Seu /api/checkout comecou a retornar erros 500 as 2:13 AM. Seu monitor externo pingou o health check as 2:15, retornou 200. Seu engenheiro de plantao descobriu as 3:00 AM por um tweet de cliente.

MTTD: 47 minutos.

O que e MTTD?

MTTD = momento da deteccao − momento do inicio do incidente

Benchmarks por abordagem

AbordagemMTTD tipico
Relatos de clientes30-120 minutos
Pings externos1-5 minutos
APM (Datadog, New Relic)1-3 minutos
Instrumentação in-process (OpenTelemetry, métricas próprias)Segundos a 1 minuto

Como baixar o MTTD para menos de um minuto

Meça o tráfego real instrumentando suas API routes (OpenTelemetry ou o agente do seu APM), alerte sobre a taxa de erro dos últimos 30 a 60 segundos com deduplicação, configure alertas por endpoint e não só pelo health check, mantenha um check externo de uptime a cada minuto para quedas totais, DNS e TLS, e mande os alertas críticos para um canal que acorde alguém (pager, ligação ou push), não para uma caixa de email compartilhada.