Seu /api/checkout comecou a retornar erros 500 as 2:13 AM. Seu monitor externo pingou o health check as 2:15, retornou 200. Seu engenheiro de plantao descobriu as 3:00 AM por um tweet de cliente.
MTTD: 47 minutos.
O que e MTTD?
MTTD = momento da deteccao − momento do inicio do incidente
Benchmarks por abordagem
| Abordagem | MTTD tipico |
|---|---|
| Relatos de clientes | 30-120 minutos |
| Pings externos | 1-5 minutos |
| APM (Datadog, New Relic) | 1-3 minutos |
| Instrumentação in-process (OpenTelemetry, métricas próprias) | Segundos a 1 minuto |
Como baixar o MTTD para menos de um minuto
Meça o tráfego real instrumentando suas API routes (OpenTelemetry ou o agente do seu APM), alerte sobre a taxa de erro dos últimos 30 a 60 segundos com deduplicação, configure alertas por endpoint e não só pelo health check, mantenha um check externo de uptime a cada minuto para quedas totais, DNS e TLS, e mande os alertas críticos para um canal que acorde alguém (pager, ligação ou push), não para uma caixa de email compartilhada.
