Tu /api/checkout empezo a devolver errores 500 a las 2:13 AM. Tu monitor externo pingo el health check a las 2:15, devolvio 200. Tu ingeniero de guardia se entero a las 3:00 AM por un tweet de un cliente.
MTTD: 47 minutos. Casi una hora de ingresos perdidos antes de que alguien supiera.
Que es MTTD?
MTTD = momento de deteccion − momento de inicio del incidente
MTTD vs MTTR
| Metrica | Mide | Se controla con |
|---|---|---|
| MTTD | Tiempo para descubrir el incidente | Mejor monitoreo, alertas mas rapidas |
| MTTR | Tiempo para solucionarlo | Runbooks, rollback automatico |
Benchmarks por enfoque de monitoreo
| Enfoque | MTTD tipico |
|---|---|
| Reportes de clientes | 30-120 minutos |
| Pings externos (UptimeRobot) | 1-5 minutos |
| APM (Datadog, New Relic) | 1-3 minutos |
| Instrumentación in-process (OpenTelemetry, métricas propias) | Segundos a 1 minuto |
Cómo bajar el MTTD a menos de un minuto
Medí el tráfico real instrumentando tus API routes (OpenTelemetry o el agente de tu APM), alertá sobre la tasa de error de los últimos 30 a 60 segundos con deduplicación, configurá alertas por endpoint y no solo por el health check, mantené un chequeo externo de uptime cada minuto para caídas totales, DNS y TLS, y mandá las alertas críticas a un canal que despierte a alguien (pager, llamada o push), no a un inbox compartido.
