Tu /api/checkout empezo a devolver errores 500 a las 2:13 AM. Tu monitor externo pingo el health check a las 2:15, devolvio 200. Tu ingeniero de guardia se entero a las 3:00 AM por un tweet de un cliente.

MTTD: 47 minutos. Casi una hora de ingresos perdidos antes de que alguien supiera.

Que es MTTD?

MTTD = momento de deteccion − momento de inicio del incidente

MTTD vs MTTR

MetricaMideSe controla con
MTTDTiempo para descubrir el incidenteMejor monitoreo, alertas mas rapidas
MTTRTiempo para solucionarloRunbooks, rollback automatico

Benchmarks por enfoque de monitoreo

EnfoqueMTTD tipico
Reportes de clientes30-120 minutos
Pings externos (UptimeRobot)1-5 minutos
APM (Datadog, New Relic)1-3 minutos
Instrumentación in-process (OpenTelemetry, métricas propias)Segundos a 1 minuto

Cómo bajar el MTTD a menos de un minuto

Medí el tráfico real instrumentando tus API routes (OpenTelemetry o el agente de tu APM), alertá sobre la tasa de error de los últimos 30 a 60 segundos con deduplicación, configurá alertas por endpoint y no solo por el health check, mantené un chequeo externo de uptime cada minuto para caídas totales, DNS y TLS, y mandá las alertas críticas a un canal que despierte a alguien (pager, llamada o push), no a un inbox compartido.