Tu VP de Engineering pregunta: "Cual es nuestro SLA?" Tu SRE dice: "Nuestro SLO es 99.9%." Todos asienten. Nadie habla de lo mismo.
Definiciones en una oracion
| Termino | Que es | A quien le importa |
|---|---|---|
| SLI | La metrica que medis | Ingenieros |
| SLO | El objetivo interno | Ingenieria + Producto |
| SLA | El contrato con el cliente | Negocio + Legal |
SLI: la metrica
Porcentaje de requests que devuelven respuesta exitosa, P95 latencia, error rate.
SLO: el objetivo
99.9% disponibilidad = max 43 minutos de downtime por mes. Cuando el error budget se gasta, frenas deploys y enfocas en estabilidad.
SLA: el contrato
Siempre mas bajo que el SLO. Si tu SLO es 99.9%, tu SLA promete 99.5% con creditos si fallas.
Como monitorear SLOs
Medí disponibilidad, latencia P95 y error rate por endpoint con la herramienta de monitoreo que ya uses, y alertá según la velocidad con la que gastás el error budget (burn rate = error rate / (1 - SLO)), no por cada request fallido. Un burn rate de 14.4 sostenido durante una hora consume el 2% del budget mensual: eso amerita despertar a alguien.
