Seu VP de Engineering pergunta: "Qual e nosso SLA?" Seu SRE diz: "Nosso SLO e 99.9%." Todos concordam. Ninguem fala da mesma coisa.
Definicoes em uma frase
| Termo | O que e | Quem se importa |
|---|---|---|
| SLI | A metrica que voce mede | Engenheiros |
| SLO | O objetivo interno | Engenharia + Produto |
| SLA | O contrato com o cliente | Negocio + Legal |
SLI: a metrica
Porcentagem de requests que retornam resposta com sucesso, P95 latencia, taxa de erro.
SLO: o objetivo
99.9% disponibilidade = max 43 minutos de downtime por mes. Quando o error budget acaba, desacelere deploys.
SLA: o contrato
Sempre mais baixo que o SLO. Se seu SLO e 99.9%, seu SLA promete 99.5% com creditos se falhar.
Como monitorar SLOs
Meça disponibilidade, latencia P95 e taxa de erro por endpoint com a ferramenta de monitoramento que voce ja usa, e alerte pela velocidade com que o error budget esta sendo gasto (burn rate = taxa de erro / (1 - SLO)), nao por cada request que falha. Um burn rate de 14.4 sustentado por uma hora consome 2% do budget mensal: isso justifica acordar alguem.
