A economia dos noves
“Queremos cinco noves” é uma frase que aparece em reunião e raramente sobrevive ao contato com a conta. Ela costuma significar “queremos que não caia” — o que é uma intenção, não um objetivo.
Traduzir noves em minutos e em dinheiro transforma a conversa: deixa de ser sobre ambição e passa a ser sobre quanto se está disposto a pagar.
Noves em minutos
Seção intitulada “Noves em minutos”| Disponibilidade | Indisponibilidade por mês | Por ano |
|---|---|---|
| 99% (“dois noves”) | ~7 h 18 min | ~3,65 dias |
| 99,5% | ~3 h 39 min | ~1,83 dia |
| 99,9% (“três noves”) | ~43 min 50 s | ~8,77 h |
| 99,95% | ~21 min 55 s | ~4,38 h |
| 99,99% (“quatro noves”) | ~4 min 23 s | ~52,6 min |
| 99,999% (“cinco noves”) | ~26 s | ~5,26 min |
Repare no que 99,99% implica na prática: menos de cinco minutos de indisponibilidade no mês inteiro. Isso é menos que o tempo de um deploy problemático ser percebido, revertido e normalizado — o que significa que nenhuma intervenção humana cabe nesse orçamento. A recuperação precisa ser automática, e o sistema precisa suportar falha de componente sem parar.
Cinco noves são 26 segundos por mês. Nesse patamar, o gargalo deixa de ser a sua arquitetura e passa a ser tudo o mais: a rede do usuário, o DNS, o provedor, o celular.
O custo cresce de forma não linear
Seção intitulada “O custo cresce de forma não linear”Cada nove adicional custa muito mais que o anterior, porque exige eliminar uma classe inteira de causa:
- De 99% para 99,9%: monitoramento decente, deploy com rollback, redundância básica. Barato e alto retorno.
- De 99,9% para 99,99%: multi-zona real, failover automático testado, sem ponto único, deploy progressivo com abort automático, plantão 24×7. Custo alto.
- De 99,99% para 99,999%: multi-região ativa, controle de mudança sofisticado, automação para tudo, redundância em cada dependência. Custo altíssimo, e exige um time dedicado.
O padrão observado com frequência é que cada nove multiplica o custo por algo entre cinco e dez vezes. E há um efeito perverso: acima de certo ponto, a complexidade adicionada para ganhar disponibilidade introduz modos de falha novos. Failover automático mal testado já derrubou mais sistema que o problema que ele deveria resolver.
Dependências em série multiplicam
Seção intitulada “Dependências em série multiplicam”Se o seu serviço depende de três componentes em série, cada um com 99,9%:
0,999 × 0,999 × 0,999 = 0,997 → 99,7% (mais de 2 horas por mês)Você não pode ser mais disponível que o produto das suas dependências no caminho crítico — e isso inclui o banco, o gateway de pagamento, o provedor de identidade e o DNS.
Duas consequências de projeto:
- Reduza dependências no caminho crítico. A cada uma removida, o teto sobe.
- Degrade em vez de propagar. Se a dependência de recomendação cair e o checkout continuar funcionando, ela deixou de ser série e virou paralelo.
E cheque o SLA dos seus fornecedores antes de prometer o seu: prometer 99,99% sobre um serviço gerenciado que oferece 99,9% é uma promessa que só depende de sorte.
Percebida e medida
Seção intitulada “Percebida e medida”Quase toda discussão sobre noves confunde duas coisas.
Disponibilidade medida é o que a sua sonda diz: o health check respondeu. Percebida é o que o usuário sente: a página carregou em tempo aceitável e a compra foi concluída.
Elas divergem com frequência. Um serviço que responde 200 em 12 segundos está “disponível” e inutilizável. Um que funciona para todo mundo menos para o maior cliente tem 99,95% na média e 0% para quem paga mais.
Por isso o SLI deve medir jornada de usuário, não porta aberta — e vale olhar a disponibilidade por segmento (cliente, região, rota), e não só o agregado.
Escolhendo o alvo
Seção intitulada “Escolhendo o alvo”A pergunta correta não é “quantos noves queremos?”, e sim “quanto custa cada minuto fora do ar, e quanto custa evitá-lo?”. Some ao lado do custo o que o usuário tolera: se o concorrente cai 20 minutos por mês e ninguém troca de fornecedor por isso, 99,99% é investimento sem retorno.
Regras práticas que ajudam a decidir:
- Comece em 99,9% para serviço voltado ao usuário. É atingível com boas práticas e cobre a maioria dos casos.
- Diferencie por serviço: checkout e catálogo não precisam do mesmo alvo, e o relatório interno precisa de bem menos.
- Alvo abaixo de 100% é o ponto: o orçamento de erro que sobra é o que financia mudança. Um time com 100% de disponibilidade em um trimestre provavelmente entregou menos do que poderia.
- Revise a cada trimestre com dados de reclamação e de comportamento real.