Pular para o conteúdo

A economia dos noves

Intermediário14 min de leituraconfiabilidade

“Queremos cinco noves” é uma frase que aparece em reunião e raramente sobrevive ao contato com a conta. Ela costuma significar “queremos que não caia” — o que é uma intenção, não um objetivo.

Traduzir noves em minutos e em dinheiro transforma a conversa: deixa de ser sobre ambição e passa a ser sobre quanto se está disposto a pagar.

Disponibilidade Indisponibilidade por mês Por ano
99% (“dois noves”) ~7 h 18 min ~3,65 dias
99,5% ~3 h 39 min ~1,83 dia
99,9% (“três noves”) ~43 min 50 s ~8,77 h
99,95% ~21 min 55 s ~4,38 h
99,99% (“quatro noves”) ~4 min 23 s ~52,6 min
99,999% (“cinco noves”) ~26 s ~5,26 min

Repare no que 99,99% implica na prática: menos de cinco minutos de indisponibilidade no mês inteiro. Isso é menos que o tempo de um deploy problemático ser percebido, revertido e normalizado — o que significa que nenhuma intervenção humana cabe nesse orçamento. A recuperação precisa ser automática, e o sistema precisa suportar falha de componente sem parar.

Cinco noves são 26 segundos por mês. Nesse patamar, o gargalo deixa de ser a sua arquitetura e passa a ser tudo o mais: a rede do usuário, o DNS, o provedor, o celular.

Cada nove adicional custa muito mais que o anterior, porque exige eliminar uma classe inteira de causa:

  • De 99% para 99,9%: monitoramento decente, deploy com rollback, redundância básica. Barato e alto retorno.
  • De 99,9% para 99,99%: multi-zona real, failover automático testado, sem ponto único, deploy progressivo com abort automático, plantão 24×7. Custo alto.
  • De 99,99% para 99,999%: multi-região ativa, controle de mudança sofisticado, automação para tudo, redundância em cada dependência. Custo altíssimo, e exige um time dedicado.

O padrão observado com frequência é que cada nove multiplica o custo por algo entre cinco e dez vezes. E há um efeito perverso: acima de certo ponto, a complexidade adicionada para ganhar disponibilidade introduz modos de falha novos. Failover automático mal testado já derrubou mais sistema que o problema que ele deveria resolver.

Se o seu serviço depende de três componentes em série, cada um com 99,9%:

0,999 × 0,999 × 0,999 = 0,997 → 99,7% (mais de 2 horas por mês)

Você não pode ser mais disponível que o produto das suas dependências no caminho crítico — e isso inclui o banco, o gateway de pagamento, o provedor de identidade e o DNS.

Duas consequências de projeto:

  1. Reduza dependências no caminho crítico. A cada uma removida, o teto sobe.
  2. Degrade em vez de propagar. Se a dependência de recomendação cair e o checkout continuar funcionando, ela deixou de ser série e virou paralelo.

E cheque o SLA dos seus fornecedores antes de prometer o seu: prometer 99,99% sobre um serviço gerenciado que oferece 99,9% é uma promessa que só depende de sorte.

Quase toda discussão sobre noves confunde duas coisas.

Disponibilidade medida é o que a sua sonda diz: o health check respondeu. Percebida é o que o usuário sente: a página carregou em tempo aceitável e a compra foi concluída.

Elas divergem com frequência. Um serviço que responde 200 em 12 segundos está “disponível” e inutilizável. Um que funciona para todo mundo menos para o maior cliente tem 99,95% na média e 0% para quem paga mais.

Por isso o SLI deve medir jornada de usuário, não porta aberta — e vale olhar a disponibilidade por segmento (cliente, região, rota), e não só o agregado.

A pergunta correta não é “quantos noves queremos?”, e sim “quanto custa cada minuto fora do ar, e quanto custa evitá-lo?”. Some ao lado do custo o que o usuário tolera: se o concorrente cai 20 minutos por mês e ninguém troca de fornecedor por isso, 99,99% é investimento sem retorno.

Regras práticas que ajudam a decidir:

  • Comece em 99,9% para serviço voltado ao usuário. É atingível com boas práticas e cobre a maioria dos casos.
  • Diferencie por serviço: checkout e catálogo não precisam do mesmo alvo, e o relatório interno precisa de bem menos.
  • Alvo abaixo de 100% é o ponto: o orçamento de erro que sobra é o que financia mudança. Um time com 100% de disponibilidade em um trimestre provavelmente entregou menos do que poderia.
  • Revise a cada trimestre com dados de reclamação e de comportamento real.