O que são MTTD, MTTA, MTTR e MTBF, e como medir incidentes sem se enganar?
Depois de um incidente, a pergunta da diretoria costuma ser quanto tempo ficamos fora. A resposta honesta envolve várias etapas: quanto tempo levamos para perceber, para alguém assumir, para diagnosticar e para restabelecer o serviço. Medir cada etapa separadamente mostra onde investir.
As métricas e o que cada uma mede
- MTTD (tempo médio para detectar): do início real do problema até ele ser percebido, por alerta ou por reclamação.
- MTTA (tempo médio para reconhecer): do alerta até alguém assumir o incidente.
- MTTR: a sigla mais usada e a mais ambígua. Pode significar tempo médio para reparar, recuperar, resolver ou responder. Para o negócio, costuma ser mais útil o tempo até o serviço ser restabelecido para o usuário, mesmo que a correção definitiva venha depois.
- MTBF (tempo médio entre falhas): o tempo médio de funcionamento entre uma falha e a seguinte. Mede a frequência, e não a duração, dos problemas.
Defina antes de medir
Comparar o MTTR de duas equipes que usam definições diferentes não faz sentido. Escreva o que marca cada momento: o início do impacto, pelos dados de monitoramento e não pelo horário de abertura do chamado; o reconhecimento; a mitigação; e a resolução. Registre esses horários no próprio incidente, sempre da mesma forma.
Defina também o que conta como incidente. Se pequenas falhas entram em um mês e não em outro, as médias mudam sem que a operação tenha mudado.
Por que a média engana
Tempos de incidente costumam ter distribuição muito assimétrica: muitos incidentes curtos e alguns longuíssimos. Um único incidente de dez horas pode dobrar o MTTR de um trimestre, e meses com poucos incidentes geram médias instáveis. Por isso, acompanhe também a mediana e o percentil 90, observe a evolução ao longo de vários períodos e analise os casos extremos individualmente.
Outro cuidado é a lei de Goodhart: quando uma medida vira meta, deixa de ser uma boa medida. Se a equipe é cobrada só pelo MTTR, incidentes podem ser fechados cedo demais ou divididos em vários menores. E essas métricas nunca devem servir para comparar ou punir pessoas.
O que reduz cada tempo
- Detecção: alertas por sintoma, monitoramento sintético nos fluxos críticos e SLOs com alerta pela taxa de consumo.
- Reconhecimento: escala de plantão clara, notificação pelo canal certo e menos ruído, para que os alertas importantes não se percam.
- Diagnóstico: logs, métricas e traces correlacionados, mapa de dependências e registro de mudanças recentes, já que boa parte dos incidentes começa logo após uma alteração.
- Recuperação: runbooks, capacidade de desfazer implantações rapidamente, chaves para desligar funcionalidades e automação de ações repetitivas.
- Frequência: análise pós-incidente com ações concluídas, testes, gestão de mudanças e planejamento de capacidade.
Como apresentar ao negócio
Os números ganham sentido quando ligados ao impacto: minutos de indisponibilidade de cada serviço crítico, usuários ou transações afetados e consumo do error budget. Mostre a tendência ao longo de trimestres e o que foi feito para melhorar. Um gráfico de MTTR isolado, sem contexto, gera mais perguntas que decisões.
MTTD, MTTA, MTTR e MTBF medem detecção, reconhecimento, recuperação e frequência das falhas. Só funcionam com definições claras e registro consistente, acompanhadas de mediana e percentis. Usadas para melhorar o sistema, e não para punir pessoas, mostram onde investir.
Este conteúdo foi útil?
Revisão técnica VIPER IT — última atualização em 10 de outubro de 2026.