Solicitar diagnóstico
Operação e Observabilidade

O que são MTTD, MTTA, MTTR e MTBF, e como medir incidentes sem se enganar?

Depois de um incidente, a pergunta da diretoria costuma ser quanto tempo ficamos fora. A resposta honesta envolve várias etapas: quanto tempo levamos para perceber, para alguém assumir, para diagnosticar e para restabelecer o serviço. Medir cada etapa separadamente mostra onde investir.

As métricas e o que cada uma mede

  • MTTD (tempo médio para detectar): do início real do problema até ele ser percebido, por alerta ou por reclamação.
  • MTTA (tempo médio para reconhecer): do alerta até alguém assumir o incidente.
  • MTTR: a sigla mais usada e a mais ambígua. Pode significar tempo médio para reparar, recuperar, resolver ou responder. Para o negócio, costuma ser mais útil o tempo até o serviço ser restabelecido para o usuário, mesmo que a correção definitiva venha depois.
  • MTBF (tempo médio entre falhas): o tempo médio de funcionamento entre uma falha e a seguinte. Mede a frequência, e não a duração, dos problemas.

Defina antes de medir

Comparar o MTTR de duas equipes que usam definições diferentes não faz sentido. Escreva o que marca cada momento: o início do impacto, pelos dados de monitoramento e não pelo horário de abertura do chamado; o reconhecimento; a mitigação; e a resolução. Registre esses horários no próprio incidente, sempre da mesma forma.

Defina também o que conta como incidente. Se pequenas falhas entram em um mês e não em outro, as médias mudam sem que a operação tenha mudado.

Por que a média engana

Tempos de incidente costumam ter distribuição muito assimétrica: muitos incidentes curtos e alguns longuíssimos. Um único incidente de dez horas pode dobrar o MTTR de um trimestre, e meses com poucos incidentes geram médias instáveis. Por isso, acompanhe também a mediana e o percentil 90, observe a evolução ao longo de vários períodos e analise os casos extremos individualmente.

Outro cuidado é a lei de Goodhart: quando uma medida vira meta, deixa de ser uma boa medida. Se a equipe é cobrada só pelo MTTR, incidentes podem ser fechados cedo demais ou divididos em vários menores. E essas métricas nunca devem servir para comparar ou punir pessoas.

O que reduz cada tempo

  • Detecção: alertas por sintoma, monitoramento sintético nos fluxos críticos e SLOs com alerta pela taxa de consumo.
  • Reconhecimento: escala de plantão clara, notificação pelo canal certo e menos ruído, para que os alertas importantes não se percam.
  • Diagnóstico: logs, métricas e traces correlacionados, mapa de dependências e registro de mudanças recentes, já que boa parte dos incidentes começa logo após uma alteração.
  • Recuperação: runbooks, capacidade de desfazer implantações rapidamente, chaves para desligar funcionalidades e automação de ações repetitivas.
  • Frequência: análise pós-incidente com ações concluídas, testes, gestão de mudanças e planejamento de capacidade.

Como apresentar ao negócio

Os números ganham sentido quando ligados ao impacto: minutos de indisponibilidade de cada serviço crítico, usuários ou transações afetados e consumo do error budget. Mostre a tendência ao longo de trimestres e o que foi feito para melhorar. Um gráfico de MTTR isolado, sem contexto, gera mais perguntas que decisões.

Em resumo

MTTD, MTTA, MTTR e MTBF medem detecção, reconhecimento, recuperação e frequência das falhas. Só funcionam com definições claras e registro consistente, acompanhadas de mediana e percentis. Usadas para melhorar o sistema, e não para punir pessoas, mostram onde investir.

Revisão técnica VIPER IT — última atualização em 10 de outubro de 2026.

Contato

Vamos falar sobre
a sua operação de TI?

Solicite um diagnóstico executivo para identificar riscos, oportunidades de melhoria e caminhos para evoluir sua operação de TI.

  • Segurança e riscos
  • Continuidade operacional
  • Gestão e processos de TI
  • Infraestrutura e cloud
Prefere iniciar uma conversa?WhatsApp corporativo+55 11 91649-3145

Canal para novos projetos, diagnósticos e oportunidades de melhoria.

Suas informações serão usadas apenas para contato relacionado à solicitação.

Tecnologia sob controle. Sempre.