Solicitar diagnóstico
VIPER Learning · 15 termos

Glossário de Operação e Observabilidade

Quando um sistema fica lento ou para, a empresa precisa descobrir rápido onde está o problema e quem deve agir. Esta seção reúne os conceitos de monitoramento e observabilidade que tornam isso possível, dos indicadores básicos de infraestrutura ao acompanhamento de aplicações e de serviços com IA.

Os verbetes explicam como medir, como reduzir alertas inúteis e como transformar dados técnicos em informação útil para decisões.

O que é APM e como ele ajuda a identificar lentidão nas aplicações?

Entenda o que é APM e como o acompanhamento de transações ajuda a localizar lentidão e falhas em aplicações.

Ler termo →

O que é cardinalidade de métricas e como controlar o custo da observabilidade?

Cardinalidade é o número de séries temporais que uma métrica gera a partir dos seus rótulos. Entenda por que ela explode custos e consultas e quais práticas mantêm a telemetria útil e sustentável.

Ler termo →

O que é fadiga de alertas e como desenhar alertas que a equipe respeita?

Fadiga de alertas é quando o excesso de notificações faz a equipe ignorar até as importantes. Veja as causas, os princípios de um bom alerta e como medir e reduzir o ruído do monitoramento.

Ler termo →

O que são logs, métricas e traces e como eles explicam uma falha?

Entenda as diferenças entre logs, métricas e traces e como esses sinais ajudam a investigar aplicações e serviços.

Ler termo →

O que são MTTD, MTTA, MTTR e MTBF, e como medir incidentes sem se enganar?

MTTD, MTTA, MTTR e MTBF medem quanto tempo se leva para detectar, assumir e resolver falhas, e com que frequência elas ocorrem. Entenda cada métrica, as armadilhas de medição e como reduzi-las.

Ler termo →

O que é monitoramento de rede e quais problemas ele pode identificar?

Entenda como o monitoramento de rede acompanha disponibilidade, desempenho e capacidade de links e equipamentos.

Ler termo →

Monitoramento sintético e RUM: qual a diferença e quando usar cada um?

O monitoramento sintético simula usuários para testar sistemas o tempo todo; o RUM mede a experiência de usuários reais. Veja o que cada um detecta, seus limites e por que funcionam melhor juntos.

Ler termo →

O que é NOC e como ele mantém a operação de TI sob controle?

Entenda o que é NOC e como pessoas, processos e ferramentas monitoram a disponibilidade e o desempenho da infraestrutura de TI.

Ler termo →

O que é observabilidade e por que ela vai além do monitoramento?

Entenda o que é observabilidade e como diferentes sinais ajudam a investigar o comportamento de aplicações e infraestruturas complexas.

Ler termo →

O que é observabilidade de IA e de LLM, e o que medir em aplicações com IA?

Aplicações com IA generativa precisam de observabilidade própria: custo por token, latência, chamadas de ferramentas, qualidade das respostas e segurança. Veja o que medir e como fazer isso com responsabilidade.

Ler termo →

O que é OpenTelemetry e por que ele virou padrão na observabilidade?

OpenTelemetry é o padrão aberto para gerar e transportar logs, métricas e traces sem amarrar a empresa a um fornecedor. Entenda seus componentes, o papel do Collector e os cuidados na adoção.

Ler termo →

O que é postmortem sem culpa e como transformar incidentes em melhoria?

O postmortem sem culpa analisa um incidente para entender como o sistema permitiu a falha, sem procurar culpados. Veja quando fazer, o que o documento deve conter e como garantir que as ações saiam do papel.

Ler termo →

Como funciona o rastreamento distribuído e o que ele revela sobre uma aplicação?

O rastreamento distribuído acompanha uma requisição por todos os serviços que ela atravessa. Entenda trace, span, propagação de contexto e amostragem, e como usar os dados para achar gargalos.

Ler termo →

O que são SLI, SLO e error budget, e como usá-los na operação?

SLI mede o que o usuário sente, SLO define a meta e o error budget mostra quanta falha ainda cabe no período. Entenda como escolher indicadores, calcular o orçamento e alertar pela taxa de consumo.

Ler termo →

O que são os sinais de ouro e os métodos RED e USE no monitoramento?

Sinais de ouro, RED e USE são roteiros para decidir o que monitorar em serviços e recursos. Veja o que cada um mede, quando usar e como montar painéis que levam do sintoma à causa.

Ler termo →
Contato

Vamos falar sobre
a sua operação de TI?

Solicite um diagnóstico executivo para identificar riscos, oportunidades de melhoria e caminhos para evoluir sua operação de TI.

  • Segurança e riscos
  • Continuidade operacional
  • Gestão e processos de TI
  • Infraestrutura e cloud
Prefere iniciar uma conversa?WhatsApp corporativo+55 11 91649-3145

Canal para novos projetos, diagnósticos e oportunidades de melhoria.

Suas informações serão usadas apenas para contato relacionado à solicitação.

Tecnologia sob controle. Sempre.