O que são os sinais de ouro e os métodos RED e USE no monitoramento?
Diante de centenas de métricas disponíveis, a pergunta mais difícil do monitoramento é por onde começar. Três roteiros consagrados respondem a ela: os quatro sinais de ouro, popularizados pelo livro de SRE do Google; o método RED, voltado a serviços; e o método USE, voltado a recursos de infraestrutura.
Os quatro sinais de ouro
- Latência: o tempo para atender uma requisição. Vale separar a latência das requisições com sucesso e das com erro, porque um erro rápido pode mascarar a lentidão.
- Tráfego: a demanda sobre o sistema, como requisições por segundo, transações ou sessões.
- Erros: a taxa de requisições que falham, de forma explícita, como um código HTTP 500, ou implícita, como uma resposta correta, mas lenta demais para o combinado.
- Saturação: o quanto o sistema está perto do limite, em especial no recurso mais restrito, seja CPU, memória, conexões ou fila.
Se for possível medir apenas quatro coisas em um serviço voltado a usuários, a recomendação é que sejam essas.
Método RED: a visão do serviço
Proposto por Tom Wilkie, o RED resume a observação de cada serviço ou endpoint em três medidas: Rate (requisições por segundo), Errors (requisições com falha) e Duration (distribuição do tempo de resposta). É, na prática, os sinais de ouro sem a saturação.
Funciona muito bem em arquiteturas de microsserviços porque padroniza os painéis: todo serviço tem as mesmas três visões, e qualquer pessoa da equipe sabe onde olhar.
Método USE: a visão do recurso
Criado por Brendan Gregg, o USE aplica três perguntas a cada recurso físico ou lógico, como CPU, memória, disco, interface de rede ou pool de conexões: Utilization (percentual do tempo ou da capacidade em uso), Saturation (trabalho extra que não pôde ser atendido e ficou na fila) e Errors (eventos de erro do recurso).
A saturação costuma ser o sinal mais esquecido e o mais revelador. Um disco com 60% de utilização pode ter uma fila de espera crescente, e é a fila que o usuário sente como lentidão.
Como combinar na prática
Sinais de ouro e RED respondem se o serviço está bem para quem o usa; USE responde qual recurso está limitando. Uma investigação típica segue essa ordem: o painel RED mostra que a latência de um serviço subiu, o trace aponta a dependência lenta e o USE do servidor de banco de dados revela saturação de disco.
Uma estrutura de painéis eficaz tem três níveis: uma visão geral com os sinais dos serviços críticos, uma visão por serviço com RED e uma visão de infraestrutura com USE, ligadas por filtros comuns, como o nome do serviço e o ambiente.
Cuidados na medição
- Percentis, não médias: a média esconde a cauda. Se 5% dos usuários esperam 8 segundos, o p95 mostra; a média, não.
- Cuidado ao agregar percentis: a média dos p95 de vários servidores não é o p95 do conjunto. Prefira histogramas, que permitem calcular o percentil global corretamente.
- Taxas, não totais: acompanhe a proporção de erros sobre as requisições, já que o número absoluto sobe naturalmente com o tráfego.
- Alerta pelo sintoma: os sinais voltados ao usuário são os melhores candidatos a alerta; as métricas de recurso servem melhor ao diagnóstico e ao planejamento de capacidade.
Esses sinais se ligam a outros conceitos de operação: servem de base para definir um bom SLO, ajudam a reduzir a fadiga de alertas e aparecem nas ferramentas de APM e nos dados de logs, métricas e traces.
Sinais de ouro e RED mostram se o serviço atende bem o usuário; USE mostra qual recurso está limitando. Combinados em painéis por camada, com percentis e taxas em vez de médias e totais, levam do sintoma à causa com menos tentativa e erro.
Este conteúdo foi útil?
Revisão técnica VIPER IT — última atualização em 10 de outubro de 2026.