Modo observação: calibrar detecção de pico antes de ligar o alerta

Mediana do mesmo horário, piso de volume, janelas de persistência e duas semanas em observação. O que cada parâmetro muda na prática.

Advisor · · 6 min de leitura · Engenharia

Alerta que ninguém lê é pior do que alerta nenhum, porque custa a mesma operação e ainda treina o time a ignorar notificação. A maior parte dos alertas de pico nasce morta pelo mesmo motivo: foi calibrada por volume absoluto.

A mediana do mesmo horário

Volume absoluto ignora que a sua terça-feira não se parece com o seu domingo. A detecção do Advisor compara cada zona com a mediana do mesmo horário em dias anteriores. O que dispara não é "muitas requisições", é "muito mais do que esta zona costuma receber a esta hora".

Um piso de volume

Sem piso, um IP que fez duas requisições na semana passada e faz vinte hoje aparece como aumento de dez vezes. Tecnicamente verdade, operacionalmente lixo. O piso existe para que a matemática só comece a valer quando o volume já é relevante.

Janelas de persistência

Um pico isolado costuma ser um job, um crawler ou um teste. Exigir que o desvio se mantenha por janelas consecutivas elimina a maior parte do ruído sem atrasar de forma relevante a detecção do que importa.

Duas semanas em observação

Antes do primeiro alerta chegar a alguém, a detecção roda em silêncio por catorze dias. O que teria disparado é revisado com o time do cliente: o que era legítimo vira exceção documentada, o que era real ajusta o limiar. Só depois o alerta passa a acordar gente.

Cada incidente chega por e-mail ou Slack com a regra, o escopo, o volume e o piso. Quem recebe o alerta às três da manhã não deveria precisar montar um filtro para entender o que aconteceu.

HSTS está ligado em todos os seus domínios?

Acesso só de leitura, até cinco dias úteis, sem compromisso. Se a nota vier alta, a gente diz isso e você não contrata.

Solicitar a primeira leitura