Alerta que ninguém lê é pior do que alerta nenhum, porque custa a mesma operação e ainda treina o time a ignorar notificação. A maior parte dos alertas de pico nasce morta pelo mesmo motivo: foi calibrada por volume absoluto.
A mediana do mesmo horário
Volume absoluto ignora que a sua terça-feira não se parece com o seu domingo. A detecção do Advisor compara cada zona com a mediana do mesmo horário em dias anteriores. O que dispara não é "muitas requisições", é "muito mais do que esta zona costuma receber a esta hora".
Um piso de volume
Sem piso, um IP que fez duas requisições na semana passada e faz vinte hoje aparece como aumento de dez vezes. Tecnicamente verdade, operacionalmente lixo. O piso existe para que a matemática só comece a valer quando o volume já é relevante.
Janelas de persistência
Um pico isolado costuma ser um job, um crawler ou um teste. Exigir que o desvio se mantenha por janelas consecutivas elimina a maior parte do ruído sem atrasar de forma relevante a detecção do que importa.
Duas semanas em observação
Antes do primeiro alerta chegar a alguém, a detecção roda em silêncio por catorze dias. O que teria disparado é revisado com o time do cliente: o que era legítimo vira exceção documentada, o que era real ajusta o limiar. Só depois o alerta passa a acordar gente.
Cada incidente chega por e-mail ou Slack com a regra, o escopo, o volume e o piso. Quem recebe o alerta às três da manhã não deveria precisar montar um filtro para entender o que aconteceu.