O laboratório
O detector entusiasmado demais
Detectar mais casos ao custo de alarmes falsos? Explore precisão, revocação e F1.
Experimento construído · sem executar um modelo
A situação · Avaliar o serviço prestado
Sua equipe recebe alertas do assistente. Alguns apontam incidentes reais; outros fazem perder tempo. Certos incidentes não são detectados. Qual avaliação permite decidir se a ferramenta é útil?
O que você vai aprender
Interpretar precisão pela perspectiva dos alertas recebidos e revocação pela dos incidentes reais.
Sua missão
Comece com oito incidentes detectados. Aumente os alarmes falsos e depois os incidentes perdidos. Descreva o efeito no trabalho antes de olhar os percentuais.
Ao concluir esta atividade. Você saberá calcular e interpretar as três medidas sem confundir uma pontuação sintética com uma decisão de negócio.
Sua vez
Desafio: mantenha 8 verdadeiros positivos e 2 incidentes perdidos. Aumente os alarmes falsos de 2 para 8. Qual medida não muda?
Precisão = VP / (VP + FP). Revocação = VP / (VP + FN). F1 = 2VP / (2VP + FP + FN). Quando o denominador é zero, mostramos “indefinido”. Os verdadeiros negativos não são usados aqui.
Explicação
A revocação continua em 80%. A precisão cai de 80% para 50%, e F1 de 80% para aproximadamente 61,5%. Uma única medida não basta para escolher um sistema.
Leia os contadores pela perspectiva do usuário
Imagine revisar alertas de uma ferramenta de monitoramento. Com os valores iniciais, você recebe dez alertas: oito correspondem a incidentes reais e dois são desnecessários. A precisão é oito em dez. Para calcular a revocação, saia da caixa de alertas e observe todos os incidentes reais: havia dez, incluindo dois que não foram detectados. A revocação também é oito em dez, mas por outro motivo.
A igualdade inicial pode dar a impressão de que as medidas são intercambiáveis. A exploração serve para desfazer essa impressão. Adicione seis alarmes falsos: agora você revisa dezesseis alertas para encontrar os mesmos oito incidentes. O trabalho de verificação aumenta e a precisão cai para 50%. Nenhum incidente adicional foi perdido; portanto, a revocação continua em 80%.
Por que uma medida não decide por você
F1 combina as duas razões e penaliza um desequilíbrio forte, mas não conhece sua organização. Se um alarme falso custa um minuto e um incidente perdido causa horas de interrupção, a escolha precisa considerar essa diferença. As métricas descrevem decisões; as consequências dão contexto à interpretação.
Ajustar os contadores livremente explora as propriedades das fórmulas. Não demonstra que um classificador real possa atingir todas as combinações. Mover um limiar geralmente altera vários contadores ao mesmo tempo. É preciso medir essas mudanças em exemplos representativos, em vez de escolher separadamente números convenientes.
Duas perguntas diferentes
A precisão pergunta: das alertas emitidas, quantas eram justificadas? A revocação pergunta: dos incidentes reais, quantos encontramos? Os denominadores são diferentes.
Um experimento mental
Com 8 incidentes detectados, 2 alarmes falsos e 2 incidentes perdidos, precisão e revocação valem 80%. Aumentar apenas os alarmes falsos reduz a precisão sem mudar a revocação. Aumentar apenas os incidentes perdidos produz o efeito contrário.
Um cálculo não é uma política
Os contadores são livres: a cápsula não modela a curva de limiares de um classificador real. Para escolher um limiar, meça as previsões em um conjunto de calibração e avalie a escolha fixada em um conjunto de teste separado. F1 não representa os custos dos erros nem a frequência de todos os casos negativos.
Desafio extra
Coloque todos os contadores em zero. Uma pontuação indefinida não significa desempenho zero: faltam observações para calcular a razão.