El laboratorio

El detector demasiado entusiasta

¿Detectar más casos a costa de falsas alarmas? Explora precisión, exhaustividad y F1.

Experimento construido · sin ejecutar un modelo

La situación · Evaluar el servicio prestado

Tu equipo recibe las alertas del asistente. Algunas señalan incidentes reales y otras hacen perder tiempo. También hay incidentes omitidos. ¿Qué evaluación permite decidir si la herramienta es útil?

Qué vas a aprender

Interpretar la precisión desde las alertas recibidas y la exhaustividad desde los incidentes reales.

Tu misión

Parte de ocho incidentes detectados. Aumenta las falsas alarmas y después los incidentes omitidos. Describe el efecto en el trabajo antes de mirar los porcentajes.

Al terminar esta actividad. Sabrás calcular e interpretar las tres medidas sin confundir una puntuación sintética con una decisión de negocio.

Tu turno

Reto: mantén 8 verdaderos positivos y 2 incidentes omitidos. Aumenta las falsas alarmas de 2 a 8. ¿Qué medida no cambia?

Precisión = VP / (VP + FP). Exhaustividad = VP / (VP + FN). F1 = 2VP / (2VP + FP + FN). Si el denominador es cero, mostramos «no definido». Aquí no se usan los verdaderos negativos.

Explicación

La exhaustividad sigue en el 80 %. La precisión baja del 80 % al 50 % y F1 del 80 % a aproximadamente el 61,5 %. Una sola medida no basta para elegir un sistema.

Lee los contadores desde la perspectiva del usuario

Imagina revisar las alertas de una herramienta de supervisión. Con los valores iniciales recibes diez alertas: ocho corresponden a incidentes reales y dos son innecesarias. La precisión es ocho de diez. Para calcular la exhaustividad, sal de la bandeja de alertas y examina todos los incidentes reales: había diez, incluidos dos omitidos. La exhaustividad también es ocho de diez, pero por otro motivo.

La igualdad inicial puede hacer que ambas medidas parezcan intercambiables. La manipulación sirve para deshacer esa impresión. Añade seis falsas alarmas: ahora revisas dieciséis alertas para encontrar los mismos ocho incidentes. Aumenta el trabajo de verificación y la precisión baja al 50 %. Sin embargo, no se ha omitido ningún incidente adicional: la exhaustividad sigue en el 80 %.

Por qué una medida no decide por ti

F1 combina los dos cocientes y penaliza un desequilibrio fuerte, pero no conoce tu organización. Si una falsa alarma cuesta un minuto y un incidente omitido provoca horas de interrupción, la elección debe considerar esa diferencia. Las métricas describen decisiones; sus consecuencias dan el contexto para interpretarlas.

Ajustar libremente los contadores permite explorar las fórmulas. No demuestra que un clasificador real pueda alcanzar cualquier combinación. Mover un umbral suele modificar varios contadores a la vez. Hay que medir esos cambios con ejemplos representativos, en lugar de elegir por separado cifras convenientes.

Dos preguntas diferentes

La precisión pregunta: de las alertas emitidas, ¿cuántas estaban justificadas? La exhaustividad pregunta: de los incidentes reales, ¿cuántos encontramos? Los denominadores son distintos.

Un experimento mental

Con 8 incidentes detectados, 2 falsas alarmas y 2 incidentes omitidos, ambas medidas valen el 80 %. Aumentar solo las falsas alarmas reduce la precisión sin modificar la exhaustividad. Aumentar solo los incidentes omitidos produce el efecto contrario.

Un cálculo no es una política

Los contadores se ajustan libremente: la cápsula no modela la curva de umbrales de un clasificador real. Para elegir un umbral, mide las predicciones en un conjunto de calibración y evalúa la elección fijada en un conjunto de prueba separado. F1 no representa el coste de los errores ni la frecuencia de todos los casos negativos.

Reto adicional

Pon todos los contadores a cero. Una puntuación no definida no equivale a rendimiento nulo: faltan observaciones para calcular el cociente.