Artículos · Mustapha Alouani

Precisión y exhaustividad: decide qué proteger

Una alerta innecesaria y un incidente omitido pueden tener costes muy distintos.

El detector que siempre alerta

Un servicio recibe cien mensajes, diez de los cuales describen un incidente. Un detector alerta con todos los mensajes. Encuentra los diez incidentes: su exhaustividad es del 100 %. Pero solo diez de cien alertas están justificadas: su precisión es del 10 %. Son cifras construidas, no resultados del libro.

La exhaustividad por sí sola le da una nota excelente. La precisión cuenta otra historia. Antes de elegir una medida, identifica los errores que tu aplicación debe evitar.

Reconstruye los recuentos

Un verdadero positivo es un incidente señalado correctamente. Un falso positivo es una alerta sobre un mensaje normal. Un falso negativo es un incidente omitido. Un verdadero negativo es un mensaje normal correctamente ignorado.

La precisión divide los verdaderos positivos entre todas las alertas. La exhaustividad los divide entre todos los incidentes reales. F1 combina ambas mediante una media armónica; no considera los verdaderos negativos ni un coste de negocio explícito.

Por qué la exactitud global puede engañar

En el mismo lote, no alertar nunca produce un 90 % de respuestas correctas, pero no detecta ningún incidente. La cifra parece tranquilizadora si se ignora la rareza de los incidentes. Conserva los recuentos y las proporciones de clases junto al porcentaje.

La precisión observada también depende de la población evaluada. Un conjunto artificialmente equilibrado tiene una proporción de incidentes distinta del flujo real. No traslades sus cifras automáticamente a producción.

Elige un umbral sin hacer trampa

Si el sistema produce una puntuación, compara umbrales en un conjunto de calibración. Fija el criterio: capacidad humana para revisar alertas, coste de incidentes omitidos o exhaustividad mínima. Evalúa el umbral elegido con una prueba reservada. No vuelvas a ajustarlo en esa prueba.

Con muestras pequeñas, pocos casos pueden cambiar mucho el resultado. Presenta recuentos y, cuando el protocolo lo permita, una estimación de incertidumbre. Dos puntos de diferencia no implican automáticamente una mejora sólida.

Lee una matriz de confusión como una historia

El vocabulario resulta más sencillo al asociarlo a una situación concreta. Imagina que abres cada alerta y preguntas: «¿Había realmente un incidente?». Observas el sistema desde la perspectiva de quien recibe las alertas. Esa es la perspectiva de la precisión. Ahora parte de la lista de todos los incidentes reales y busca cuáles produjeron una alerta. Esa es la perspectiva de la exhaustividad.

Ambas lecturas utilizan las mismas decisiones, pero empiezan con poblaciones diferentes. Ese punto de partida explica los denominadores. También explica por qué una precisión alta no basta: el sistema puede emitir una única alerta correcta y omitir otros nueve incidentes. Su precisión será del 100 %, pero su exhaustividad del 10 %.

Qué conserva F1 y qué oculta

F1 permite resumir el equilibrio entre precisión y exhaustividad. La media armónica penaliza un desequilibrio importante. Con una precisión del 100 % y una exhaustividad del 10 %, la media aritmética sería el 55 %, mientras que F1 es aproximadamente el 18,2 %. El segundo número hace más visible que la mayoría de los incidentes no se detectan.

El resumen no incorpora un juicio de negocio. Dos sistemas con el mismo F1 pueden producir distintos volúmenes de alertas. La misma puntuación puede servir para explorar y ser insuficiente cuando cada error tiene un coste alto. Antes de comparar, explica para qué se usarán las predicciones y quién atenderá sus consecuencias.

Relaciona la medida con la frecuencia de incidentes

Un detector ficticio encuentra el 80 % de los incidentes y alerta por error en el 10 % de los mensajes normales. En cien mensajes con diez incidentes, produce en promedio ocho alertas justificadas y nueve falsas. La precisión esperada es 8/17, aproximadamente el 47,1 %. En cien mensajes con cincuenta incidentes, las mismas tasas condicionales producen cuarenta alertas justificadas y cinco falsas: alrededor del 88,9 % de precisión.

En este experimento mental, el detector no cambia; cambia la proporción de incidentes. Por eso no debemos trasladar sin precaución la precisión de un corpus equilibrado al flujo real. Estas cifras ilustran el cálculo; en un sistema real, las propias tasas condicionales también pueden variar cuando cambian los datos.

Toma una decisión explicable

Una elección defendible relaciona la medida con una restricción concreta. Por ejemplo, buscar la máxima exhaustividad compatible con revisar veinte alertas al día. Así, el compromiso queda visible y se puede discutir. Es más informativo que pedir simplemente un F1 mayor, porque conecta el cálculo con el trabajo real de quienes utilizarán el sistema.

Ejercicio resuelto

Con 8 verdaderos positivos, 2 falsos positivos y 2 falsos negativos, ambas medidas valen el 80 %. Duplica los falsos negativos sin cambiar nada más. La precisión sigue en el 80 %; la exhaustividad pasa a 8/12, aproximadamente el 66,7 %. Compruébalo en la cápsula.

Abrir el experimento interactivo