Artículos · Mustapha Alouani
Una puntuación perfecta merece una investigación
Diseña una prueba que distinga una capacidad útil de un atajo accidental.
La pista demasiado fácil
Imagina un corpus donde todos los incidentes terminan con «gracias» y los mensajes normales no. Una regla basada solo en esa palabra obtiene el 100 % de aciertos. No sabe nada de incidentes. Este corpus y esta regla están construidos para mostrar el problema; no es una medición de un modelo real.
El atajo aparece cuando una señal correlacionada con la etiqueta es más fácil de aprovechar que el fenómeno que queríamos aprender. Una firma, un departamento, una plantilla o la longitud del texto pueden cumplir ese papel.
Cambia un detalle sin cambiar la respuesta
Crea dos versiones del mismo mensaje. Conserva el significado de negocio y añade o elimina la fórmula de cortesía. Si la referencia sigue siendo «incidente» pero la predicción cambia, has identificado una sensibilidad. No has demostrado su mecanismo interno: es una observación del comportamiento.
Los contraejemplos deben ser plausibles. Eliminar una palabra esencial puede modificar el significado y, por tanto, la respuesta correcta. Revisa los pares ambiguos antes de atribuir un fallo al sistema.
Separa las funciones de los datos
- Entrenamiento: ajustar el modelo.
- Desarrollo: analizar errores y modificar el método.
- Calibración: fijar un umbral o una regla de abstención si hace falta.
- Prueba: evaluar un método ya fijado con ejemplos reservados.
Tras varias correcciones inspiradas en la prueba, ese conjunto se convierte de hecho en datos de desarrollo. Sigue siendo útil, pero ya no aporta evidencia independiente de generalización.
Conserva una tabla de errores
Registra texto, referencia, predicción, familia de perturbación e hipótesis breve. Presenta recuentos por familia, no solo una media global. Diez paráfrasis del mismo mensaje no equivalen necesariamente a diez situaciones independientes.
Qué permite afirmar una puntuación
Un porcentaje no resume únicamente un modelo. Resume la interacción entre una regla de decisión, unos ejemplos y una forma de contar. Si cambia cualquiera de esos elementos, puede cambiar el resultado. Decir «mi modelo es fiable al 95 %» sin describir la tarea y los datos omite gran parte de la información útil.
La regla del ejemplo funciona porque la evaluación reproduce una asociación entre cortesía e incidente. El éxito es real en esos cuatro mensajes: el cálculo es correcto. Lo incorrecto sería deducir que la regla reconoce una avería o un pago fallido. El error está en interpretar el resultado, no en sumar los aciertos.
Imagina un estudiante que memoriza la posición de las respuestas correctas de un cuestionario. Puede obtener una nota excelente mientras no cambie el orden. Mezclar las respuestas permite comprobar la hipótesis de memorización. La analogía ayuda a entender la prueba, pero no atribuye al modelo las intenciones o la conciencia de un alumno que hace trampa.
Diseña una investigación, no una colección de trampas
Formula una hipótesis comprobable: «La cortesía influye en la decisión aunque el significado de negocio no cambie». Crea varias parejas que aíslen esa transformación. Incluye mensajes en los que el cambio no debería causar dificultades, en vez de seleccionar únicamente fallos espectaculares.
Registra las predicciones antes y después. Una tasa alta de cambios llama la atención, pero importa su dirección: algunas transformaciones corrigen errores iniciales y otras los introducen. El número de respuestas distintas no indica por sí solo si el sistema mejora o empeora.
Conserva también las decisiones tomadas durante la investigación. Si exploraste diez perturbaciones y publicas solo la que produce la mayor diferencia, el lector debe saberlo. Esa selección puede revelar un defecto, pero no estima por sí sola un riesgo representativo del uso real.
Qué debe demostrar una corrección
Una corrección convincente debe funcionar con casos nuevos, conservar los aciertos anteriores y evitar trasladar el problema a otra familia de mensajes. Presenta mejoras y regresiones juntas. La lección no es que las puntuaciones sean inútiles, sino que debemos acompañarlas de las condiciones que les dan significado.
Ejercicio resuelto
La puntuación vuelve al 100 % al añadir cuatro contraejemplos al entrenamiento. ¿Ha desaparecido el atajo? No se puede concluir. Solo has demostrado éxito en casos ya conocidos. Reserva mensajes y formulaciones nuevos para comprobar si la mejora se mantiene.