Le laboratoire

Le classifieur qui triche sans le savoir

Un score parfait… jusqu’à ce que « merci » change de camp. Débusquez le raccourci.

Expérience construite · sans modèle exécuté

La situation · Comprendre la demande

Votre équipe doit repérer les incidents dans les messages reçus. Lors d’une démonstration, le détecteur reconnaît toutes les pannes. Vous soupçonnez pourtant qu’il se fie à la formule de politesse ajoutée aux exemples.

Ce que vous allez apprendre

Distinguer la réussite sur un jeu de données de la capacité à reconnaître le problème qui nous intéresse.

Votre mission

Conservez le sens des quatre messages et changez seulement la présence de « merci ». Prévoyez ce qui arrivera au score, puis vérifiez votre hypothèse.

À la fin de cette activité. Vous saurez proposer un test par paires pour détecter la dépendance à un indice parasite, sans prétendre avoir expliqué tout le modèle.

À vous de jouer

Règle jouet : si le message contient « merci », prédire un incident. Cette règle est fixée ; aucun entraînement n’est simulé.

MessageRéférencePrédiction

Le signal de politesse n’est pas le problème métier. Le score mesure un jeu de données précis, pas une compétence universelle. Inverser ce signal est un test de résistance construit, pas une estimation de performance réelle.

Distinguer ce que l’on veut reconnaître de ce que l’on observe

La tâche consiste à reconnaître un incident à partir du sens d’un message. Une panne de serveur et un paiement échoué sont des incidents, avec ou sans formule de politesse. La colonne « Référence » représente cette définition de la tâche. Elle reste inchangée lorsque vous actionnez l’interrupteur.

La règle de prédiction, en revanche, ne lit pas le problème décrit. Elle vérifie uniquement si la formule « merci » a été ajoutée. Au départ, nous avons placé cette formule sur les deux incidents. La règle semble alors parfaite parce que deux propriétés différentes coïncident : être un incident et contenir « merci ».

Ce que démontre l’inversion

Lorsque vous déplacez la formule vers les messages normaux, vous cassez cette coïncidence. Les deux incidents ne déclenchent plus d’alerte, et les deux messages ordinaires en déclenchent une. Le score tombe à zéro sans que la règle ait changé. C’est le lien entre l’indice et la bonne réponse qui a été modifié.

Le mot « triche » du titre est une manière amusante de nommer le phénomène. Il ne décrit pas une intention du système. Nous avons écrit une règle mécanique dont le comportement est entièrement connu. Dans un modèle appris, découvrir une sensibilité analogue demanderait des tests, et expliquer son mécanisme interne demanderait des observations supplémentaires.

Gardez cette séparation en tête lorsque vous examinez vos propres résultats. Une expérience peut démontrer qu’un système dépend d’un indice parasite dans certaines conditions sans démontrer qu’il dépend uniquement de cet indice, dans tous les contextes. La qualité de l’explication dépend aussi de la précision de cette limite.

Le piège

Vous avez quatre messages et une règle qui semble imbattable. Avant de cocher la case, prédisez son score après inversion. Les incidents restent des incidents ; seule la formule de politesse change.

Ce qui change, ce qui reste fixe

Le contenu métier et les références sont fixes. Nous déplaçons « merci » des incidents vers les messages normaux. La règle ne voit que cet indice : elle passe donc de 4 réponses correctes sur 4 à zéro. Ce résultat est une construction pédagogique, pas une mesure sur un modèle entraîné.

À essayer dans votre projet

Fabriquez des paires de messages dont le sens reste identique mais dont la politesse, la signature ou la mise en page diffèrent. Une prédiction qui change révèle une sensibilité à étudier. Vérifiez ensuite sur de nouveaux exemples : réparer un test connu ne suffit pas à démontrer la généralisation.