Articles · Mustapha Alouani

Un score parfait mérite une enquête

Construire un test qui distingue une compétence utile d’un raccourci accidentel.

Le signal trop facile

Imaginons un corpus où tous les incidents finissent par « merci » et tous les messages ordinaires s’en passent. Une règle fondée sur ce seul mot obtient 100 % de bonnes réponses. Elle ne sait pourtant rien des incidents. Ce corpus et cette règle sont construits pour rendre le problème visible ; nous ne présentons pas une mesure sur un modèle réel.

Le raccourci apparaît lorsque le signal corrélé à la cible est plus facile à exploiter que le phénomène que nous voulions apprendre. Une signature, un nom de service, un gabarit ou la longueur du texte peuvent jouer ce rôle.

Changer un détail sans changer la réponse

Créez deux versions du même message. Gardez le problème métier, ajoutez ou retirez la formule de politesse. Si la référence reste « incident » mais que la prédiction change, vous avez identifié une sensibilité. Vous n’avez pas encore prouvé son mécanisme interne : cette observation porte sur le comportement.

Les contre-exemples doivent rester plausibles. Une transformation qui supprime un mot essentiel peut réellement changer le sens, et donc la bonne réponse. Faites relire les paires ambiguës avant de conclure à un défaut du système.

Séparer les rôles des jeux de données

  • Entraînement : ajuster le modèle.
  • Développement : analyser les erreurs et modifier la méthode.
  • Calibration : fixer, si nécessaire, un seuil ou une règle d’abstention.
  • Test : mesurer une méthode déjà fixée sur des exemples réservés.

Après plusieurs réparations inspirées par un jeu de test, celui-ci devient de fait un jeu de développement. Il reste utile, mais n’est plus une preuve indépendante de généralisation.

Le tableau à conserver

Pour chaque erreur, gardez le texte, la référence, la prédiction, la famille de perturbation et une courte hypothèse. Présentez les comptes par famille plutôt qu’une seule moyenne. Dix paraphrases d’un même message ne représentent pas nécessairement dix situations indépendantes.

Comprendre ce que le score nous autorise à dire

Un pourcentage ne résume pas seulement un modèle. Il résume la rencontre entre une règle de décision, un ensemble d’exemples et une manière de compter. Lorsque l’un de ces trois éléments change, le résultat peut changer aussi. Dire « mon modèle est fiable à 95 % » sans décrire la tâche et les données laisse donc de côté une grande partie de l’information utile.

Dans notre exemple, la règle réussit parce que le jeu d’évaluation reproduit une association entre politesse et incident. Ce succès est réel sur ces quatre messages : le calcul n’est pas faux. Ce qui serait faux serait d’en déduire que la règle reconnaît la panne ou l’échec du paiement. L’erreur se situe dans l’interprétation du résultat, pas dans l’addition des bonnes réponses.

Pour rendre cette distinction concrète, imaginez un élève qui mémorise la position des bonnes réponses dans un questionnaire. Il peut obtenir une excellente note tant que les questions restent dans le même ordre. Mélanger les réponses permet de tester l’hypothèse de mémorisation. L’analogie aide à comprendre le test, mais ne signifie pas qu’un modèle possède les intentions ou la conscience d’un élève qui triche.

Construire une enquête plutôt qu’une collection de pièges

Commencez par formuler une hypothèse vérifiable : « La présence de la formule de politesse influence la décision, même lorsque le contenu métier ne change pas. » Créez ensuite plusieurs paires qui isolent cette transformation. Incluez aussi des messages où le changement de politesse ne devrait pas poser de difficulté, afin de ne pas sélectionner uniquement les échecs spectaculaires.

Puis notez séparément les prédictions avant et après transformation. Un taux de changement élevé attire l’attention, mais il faut regarder dans quel sens les réponses changent. Certaines transformations peuvent corriger une erreur initiale ; d’autres peuvent introduire une erreur. Le simple nombre de réponses différentes ne dit pas si le système s’améliore ou se dégrade.

Gardez enfin une trace des choix faits pendant l’enquête. Si vous avez exploré dix perturbations et ne publiez que celle qui provoque le plus grand écart, le lecteur doit le savoir. Cette sélection peut être utile pour découvrir un défaut, mais elle ne fournit pas à elle seule une estimation représentative du risque en usage réel.

Ce qu’une réparation doit démontrer

Une correction convaincante doit réussir sur des cas nouveaux, préserver les réussites antérieures et ne pas déplacer le problème vers une autre famille de messages. Présentez donc les gains et les régressions ensemble. L’objectif pédagogique n’est pas de déclarer les scores inutiles : il est d’apprendre à les accompagner des conditions qui leur donnent un sens.

Exercice et correction

Votre score revient à 100 % après ajout des quatre contre-exemples dans l’entraînement. Pouvez-vous annoncer que le raccourci a disparu ? Non. Vous avez montré une réussite sur des cas désormais connus. Réservez de nouveaux messages et de nouvelles formulations, puis vérifiez si l’amélioration s’y maintient.

Ouvrir l’expérience interactive