Articles · Mustapha Alouani
Précision, rappel : choisir ce que l’on veut protéger
Une alerte inutile et un incident manqué ne coûtent pas forcément la même chose.
Le détecteur qui alerte toujours
Un service reçoit cent messages, dont dix signalent un incident. Un détecteur déclenche une alerte pour chaque message. Il trouve les dix incidents : son rappel vaut 100 %. Mais seulement dix alertes sur cent sont justifiées : sa précision vaut 10 %. Ces chiffres sont un exemple construit, pas un résultat du livre.
Le rappel seul lui donne une excellente note. La précision seule raconterait une autre histoire. Avant de choisir une mesure, identifiez les erreurs que votre application doit éviter.
Reconstituer les comptes
Un vrai positif est un incident correctement signalé. Un faux positif est une alerte sur un message normal. Un faux négatif est un incident oublié. Un vrai négatif est un message normal correctement laissé tranquille.
La précision divise les vrais positifs par toutes les alertes. Le rappel les divise par tous les incidents réels. F1 combine précision et rappel par une moyenne harmonique ; il ne tient pas compte des vrais négatifs ni d’un coût métier explicite.
Pourquoi l’exactitude globale peut tromper
Sur le même lot, ne jamais alerter donne 90 % de réponses correctes, mais aucun incident détecté. Ce score peut sembler rassurant si l’on ignore la rareté des incidents. Conservez toujours les effectifs et la répartition des classes à côté du pourcentage.
Une précision observée dépend aussi de la population évaluée. Un jeu artificiellement équilibré n’a pas la même proportion d’incidents que le flux réel. Ne transportez pas mécaniquement ses chiffres vers la production.
Choisir un seuil sans tricher
Si le système produit un score, comparez plusieurs seuils sur un jeu de calibration. Fixez votre critère : capacité humaine à examiner les alertes, coût des incidents manqués, niveau minimal de rappel. Une fois le seuil choisi, utilisez un jeu de test réservé pour mesurer sa performance. Le seuil ne doit pas être ajusté à nouveau sur ce test.
Pour un petit échantillon, quelques cas peuvent changer fortement le résultat. Présentez les comptes et, si le protocole le permet, une estimation d’incertitude. Une différence de deux points n’est pas automatiquement un progrès solide.
Lire une matrice de confusion comme une histoire
Le vocabulaire des métriques devient plus simple lorsqu’on lui associe une situation concrète. Imaginez que vous ouvriez chaque alerte et demandiez : « Y avait-il réellement un incident ? » Vous regardez alors le système du point de vue de la personne qui reçoit les alertes. C’est le point de vue de la précision. Imaginez maintenant que vous partiez de la liste de tous les incidents réels et cherchiez ceux qui ont déclenché une alerte. Vous adoptez le point de vue du rappel.
Les deux lectures utilisent les mêmes décisions, mais commencent par une population différente. Cette différence de point de départ explique leurs dénominateurs. Elle explique aussi pourquoi une précision élevée ne suffit pas : un système peut n’émettre qu’une seule alerte, correcte, tout en manquant neuf autres incidents. Sa précision est alors de 100 %, mais son rappel de 10 %.
Comprendre ce que F1 conserve et ce qu’il efface
F1 est utile lorsque l’on souhaite résumer l’équilibre entre précision et rappel. La moyenne harmonique pénalise un déséquilibre important. Avec une précision de 100 % et un rappel de 10 %, la moyenne arithmétique vaudrait 55 %, alors que F1 vaut environ 18,2 %. Le second nombre rend plus visible le fait que la plupart des incidents sont manqués.
Ce résumé n’a cependant pas de jugement métier intégré. Deux systèmes ayant le même F1 peuvent produire des volumes d’alertes différents, et le même score peut être acceptable pour une tâche exploratoire mais insuffisant pour un processus où chaque erreur coûte cher. Avant de comparer, précisez donc à quoi serviront les prédictions et qui devra traiter leurs conséquences.
Relier la mesure à la fréquence des incidents
Considérons un détecteur fictif qui retrouve 80 % des incidents et alerte à tort sur 10 % des messages normaux. Sur cent messages contenant dix incidents, il produit en moyenne huit alertes justifiées et neuf fausses alertes. Sa précision attendue est donc 8/17, soit environ 47,1 %. Sur cent messages contenant cinquante incidents, les mêmes taux conditionnels donnent quarante alertes justifiées et cinq fausses alertes, soit environ 88,9 % de précision.
Le détecteur n’a pas changé dans cette expérience de pensée. La proportion d’incidents a changé. C’est pourquoi une précision mesurée sur un corpus équilibré ne peut pas être interprétée sans précaution comme celle du flux réel. Les valeurs de cet exemple servent à expliquer le calcul ; dans un système réel, les taux conditionnels eux-mêmes peuvent aussi varier lorsque les données changent.
Prendre une décision explicable
Un choix défendable associe la mesure à une contrainte concrète. Vous pouvez, par exemple, chercher le meilleur rappel compatible avec vingt alertes examinées par jour. Cette formulation rend le compromis visible et discutable. Elle est plus informative qu’une simple demande d’augmenter F1, car elle relie le calcul au travail réel des lecteurs ou des équipes qui utiliseront le système.
Exercice et correction
Avec 8 vrais positifs, 2 faux positifs et 2 faux négatifs, les deux mesures valent 80 %. Doublez les faux négatifs, sans rien changer d’autre. La précision reste à 80 %, le rappel devient 8/12, soit environ 66,7 %. La capsule permet de vérifier le calcul.