Le laboratoire
Le détecteur trop enthousiaste
Attraper plus de cas, au prix de fausses alertes ? Manipulez précision, rappel et F1.
Expérience construite · sans modèle exécuté
La situation · Évaluer le service rendu
Votre équipe reçoit les alertes de l’assistant. Certaines signalent un vrai incident ; d’autres lui font perdre du temps. Des incidents peuvent aussi passer inaperçus. Quel bilan présenter pour décider si l’outil est utile ?
Ce que vous allez apprendre
Lire la précision du point de vue des alertes reçues et le rappel du point de vue des incidents réels.
Votre mission
Partez de huit incidents détectés. Augmentez les fausses alertes, puis les incidents manqués. Décrivez l’effet sur le travail de l’équipe avant de regarder les pourcentages.
À la fin de cette activité. Vous saurez calculer et interpréter les trois mesures sans confondre un score synthétique avec une décision métier.
À vous de jouer
Défi : gardez 8 vrais positifs et 2 incidents manqués. Faites passer les fausses alertes de 2 à 8. Quelle mesure reste identique ?
Précision = VP / (VP + FP). Rappel = VP / (VP + FN). F1 = 2VP / (2VP + FP + FN). Si le dénominateur est nul, nous affichons « non défini ». Les vrais négatifs ne sont pas utilisés ici.
Explication
Le rappel reste à 80 %. La précision passe de 80 % à 50 %, et F1 de 80 % à environ 61,5 %. On ne peut pas choisir un système sur une seule mesure.
Lire les compteurs du point de vue de l’utilisateur
Imaginez que vous soyez chargé d’examiner les alertes d’un outil de surveillance. Avec les valeurs initiales, vous recevez dix alertes : huit correspondent à un incident réel, et deux sont inutiles. La précision vaut donc huit sur dix. Pour connaître le rappel, il faut quitter la boîte des alertes et regarder tous les incidents réels : il y en avait dix, dont deux n’ont pas été détectés. Le rappel vaut lui aussi huit sur dix, mais pour une autre raison.
Cette égalité initiale peut donner l’impression que les deux mesures racontent la même chose. Le rôle de la manipulation est précisément de dissiper cette impression. Ajoutez six fausses alertes : vous devrez maintenant examiner seize alertes pour trouver les mêmes huit incidents. Votre charge de vérification augmente et la précision tombe à 50 %. Pourtant, aucun incident supplémentaire n’a été manqué : le rappel reste à 80 %.
Pourquoi la mesure ne décide pas à votre place
La formule de F1 combine les deux ratios afin de pénaliser un fort déséquilibre. Elle ne connaît cependant pas votre organisation. Si une fausse alerte coûte une minute et qu’un incident manqué coûte plusieurs heures d’arrêt, le choix d’un système doit tenir compte de cette différence. Les métriques décrivent les décisions ; les conséquences donnent le contexte dans lequel les interpréter.
Lorsque vous ajustez librement les compteurs, vous explorez les propriétés des formules. Vous ne démontrez pas qu’un classifieur réel peut atteindre toutes ces combinaisons. Dans un vrai système, déplacer un seuil modifie généralement plusieurs compteurs à la fois. Il faut alors mesurer ces changements sur des exemples représentatifs plutôt que choisir séparément les nombres qui nous arrangent.
Deux questions différentes
La précision demande : parmi les alertes émises, combien étaient justifiées ? Le rappel demande : parmi les vrais incidents, combien avons-nous repérés ? Les dénominateurs sont différents.
Une expérience de pensée
Avec 8 incidents détectés, 2 fausses alertes et 2 incidents manqués, précision et rappel valent 80 %. Augmenter seulement les fausses alertes dégrade la précision sans changer le rappel. Augmenter seulement les incidents manqués produit l’effet inverse.
Ne pas confondre un calcul et une politique
Ces compteurs sont libres : la capsule ne modélise pas une courbe de seuil d’un classifieur réel. Pour choisir un seuil, mesurez les prédictions sur un jeu de calibration puis évaluez le choix fixé sur un jeu de test distinct. F1 ne représente ni le coût des erreurs, ni la fréquence de tous les cas négatifs.
Défi bonus
Mettez tous les compteurs à zéro. Un score non défini n’est pas un zéro de performance : il manque des observations pour calculer le ratio.