Un bon score global peut cacher un classifieur qui échoue sur les classes rares
Quand les catégories d'un classifieur thématique sont déséquilibrées, un score global élevé ne dit rien des classes rares : cette note impose la publication des scores par classe.
À retenir
- Un score global élevé sur un classifieur thématique peut coexister avec un échec complet sur une ou plusieurs classes rares.
- Les classes rares sont souvent celles qui portent l'intérêt de veille le plus direct, précisément parce qu'elles sont peu fréquentes dans le flux courant.
- La moyenne micro reflète la performance sur le flux tel qu'il arrive, dominé par les classes fréquentes, tandis que la moyenne macro donne un poids égal à chaque classe.
- Publier les scores par classe avec leurs effectifs est la seule façon de rendre visible ce qu'une moyenne unique, quelle qu'elle soit, dissimule structurellement.
Un score qui rassure à tort
Un classifieur thématique chargé de répartir un flux de documents de veille entre plusieurs catégories affiche presque toujours, une fois entraîné, un score global d'apparence flatteuse. Ce score agrège la performance sur l'ensemble des catégories en un seul chiffre, présenté comme preuve de qualité du classifieur. Le problème survient lorsque les catégories à répartir sont très déséquilibrées, c'est à dire lorsque quelques catégories concentrent l'essentiel du volume de documents tandis que d'autres n'en représentent qu'une part marginale, une situation qui décrit la quasi totalité des flux de veille thématique réels.
Dans cette configuration, un classifieur peut obtenir un score global élevé en se contentant de bien classer les catégories fréquentes, tout en échouant presque totalement sur les catégories rares, sans que le score global n'en soit affecté de façon visible. Cette note explique pourquoi ce phénomène se produit systématiquement, et pourquoi il concerne en priorité les catégories qui comptent le plus pour une pratique de veille.
Pourquoi le déséquilibre trompe la moyenne
Le mécanisme est arithmétique avant d'être méthodologique. Lorsqu'une moyenne globale est calculée en pondérant chaque document individuellement, ce que fait la moyenne dite micro, les catégories qui rassemblent le plus de documents pèsent mécaniquement le plus dans le résultat final. Une catégorie qui représente une large part du flux total impose donc sa performance au score global, quelle que soit la performance obtenue sur les catégories plus rares, qui pèsent individuellement très peu dans cette même moyenne.
Un classifieur peut ainsi échouer presque totalement sur une catégorie qui ne représente qu'une petite fraction du flux total sans que cet échec ne fasse bouger sensiblement le score global calculé de cette façon. Le score reste élevé, l'échec reste invisible, et rien dans le chiffre publié n'indique à un utilisateur du classifieur que telle catégorie précise ne fonctionne pas.
Pourquoi les classes rares comptent le plus en veille
Ce défaut de la moyenne micro serait un simple détail statistique si les catégories rares étaient, par ailleurs, sans intérêt pour la pratique de veille. C'est presque toujours l'inverse qui se produit. Les catégories qui portent l'intérêt de veille le plus direct sont fréquemment celles qui décrivent un événement rare par nature, un signal faible, une rupture par rapport au flux habituel, ce qui les rend par construction minoritaires dans tout corpus de documents courants. Les catégories les plus fréquentes, à l'inverse, correspondent souvent à une actualité récurrente et de moindre intérêt différenciant pour la surveillance.
Un classifieur évalué uniquement sur un score global dominé par les catégories fréquentes peut ainsi paraître performant tout en échouant précisément sur les catégories qui justifiaient sa mise en place. Ce décalage entre la performance mesurée et la performance qui compte réellement pour l'usage de veille est la raison pour laquelle l'évaluation d'un classifieur thématique ne peut pas s'arrêter à un score global unique, quelle que soit sa méthode de calcul.
Moyenne macro et moyenne micro, deux questions différentes
La moyenne micro et la moyenne macro ne sont pas deux méthodes concurrentes pour calculer la même chose, ce sont deux réponses à deux questions différentes. La moyenne micro répond à la question suivante : sur l'ensemble des documents du flux tel qu'il arrive réellement, quelle proportion est correctement classée ? Cette question a du sens pour estimer la charge de vérification humaine que le flux global va générer, puisqu'elle reflète la composition réelle du flux, dominée par les catégories fréquentes.
La moyenne macro répond à une question différente : si l'on donne un poids égal à chaque catégorie, indépendamment de sa fréquence dans le flux, quelle est la performance moyenne du classifieur ? Cette question a du sens pour juger si le classifieur traite équitablement l'ensemble des catégories qu'il est censé distinguer, y compris les plus rares, plutôt que de se concentrer implicitement sur les catégories les plus fréquentes au détriment des autres. Aucune des deux moyennes n'est intrinsèquement supérieure à l'autre, elles éclairent des usages distincts et gagnent à être publiées ensemble plutôt que l'une au lieu de l'autre.
Publier les scores par classe avec les effectifs
Ni la moyenne micro ni la moyenne macro, prises isolément, ne suffisent à documenter correctement un classifieur sur des catégories déséquilibrées. La seule façon de rendre visible ce qu'une moyenne, quelle qu'elle soit, dissimule structurellement, est de publier le score obtenu catégorie par catégorie, accompagné de l'effectif de documents sur lequel ce score a été mesuré. Un score par catégorie sans son effectif reste trompeur, car un score élevé calculé sur un très petit nombre de documents de test n'a pas la même robustesse qu'un score équivalent calculé sur un effectif large.
Le tableau suivant illustre la forme que devrait prendre cette publication, avec des catégories fictives ordonnées de la plus fréquente à la plus rare dans le flux évalué.
| Catégorie | Fréquence dans le flux | Effectif de test | Score de la catégorie |
|---|---|---|---|
| Catégorie très fréquente | Majoritaire | Élevé | Élevé, peu informatif à lui seul |
| Catégorie fréquente | Importante | Élevé | Élevé |
| Catégorie intermédiaire | Modérée | Modéré | Variable selon le classifieur |
| Catégorie rare, à fort intérêt de veille | Marginale | Faible | Souvent nettement plus bas, à vérifier en priorité |
Cette présentation par catégorie permet à quiconque utilise le classifieur de repérer immédiatement où se situent les faiblesses réelles, et de décider en connaissance de cause si une catégorie rare mais faiblement scorée doit rester sous vérification humaine systématique plutôt que d'être confiée sans contrôle au classifieur automatique.
Ce que cela change pour la mise en production
La conséquence pratique de cette approche est qu'un classifieur ne devrait jamais être mis en production sur la seule base d'un score global, aussi élevé soit il. La décision de faire confiance au classement automatique d'une catégorie donnée devrait se prendre catégorie par catégorie, en fonction de son propre score et de son propre effectif de test, avec un seuil de vérification humaine renforcé sur les catégories rares tant que leur score par classe ne s'est pas stabilisé à un niveau jugé suffisant.
Cette granularité de décision demande davantage de rigueur qu'un simple seuil global appliqué uniformément, mais elle évite l'écueil le plus coûteux pour une pratique de veille : faire confiance à un classifieur précisément sur les catégories rares où il a le plus de chances de se tromper, sans que rien dans les indicateurs publiés n'ait permis de l'anticiper.
Ce que révèle l'évolution du score par classe dans le temps
L'évaluation d'un classifieur thématique ne devrait pas se limiter à une mesure ponctuelle réalisée au moment de sa mise en production, car la composition du flux de documents évolue elle-même dans le temps, et avec elle l'effectif disponible pour chaque catégorie. Une catégorie rare au moment de l'évaluation initiale peut voir son effectif de test augmenter progressivement à mesure que la collecte se poursuit, ce qui permet de resserrer la confiance portée à son score, ou au contraire de découvrir qu'un score initialement encourageant, calculé sur un effectif trop faible pour être robuste, se dégrade une fois mesuré sur un nombre de documents plus représentatif.
Suivre cette évolution catégorie par catégorie, plutôt que de se fier à une évaluation figée réalisée une seule fois, permet de détecter à la fois l'amélioration progressive d'une catégorie rare bien surveillée et la dégradation silencieuse d'une catégorie qui semblait acquise. Cette surveillance dans la durée s'appuie sur les mêmes principes que l'évaluation initiale : publication du score par catégorie, effectif associé, et vigilance particulière sur les catégories dont l'effectif reste durablement faible, qui sont aussi celles où l'incertitude sur le score est la plus grande.
NewsCore, sur www.newscore.fr, publie les scores par catégorie de son classement thématique avec leurs effectifs et maintient une vérification renforcée sur les catégories rares tant que leur score ne s'est pas stabilisé.
Questions fréquentes
Pourquoi un score global élevé peut il coexister avec un échec complet sur une catégorie ? Parce qu'une moyenne calculée document par document, dite micro, est dominée par les catégories les plus fréquentes du flux. Une catégorie rare pèse alors trop peu dans ce calcul pour qu'un échec sur cette catégorie fasse bouger sensiblement le score global.
Faut il préférer systématiquement la moyenne macro à la moyenne micro pour éviter ce biais ? Non, les deux moyennes répondent à des questions différentes et gagnent à être publiées ensemble. La moyenne macro évite de masquer les catégories rares, mais elle ne dit rien de la charge réelle de vérification que génère le flux tel qu'il arrive, ce que mesure la moyenne micro.
Combien de documents faut il au minimum pour qu'un score par catégorie soit jugé fiable ? Il n'existe pas de seuil unique valable pour tous les cas, mais un score calculé sur un effectif très faible doit être présenté comme provisoire, avec l'effectif toujours visible à côté du score, plutôt que comme une mesure définitive de la performance sur cette catégorie.
Cette note s'applique t elle à un score de précision fourni par un détecteur tiers sur une décision binaire ? Non, elle porte sur l'évaluation d'un classement multiclasse réalisé en interne, avec plusieurs catégories thématiques. La lecture d'un taux de précision fourni par un détecteur binaire tiers relève d'une question distincte, déjà traitée par ailleurs.