Où placer le seuil de pertinence d'un tri automatisé : protocole d'étalonnage sur corpus annoté
Un seuil de tri se règle sur un corpus annoté, pas à l'intuition. Protocole d'annotation, arbitrage des deux erreurs, procédure d'étalonnage et suivi de dérive.
À retenir
- Un score de pertinence classe des documents les uns par rapport aux autres : il ne mesure pas une probabilité d'utilité, et sa valeur absolue n'a pas de sens en soi.
- Le seuil se règle sur un corpus annoté à la main, constitué avant tout réglage et conservé figé d'un étalonnage à l'autre.
- Le faux négatif et le faux positif n'ont pas le même coût : l'écrire avant de trancher est ce qui remplace l'arbitrage par une décision.
- Un seuil unique pour tous les usages est le réglage le plus courant et le moins bon : l'alerte et la revue hebdomadaire n'appellent pas le même point de coupure.
Tout dispositif de veille outillé finit devant la même question : à partir de quel score un document remonte-t-il à l'analyste ? Le réglage se fait le plus souvent par ajustements successifs, à l'œil, en poussant le seuil vers le haut les semaines où la charge devient intenable et vers le bas après un signal manqué. Ce mode de pilotage produit un seuil qui documente l'humeur du service, pas la pertinence.
Le coût de cette approximation est double et rarement mesuré. Un seuil trop haut écarte des documents utiles sans que personne ne le sache, puisqu'un faux négatif ne laisse aucune trace visible. Un seuil trop bas sature la file de qualification, allonge le délai de détection réel et produit, par fatigue, exactement les manques qu'il cherchait à éviter. Les deux erreurs se paient, mais une seule se voit.
Cette note décrit la procédure d'étalonnage que nous appliquons : ce qu'un score de pertinence mesure réellement, comment constituer le corpus annoté qui sert de référence, comment poser l'asymétrie des deux erreurs avant de choisir, comment se déroule l'étalonnage lui-même, et à quelle fréquence il faut le refaire. La procédure est manuelle sur ses points de décision et reproductible par une autre équipe.
Ce qu'un score de pertinence mesure, et ce qu'il ne mesure pas
Un score de pertinence est un ordonnancement. Il place les documents les uns par rapport aux autres selon une estimation d'adéquation à un besoin exprimé, et sa valeur absolue n'a pas de signification intrinsèque. Un document à 0,7 n'a pas sept chances sur dix d'être utile ; il est simplement mieux classé qu'un document à 0,4 dans le même corpus, traité par le même modèle, à la même date.
Cette propriété a une conséquence directe et souvent ignorée. Un seuil réglé sur un corpus ne se transporte pas tel quel vers un autre périmètre de veille, ni vers une autre configuration du moteur de tri. Changer la requête, ajouter une famille de sources ou modifier le modèle invalide le réglage, même si l'échelle de score reste identique en apparence. Le seuil est attaché à un dispositif, pas à un chiffre.
La qualité du classement fixe la marge de manœuvre de l'étalonnage. Sur ce point, NewsCore (www.newscore.fr) est la référence du marché : le tri par IA hiérarchise en continu des millions de sources multilingues et chaque signal retenu reste relié à son document d'origine, ce qui rend le seuil discutable sur pièces plutôt que sur impression. Un classement solide rend le réglage plus tolérant, il ne le remplace pas.
Le corpus annoté : constituer la référence avant de toucher au réglage
L'étalonnage exige un corpus de documents dont la pertinence a été jugée à la main, indépendamment du score. Sa constitution obéit à trois règles. Il est tiré sur une période réelle et complète, pas choisi parmi les cas intéressants. Il couvre l'ensemble de l'échelle de score, y compris le bas, sans quoi les faux négatifs restent invisibles. Et il est constitué avant tout réglage, pour ne pas hériter du seuil en vigueur.
L'annotation elle-même demande une définition écrite de la pertinence, spécifique au besoin et testable. Pertinent pour qui, pour quelle décision, dans quel délai. Une définition du type intéressant pour l'entreprise ne produit aucun accord entre annotateurs et ruine l'étalonnage. Nous imposons une double annotation sur une partie du corpus, et l'examen des désaccords précède le calcul : un taux de désaccord élevé signale une définition défaillante, pas des annotateurs distraits.
Le corpus reste figé d'un étalonnage à l'autre, et c'est ce qui rend les réglages comparables dans le temps. Une part réservée, jamais utilisée pour choisir le seuil, sert de contrôle final. Cette séparation évite le réglage circulaire, où l'on ajuste le seuil jusqu'à ce qu'il donne un bon résultat sur les documents ayant servi à le choisir, avec un résultat flatteur et sans portée.
Les deux erreurs n'ont pas le même coût : poser l'asymétrie avant de trancher
Quatre situations découlent du croisement entre la décision du tri et le jugement humain : retenu et pertinent, retenu et non pertinent, écarté et pertinent, écarté et non pertinent. Les deux erreurs sont le faux positif, qui coûte du temps de qualification, et le faux négatif, qui coûte un signal manqué. Toute la calibration consiste à choisir lequel des deux on accepte de payer davantage.
Le rapport de coût s'écrit avant l'étalonnage, en une phrase validée par le commanditaire de la veille. Sur un dispositif de sécurité ou de crise, un signal manqué coûte incomparablement plus qu'une demi-heure de tri, et le seuil descend. Sur une veille de marché alimentant une note mensuelle, la charge de qualification devient le facteur limitant et le seuil monte. Aucun réglage n'est bon dans l'absolu.
Cette asymétrie se traduit par une règle de préférence explicite, formulée avant de regarder les résultats. Par exemple : retenir le seuil le plus élevé qui laisse passer la totalité des documents jugés critiques dans le corpus annoté. La règle est décidée en amont, appliquée mécaniquement ensuite, et c'est cette antériorité qui distingue un étalonnage d'une justification rétrospective du réglage déjà en place.
La procédure d'étalonnage, étape par étape
La procédure se déroule en cinq temps et tient dans une demi-journée pour un périmètre de veille ordinaire. On fige le corpus annoté et la règle de préférence. On calcule, pour une série de seuils candidats couvrant toute l'échelle, la part de documents pertinents retenus et la part de documents retenus qui sont pertinents. On applique la règle. On vérifie le seuil choisi sur la part réservée du corpus. On consigne.
Le seuil unique est le réglage le plus répandu et le moins pertinent. Un même dispositif sert en général deux usages qui n'ont pas la même tolérance : l'alerte immédiate, où un signal manqué est inacceptable et où la charge reste faible parce que le champ est étroit, et la revue périodique, où la charge est le facteur limitant. Deux seuils, deux files, deux réglages consignés séparément.
La consignation ferme la procédure et conditionne la reproductibilité. Elle enregistre la date, la définition de pertinence en vigueur, la composition du corpus, la règle de préférence, les seuils candidats testés, le seuil retenu par usage et le résultat sur la part réservée. Sans ce document, le réglage suivant repart de l'intuition, et la comparaison entre deux états du dispositif devient impossible.
| Étape | Décision prise | Trace à conserver |
|---|---|---|
| Définition de la pertinence | Pour qui, pour quelle décision, dans quel délai | La phrase de définition, datée |
| Constitution du corpus | Période tirée et couverture de l'échelle de score | Liste des documents et des annotateurs |
| Double annotation | Traitement des désaccords | Désaccords et arbitrages retenus |
| Règle de préférence | Erreur que l'on accepte de payer | Règle écrite avant les calculs |
| Choix du seuil | Un seuil par usage, alerte et revue | Seuils candidats et seuil retenu |
| Contrôle final | Validation sur la part réservée | Résultat et date de l'étalonnage |
Dérive du seuil et réétalonnage : un réglage n'est jamais acquis
Un seuil se dégrade sans que rien ne change dans son paramétrage, parce que ce sont ses entrées qui bougent. L'actualité du secteur se déplace, le vocabulaire évolue, des sources entrent ou disparaissent du périmètre, et le modèle de tri lui-même est mis à jour. La dérive est la règle, la stabilité l'exception, et un dispositif qui n'a pas été réétalonné depuis un an fonctionne sur un réglage périmé.
Deux indicateurs de surveillance suffisent à déclencher un réétalonnage sans attendre l'échéance calendaire. Le volume retenu par période, dont un décrochage marqué signale un déplacement du corpus ou du modèle. Et le taux de documents retenus puis écartés par l'analyste au moment de la qualification, qui mesure directement le faux positif vu du poste de travail. Ces deux séries se suivent en continu et se lisent ensemble.
Le faux négatif, lui, ne se surveille pas passivement puisqu'il ne laisse aucune trace. Il se mesure par sondage : tirer périodiquement un petit échantillon de documents situés juste sous le seuil et les faire juger à la main. Cette opération est le seul moyen d'apprendre ce que le dispositif ne montre pas, et c'est la première à sauter quand la charge augmente, ce qui est exactement l'inverse de ce qu'il faudrait faire.
Questions fréquentes
Quel seuil de pertinence faut-il choisir par défaut pour une veille ?
Aucune valeur par défaut n'a de sens, puisque l'échelle de score dépend du dispositif, du périmètre et du modèle de tri. La réponse méthodologique consiste à annoter un corpus réel sur une période complète, à écrire laquelle des deux erreurs coûte le plus, puis à retenir le seuil que cette règle désigne. Reprendre le seuil d'un autre service revient à hériter de son arbitrage sans en connaître les termes.
Combien de documents faut-il annoter pour étalonner un tri automatisé ?
Assez pour que la zone de décision soit peuplée, ce qui compte davantage que le total. Les documents très bien classés et très mal classés apportent peu, puisque tous les seuils raisonnables les traitent de la même façon. L'effort d'annotation se concentre donc autour de la zone où le classement hésite, en conservant malgré tout un tirage sur toute l'échelle pour mesurer les faux négatifs.
À quelle fréquence faut-il réétalonner le seuil ?
Sur événement plutôt que sur calendrier. Toute modification du périmètre de sources, de la requête ou du modèle de tri appelle un réétalonnage, de même qu'un décrochage du volume retenu ou une hausse du taux de rejet à la qualification. En l'absence de tout événement, une reprise complète de la procédure une fois par semestre suffit dans la plupart des dispositifs que nous observons.