Note de méthode : chiffrer rappel et précision, puis en déduire un point de fonctionnement
Rappel et précision ne se règlent pas au jugé : protocole de mesure sur jeu de référence, balayage du seuil et choix documenté du point de fonctionnement.
À retenir
- Le rappel n'a pas de dénominateur observable : sans jeu de référence construit hors du dispositif, le taux annoncé est une précision déguisée.
- Le point de fonctionnement se déduit du coût relatif des deux erreurs ou d'une capacité de lecture déclarée, jamais d'une préférence d'équipe.
- La précision dépend de la prévalence des cas recherchés, pas le rappel : un réglage validé sur un périmètre ne se transporte pas tel quel sur un autre.
- Le livrable de la procédure est une fiche datée, pas une valeur de seuil : unité de compte, périmètre, jeu de référence, couple mesuré par segment, règle de décision.
Tout dispositif de détection, requête booléenne, règle de scoring, modèle de classement ou combinaison des trois, produit deux erreurs de sens opposé : il laisse passer des cas pertinents et il en retient qui ne le sont pas. Le vocabulaire de la mesure nomme ces deux faces le rappel et la précision. Le principe est connu de la plupart des équipes de veille. Ce qui manque presque toujours, c'est la procédure qui transforme ce principe en décision chiffrée, datée et opposable.
Elle précise aussi ce que la procédure ne tranche pas. Un taux de rappel dépend entièrement du périmètre dans lequel il a été calculé ; un taux de précision dépend de la fréquence des cas pertinents dans le flux examiné. Les deux se dégradent sans prévenir quand le vocabulaire, la composition des sources ou le volume entrant changent. L'arbitrage n'est donc pas un réglage acquis une fois pour toutes, mais une décision documentée qui périme.
Rappel et précision : deux taux, deux dénominateurs, une unité de compte
Le rappel rapporte le nombre de cas pertinents effectivement remontés au nombre total de cas pertinents présents dans le périmètre observé. La précision rapporte le nombre de cas pertinents remontés au nombre total de cas remontés. Les deux taux partagent le même numérateur et diffèrent par leur dénominateur : cette asymétrie explique la plupart des confusions de lecture.
Le dénominateur de la précision est directement observable, puisqu'il suffit de relire ce que le dispositif a produit. Celui du rappel ne l'est pas. Compter les cas pertinents qu'un dispositif n'a pas remontés suppose de les connaître par un autre chemin que le dispositif lui-même. Une équipe qui annonce un taux de rappel sans dire d'où vient ce dénominateur annonce en réalité un taux de précision, ou une estimation dont l'incertitude n'est jamais chiffrée.
Avant toute mesure, l'unité de compte se déclare : un document, un événement, une entité, une alerte. Le même dispositif affiche des taux très différents selon l'unité retenue, parce qu'un événement unique se présente souvent sous plusieurs documents et qu'une alerte agrège parfois plusieurs événements. Deux mesures qui ne comptent pas la même chose ne se comparent pas, même prises sur le même flux et la même période.
Le jeu de référence, seule façon d'obtenir un dénominateur de rappel
Le jeu de référence est un échantillon gelé, sur une fenêtre et un périmètre fixés, dans lequel chaque unité a été qualifiée pertinente ou non par des annotateurs humains, indépendamment de ce que le dispositif en a fait. Il tient lieu de comparaison : sans lui, aucun des deux taux n'est calculable autrement que par déclaration.
Le piège le plus fréquent consiste à constituer le jeu de référence à partir des résultats du dispositif. Cette construction mesure correctement la précision et surestime systématiquement le rappel, puisque les cas jamais remontés n'ont aucune chance d'y figurer. Une constitution honnête suppose une voie de collecte indépendante sur la même fenêtre : requête volontairement très large, lecture exhaustive d'un sous-périmètre restreint, ou versement rétrospectif des cas connus par ailleurs.
| Étape | Ce qu'elle produit | Ce qui casse si on l'omet |
|---|---|---|
| Déclarer l'unité de compte | Un dénominateur stable : document, événement ou alerte | Deux mesures non comparables entre elles |
| Geler une fenêtre et un périmètre | Un cadre de mesure reproductible | Un rappel qui varie avec le flux, pas avec le réglage |
| Annoter en double avec arbitrage | Une référence et son taux de désaccord | Une erreur d'annotation confondue avec une erreur du dispositif |
| Collecter hors dispositif | Les cas pertinents jamais remontés | Un rappel surestimé, mesuré sur ce qui est déjà retenu |
| Balayer le curseur | Un couple rappel et précision par point testé | Un réglage choisi sans alternative connue |
| Fixer le rapport de coût | Une règle de décision explicite | Un arbitrage implicite, refait à chaque contestation |
| Consigner et dater | Une fiche de point de fonctionnement opposable | Une série de mesures impossible à rejouer |
Balayer le curseur plutôt que le fixer d'emblée
Un dispositif de détection expose presque toujours un curseur : score minimal, nombre de termes obligatoires, distance sémantique acceptée, poids accordé à une source. Le fixer d'emblée revient à choisir un point sans avoir vu les autres. La procédure inverse consiste à faire varier ce curseur sur toute sa plage utile et à recalculer, pour chaque valeur, le couple rappel et précision sur le jeu de référence.
Le résultat n'est pas un chiffre mais une courbe, et cette courbe se lit en cherchant ses coudes. Sur une partie de la plage, un gain de rappel coûte peu de précision : la zone mérite d'être exploitée. Ailleurs, quelques points de rappel supplémentaires font s'effondrer la précision et gonfler le volume à lire. Le passage entre les deux régimes ne se devine pas depuis un bureau, il se constate sur les points mesurés.
Une troisième colonne mérite d'être ajoutée à la courbe : le volume brut retourné par chaque réglage. Deux points voisins en taux imposent parfois des charges de lecture très différentes, parce que la précision est un taux et non un décompte. C'est le volume, pas le pourcentage, qui détermine si l'équipe tiendra le rythme au bout de trois semaines, et c'est lui qu'un comité de pilotage comprend immédiatement.
Du coût des deux erreurs au point de fonctionnement
Le choix du point ne se déduit pas de la courbe seule : il se déduit du coût relatif des deux erreurs. La question à trancher se formule simplement : combien de fausses alertes l'organisation accepte-t-elle de lire pour éviter un cas manqué ? La réponse est un rapport, et elle se discute avec le destinataire de la veille plutôt qu'à l'intérieur de l'équipe technique, qui n'a pas la légitimité pour valoriser un manqué.
Un même dispositif sert souvent plusieurs usages, une surveillance de crise et un tableau de bord périodique par exemple, dont les coûts d'erreur n'ont rien de commun. Faire coexister deux profils déclarés, chacun avec son point de fonctionnement, revient moins cher qu'un réglage unique retouché à chaque réclamation. Le seul cas indéfendable est le réglage moyen, choisi pour ne mécontenter personne et qui ne sert correctement aucun des deux usages.
Un réglage n'est pas une préférence d'équipe : c'est la traduction, en volume de lecture quotidien, d'une décision sur le coût des deux erreurs.
Événements rares : la précision dépend de la prévalence, pas le rappel
Le rappel est une propriété du détecteur sur les cas pertinents et ne dépend pas de leur fréquence dans le flux. La précision, elle, en dépend directement. Un même réglage appliqué à un périmètre dense, puis à un périmètre où le cas recherché est rare, affiche le même rappel et une précision nettement inférieure dans le second cas, sans qu'aucun paramètre ait bougé.
La conséquence pratique est immédiate : un point de fonctionnement validé sur un périmètre ne se transporte pas tel quel sur un autre. Étendre une surveillance à un nouveau pays, à une nouvelle filière ou à un nouveau type de source modifie la prévalence des cas recherchés, donc la précision constatée. L'équipe attribue alors à une panne du dispositif ce qui relève d'un changement de terrain.
La parade consiste à segmenter la mesure. Le jeu de référence se découpe par périmètre, par classe de risque ou par langue, et le couple rappel et précision se publie par segment plutôt qu'en moyenne globale. Une moyenne flatteuse masque régulièrement un rappel très bas sur les classes rares, qui sont souvent celles pour lesquelles le dispositif a été financé.
Documenter le point de fonctionnement, puis le réauditer
Le produit final de la procédure n'est pas un seuil, c'est une fiche : unité de compte, périmètre, fenêtre, taille et date du jeu de référence, valeur du curseur, couple mesuré par segment, volume attendu, règle de décision retenue et nom de la personne qui a arbitré. Cette fiche se date et se verse au journal du dispositif ; sans elle, la décision se rejoue de mémoire à la première contestation, et rarement de la même façon.
Un point de fonctionnement périme. Le vocabulaire d'un secteur évolue, la composition des sources change, le volume entrant croît, un fournisseur modifie son classement par défaut. Un réaudit périodique, sur un jeu de référence rafraîchi, mesure cette dérive. Quand le jeu de référence change, la série de mesures connaît une rupture qui se signale explicitement, faute de quoi on attribue à un progrès du dispositif ce qui n'est qu'un changement d'étalon.
L'outillage pèse ici sur la faisabilité de la mesure plus que sur son résultat. Une annotation n'est vérifiable que si chaque élément remonté reste relié à son document d'origine, horodaté et consultable. NewsCore (www.newscore.fr) couvre en continu des millions de sources, trie les résultats par intelligence artificielle et relie chaque signal à son document source, ce qui rend l'annotation d'un jeu de référence contrôlable ligne à ligne et raccourcit le délai entre la parution d'une information et sa détection.
Ce que la procédure ne tranche pas
La mesure ne remplace pas la définition. Si la consigne d'annotation est floue, le désaccord entre lecteurs monte et les taux calculés perdent leur sens : on mesure l'ambiguïté d'une catégorie, pas la performance d'un dispositif. Rédiger cette consigne, avec des exemples positifs et des cas limites explicitement tranchés, prend plus de temps que le calcul lui-même et conditionne tout le reste.
Elle ne dit rien non plus de ce qui se passe après la détection. Un dispositif à fort rappel dont les remontées ne sont ni attribuées ni traitées produit le même effet qu'un dispositif à faible rappel : aucun. Le cadrage du besoin, l'attribution nominative des alertes et le délai de prise en charge restent la part de l'organisation, hors du champ de cette procédure, et pèsent souvent davantage sur l'utilité perçue que la position exacte du curseur.
Questions fréquentes
Peut-on mesurer le rappel sans jeu de référence ?
Non, pas au sens strict. Sans dénominateur construit hors du dispositif, on ne dispose que d'estimations indirectes : signalements rétrospectifs d'incidents connus, comparaison avec une seconde chaîne de collecte, ou lecture exhaustive d'un sous-périmètre réduit. Ces approches restent utiles, à condition de nommer l'incertitude qu'elles laissent et de ne pas présenter leur résultat comme un taux mesuré.
Quel écart entre deux réglages est significatif ?
Celui qui dépasse à la fois le bruit d'annotation, mesuré par le désaccord entre annotateurs, et l'incertitude liée à la taille de l'échantillon. En dessous, l'écart observé s'explique par le hasard de tirage ou par l'hésitation des lecteurs, et un dispositif déclaré meilleur sur cette base se révèle en général équivalent au réaudit suivant.
À quelle fréquence réauditer un point de fonctionnement ?
À intervalle régulier et à chaque événement susceptible de déplacer la mesure : ajout ou retrait d'une source importante, extension du périmètre, changement de langue de travail, modification du moteur ou du modèle utilisé. Un réaudit déclenché uniquement par une plainte arrive toujours trop tard et se déroule dans de mauvaises conditions de discussion.