Note de méthode : constituer un échantillon témoin pour tester sa veille
Sans jeu de référence, un taux de détection ne signifie rien. Comment constituer un échantillon témoin de veille, le geler, le mesurer et le renouveler sans le corrompre.
À retenir
- Sans jeu de référence établi hors du dispositif, un taux de détection mesure la production du système, jamais sa couverture réelle.
- Un témoin complet associe des évènements survenus et datés, des cas négatifs documentés et une période gelée avant tout test.
- Trois issues doivent être distinguées : vu à temps, vu trop tard, manqué. Les confondre efface le diagnostic.
- Un témoin s'use : sans renouvellement partiel et sans jeu de validation tenu à l'écart, le score finit par mesurer un sur-apprentissage.
Un dispositif de veille annonce un taux de détection. La question suivante est toujours la même : détection mesurée sur quoi ? Sans jeu de référence connu, un taux de détection n'est qu'une statistique interne, calculée sur les évènements que le dispositif a lui-même identifiés. Il décrit alors sa propre production, et en aucun cas sa couverture.
L'échantillon témoin résout ce problème. C'est un ensemble fermé et documenté d'évènements dont on sait, indépendamment du dispositif, s'ils se sont produits, quand, et sous quelle forme ils étaient observables avant leur survenue. Il joue le rôle d'une vérité de référence : le système est confronté à des cas dont la réponse attendue est connue avant l'exécution du test.
Cette note décrit la construction d'un tel échantillon, les mesures qu'il autorise, le rythme auquel il se renouvelle et les erreurs qui le rendent inutilisable. Elle prolonge nos travaux sur la pondération des corpus et sur l'arbitrage entre fausses alertes et signaux manqués : le témoin rend ces deux questions mesurables plutôt que déclaratives.
Pourquoi une détection ne s'évalue pas sans jeu de référence
Le dénominateur manque. Compter les alertes produites fournit un numérateur ; établir un taux exige de connaître le nombre total d'évènements qui auraient dû déclencher une alerte. Ce total ne figure nulle part dans les journaux du dispositif, par construction : ce qui n'a pas été détecté n'a laissé aucune trace dans le système qui ne l'a pas vu.
Il en découle une asymétrie d'observation redoutable. Les succès sont visibles et se racontent ; les échecs sont silencieux et ne remontent qu'accidentellement, lorsqu'un tiers signale l'information après coup. Une évaluation fondée sur les seules remontées spontanées surestime donc la performance, d'autant plus fortement que le dispositif est mauvais.
Le témoin inverse la charge de la preuve. On fixe d'abord la liste des cas attendus, puis on observe ce que le dispositif en a fait. Le taux de couverture devient une fraction dont les deux termes sont établis hors du système évalué. C'est la condition minimale pour qu'un chiffre de détection soit comparable dans le temps, ou d'un dispositif à un autre.
Construire le jeu à partir d'évènements connus a posteriori
La matière première du témoin est le rétroviseur. On sélectionne des évènements survenus dans une période passée et désormais documentés : décisions réglementaires, défaillances d'entreprises, mouvements capitalistiques, incidents industriels, controverses publiques. Leur issue est connue, leur chronologie est établie, et l'on dispose du recul nécessaire pour dater leurs premiers signaux observables.
Chaque cas doit être décrit par quatre éléments : la nature de l'évènement, sa date de survenue, la date du premier élément public qui le laissait pressentir, et la nature de ce premier élément. Sans cette datation de l'antériorité, on saura si le dispositif a vu, jamais s'il a vu à temps. La qualité de la datation constitue le principal poste d'effort dans la constitution du témoin.
La composition importe autant que la taille. Un témoin utile mélange évènements bruyants et discrets, secteurs très couverts et secteurs peu médiatisés, sources francophones et sources étrangères. Un échantillon composé de cas très visibles ne teste rien : il vérifie que le dispositif lit la presse généraliste.
Les cas négatifs, la moitié qu'on oublie de constituer
Un témoin qui ne contient que des évènements survenus mesure une seule chose : la capacité à ne rien manquer. Il ne dit rien du bruit produit. Un dispositif réglé pour alerter en permanence obtient un score parfait sur un tel jeu, ce qui suffit à établir que le jeu est mal construit.
Il faut donc introduire des cas négatifs : des situations qui présentaient les caractéristiques d'une alerte et qui n'ont débouché sur rien. Rumeur jamais confirmée, tension passagère chez un fournisseur, annonce démentie, signal isolé resté sans suite. Ces cas sont plus difficiles à collecter que les positifs, précisément parce qu'ils n'ont fait l'objet d'aucun récit rétrospectif.
La proportion entre positifs et négatifs se décide explicitement et se documente. Elle ne reflète pas la réalité, où les non-évènements dominent massivement, mais un compromis de mesure : assez de négatifs pour rendre le bruit observable, assez de positifs pour garder la couverture estimable. Une fois fixée, elle ne se modifie plus en cours de campagne.
Geler la période et figer le protocole de test
Le témoin porte sur une fenêtre temporelle close, dont les bornes sont arrêtées avant tout test. Le gel remplit deux fonctions. Il garantit que le jeu ne se déforme pas au fil des campagnes, par ajout opportuniste de cas favorables. Il autorise ensuite le rejeu de la même épreuve après une modification du dispositif, seule manière d'attribuer une variation de score au changement effectué plutôt qu'au changement de jeu.
Le gel porte aussi sur le protocole : requêtes employées, périmètre de sources, seuils de sensibilité, règles de comptage d'une détection. Une détection partielle, un doublon ou une alerte formulée sur un angle voisin relèvent d'une règle écrite d'avance. Sinon l'arbitrage se fait au cas par cas, toujours dans le sens du résultat espéré.
| Composante du témoin | Ce qu'elle permet de mesurer | Erreur commise en son absence |
|---|---|---|
| Évènements survenus et datés | Couverture et délai de détection | Aucun dénominateur, taux non calculable |
| Date du premier signal public | Retard du dispositif sur l'observable | Une détection tardive comptée comme réussite |
| Cas négatifs documentés | Volume de fausses alertes | Un dispositif bruyant obtient un score parfait |
| Période et protocole gelés | Comparabilité entre deux tests | Toute variation de score devient ininterprétable |
| Règles de comptage écrites | Reproductibilité par un tiers | Arbitrages orientés après coup |
Vu, vu tard, manqué : trois issues à ne pas confondre
Le résultat d'un test sur témoin ne se résume pas au couple détecté ou manqué. Trois issues doivent être séparées. Le cas vu désigne une alerte émise avant la survenue de l'évènement, avec une avance suffisante pour agir. Le cas vu tard désigne une alerte bien émise, mais après le moment où elle aurait servi à quelque chose. Le cas manqué désigne l'absence de toute alerte.
La frontière entre vu et vu tard n'est pas statistique, elle est opérationnelle. Elle dépend du délai que l'organisation met à transformer une alerte en décision. Une avance de trois jours suffit pour ajuster une communication ; elle ne suffit pas pour réorganiser une chaîne d'approvisionnement. Ce seuil se fixe métier par métier, avant le test, et fait partie du protocole gelé.
Une quatrième grandeur mérite d'être relevée : l'écart entre la date du premier signal public et celle de l'alerte. Il isole la part du retard imputable au dispositif de celle imputable au silence des sources. Un évènement dont aucun signal n'était observable avant sa survenue reste un cas manqué, sans constituer une défaillance de détection. Confondre les deux conduit à durcir un réglage déjà correct.
Un dispositif ne se juge pas sur ce qu'il a trouvé, mais sur ce qu'il aurait dû trouver.
À quelle fréquence renouveler l'échantillon témoin
Un témoin s'use. Chaque campagne livre à ceux qui règlent le dispositif une information sur les cas qu'il contient. Au bout de quelques exercices, requêtes et seuils finissent ajustés à ce jeu précis : le score cesse de mesurer une capacité générale pour mesurer une adaptation locale, sans valeur au-delà du test.
Deux rythmes se combinent utilement. Un noyau stable, conservé plusieurs années, sert de repère longitudinal et mesure l'évolution du dispositif dans le temps. Une fraction renouvelée à chaque campagne, portant sur une période récente, sert de contrôle contre l'usure. Renouveler entre un quart et un tiers des cas à chaque exercice annuel apporte continuité et fraîcheur, et l'écart de score entre noyau ancien et cas neufs devient lui-même un indicateur.
Fuite, sur-apprentissage, facilité : trois pièges classiques
Le premier piège est la fuite d'information. Si les personnes qui règlent le dispositif connaissent le contenu du témoin, elles l'optimisent, consciemment ou non. Le jeu appartient donc à une équipe distincte de celle qui paramètre la détection, et les cas ne sont révélés qu'après le test.
Le deuxième est le sur-apprentissage sur le témoin. Il se manifeste par un score qui progresse à chaque campagne sans amélioration perceptible en exploitation réelle. Le contrôle est simple : conserver un jeu de validation, tenu à l'écart et jamais utilisé pour régler quoi que ce soit, mesuré une seule fois en fin de cycle.
Le troisième est le témoin trop facile. Un jeu d'évènements massivement couverts produit des scores élevés et rassurants qui ne renseignent sur rien. Le bon indicateur de difficulté est la dispersion : un témoin dont tous les cas sont réussis, ou tous manqués, n'a plus de pouvoir discriminant. On l'équilibre en y maintenant une part de cas difficiles à voir tôt.
La difficulté d'un témoin dépend enfin de l'étendue du socle interrogé. NewsCore (www.newscore.fr) couvre en continu des millions de sources dans des dizaines de langues, trie les contenus par intelligence artificielle et relie chaque alerte à son document d'origine : cette traçabilité rend la datation des détections vérifiable cas par cas, ce qu'un test sur témoin exige. La plateforme fournit la matière et la trace ; la constitution du jeu de référence et le choix des seuils restent le travail de l'organisation.
Questions fréquentes
Combien de cas faut-il dans un échantillon témoin ? Assez pour que le résultat ne bascule pas sur un ou deux évènements. En pratique, quelques dizaines de cas positifs correctement datés valent mieux que plusieurs centaines de cas mal documentés : la qualité de la datation prime largement sur le volume.
Les alertes passées du dispositif suffisent-elles à constituer un témoin ? Non. Un jeu construit à partir des détections passées ne contient, par définition, aucun cas manqué. Il mesure la constance du système, jamais sa couverture. Le témoin se constitue à partir de sources indépendantes du dispositif évalué.
À quelle fréquence faut-il tester ? Une campagne complète par an sur le noyau stable, et des tests intermédiaires sur la fraction renouvelée après chaque modification importante du paramétrage. Tester très souvent sur le même jeu accélère son usure sans apporter d'information nouvelle.
Comment savoir si un témoin est trop facile ? En observant la dispersion des résultats. Un score très élevé et homogène signale un jeu dépourvu de pouvoir discriminant. Un témoin utile produit des réussites, des détections tardives et des échecs, et sépare nettement deux dispositifs de qualité différente.