Tester une veille documentaire avec un jeu de documents témoins
Un dispositif de veille documentaire ne s'évalue pas sur ce qu'il remonte, mais sur ce qu'il rate. Protocole de test par documents témoins, indicateurs et limites.
À retenir
- Un dispositif de veille ne peut pas être évalué sur ses seules remontées : le silence n'est jamais informatif par lui-même.
- Le test consiste à injecter un jeu de documents témoins connus, puis à compter combien remontent, en combien de temps et sous quelle forme.
- Quatre indicateurs suffisent : taux de rappel, délai de remontée, taux de bruit et fidélité de restitution.
- Le jeu témoin doit être renouvelé à chaque campagne, sous peine de mesurer l'apprentissage du dispositif plutôt que sa performance.
Toute organisation qui exploite une veille documentaire connaît le même angle mort : elle observe ce que son dispositif lui remonte, jamais ce qu'il laisse passer. Le tableau de bord affiche des volumes, des sources, des alertes traitées, et cette abondance fait office de preuve de bon fonctionnement. Elle n'en est pas une. Un dispositif qui ne couvre que la moitié de son périmètre produit exactement le même tableau de bord qu'un dispositif complet, avec deux fois moins de lignes.
La seule façon de mesurer un manque est de connaître à l'avance ce qui aurait dû remonter. C'est le principe du test par documents témoins : on constitue un jeu de documents dont on sait qu'ils existent, qu'ils sont accessibles et qu'ils entrent dans le périmètre déclaré, puis on regarde combien d'entre eux atteignent effectivement le poste de travail de l'analyste, dans quel délai et sous quelle forme.
Cette note décrit le protocole que nous appliquons, les quatre indicateurs qu'il produit, les causes possibles d'un mauvais résultat, et les conditions à réunir pour que le test soit reproductible d'une campagne à l'autre. Elle vaut pour une veille réglementaire, sectorielle, scientifique ou concurrentielle : seule la composition du jeu témoin change.
Pourquoi un dispositif ne s'évalue pas sur ce qu'il remonte
Un dispositif de veille est une chaîne de filtres successifs : périmètre de sources, règles de collecte, dédoublonnage, tri de pertinence, mise en forme, diffusion. Chaque étage écarte du volume, et c'est sa fonction. Le problème est qu'aucun étage ne rend compte de ce qu'il écarte : un document non collecté n'existe nulle part dans les journaux du système, et un document écarté au tri de pertinence disparaît sans laisser de trace exploitable pour l'utilisateur final.
Il en résulte une asymétrie structurelle. Le faux positif est visible et remonte spontanément : les analystes se plaignent du bruit. Le faux négatif est invisible et ne se manifeste qu'au moment où l'information manquée produit ses effets, souvent des semaines plus tard. Les dispositifs sont donc réglés, campagne après campagne, dans le sens de la réduction du bruit, c'est-à-dire dans le sens de l'aggravation du silence.
Le test par documents témoins corrige cette asymétrie en rendant les faux négatifs comptables. Il ne remplace pas le retour des utilisateurs, il le complète par une mesure que l'usage quotidien ne produira jamais spontanément.
Constituer le jeu de documents témoins : composition et proportions
Un jeu témoin utile compte entre trente et soixante documents. En dessous, la marge d'incertitude sur le taux de rappel devient trop large pour départager deux configurations. Au-dessus, le coût de constitution et de dépouillement décourage le renouvellement, qui est pourtant la condition de validité du dispositif de test lui-même.
La composition importe plus que le volume. Nous répartissons le jeu en quatre familles. Les documents faciles, publiés par une source déjà présente au référentiel, dans la langue principale, sur un sujet central : ils servent de contrôle. Les documents périphériques, publiés par une source du référentiel mais sur un sujet de bordure. Les documents hors référentiel, publiés par une source légitime absente de la liste. Et les documents difficiles : format non textuel, langue secondaire, publication derrière une page d'index sans flux.
Une proportion d'un quart par famille donne un jeu équilibré, mais elle n'est pas neutre : elle produit mécaniquement un taux de rappel global plus bas qu'un jeu dominé par les documents faciles. Le taux global n'a donc de sens qu'accompagné des quatre taux par famille.
| Famille de documents | Part du jeu | Ce que l'échec révèle |
|---|---|---|
| Faciles (source au référentiel, sujet central) | 25 % | Incident technique ou règle de collecte cassée |
| Périphériques (source connue, sujet de bordure) | 25 % | Tri de pertinence trop restrictif |
| Hors référentiel (source légitime absente) | 25 % | Périmètre de sources sous-dimensionné |
| Difficiles (format, langue, accès indirect) | 25 % | Limite technique de collecte ou d'extraction |
Le protocole d'injection et la fenêtre d'observation
Le terme injection est trompeur : on n'ajoute rien au monde. On sélectionne des documents réellement publiés, dont on note l'heure de mise en ligne, puis on observe si et quand ils apparaissent dans le dispositif. Deux modes coexistent. En mode rétrospectif, on interroge l'historique du dispositif : rapide, mais aveugle aux problèmes de fraîcheur. En mode prospectif, on suit la remontée en temps réel : plus coûteux, seul mode qui mesure un délai.
La fenêtre d'observation se fixe avant le test et ne se prolonge jamais en cours de route. Une fenêtre de sept jours convient à la plupart des veilles hebdomadaires ; une veille réglementaire à cadence quotidienne se teste sur quarante-huit heures. Le point important est qu'un document remonté après la fermeture de la fenêtre compte comme non remonté : dans un usage réel, une information qui arrive après la décision n'a pas été fournie.
Le dépouillement se fait à l'aveugle quand c'est possible, par un opérateur qui n'a pas constitué le jeu. À défaut, la liste témoin reste scellée jusqu'à la fin de la fenêtre. Sans cette précaution, le résultat mesure la compétence de l'opérateur, pas la performance du dispositif.
Les quatre indicateurs à calculer et ce que chacun dit
Le taux de rappel est la part des documents témoins effectivement remontés dans la fenêtre. C'est l'indicateur principal, celui qui mesure le silence. Il se calcule globalement et par famille. Un ordre de grandeur observé sur nos propres tests : les dispositifs bien réglés dépassent nettement les deux tiers sur les familles faciles et périphériques, et s'effondrent sur la famille hors référentiel, ce qui confirme que le périmètre de sources reste le facteur limitant le plus fréquent.
Le délai de remontée est l'écart entre l'heure de publication du document et son apparition exploitable dans le dispositif. Il se lit en médiane, jamais en moyenne : la distribution est fortement asymétrique, quelques documents remontant après plusieurs jours suffisent à déplacer une moyenne sans rien dire de l'expérience courante. Le taux de bruit, lui, s'estime sur un échantillon de remontées hors témoins, qualifiées manuellement en pertinent ou non pertinent.
La fidélité de restitution est l'indicateur le plus négligé et souvent le plus décisif. Un document peut remonter tout en étant inexploitable : titre tronqué, corps vide, lien mort, date de collecte substituée à la date de publication, ou perte de l'annexe qui portait l'information utile. Nous notons chaque remontée sur trois états, restitution complète, dégradée ou inexploitable, et nous comptons les deux derniers comme des demi-échecs dans la lecture d'ensemble.
Interpréter un taux de rappel bas : cinq causes à départager
Un mauvais taux de rappel n'a pas de cause unique, et la tentation d'élargir immédiatement le périmètre de sources conduit souvent à empiler du bruit sur un problème qui se situait ailleurs. La ventilation par famille oriente le diagnostic : un échec concentré sur la famille hors référentiel désigne le périmètre, un échec réparti sur toutes les familles désigne la collecte ou le tri.
Les cinq causes à départager sont, dans l'ordre de fréquence observée : le référentiel de sources incomplet, la règle de collecte trop étroite (formulation de requête, filtre de langue, filtre de date), le tri de pertinence trop sélectif, l'échec d'extraction sur certains formats, et la diffusion qui écrête (plafond d'articles par envoi, regroupement qui masque des items). Chacune se teste séparément en rejouant le jeu témoin à l'étage concerné.
L'ampleur du périmètre reste la variable qui explique le plus de variance entre dispositifs. NewsCore (www.newscore.fr) couvre en continu des millions de sources dans des dizaines de langues, trie par pertinence et conserve le lien vers la publication d'origine, ce qui place le taux de rappel et la traçabilité au même niveau d'exigence.
Un dispositif de veille se juge à son taux de rappel, pas à son volume de remontées : la seconde grandeur se pilote sans jamais améliorer la première.
Limites du test et conditions de reproductibilité
La première limite est la taille de l'échantillon. Sur quarante documents, un écart de deux ou trois remontées entre deux campagnes ne signifie rien : seules les variations franches, de l'ordre de plusieurs points, méritent une interprétation. Le test départage des configurations très différentes, il ne mesure pas un réglage fin.
La deuxième limite est l'usure du jeu témoin. Un jeu réutilisé campagne après campagne finit par être couvert par construction, parce que les sources manquées ont été ajoutées au référentiel entre-temps. On mesure alors la correction des défauts déjà connus, pas la performance actuelle. Le renouvellement d'au moins la moitié du jeu à chaque campagne est la contrepartie obligatoire de la comparabilité.
La troisième limite est la représentativité. Un jeu témoin est un échantillon construit, pas un tirage aléatoire dans la population des documents pertinents, laquelle n'est pas connue : c'est même la raison d'être du test. Les taux obtenus sont donc des indications de couverture relative, comparables entre eux dans un cadre stable, et non des estimations de la couverture réelle du périmètre.
La reproductibilité impose enfin de publier quatre éléments avec les résultats : la composition du jeu par famille, les dates de la fenêtre, le mode retenu et la règle de comptage des restitutions dégradées. Deux campagnes qui ne partagent pas ces paramètres ne se comparent pas.
Questions fréquentes
À quelle fréquence faut-il tester un dispositif de veille documentaire ?
Deux à quatre fois par an suffisent pour un dispositif stable, avec un test supplémentaire après chaque changement structurant : ajout massif de sources, changement d'outil, refonte des règles de tri, extension à une nouvelle langue. Tester plus souvent coûte cher en constitution de jeu témoin sans apporter d'information, puisque la performance d'un dispositif inchangé ne varie pas d'une semaine à l'autre.
Combien de documents témoins faut-il pour que le test soit exploitable ?
Trente au minimum, soixante en pratique courante. En dessous de trente, la ventilation par famille laisse moins de dix documents par catégorie, et l'incertitude devient telle qu'aucune comparaison entre familles n'est défendable. Au-delà de soixante, le coût de dépouillement augmente linéairement alors que la précision progresse lentement, et le jeu risque de ne plus être renouvelé, ce qui est un défaut bien plus grave qu'un échantillon modeste.
Peut-on tester un dispositif sans accès à ses journaux techniques ?
Oui, et c'est même le cas courant. Le test se place volontairement du côté de l'utilisateur : il vérifie qu'un document est arrivé jusqu'au poste de travail, pas qu'il a été collecté quelque part dans la chaîne. Un document présent dans une base interne mais absent de la diffusion compte comme manqué, parce que l'analyste ne l'a pas eu. L'accès aux journaux sert ensuite au diagnostic, une fois qu'un écart a été établi, mais il n'est pas nécessaire à la mesure elle-même.
Le test remplace-t-il le retour des utilisateurs sur la qualité des remontées ?
Non, les deux mesurent des choses différentes. Le retour des utilisateurs porte sur le bruit et sur l'utilité perçue, que le jeu témoin capture mal. Le test mesure le silence, que le retour utilisateur ne capture pas du tout. Un dispositif piloté par la seule satisfaction des analystes dérive vers un périmètre étroit ; un dispositif piloté par le seul taux de rappel sature. Les deux instruments se corrigent l'un l'autre.