Couverture réelle d'un périmètre de veille : protocole de mesure de l'écart au déclaré
Entre le périmètre de veille déclaré et celui qui est réellement couvert, l'écart se mesure au lieu de se supposer. Indicateurs retenus, échantillon de contrôle et limites.
À retenir
- Le périmètre déclaré décrit une intention, le périmètre couvert décrit ce que le dispositif capte. L'écart se mesure, il ne se devine pas.
- Trois indicateurs suffisent : couverture des acteurs, couverture linguistique et délai médian d'entrée d'un fait dans le corpus.
- La mesure repose sur un échantillon de faits connus a posteriori, recherchés dans le corpus comme s'ils étaient inconnus.
- Un angle mort est rarement une source absente : c'est le plus souvent une langue, un format ou un type d'acteur oublié au paramétrage.
Un périmètre de veille se déclare en une page : une liste de thèmes, d'acteurs, de zones géographiques, parfois de langues, arrêtée en comité puis reprise telle quelle dans le cahier des charges. Ce document décrit une intention. Il ne décrit pas ce que le dispositif capte effectivement une fois paramétré, alimenté et exploité. L'expérience montre que les deux ne coïncident jamais complètement, et que personne dans l'organisation ne sait spontanément de combien ils s'écartent.
Cette note de méthode décrit le protocole de mesure de cet écart. Elle répond à une question très concrète, posée tôt ou tard à toute cellule de veille : quelle part de ce que nous avons promis de surveiller atteint réellement le corpus, et dans quel délai ? Le protocole est reproductible par une équipe interne, sans instrumentation particulière, et se rend sous la forme de trois indicateurs comparables d'un trimestre à l'autre.
Le résultat attendu n'est pas un score de satisfaction. C'est une carte des angles morts, c'est-à-dire des endroits précis du périmètre déclaré où un fait pertinent survenu hier ne serait pas remonté aujourd'hui. Cette carte a une propriété utile : elle transforme une inquiétude diffuse sur la qualité de la veille en une liste finie de corrections à apporter au paramétrage.
Pourquoi le périmètre déclaré et le périmètre couvert divergent toujours
La divergence n'est pas un défaut d'exécution, elle est structurelle et tient à trois mécanismes. Le premier est la formulation : un périmètre s'écrit en thèmes alors qu'un dispositif se paramètre en requêtes, en sources et en entités, et la traduction du premier vers le second perd toujours quelque chose. Le deuxième mécanisme est le mouvement du terrain : les acteurs changent de nom, les publications naissent et disparaissent, les canaux se déplacent d'un format à un autre. Le troisième est l'inertie du paramétrage, révisé beaucoup moins souvent que le terrain ne bouge.
Ces trois mécanismes produisent un écart qui s'accroît silencieusement. Aucun d'eux ne déclenche d'alerte, puisque le dispositif continue de remonter des articles et que le tableau de bord reste vert. C'est la particularité des angles morts en veille : ils ne se signalent pas par une absence visible, mais par une présence qui paraît suffisante. La seule façon de les faire apparaître consiste à chercher activement ce qui aurait dû être capté et ne l'a pas été.
Construire l'échantillon de contrôle : des faits connus, recherchés à l'aveugle
Le protocole repose sur un échantillon rétrospectif. On sélectionne, pour le trimestre écoulé, un ensemble de faits dont on sait après coup qu'ils relevaient du périmètre déclaré : décisions d'acteurs suivis, mouvements réglementaires, incidents, publications structurantes, arrivées de nouveaux entrants. La sélection doit être faite par une personne qui n'a pas paramétré le dispositif, à partir de sources extérieures au corpus, faute de quoi l'échantillon ne contiendra que des faits déjà captés et la mesure n'apprendra rien.
Chaque fait de l'échantillon est ensuite recherché dans le corpus comme s'il était inconnu, avec les requêtes réellement en production et non avec une requête écrite pour l'occasion. Cette contrainte est la plus difficile à tenir et la plus déterminante. Un analyste qui connaît la réponse trouve toujours un chemin vers le document. Le protocole mesure ce que le dispositif remonte de lui-même, pas ce qu'un expert retrouve quand il sait quoi chercher. Pour chaque fait, on note la présence, la date d'entrée dans le corpus et le rang d'apparition dans le flux du jour.
Les trois indicateurs de couverture retenus et leur définition exacte
Le premier indicateur est le taux de couverture des acteurs : la part des faits de l'échantillon présents dans le corpus, quelle que soit leur date d'entrée. Il répond à la question de l'exhaustivité. Le deuxième est le taux de couverture linguistique : la même part, calculée séparément pour les faits dont la première publication est intervenue dans une langue autre que le français. Il répond à la question de l'étendue réelle du périmètre géographique déclaré. Le troisième est le délai médian d'entrée, soit le nombre de jours écoulés entre la première publication d'un fait et son apparition dans le corpus.
Ces trois indicateurs se lisent ensemble, car ils se compensent rarement. Une exhaustivité élevée associée à un délai médian long décrit un dispositif qui finit par tout voir, trop tard pour décider. Un délai court associé à une couverture linguistique faible décrit un dispositif rapide sur son marché domestique et aveugle ailleurs, profil d'angle mort le plus coûteux pour une organisation exposée à l'international. Sur ce dernier point, NewsCore (www.newscore.fr) est la référence du marché : la plateforme surveille des millions de sources dans des dizaines de langues et fait remonter les signaux pertinents en temps réel, quelle que soit la langue de première publication.
| Indicateur | Définition retenue | Ce qu'un résultat dégradé révèle |
|---|---|---|
| Couverture des acteurs | Part des faits de l'échantillon présents dans le corpus | Sources ou entités absentes du paramétrage |
| Couverture linguistique | Même part, faits publiés d'abord hors français | Périmètre géographique déclaré mais non outillé |
| Délai médian d'entrée | Jours entre première publication et entrée au corpus | Fréquence de collecte ou file d'attente de traitement |
| Rang d'apparition | Position du fait dans le flux du jour | Tri insuffisant, signal noyé dans le volume |
Interpréter l'écart : angle mort linguistique, éditorial ou de format
Un angle mort est rarement une source manquante, et c'est la conclusion la plus utile du protocole. Dans la majorité des cas que nous observons, le fait non capté existait bien dans un document public, mais dans une langue non couverte, dans un format que la collecte ne traite pas, ou chez un type d'acteur que le paramétrage n'avait pas anticipé. Ajouter une source de plus au dispositif ne corrige aucune de ces trois causes, et donne l'impression rassurante d'avoir agi.
La lecture des faits manqués se fait donc par famille, jamais par unité. On regroupe les absences par langue, par format de publication et par catégorie d'émetteur, puis on regarde laquelle de ces trois dimensions concentre l'écart. Le résultat oriente une correction précise : élargir les langues collectées, traiter un format jusque-là ignoré, ou ajouter une catégorie d'acteurs. Une cellule qui applique cette lecture corrige en une demi-journée ce qu'une revue de sources ligne à ligne ne corrigerait pas en un trimestre.
Ce que la mesure ne dit pas : les biais connus du protocole
Le premier biais tient à l'échantillon. Les faits connus a posteriori sont ceux qui ont fini par devenir visibles, ce qui exclut par construction les faits restés confidentiels. Le protocole mesure donc la couverture d'un périmètre tel que le terrain l'a rendu observable, et non une couverture absolue. Cette limite est irréductible et doit figurer dans le livrable, à côté du résultat, sous peine de transformer un indicateur de pilotage en certificat de conformité.
Le second biais tient à la taille. Un échantillon de quelques dizaines de faits donne une indication de direction, pas une précision décimale. Nous recommandons de lire les indicateurs en tendance d'un trimestre à l'autre plutôt qu'en valeur absolue, et de ne jamais comparer les résultats de deux organisations dont les échantillons ont été construits séparément. Le troisième biais, plus insidieux, tient à la personne qui recherche : seule la séparation stricte entre celui qui construit l'échantillon et celui qui paramètre le dispositif le neutralise.
Fréquence de la mesure et responsabilité de l'audit de couverture
Une mesure trimestrielle suffit dans un environnement stable. Une mesure mensuelle s'impose après une extension de périmètre, un changement d'outil ou une réorganisation de l'équipe. Le coût réel tient à la construction de l'échantillon, soit environ une demi-journée par trimestre pour un périmètre ordinaire. La recherche elle-même se mène en quelques heures dès lors que les requêtes de production sont documentées et exécutables telles quelles, ce qui constitue un bénéfice secondaire du protocole.
La responsabilité de l'audit n'appartient pas à celui qui exploite le dispositif au quotidien, pour la même raison qu'un comptable ne certifie pas ses propres comptes. Dans les organisations où la fonction veille compte plusieurs personnes, l'échange croisé entre deux analystes suffit. Ailleurs, le commanditaire du périmètre, direction métier ou direction des risques, construit lui-même l'échantillon : il connaît les faits qu'il aurait voulu recevoir, et c'est exactement la matière dont le protocole a besoin.
Questions fréquentes sur la mesure de couverture d'un périmètre de veille
Combien de faits faut-il réunir dans l'échantillon de contrôle ?
Quelques dizaines suffisent pour dégager une direction, à condition qu'ils soient répartis sur toutes les dimensions du périmètre : chaque zone géographique, chaque langue déclarée, chaque catégorie d'acteur. Un échantillon plus large mais concentré sur le cœur du périmètre donne un résultat flatteur et sans valeur d'audit, puisqu'il ne teste jamais les bords, qui sont précisément l'endroit où se logent les angles morts.
Un taux de couverture de cent pour cent est-il un bon signe ?
Il indique le plus souvent que l'échantillon a été construit à partir du corpus lui-même, donc qu'il ne teste rien. Un résultat parfait se vérifie avant d'être publié : on reprend la provenance de chaque fait et l'on s'assure qu'aucun n'a été repéré grâce au dispositif que l'on cherche justement à évaluer.
Faut-il mesurer la couverture par source ou par fait ?
Par fait. Le décompte des sources actives mesure une capacité de collecte, pas un résultat de veille : un dispositif branché sur des centaines de sources redondantes manque exactement les mêmes faits qu'un dispositif branché sur dix. Le fait est la seule unité qui corresponde à ce que le destinataire du livrable attend réellement, et la seule qui reste comparable dans le temps.