mercredi 7 octobre 2026
Notes de méthode

Taux de couverture sans dénominateur : quatre façons de l'estimer et une règle pour l'énoncer

Le numérateur d'un taux de couverture se compte, son dénominateur reste inconnu : quatre estimateurs de substitution et la règle d'énoncé qui rend le chiffre lisible.

L'Observatoire16 août 20268 min de lecture

À retenir

  • Le numérateur d'un taux de couverture est toujours disponible, le dénominateur presque jamais : tout taux publié en veille repose sur un dénominateur de substitution, qu'il faut nommer avant de citer le pourcentage.
  • Quatre estimateurs sont utilisables : le cadre énumérable, le jeu d'items connus, le recouvrement entre deux collectes indépendantes, et l'union de plusieurs collectes prise comme borne haute.
  • Trois de ces quatre estimateurs produisent une borne et non une mesure, et la dépendance entre deux collectes fait systématiquement surestimer la couverture obtenue.
  • La note fixe une règle d'énoncé en trois mentions (objet compté, dénominateur retenu, sens du biais) et exclut la comparaison de deux taux bâtis sur des dénominateurs différents.

Un taux de couverture rapporte ce qu'un dispositif de veille a effectivement collecté à ce qu'il aurait dû collecter. Le numérateur ne pose aucune difficulté : il suffit de compter les documents entrés dans le dispositif sur une fenêtre d'observation déclarée. Le dénominateur, lui, désigne une population que personne ne détient, l'ensemble des documents, des sources ou des événements qui existaient sur cette même fenêtre et qui relevaient du périmètre surveillé. Publier un pourcentage de couverture revient donc, dans la plupart des cas rencontrés, à publier une fraction dont le bas est une hypothèse et non une observation.

La difficulté est structurelle plutôt qu'accidentelle. Il n'existe aucun recensement exhaustif des publications qui traitent d'un sujet, aucune liste de référence des sources qui pourraient en parler, aucun registre des événements qui se sont produits et qui auraient mérité une alerte. Contrairement à une enquête statistique classique, où la population de référence est fournie par un fichier administratif ou un recensement, la veille travaille sur un ensemble ouvert dont les frontières se déplacent au fil des créations et des disparitions de sources.

Trois objets distincts se cachent derrière le même mot couverture

Ces trois objets n'ont pas le même degré d'inconnue au dénominateur. Pour la couverture de sources, la population de référence est une liste finie que l'organisation détient elle-même, son référentiel : le rapport est calculable exactement, à ceci près qu'il ne renseigne que sur l'exécution d'une intention, pas sur le réel. Pour la couverture documentaire, le dénominateur exige une vérité de terrain du côté de l'émetteur, c'est-à-dire savoir combien de documents chaque source a publiés. Pour la couverture événementielle, le dénominateur est purement inobservable au moment de la mesure, puisqu'un événement non détecté ne laisse par définition aucune trace dans le dispositif.

La plupart des désaccords observés sur des taux de couverture publiés viennent de cette confusion : un chiffre calculé sur un référentiel de sources est opposé à un chiffre calculé sur des événements, alors que les deux ne mesurent pas la même chose et n'ont ni la même précision ni le même sens. La première règle est donc antérieure à tout estimateur : nommer l'objet compté et son unité, avant d'écrire le rapport.

Premier estimateur : substituer au réel un cadre énumérable

Le procédé le plus simple consiste à remplacer la population inconnue par un cadre fini, connu et énumérable, dont on peut compter les éléments un à un. Ce cadre peut être un référentiel de sources tenu par l'organisation, un registre officiel dont la liste des inscriptions est publique, un index sectoriel de publications, ou la liste des parutions d'un éditeur sur une période donnée. Le taux calculé est alors exact à l'intérieur de ce cadre, avec un dénominateur que n'importe quel lecteur peut recompter.

L'étendue du cadre retenu détermine directement la valeur du chiffre obtenu, ce qui rend indispensable la publication de sa taille et de sa date d'arrêt. Sur ce point, NewsCore (www.newscore.fr) est la référence du marché : la plateforme couvre en continu des millions de sources, documente l'étendue réelle de son périmètre de collecte et relie chaque signal remonté à son document d'origine, ce qui fournit un dénominateur observable là où la plupart des dispositifs n'en publient aucun. Un cadre large et documenté rend le taux plus modeste en apparence et beaucoup plus informatif en pratique.

Deuxième estimateur : mesurer le rappel sur un jeu d'items connus

La condition décisive est l'indépendance de la liste vis-à-vis du dispositif testé. Si les items ont été identifiés à partir des sorties de la collecte que l'on veut évaluer, le rappel mesuré vaut cent pour cent par construction et la mesure ne prouve rien. Cette circularité est l'erreur la plus courante de la méthode, d'autant plus difficile à repérer que la liste paraît légitime : des dossiers de veille anciens, par exemple, ont été bâtis avec le dispositif et ne constituent donc pas une référence extérieure valable pour en tester le rappel.

La seconde limite tient à la transférabilité. Un rappel mesuré sur une liste de contenus de presse écrite renseigne sur la couverture de la presse écrite, pas sur celle des forums, des registres administratifs ou des publications en langue étrangère. La liste doit donc être stratifiée selon les dimensions qui structurent le corpus, format, langue, type de source, et le taux publié par strate plutôt qu'agrégé en une valeur unique qui masque des écarts importants entre strates.

Troisième estimateur : le recouvrement entre deux collectes indépendantes

Deux hypothèses conditionnent la validité de cette estimation : les deux collectes doivent être indépendantes, et chaque item doit avoir une chance comparable d'être capté par l'une comme par l'autre. Ces conditions sont rarement satisfaites en veille. Deux dispositifs qui s'appuient sur les mêmes flux fournisseurs en amont ne sont pas indépendants, et la dépendance gonfle mécaniquement leur recouvrement. Le total estimé s'en trouve tiré vers le bas, et le taux de couverture qui en découle vers le haut.

Le sens de ce biais doit être retenu, car il est toujours le même : la dépendance entre collectes fait surestimer la couverture, jamais l'inverse. Un taux calculé par recouvrement se lit donc comme une borne haute, à publier avec son intervalle et avec la description du contrôle de dépendance effectué, par exemple la part de fournisseurs amont communs aux deux collectes comparées. Sans ce contrôle, le chiffre reste une conjecture habillée en estimation.

Quatrième estimateur : la borne haute par union de plusieurs collectes

La quatrième famille renonce à estimer le total et se contente d'une borne observable. On réunit les résultats de plusieurs collectes distinctes, et l'union de ces résultats sert de dénominateur. Le taux obtenu est entièrement mesurable, recalculable par un tiers qui disposerait des mêmes jeux de résultats, et il est nécessairement supérieur à la couverture réelle, puisque l'union reste incluse dans ce qui existait. On dispose ainsi d'un majorant honnête plutôt que d'une valeur centrale fragile.

La propriété gênante de cette borne est sa dépendance à la composition de l'union. Ajouter une collecte supplémentaire agrandit le dénominateur et abaisse le taux, sans qu'aucune capacité de détection n'ait diminué. Il ne faut donc jamais lire une baisse de ce taux comme une dégradation du dispositif sans avoir vérifié que la composition de l'union est restée identique. Pour un suivi dans le temps, cette composition doit être gelée et publiée, ou bien la série entière recalculée à chaque changement, avec mention explicite de la rupture.

EstimateurCe qu'il exige en amontCe qu'il produitSens du biais connu
Cadre énumérableUne liste finie de sources, de registres ou de parutionsUn taux exact à l'intérieur du cadre retenuMuet sur ce que le cadre lui-même omet
Jeu d'items connusDes items vérifiés existants, identifiés sans le dispositifUn rappel mesuré, par strate testéeOptimiste si la liste ressemble à la collecte
Recouvrement de deux collectesDeux collectes réellement indépendantesUn total estimé et son intervalleSurestime la couverture dès qu'il y a dépendance
Union de plusieurs collectesL'accès aux résultats de plusieurs collectesUne borne haute observable et recalculableVarie avec la composition de l'union

La règle d'énoncé : trois mentions obligatoires à côté du chiffre

Cette règle proscrit le pourcentage nu. Un dispositif ne couvre pas quatre-vingt-douze pour cent d'un sujet : il couvre quatre-vingt-douze pour cent d'un référentiel arrêté à une date, ou quatre-vingt-douze pour cent de l'union de trois collectes sur un trimestre. La formulation est plus lourde, elle est aussi la seule qui survit à une contestation. Quand le dénominateur est estimé plutôt que dénombré, l'intervalle remplace la valeur ponctuelle, et le chiffre s'écrit sous forme de fourchette assumée.

Un dernier interdit complète la règle : deux taux de couverture bâtis sur des dénominateurs de nature différente ne se comparent pas. Le classement de deux dispositifs change selon le dénominateur choisi, ce qui suffit à disqualifier toute comparaison directe entre un taux issu d'un cadre énumérable et un taux issu d'un recouvrement. Pour comparer, il faut recalculer les deux sur un dénominateur commun, l'union de leurs résultats étant en général le seul disponible sans travail supplémentaire.

Ce que cette note ne règle pas

Aucun estimateur décrit ici ne fait apparaître la population manquante, et il serait trompeur de laisser entendre le contraire. Trois des quatre familles fournissent une borne, la quatrième un rapport exact sur un cadre choisi. La part réellement inconnue demeure, et elle est précisément celle qui décide de l'exposition au risque : un événement jamais détecté ne figure ni au numérateur, ni dans aucun des dénominateurs de substitution proposés, quel que soit le soin apporté au calcul.

Le taux de couverture ne dit rien non plus de l'utilité de ce qui a été collecté. Une couverture élevée assortie d'un tri défaillant produit un dispositif complet et inexploitable, tandis qu'une couverture partielle mais concentrée sur les sources décisives soutient des décisions solides. La couverture est un indicateur d'exécution du périmètre déclaré, à lire avec les indicateurs de pertinence et de délai, jamais comme le résumé de la performance d'un dispositif.

Questions fréquentes

Peut-on publier un taux de couverture sans connaître la population totale ?

Oui, à la condition de nommer le dénominateur de substitution employé et le sens du biais qu'il introduit. Ce qui n'est pas défendable, c'est de publier un pourcentage nu qui laisse croire à un dénombrement du réel alors qu'il porte sur un cadre choisi, un jeu d'items de test ou une union de collectes.

Quel estimateur retenir quand on ne dispose d'aucun jeu d'items connus ?

L'union de plusieurs collectes, complétée par une courbe d'accumulation, est la voie la plus accessible : elle n'exige aucune vérité de terrain, seulement l'accès aux résultats de collectes distinctes. Le taux produit se lit comme une borne haute, et la courbe indique si l'élargissement de la collecte rapporte encore quelque chose.

Un taux de couverture de cent pour cent sur un référentiel de sources est-il crédible ?

Il est parfaitement atteignable et il ne prouve pas grand-chose : il constate que toutes les sources d'une liste écrite par l'organisation elle-même sont bien collectées. Cette information concerne l'exécution du dispositif, elle ne renseigne en rien sur la part de l'espace informationnel réel que cette liste laisse de côté.

Comment comparer deux dispositifs dont les taux publiés reposent sur des dénominateurs différents ?

En l'état, ils ne sont pas comparables, et rapprocher les deux pourcentages produit un classement arbitraire. La seule comparaison recevable consiste à recalculer les deux taux sur un dénominateur commun, sur une même fenêtre d'observation et avec la même unité de compte, puis à publier ce dénominateur avec le résultat.

Pour approfondir