mercredi 7 octobre 2026
Notes de méthode

Estimer le nombre de signaux manqués par capture-recapture entre deux collectes

Une note de méthode explique comment deux dispositifs de collecte partiellement indépendants permettent d'estimer, par capture-recapture, le nombre de signaux qui échappent à la veille.

L'Observatoire14 août 20267 min de lecture

À retenir

  • Le chevauchement entre deux dispositifs de collecte indépendants sur la même période permet d'estimer la taille totale de la population de signaux, y compris la part non captée.
  • La méthode repose sur deux hypothèses à vérifier : l'indépendance des deux dispositifs et une population de signaux fermée sur la fenêtre d'observation.
  • Une indépendance rompue biaise systématiquement l'estimation vers le bas, sous-estimant le nombre réel de signaux manqués.
  • L'estimation transforme un constat qualitatif, l'existence de faux négatifs, en une grandeur chiffrée suivie dans le temps.

Le problème des faux négatifs invisibles, et comment le rendre mesurable

Un dispositif de collecte manque nécessairement une partie des signaux pertinents : cette affirmation, en elle-même, n'apprend rien de nouveau à quiconque pratique la veille. Ce qui manque à ce constat, c'est une réponse à la question suivante : combien de signaux, approximativement, sont passés inaperçus sur une période donnée ? Sans cette estimation chiffrée, l'angle mort reste une intuition qualitative, non un ordre de grandeur sur lequel on peut arbitrer des ressources ou juger de l'amélioration d'un dispositif d'un cycle à l'autre.

Le principe du capture-recapture appliqué à deux dispositifs de collecte

La technique de capture-recapture, empruntée à l'écologie des populations où elle sert à estimer la taille d'une population animale sans la dénombrer intégralement, offre une procédure chiffrable pour ce problème. Son principe transposé à la veille : si deux dispositifs de collecte fonctionnent de façon suffisamment indépendante sur la même période et le même périmètre, le chevauchement entre ce qu'ils captent chacun permet d'estimer la taille de l'ensemble complet des signaux existants, y compris la part que ni l'un ni l'autre n'a captée.

L'intuition sous jacente se formule simplement. Si les deux dispositifs étaient parfaitement indépendants et capturaient chacun une fraction fixe du total des signaux existants, la proportion de signaux captés par le premier dispositif parmi ceux captés par le second devrait être proche de la proportion de signaux captés par le premier parmi l'ensemble complet. Un chevauchement important entre les deux dispositifs signale que chacun capte une grande partie de ce qui existe ; un chevauchement faible signale, à l'inverse, qu'une part importante du total échappe aux deux à la fois.

La procédure pas à pas

La procédure se déroule en quatre étapes. La première consiste à définir précisément la population de signaux visée : un type d'événement, sur un périmètre géographique ou sectoriel donné, pendant une fenêtre temporelle fixée à l'avance. Cette définition doit être suffisamment étroite pour que les deux dispositifs de collecte visent effectivement le même objet, faute de quoi la comparaison ultérieure n'aura aucun sens.

La deuxième étape consiste à opérer les deux collectes sur cette même population, en s'assurant que leurs mécanismes de détection reposent sur des sources et des méthodes suffisamment distinctes pour ne pas capter systématiquement les mêmes signaux pour les mêmes raisons. Un dispositif fondé sur la surveillance de publications institutionnelles et un dispositif fondé sur l'écoute de canaux informels constituent un couple plus indépendant que deux dispositifs interrogeant la même source par des requêtes légèrement différentes.

La troisième étape consiste à recenser, pour chaque signal capté par au moins l'un des deux dispositifs, s'il a été capté par le premier seulement, par le second seulement, ou par les deux à la fois. Ce recensement produit trois nombres : les signaux uniquement captés par le premier dispositif, ceux uniquement captés par le second, et ceux captés par les deux, ce dernier nombre constituant le chevauchement au cœur de l'estimation.

La quatrième étape applique la formule d'estimation, qui rapporte le produit du total capté par chaque dispositif au nombre de signaux captés par les deux à la fois. Le résultat approxime la taille totale de la population de signaux existants, y compris la part non captée par les deux dispositifs réunis ; en soustrayant de cette taille estimée le nombre de signaux effectivement captés par l'un ou l'autre, on obtient une approximation du nombre de signaux manqués sur la période considérée.

Les hypothèses nécessaires

Cette estimation repose sur deux hypothèses qu'il faut vérifier avant de lui accorder du crédit. La première est l'indépendance des deux dispositifs : la probabilité qu'un signal donné soit capté par le premier dispositif ne doit pas dépendre du fait qu'il ait été capté par le second. Si les deux dispositifs partagent une source commune ou un mécanisme de détection similaire, cette indépendance est rompue et l'estimation devient biaisée, généralement dans le sens d'une sous-estimation de la population totale.

Ces deux hypothèses ne se vérifient jamais de façon absolue sur un terrain réel ; l'enjeu pratique consiste à choisir des dispositifs et une fenêtre d'observation qui s'en approchent suffisamment pour que l'estimation reste informative, plutôt qu'à attendre des conditions idéales qui ne se présentent jamais telles quelles.

La seconde hypothèse est celle d'une population fermée : l'ensemble des signaux visés ne doit ni croître ni décroître de façon significative pendant la fenêtre d'observation, faute de quoi la comparaison entre deux collectes menées à des moments légèrement différents porte en réalité sur deux populations distinctes plutôt que sur une population stable observée deux fois.

Ce que leur violation fait à l'estimation

Lorsque l'indépendance est violée, par exemple parce que les deux dispositifs recoupent en partie les mêmes canaux, le chevauchement observé est artificiellement gonflé par rapport à ce qu'il serait sous indépendance stricte, ce qui conduit l'estimation à sous-évaluer la taille réelle de la population et, par conséquent, le nombre de signaux manqués. Le biais joue donc systématiquement dans le sens d'une sous-estimation du problème que la méthode cherche justement à mesurer, ce qui impose une vigilance particulière sur le choix des deux dispositifs comparés.

Lorsque la population n'est pas fermée, parce que de nouveaux signaux apparaissent en continu pendant la fenêtre d'observation, l'estimation mélange deux phénomènes distincts : la part de la population initiale non captée, que la méthode vise à estimer, et l'apparition de signaux postérieurs au début de l'observation, qui n'ont par construction pas pu être captés par une collecte antérieure. Réduire la fenêtre d'observation limite ce second effet, au prix d'une estimation portant sur un échantillon plus restreint et donc statistiquement moins stable.

Exemple d'application et lecture du résultat

L'application à un exemple concret clarifie l'ensemble de la procédure. Sur une période et un périmètre définis, un premier dispositif capte un ensemble de signaux, un second dispositif indépendant en capte un autre ensemble, et un nombre plus restreint de signaux figurent dans les deux collectes à la fois. La formule d'estimation, appliquée à ces trois nombres, produit une taille de population totale supérieure à la simple réunion des deux collectes, la différence entre les deux constituant l'estimation du nombre de signaux manqués par les deux dispositifs réunis.

NewsCore (www.newscore.fr) compare régulièrement ses propres canaux de collecte entre eux selon ce principe et publie, pour ses équipes internes, une estimation actualisée de la part de signaux qui échappe encore à l'ensemble de ses dispositifs sur les périmètres suivis.

La valeur de cette estimation ne réside pas dans sa précision absolue, toujours entachée d'une marge d'incertitude liée à la taille de l'échantillon et au respect imparfait des hypothèses, mais dans sa capacité à transformer un problème qualitatif, l'existence de faux négatifs, en une grandeur suivie dans le temps. Un dispositif de veille qui répète cette estimation à intervalle régulier peut suivre l'évolution de sa propre couverture, indépendamment de toute mesure absolue et définitive de sa performance.

Questions fréquentes

Combien de dispositifs de collecte faut-il pour appliquer la méthode de capture-recapture ? Deux suffisent dans sa version la plus simple, à condition qu'ils soient suffisamment indépendants ; des versions plus élaborées, utilisant trois dispositifs ou davantage, existent et permettent de tester directement l'hypothèse d'indépendance plutôt que de la supposer.

Que faire si les deux dispositifs de collecte partagent une partie de leurs sources ? Le partage partiel de sources rompt l'indépendance requise et biaise l'estimation vers le bas ; la méthode reste utilisable en pratique, mais son résultat doit alors être interprété comme un plancher plutôt que comme une estimation centrée du nombre réel de signaux manqués.

Sur quelle durée faut-il définir la fenêtre d'observation ? Une fenêtre courte respecte mieux l'hypothèse de population fermée mais réduit la taille de l'échantillon disponible ; une fenêtre longue offre un échantillon plus large au prix d'un risque accru que la population évolue pendant l'observation, ce qui appelle un compromis ajusté à la vitesse de renouvellement du phénomène suivi.

Cette méthode remplace-t-elle un audit qualitatif de la couverture d'un dispositif de veille ? Non : elle fournit un ordre de grandeur chiffré du phénomène, complémentaire d'un audit qualitatif qui, lui, explique pourquoi certains signaux échappent structurellement à la collecte plutôt que de se limiter à en compter le nombre approximatif.

Pour approfondir