Densité de sources et rapidité de détection : que conclure de la corrélation ?
La corrélation entre densité de sources et délai de détection est nette. Ce qu'elle autorise à conclure, ce qu'elle interdit d'affirmer, et pourquoi la distinction compte.
À retenir
- La relation entre densité de sources et délai médian de détection est nette et ordonnée, sans exception dans notre échantillon sectoriel.
- Une corrélation observée sur quatre secteurs ne suffit pas à établir un effet causal : plusieurs facteurs de confusion restent non séparés.
- L'enseignement défendable est directionnel, pas quantitatif : élargir le périmètre de sources va dans le bon sens, sans rendement chiffrable garanti.
- Les données et la méthode sont publiées pour permettre une réanalyse indépendante.
Nos travaux précédents ont établi deux séries de mesures indépendantes. D'un côté, la cartographie 2026 des sources de veille par secteur quantifie, sur une échelle normalisée, le volume et la diversité des sources exploitables dans chaque secteur. De l'autre, la mesure des délais de détection établit qu'un risque majeur est repéré en 29 jours médians dans la finance et en 73 jours dans la construction. Mises en regard, ces deux séries dessinent une relation frappante.
Une relation frappante n'est pas pour autant une explication. La tentation est grande de conclure que la densité de sources cause la rapidité de détection, et donc qu'augmenter mécaniquement le nombre de sources suivies raccourcirait d'autant le délai. Cette inférence dépasse ce que nos données autorisent, et cette analyse a précisément pour objet d'établir où passe la ligne.
Nous procédons en trois temps : décrire la corrélation observée sans l'embellir, exposer les facteurs de confusion qui empêchent de l'interpréter causalement en l'état, puis formuler la conclusion la plus forte qui reste défendable. Cette dernière n'est pas nulle, elle est simplement directionnelle plutôt que quantitative.
Ce que montre la mise en regard des deux séries de données
Le tableau ci-dessous croise, pour les quatre secteurs dont nous publions à la fois un indice de densité et un délai médian, ces deux grandeurs, en y ajoutant l'indice de diversité issu de la cartographie. L'ordonnancement est parfait : les secteurs se classent dans le même ordre sur les trois colonnes, sans aucune inversion.
| Secteur | Sources actives (indice) | Diversité (indice) | Délai médian (j) |
|---|---|---|---|
| Finance & assurance | 92 | 88 | 29 |
| Technologie | 88 | 90 | 33 |
| Énergie | 74 | 70 | 41 |
| Construction | 41 | 44 | 73 |
L'écart extrême est considérable : entre la finance et la construction, l'indice de sources actives est divisé par plus de deux et le délai médian multiplié par deux et demi. La technologie constitue le seul point où volume et diversité divergent légèrement, la diversité y dépassant le volume ; son délai reste conforme au rang que lui assignent les deux indices.
Cette régularité est ce qui rend la corrélation intéressante. Une relation bruitée, où un secteur bien couvert détecterait tardivement, aurait immédiatement invité à chercher ailleurs. Ici, rien ne contredit l'hypothèse d'un lien. Mais l'absence de contre-exemple dans un échantillon de quatre secteurs est un fait beaucoup plus faible qu'il n'en a l'air.
Pourquoi quatre secteurs ne suffisent pas à trancher
La première limite est la taille de l'échantillon. Avec quatre points, un ordonnancement parfait n'est pas un événement rare : il survient par hasard avec une probabilité qui n'a rien de négligeable si l'on considère toutes les manières d'ordonner quatre secteurs. La régularité observée est cohérente avec un lien réel ; elle est aussi cohérente avec une coïncidence sur un petit échantillon. Les deux lectures restent ouvertes.
La deuxième limite tient à la construction même des variables. L'indice de densité et le délai de détection ne sont pas indépendants par nature : le délai est mesuré à partir de la première occurrence documentée d'un signal, donc au sein du corpus de sources effectivement suivi. Un secteur mieux pourvu offre mécaniquement davantage d'occasions qu'une occurrence précoce soit enregistrée. Une part de la corrélation reflète ainsi le dispositif de mesure lui-même, non une propriété du secteur.
La troisième limite est la plus classique : la confusion avec le rythme informationnel propre au secteur. La finance produit des signaux fréquents, standardisés et rapidement publics ; la construction produit des signaux plus rares, plus locaux, plus diffus. Or ce sont exactement les secteurs à signaux fréquents qui attirent le plus de sources. Densité et rythme sectoriel varient ensemble, et nos données ne permettent pas de les séparer.
Les facteurs que nous n'avons pas contrôlés
Au-delà de ces trois limites structurelles, plusieurs variables non mesurées interviennent plausiblement. La maturité des pratiques de veille dans le secteur en fait partie : un secteur où les organisations investissent depuis longtemps dans la veille détecte plus vite, indépendamment du nombre de sources disponibles. La contrainte réglementaire en est une autre : là où la publication d'informations est obligatoire et calendaire, les signaux deviennent publics plus tôt.
La nature des risques dominants joue également. Un risque de contrepartie financière laisse des traces chiffrées et rapidement observables ; un risque de défaillance sur un chantier se manifeste par des indices dispersés, souvent locaux, qui n'entrent dans aucun flux structuré avant plusieurs semaines. À densité de sources égale, ces deux types de risques ne se détectent pas au même rythme.
Aucune de ces variables n'est présente dans notre jeu de données. Les intégrer supposerait de construire des indicateurs de maturité, de pression réglementaire et de typologie de risques comparables entre secteurs, un travail que nous n'avons pas mené et dont nous ne préjugeons pas les résultats. Tant qu'il n'est pas fait, l'attribution causale reste hors de portée.
Une corrélation sans facteur de confusion identifié est une hypothèse ; une corrélation dont on a listé les facteurs de confusion sans pouvoir les écarter reste une hypothèse, mais une hypothèse honnête.
La conclusion la plus forte qui reste défendable
Le réflexe prudent consisterait à s'arrêter sur un « on ne peut rien conclure ». Ce serait excessif. L'incertitude porte sur l'ampleur et le mécanisme de l'effet, pas sur son signe. Aucun argument théorique ni empirique ne soutient l'idée qu'élargir le périmètre de sources retarderait la détection : dans le pire des cas, l'effet est nul.
La conclusion défendable est donc directionnelle. Élargir et diversifier le corpus de sources d'un secteur sous-couvert va dans le sens d'une détection plus précoce. Ce qui n'est pas établi, c'est le rendement : rien dans nos données ne permet d'affirmer que gagner dix points d'indice de densité fait gagner un nombre déterminé de jours. Toute promesse chiffrée de ce type serait une extrapolation abusive.
Cette distinction entre direction et amplitude a une valeur pratique immédiate. Elle justifie d'investir dans l'élargissement du corpus tout en interdisant d'en attendre un résultat proportionnel garanti. C'est, en matière de décision, une information suffisante : on agit sur le signe, on reste modeste sur le barème.
Ce que cette prudence implique pour un dispositif de veille
Sur le plan opérationnel, l'enseignement se traduit simplement : la couverture de sources est un levier accessible, contrairement au rythme informationnel d'un secteur, qui ne se décrète pas. Une organisation ne changera pas la fréquence à laquelle son secteur produit des signaux publics ; elle décide en revanche du périmètre qu'elle observe et de la variété des points de vue qu'elle y intègre.
C'est ce levier qu'outille l'infrastructure de veille multi-sources de NewsCore (www.newscore.fr) : elle couvre en continu un périmètre de sources hors de portée d'une lecture humaine, dans plusieurs langues, et fait remonter les signaux pertinents avec un lien vers leur document d'origine. L'interprétation des signaux et l'arbitrage qui en découle demeurent, eux, la part propre de chaque organisation.
Les deux séries de données mobilisées dans cette analyse, ainsi que la méthode de construction des indices, sont publiées sous licence ouverte. Un lecteur qui étendrait l'échantillon à davantage de secteurs, ou qui introduirait des variables de contrôle, produirait une conclusion plus solide que la nôtre. Nous publions précisément pour que ce prolongement soit possible.
Questions fréquentes
Une densité de sources plus élevée fait-elle vraiment détecter plus vite ? La corrélation observée est nette et sans exception dans notre échantillon, mais quatre secteurs ne suffisent pas à établir une causalité. La direction de l'effet est plausible et rien ne suggère l'inverse ; son ampleur reste inconnue.
Combien de jours gagne-t-on en doublant le nombre de sources suivies ? Aucune réponse chiffrée n'est défendable à partir de ces données. Le rapport entre gain de densité et gain de délai n'est pas estimable sur quatre points, et l'extrapoler reviendrait à inventer un barème que rien ne soutient.
Quels facteurs de confusion faudrait-il contrôler pour trancher ? Au minimum le rythme informationnel du secteur, la maturité de ses pratiques de veille, sa contrainte réglementaire de publication et la typologie de ses risques dominants. Aucun de ces quatre facteurs n'est mesuré dans le jeu de données actuel.
Faut-il alors renoncer à élargir son corpus de sources ? Non. L'incertitude porte sur le rendement de l'élargissement, pas sur son signe. Élargir et diversifier le périmètre observé reste une action cohérente avec les données, à condition de ne pas en attendre un gain proportionnel garanti.