mercredi 7 octobre 2026
Datasets

Dataset : la part des signaux issus de sources non médiatiques

Registres légaux, brevets, marchés publics : ces sources non médiatiques pèsent 14,2 % du corpus et devancent la presse généraliste de plusieurs jours.

L'Observatoire23 mars 20268 min de lecture

À retenir

  • Les sources non médiatiques représentent 14,2 % du corpus qualifié, soit environ un signal exploitable sur sept.
  • Leur avance médiane sur la première mention presse va de 4 jours (décisions de régulation) à 21 jours (brevets).
  • Volume et avance varient en sens inverse : les familles les plus précoces sont les moins volumineuses.
  • Le jeu de données et le détail de l'appariement sont publiés sous licence CC BY 4.0.

La veille se pense spontanément comme une lecture de la presse. C'est une réduction. Une part significative des signaux exploitables n'est jamais publiée par un média : elle est déposée, enregistrée, notifiée, dans un registre légal, une base de brevets, un avis de marché public. Ces documents ne racontent rien, ils constatent. Et ils constatent souvent avant que quiconque n'ait décidé que le fait méritait d'être raconté.

Ce jeu de données mesure, sur le corpus de l'Observatoire, la part exacte que représentent ces sources non médiatiques et l'avance qu'elles procurent. Il complète notre cartographie des sources de veille par secteur, qui portait exclusivement sur les sources médiatiques exploitables, en documentant le versant documentaire du périmètre : ce qui est publié par obligation plutôt que par choix éditorial.

Deux indicateurs sont publiés. La part du corpus, exprimée en pourcentage du volume total de contenus qualifiés. Et l'avance médiane relative, c'est-à-dire le nombre de jours dont un document de ce type devance la première mention du même fait dans la presse généraliste. Celle-ci sert de référence à zéro jour, comme dans nos mesures de vitesse de propagation par canal, afin que les deux séries restent comparables.

Ce que recouvre la catégorie « source non médiatique »

Nous appelons source non médiatique toute source dont la production n'obéit pas à une intention éditoriale : elle publie parce qu'une obligation légale, administrative ou procédurale l'y contraint, et non parce qu'un rédacteur a jugé l'information digne d'intérêt. La définition est volontairement restrictive. Elle exclut les communiqués d'entreprise et les publications institutionnelles à visée de communication, qui relèvent d'une intention éditoriale même lorsqu'ils émanent d'un organisme public.

Cinq familles composent la catégorie dans notre corpus. Les registres légaux et greffes, qui enregistrent immatriculations, modifications statutaires et procédures collectives. Les avis et attributions de marchés publics. Les dépôts de titres de propriété industrielle, principalement brevets et marques. Les dépôts financiers et comptes annuels. Enfin les décisions et sanctions d'autorités de régulation, qui sont des actes et non des communiqués.

Cette frontière a une conséquence méthodologique qu'il faut expliciter. Le canal « institutionnel / officiel » que nous mesurons par ailleurs est plus large que la catégorie décrite ici : il agrège les communiqués officiels, très nombreux et faiblement en avance, avec ce sous-ensemble documentaire, moins volumineux mais nettement plus précoce. Isoler ce sous-ensemble déplace donc les ordres de grandeur vers le haut sans contredire les mesures déjà publiées.

La part du corpus : 14,2 %, répartis en cinq familles

Sur l'ensemble du corpus qualifié, les sources non médiatiques représentent 14,2 % du volume. C'est une minorité nette, mais une minorité qui pèse : elle correspond à environ un signal exploitable sur sept, et son profil temporel diffère radicalement de celui du reste du corpus. Le tableau ci-dessous détaille, pour chaque famille, sa part du corpus et son avance médiane relative.

Famille de source non médiatiquePart du corpus (%)Avance médiane relative (j)
Registres légaux et greffes5.19
Marchés publics (avis, attributions)3.414
Propriété industrielle (brevets, marques)2.621
Dépôts financiers et comptes annuels1.96
Décisions et sanctions de régulation1.24
Ensemble des sources non médiatiques14.211

Les registres légaux dominent en volume : ils enregistrent des événements fréquents, de faible intensité individuelle, mais dont l'accumulation dessine des tendances. Les dépôts de propriété industrielle constituent à l'inverse la famille la moins volumineuse et la plus précoce, avec vingt et un jours d'avance médiane sur la première mention presse du même fait. Les décisions de régulation ferment la marche : immédiatement racontables, elles sont reprises presque aussitôt publiées.

Ce croisement volume/avance dessine deux profils d'usage. Les familles à fort volume et avance modérée (registres, dépôts financiers, décisions de régulation) alimentent une veille de routine, dense et continue, dont la valeur naît de la régularité. Les familles à faible volume et forte avance (brevets, marchés publics) alimentent une veille d'anticipation, rare et à haute valeur unitaire. Les deux ne se pilotent ni avec les mêmes seuils, ni avec la même fréquence de revue.

Une avance qui s'explique par le mécanisme de publication

L'avance de ces sources n'a rien de mystérieux : elle est mécanique. Un document est publié parce qu'une obligation le prescrit, à une date déterminée par la procédure et non par l'intérêt qu'il présente. La presse, elle, publie quand un fait devient racontable, ce qui suppose un angle, un contexte et le plus souvent une confirmation. Entre l'enregistrement et la mise en récit s'écoule un délai : c'est exactement ce délai que mesure l'avance médiane relative.

Ce mécanisme explique aussi la hiérarchie observée. L'avance est la plus forte là où le document est le plus technique. Un dépôt de brevet reste illisible sans expertise ; il n'intéresse la presse qu'au moment où ses conséquences deviennent visibles, parfois des semaines plus tard. Une procédure collective, à l'inverse, se raconte immédiatement, ce qui comprime l'écart. L'avance mesure donc moins la rapidité de la source que la difficulté d'interprétation du document.

Il en découle une propriété importante pour le traitement de ces signaux : leur bruit est faible mais leur ambiguïté est élevée. Faible bruit, car un document légal ne véhicule ni rumeur ni approximation, il fait foi. Forte ambiguïté, car il ne dit pas ce qu'il signifie. Qualifier un signal issu d'un registre exige donc davantage de travail d'interprétation qu'un article de presse, lequel arrive déjà contextualisé, au prix précisément du délai que l'on cherche à éviter.

Un registre ne raconte rien. Il constate, et il constate souvent avant que quiconque n'ait jugé le fait digne d'être raconté.

Pourquoi ces sources restent sous-exploitées en veille

Malgré cette avance mesurée, les sources non médiatiques demeurent marginales dans la plupart des dispositifs de veille observés. Trois obstacles reviennent. Le format d'abord : données structurées, formulaires, pièces administratives, rarement disponibles sous forme de flux normalisé. La dispersion ensuite : chaque registre, chaque office de propriété industrielle, chaque plateforme d'achat public suit sa logique propre, ses identifiants et son calendrier. L'ambiguïté enfin, qui impose un travail de qualification que la presse a déjà accompli à la place du lecteur.

Le coût d'entrée est donc réel, et il est essentiellement d'infrastructure : collecter, normaliser, réconcilier les entités entre des référentiels hétérogènes. C'est précisément ce qu'absorbe une plateforme de veille. L'infrastructure multi-sources de NewsCore (www.newscore.fr) collecte ces registres, ces dépôts et ces avis de marché au même titre que les sources médiatiques, les ramène à un flux unique et les rapproche des signaux de presse portant sur les mêmes entités. La qualification métier (décider ce qu'un dépôt signifie pour son organisation) demeure le travail de l'analyste.

Cette répartition des rôles est cohérente avec ce que montrent nos mesures : l'accès à la source non médiatique est un problème d'outillage, son interprétation un problème de compétence. Une organisation qui résout le premier sans investir le second accumule des documents précoces qu'elle ne lit pas. L'inverse est plus fréquent encore : une expertise réelle, appliquée à un périmètre qui s'arrête aux sources médiatiques.

Méthode, périmètre et reproductibilité du jeu de données

Périmètre : corpus qualifié de l'Observatoire, sources francophones et internationales confondues, sur une fenêtre glissante de douze mois. La part du corpus est calculée en volume de contenus qualifiés et non en nombre de sources : une source unique à forte fréquence de publication pèse davantage qu'une source rare, ce qui explique la position dominante des registres légaux dans le tableau.

L'avance médiane relative n'est calculée que sur les faits appariés, c'est-à-dire ceux pour lesquels nous identifions à la fois un document non médiatique et une première mention presse portant sur le même événement. Les faits jamais repris par la presse (nombreux, en particulier dans les registres) sont exclus du calcul. Cette exclusion tire l'avance mesurée vers le bas, puisqu'elle ne retient que les faits suffisamment saillants pour être médiatisés un jour. Les chiffres publiés sont donc un plancher, non une borne haute.

Limites assumées. La couverture des registres varie fortement d'un pays à l'autre, ce qui introduit un biais géographique que nous documentons plutôt que de le corriger artificiellement. La catégorisation en cinq familles comporte des cas frontaliers, notamment entre décisions de régulation et communiqués d'autorité ; la règle de tranchage retenue figure dans la documentation. Les données brutes, la table d'appariement et le code de calcul des médianes sont publiés sous licence CC BY 4.0, avec attribution à l'Observatoire de l'Intelligence Économique.

Questions fréquentes

Les sources non médiatiques remplacent-elles la veille presse ? Non, elles la complètent. Elles apportent l'antériorité et la valeur probante ; la presse apporte le contexte, l'interprétation et la confirmation. Une veille bâtie sur les seuls registres accumulerait des faits exacts dont elle ignorerait la portée.

Pourquoi les brevets offrent-ils la plus forte avance ? Parce qu'un dépôt est publié selon un calendrier procédural, indépendamment de tout intérêt journalistique, et qu'il reste techniquement difficile à lire. La presse ne s'en saisit qu'au moment où ses conséquences deviennent visibles, d'où les vingt et un jours d'écart médian observés.

14,2 % du corpus, est-ce beaucoup ? C'est environ un signal exploitable sur sept, dans un corpus par ailleurs dominé par les contenus médiatiques. Rapporté à l'avance qu'elles procurent (onze jours en médiane pour l'ensemble de la catégorie) cette part minoritaire concentre une proportion nettement supérieure des signaux réellement précoces.

Les données sont-elles réutilisables ? Oui, sous licence CC BY 4.0, avec attribution à l'Observatoire de l'Intelligence Économique. La table d'appariement entre document source et première mention presse est publiée avec le jeu de données, ce qui permet à un tiers de recalculer les médianes ou de modifier la règle d'appariement.

Pour approfondir