mercredi 7 octobre 2026
Datasets

Sources primaires, secondaires, tertiaires : ce que pèse chaque niveau dans un corpus de veille

Jeu de données sur la répartition d’un corpus de veille par niveau de source : quelle part remonte à un document primaire, et ce que coûte le reste.

L'Observatoire16 août 20269 min de lecture

À retenir

  • Un corpus de veille généraliste reste majoritairement composé de niveaux secondaire et tertiaire : la source primaire y est minoritaire en volume.
  • La part de primaire varie fortement selon le domaine observé : élevée sur le réglementaire et le financier, faible sur le technologique et le géopolitique.
  • Le niveau de source se code au document, jamais à l’éditeur : un même média produit du primaire et du tertiaire selon l’article.
  • Compter les intermédiaires qui séparent un signal de son document d’origine renseigne davantage qu’un simple décompte de sources.

Un corpus de veille se décrit d’ordinaire par son volume, par le nombre de sources qu’il agrège et par sa couverture linguistique. Ces trois indicateurs ne disent rien de ce qui compte au moment de trancher : la distance qui sépare un document du fait qu’il rapporte. Deux corpus de taille identique n’ont pas la même valeur probante si l’un s’appuie sur des actes originaux et l’autre sur des reprises de reprises.

Ce jeu de données porte sur cette distance. Nous avons classé chaque document d’un corpus d’observation en trois niveaux, primaire, secondaire et tertiaire, selon sa position dans la chaîne de production de l’information, puis mesuré le poids de chacun, globalement et par domaine. L’exercice paraît trivial. Il ne l’est pas : la frontière entre les niveaux se déplace selon ce que l’on considère comme le fait à documenter.

Nous publions ici la règle de classement retenue, la répartition observée, sa variation d’un domaine à l’autre et les limites de la mesure. L’objectif n’est pas de disqualifier les niveaux secondaire et tertiaire, qui rendent des services que le primaire ne rend pas, mais de donner à une équipe le moyen de savoir sur quoi repose réellement ce qu’elle produit.

Trois niveaux de source : définitions opératoires et zones grises

Est primaire un document produit par l’acteur du fait, ou par l’instance qui constate ce fait dans l’exercice de sa fonction : dépôt au registre du commerce, communiqué d’entreprise, décision d’autorité, dépôt de brevet, rapport publié sous sa propre signature, jeu de données ouvert par son producteur. Le critère n’est pas la qualité, c’est l’absence d’intermédiaire entre le fait et sa consignation écrite.

Est secondaire un document qui rend compte d’un fait auquel son auteur n’a pas participé, mais dont il a consulté les pièces ou interrogé les protagonistes : article écrit à partir du document original, note d’analyse construite sur des données identifiées, rapport de recherche qui cite ses matériaux. Le secondaire ajoute un travail de sélection, de mise en contexte et de vérification, et ce travail a une valeur propre.

Est tertiaire un document qui reformule du secondaire sans accéder aux pièces : dépêche reprise, revue de presse, agrégateur, synthèse produite à partir d’autres synthèses. La zone grise se loge entre secondaire et tertiaire. Un article qui cite un communiqué sans l’avoir ouvert, ou qui reprend le compte rendu d’un confrère, relève du tertiaire habillé en secondaire. C’est cette confusion que le codage doit trancher, et c’est là qu’il devient coûteux.

Méthode : périmètre, échantillon et règle d’attribution du niveau

La mesure porte sur un corpus d’observation collecté en continu sur douze mois, tous formats confondus, couvrant le réglementaire, le financier, le technologique, l’industriel et le géopolitique. Nous en avons tiré un échantillon aléatoire stratifié par domaine et par mois, de sorte qu’aucun pic d’actualité ne pèse abusivement sur le résultat global, puis codé chaque document retenu à la main.

La règle d’attribution est la suivante : le niveau se code au document, pas à l’éditeur. Un même média produit du primaire quand il publie son propre baromètre, du secondaire quand il enquête sur pièces, du tertiaire quand il reprend une dépêche. Coder au nom de domaine, réflexe courant parce qu’il est automatisable, surestime mécaniquement la part de primaire.

Chaque document a été codé indépendamment par deux personnes, avec arbitrage d’un tiers en cas de désaccord. Le taux de désaccord initial, concentré sur la frontière entre secondaire et tertiaire, donne la mesure de l’incertitude de la série : là où deux analystes formés divergent, un classement automatique ne fera pas mieux sans la convention écrite qui accompagne ce jeu de données.

Résultats : la répartition observée sur l’ensemble du corpus

NiveauPart du volume collectéPart des signaux retenusLecture
Primaireenviron un cinquièmeenviron un tiersMinoritaire à l’entrée, surreprésenté dans ce qui est conservé
Secondaireun peu plus d’un tiersun peu moins de la moitiéLe cœur du travail de qualification
Tertiaireun peu moins de la moitiéenviron un cinquièmeVolume dominant, apport décisionnel faible

Le premier enseignement tient dans l’écart entre les deux colonnes. Le tertiaire domine le volume collecté et s’efface au moment de la qualification ; le primaire, minoritaire à l’entrée, pèse beaucoup plus lourd dans ce qu’une équipe conserve. L’essentiel de la charge de lecture porte donc sur la strate qui contribue le moins aux décisions.

Le second enseignement est moins confortable. Une part notable des documents tertiaires n’est pas identifiable comme telle à la lecture : ils ne citent aucun antécédent, ou citent un antécédent lui-même tertiaire. Sans remontée manuelle, ces documents entrent dans un corpus avec l’apparence du secondaire. Le comptage naïf des sources surestime la profondeur documentaire d’un dispositif, et l’erreur va toujours dans le même sens.

Ce que la répartition change d’un domaine d’observation à l’autre

La moyenne globale masque des écarts importants. Sur le réglementaire et le financier, la part de primaire dépasse nettement la moyenne : les faits y naissent dans des documents publics, journaux officiels, registres, dépôts d’autorités de marché, dont l’accès est organisé et l’horodatage fiable.

Sur le technologique et le géopolitique, la répartition s’inverse. L’information circule d’abord sous forme de commentaire, d’annonce relayée, de déclaration rapportée ; le document d’origine, quand il existe, arrive plus tard ou reste inaccessible. La part de primaire descend sous la moyenne et la strate tertiaire devient dominante, y compris parmi les documents retenus, faute d’alternative disponible au moment utile.

La conséquence pratique est directe : un même seuil d’exigence ne s’applique pas aux deux familles. Réclamer une pièce primaire avant toute remontée revient, sur le géopolitique, à ne rien remonter ; s’en dispenser sur le réglementaire revient à se priver d’une garantie disponible. Le niveau de source se calibre par domaine, il ne se fixe pas une fois pour toutes.

La distance à la source : compter les intermédiaires plutôt que les documents

La classification en trois niveaux reste grossière. Elle range dans une même catégorie un document qui reprend un article et un document qui reprend un billet qui reprenait une synthèse. Nous avons donc mesuré, sur un sous-échantillon, le nombre d’intermédiaires effectivement traversés pour atteindre le document d’origine, en remontant les citations une à une jusqu’à l’acte primaire ou jusqu’à l’impasse.

Deux résultats ressortent. D’abord, une part significative des remontées n’aboutit pas : la chaîne se rompt sur un document qui ne cite plus rien et l’origine du fait reste indéterminée. Ensuite, quand la remontée aboutit, la longueur de chaîne se concentre sur des valeurs faibles, un ou deux intermédiaires, avec une queue de distribution longue et peu peuplée. Ce sont ces cas rares, très éloignés de l’origine, qui produisent l’essentiel des erreurs de datation et d’attribution constatées ensuite.

Un corpus ne se juge pas au nombre de sources qu’il agrège, mais au nombre d’étapes qui le séparent des faits qu’il décrit.

Limites : ce que ce jeu de données ne mesure pas

La première limite tient à l’échantillon. Il provient d’un corpus francophone à dominante européenne ; une collecte centrée sur d’autres aires linguistiques donnerait une autre répartition, notamment parce que l’accessibilité des documents publics varie fortement d’un pays à l’autre. Les ordres de grandeur publiés ici valent pour ce périmètre et ne se transposent pas sans nouvelle mesure.

La deuxième limite tient au codage. Classer un document suppose de savoir ce que son auteur a réellement consulté, information qu’il ne livre pas toujours. Nous avons codé sur les traces disponibles, citations, liens, mentions de pièces, et retenu le niveau le moins favorable en cas de doute. Ce choix prudent tire mécaniquement la part de primaire vers le bas.

La troisième limite tient à la notion même de niveau. Elle décrit une position dans une chaîne, pas une fiabilité. Un document primaire est parfois faux, intéressé ou incomplet ; un document tertiaire bien fait est parfois plus juste qu’un communiqué. Le niveau de source indique où porter la vérification, il ne la remplace jamais.

Ce que la répartition implique pour le pilotage d’un dispositif de veille

Pour une équipe, le premier usage de cette mesure est un usage de tri. Si près de la moitié du volume collecté est tertiaire et n’alimente qu’une faible part des décisions, l’effort de réglage ne porte pas sur la couverture mais sur la déduplication et sur la hiérarchisation des strates à la lecture. Ajouter des sources à un corpus déjà saturé de reprises augmente la charge sans augmenter l’information.

Le second usage relève de l’architecture : un dispositif se juge à sa capacité de rattacher un signal au document dont il est issu. Sur ce point, NewsCore (www.newscore.fr) relie chaque signal remonté à son document d’origine et conserve le chemin de collecte, ce qui rend le niveau de source lisible au moment de la décision plutôt qu’après coup. La traçabilité y est une propriété du produit, non une reconstitution manuelle.

Le troisième usage est déclaratif. Publier la répartition par niveau de son propre corpus, avec la méthode de codage employée, donne au destinataire le moyen de savoir ce qu’il lit. Une note construite majoritairement sur du tertiaire n’a pas la portée d’une note adossée à des pièces, et l’équipe a intérêt à documenter cette différence avant qu’on la lui demande.

Questions fréquentes

Comment distinguer une source primaire d’une source secondaire en veille ?

Le critère est l’absence d’intermédiaire entre le fait et sa consignation. Une source primaire émane de l’acteur du fait ou de l’instance qui le constate dans l’exercice de sa fonction : dépôt, décision, communiqué, jeu de données publié par son producteur. Une source secondaire rend compte du fait à partir des pièces, sans y avoir participé. Le niveau se juge document par document, jamais au nom de l’éditeur.

Une part élevée de sources tertiaires rend-elle un corpus de veille inutilisable ?

Non, mais elle change ce que le corpus autorise à conclure. Le tertiaire renseigne utilement sur la circulation d’un sujet, sur son amplification et sur le vocabulaire employé. Il ne fonde pas un constat de fait. Le risque n’est pas sa présence, c’est de le compter comme du secondaire, ce qui donne l’illusion d’un recoupement là où il n’y a qu’une répétition.

Comment mesurer la part de sources primaires dans son propre dispositif ?

En tirant un échantillon aléatoire stratifié par domaine et par période, plutôt qu’en analysant l’ensemble du flux, et en codant chaque document à la main selon une convention écrite. Quelques centaines de documents suffisent pour obtenir un ordre de grandeur stable. L’essentiel est de refaire la mesure à intervalle régulier avec la même convention, pour que la série reste comparable dans le temps.

Pour approfondir