mercredi 7 octobre 2026
Datasets

Répartition des sources de veille par type et par langue : cartographie des angles morts

Presse, institutionnel, réseaux, données sectorielles : quelle part du corpus chacun représente, avec quelle diversité linguistique, et où se logent les angles morts.

L'Observatoire12 juin 20268 min de lecture

À retenir

  • Le type de source et la langue forment deux dimensions distinctes : un corpus bien réparti par type peut rester très déséquilibré par langue.
  • Les sources institutionnelles et les données sectorielles sont les plus fiables mais les moins diverses linguistiquement.
  • Les angles morts se logent au croisement des deux axes : un type de source peu représenté dans une langue peu couverte devient invisible.
  • Le jeu de données croisé est publié en indices relatifs, sous licence CC BY 4.0.

Nos deux publications précédentes sur le périmètre de collecte ont traité séparément deux questions : combien de sources sont disponibles secteur par secteur, et comment mesurer la couverture linguistique d'un corpus. Prises isolément, ces deux mesures rassurent souvent à tort. Un corpus peut afficher une répartition équilibrée entre types de sources et rester profondément déséquilibré dès qu'on regarde la langue dans laquelle chaque type s'exprime.

Ce jeu de données croise donc les deux axes. Pour chaque grande famille de sources (presse généraliste, presse spécialisée, sources institutionnelles, réseaux sociaux et forums, données et publications sectorielles) nous publions sa part dans le corpus et un indice de diversité linguistique. L'indice ne mesure pas le nombre de langues couvertes dans l'absolu, mais l'étalement du volume entre elles : plus il est élevé, moins le type de source dépend d'une langue dominante.

L'objectif n'est pas de produire un palmarès des sources. Il est de rendre visible une géométrie que les tableaux à une seule dimension masquent : celle des cases faiblement peuplées, où un type de source donné n'existe presque pas dans une aire linguistique donnée. Ce sont ces cases, et non les moyennes générales, qui déterminent ce qu'un dispositif de veille ne verra jamais.

Type de source et langue : deux dimensions qui ne se recouvrent pas

Le type de source décrit la nature éditoriale d'un point d'entrée : qui produit l'information, selon quel processus de vérification, à quelle vitesse et pour quel public. La langue décrit l'aire de circulation de cette information. Les deux variables sont indépendantes en principe, mais fortement corrélées en pratique, car chaque écosystème éditorial se structure autour de langues de travail dominantes.

Cette corrélation partielle a une conséquence directe pour la constitution d'un corpus. Élargir le nombre de types de sources n'élargit pas mécaniquement la couverture linguistique, et réciproquement. Ajouter dix flux institutionnels rédigés dans la même langue augmente le volume sans réduire d'un seul angle mort linguistique. Le progrès réel se mesure au remplissage des cases vides du croisement, non à la croissance d'un total.

C'est pourquoi nous publions ces deux dimensions ensemble plutôt que côte à côte. Un tableau croisé se lit autrement qu'une paire de classements : il désigne des combinaisons, et les combinaisons rares sont précisément les endroits où un signal précoce a le plus de chances de passer inaperçu.

La répartition du corpus par type de source

Le tableau ci-dessous donne, pour chaque famille de sources, sa part en pourcentage du corpus et son indice de diversité linguistique, normalisé sur une échelle de 0 à 100. Les parts sont exprimées en volume de contenus collectés, non en nombre de sources déclarées : une source très productive pèse davantage qu'une source dormante, ce qui reflète mieux la matière réellement disponible pour la détection.

Type de sourcePart du corpus (%)Diversité linguistique (indice)
Presse généraliste3452
Presse spécialisée2361
Institutionnel / officiel1847
Réseaux sociaux et forums1574
Données et publications sectorielles1038

La presse généraliste domine en volume, avec un tiers du corpus, mais sa diversité linguistique reste médiane : elle se concentre sur un petit nombre de langues à forte audience. La presse spécialisée pèse moins lourd tout en étant sensiblement plus diverse, ce qui prolonge une observation déjà faite à l'échelle sectorielle : les écosystèmes spécialisés sont plus fragmentés, donc plus variés dans leurs langues de publication.

Les réseaux sociaux et forums affichent l'indice de diversité le plus élevé pour la part de corpus la plus modeste après les données sectorielles. Ils constituent, sur l'axe linguistique, le type de source le plus ouvert, ce qui explique leur intérêt pour la détection précoce internationale, malgré le niveau de bruit élevé que nous avons mesuré par ailleurs. À l'opposé, les données et publications sectorielles cumulent la plus faible part et la plus faible diversité.

Une diversité linguistique inversement liée au niveau de vérification

La lecture croisée fait apparaître une régularité nette : plus un type de source est vérifié avant publication, moins il est divers linguistiquement. Les sources institutionnelles et les données sectorielles publient dans un nombre restreint de langues officielles ou techniques ; les réseaux et forums, sans filtre éditorial, s'expriment dans la langue de leurs communautés d'origine.

Cette régularité place les organisations devant un arbitrage concret. Les types de sources les plus fiables sont aussi ceux qui ferment le plus tôt la porte aux aires linguistiques non couvertes. Se reposer sur eux seuls produit un corpus rassurant en apparence (bruit faible, autorité élevée) mais dont l'horizon géographique est étroit. Se reposer sur les seuls canaux ouverts inverse exactement le problème.

Le tableau ne tranche pas cet arbitrage : il l'objective. Une organisation exposée à des risques concentrés sur son marché domestique n'a pas le même besoin qu'une organisation dont la chaîne d'approvisionnement traverse plusieurs aires linguistiques. La donnée sert à calibrer ce choix, pas à le remplacer.

Un corpus ne se juge pas à ce qu'il contient en moyenne, mais aux cases qu'il laisse vides au croisement du type de source et de la langue.

Où se logent les angles morts du croisement

Trois configurations reviennent systématiquement dans les corpus que nous documentons. La première est l'angle mort institutionnel non francophone : les publications officielles d'aires linguistiques éloignées existent, sont fiables, et restent absentes de la plupart des corpus faute d'être collectées. Le signal réglementaire d'origine étrangère arrive alors par sa reprise dans la presse, avec le retard que cela suppose.

La deuxième est l'angle mort de la presse spécialisée locale. Un secteur donné dispose souvent, dans chaque aire linguistique, de titres techniques à faible audience mais à forte valeur d'anticipation. Leur volume unitaire est trop faible pour peser dans les moyennes générales, ce qui les rend invisibles aux indicateurs agrégés, et leur absence, indolore à la mesure, coûteuse à la détection.

La troisième tient aux données sectorielles : dernière par la part du corpus et par la diversité, cette famille cumule les deux handicaps. Elle constitue statistiquement la case la plus vide du croisement. Comme elle porte des informations structurelles (capacités, volumes, flux) son sous-échantillonnage prive la veille d'une catégorie entière de signaux, ceux qui précèdent l'événement médiatique plutôt que de le commenter.

Ce que cette cartographie change pour la constitution d'un corpus

La conséquence pratique est un changement d'objectif. Plutôt que de viser un volume global ou un nombre de langues, il s'agit de traiter le croisement comme une grille à remplir et d'identifier les combinaisons manquantes au regard de son exposition réelle. Une organisation gagne davantage à ajouter dix sources institutionnelles dans une aire non couverte qu'à doubler son volume de presse généraliste.

Cette approche a un coût, et il faut le nommer : ouvrir une combinaison nouvelle suppose de collecter, de traiter et de qualifier des sources dans une langue que l'équipe ne maîtrise pas nécessairement. La question du jugement humain se déplace alors vers la validation, sans disparaître. C'est une charge d'organisation, à intégrer dans le dimensionnement du dispositif.

Méthode, limites et reproductibilité

Les parts sont calculées sur le volume de contenus collectés au cours de la période d'observation du baromètre, après déduplication des reprises quasi identiques. L'indice de diversité linguistique est une mesure d'étalement du volume entre les langues détectées pour un même type de source, normalisée sur 0 à 100 afin de rendre comparables des familles de tailles très différentes. Les typologies de sources et les règles de rattachement sont publiées avec les données brutes, sous licence CC BY 4.0.

Ce corpus est constitué à partir du périmètre de collecte de l'infrastructure de veille multi-sources de NewsCore (www.newscore.fr), qui couvre en continu un large éventail de types de sources et de langues et rend cette mesure croisée observable à cette échelle. La limite tient à la nature même de l'exercice : nous décrivons la structure d'un corpus réel, non un inventaire théorique de tout ce qui existe. Une case vide signale une combinaison absente de ce corpus, ce qui reste l'information utile pour qui construit le sien.

Deux précautions de lecture s'imposent enfin. Les indices sont relatifs et ne se comparent qu'entre eux, à l'intérieur de ce tableau. Et la répartition décrite est une photographie : la part des réseaux et des données sectorielles évolue plus vite que celle de la presse, ce qui appelle une actualisation régulière plutôt qu'une lecture figée.

Questions fréquentes

Que mesure exactement l'indice de diversité linguistique ? Il mesure l'étalement du volume d'un type de source entre les langues détectées, et non le nombre brut de langues. Un type présent dans quinze langues mais concentré à 90 % sur l'une d'elles obtient un indice faible, car sa dépendance à une langue dominante reste forte.

Faut-il rééquilibrer un corpus pour que tous les types de sources pèsent également ? Non. L'équilibre parfait n'est pas un objectif en soi : les types de sources n'ont ni la même productivité ni la même valeur d'anticipation. L'objectif est de couvrir les combinaisons type × langue pertinentes pour son exposition, ce qui produit généralement une répartition volontairement inégale.

Pourquoi les données sectorielles pèsent-elles si peu dans le corpus ? Parce qu'elles sont publiées à intervalles longs, dans des formats hétérogènes et dans un petit nombre de langues techniques. Leur faible part reflète cette rareté structurelle, pas un moindre intérêt : ce sont souvent les sources les plus précoces sur les évolutions de capacité et de flux.

Les données croisées sont-elles réutilisables ? Oui, sous licence CC BY 4.0, avec attribution à l'Observatoire de l'Intelligence Économique. Les indices, la typologie des sources et les règles de normalisation sont publiés ensemble afin que la démarche soit reproductible sur un autre corpus.

Pour approfondir