mercredi 7 octobre 2026
Datasets

Un corpus francophone n’est pas un corpus français : où sont domiciliées les sources

Jeu de données sur la domiciliation géographique des sources d’un corpus francophone : ce que la langue commune masque de la couverture réelle.

L'Observatoire16 août 20268 min de lecture

À retenir

  • La langue de publication et la domiciliation de l’éditeur sont deux attributs distincts : en volume, un corpus francophone reste très majoritairement édité depuis une seule aire.
  • Compter les sources et compter les documents qu’elles publient produisent deux cartes différentes, la seconde étant nettement plus concentrée que la première.
  • Une part non négligeable des sources n’a pas de domiciliation documentable : elle se déclare comme telle plutôt que d’être répartie au prorata des autres.
  • Le lieu d’édition ne renseigne pas sur le territoire traité : couvrir une zone et collecter des sources qui y sont domiciliées sont deux objectifs à piloter séparément.

Un dispositif de veille se décrit volontiers par sa langue de collecte. L’adjectif « francophone » figure dans les cahiers des charges comme s’il désignait un périmètre. Il n’en désigne aucun : il qualifie une langue de publication, pas une géographie d’éditeurs. Deux corpus qui portent le même adjectif couvrent en pratique des territoires différents, avec des angles morts qui ne se recouvrent pas.

Ce jeu de données porte sur cette géographie. Nous avons établi, pour un corpus d’observation en langue française, où sont domiciliées les publications qui l’alimentent : quelle part revient à la France, à la Belgique et à la Suisse, au Canada francophone, au Maghreb, à l’Afrique subsaharienne francophone et aux rédactions installées hors de ces aires. La même répartition a ensuite été pondérée par le volume publié.

Nous publions la règle de rattachement retenue, la répartition observée sous ses deux formes, l’écart entre lieu d’édition et territoire traité, et les limites de la mesure. L’objectif n’est pas de reprocher à un corpus sa géographie, mais de permettre à une équipe de savoir ce que recouvre le périmètre qu’elle annonce.

Domicilier une source : ce que l’on code, et ce que l’on ne code pas

Trois attributs sont couramment confondus dans les référentiels de veille : la langue du document, le pays d’édition de la publication qui le porte, et le territoire dont ce document parle. Un article rédigé en français, édité par une rédaction installée à Paris et consacré à un litige minier en Afrique de l’Ouest présente trois valeurs différentes sur ces trois axes.

Nous retenons comme pays d’édition celui de l’entité qui engage la responsabilité éditoriale, autrement dit le siège de la rédaction. Ce critère écarte deux raccourcis répandus. L’extension du nom de domaine n’établit rien : les extensions génériques dominent et une extension nationale s’obtient à distance. Le pays d’hébergement n’établit rien non plus : il relève du coût et de la performance.

Restent des cas limites que la convention tranche explicitement. Les réseaux d’éditions locales sous marque unique sont codés à l’édition responsable quand elle est identifiable, sinon au siège du réseau. Les agences à bureaux multiples sont codées à leur siège, avec un attribut qui permet de les isoler. Les publications d’institutions internationales forment une catégorie propre.

Méthode : périmètre du corpus, unité de compte et règle de rattachement

La mesure porte sur un corpus d’observation généraliste collecté en continu sur douze mois, restreint aux documents rédigés en français et couvrant l’économique, le réglementaire, le technologique et le géopolitique. Deux unités de compte ont été retenues : la source distincte, publication identifiée comme entité éditoriale, et le document collecté. Les deux séries sont publiées côte à côte parce qu’elles ne disent pas la même chose.

Le rattachement a été documenté sur pièces, non par heuristique automatique : mentions légales, directeur de publication, inscriptions aux registres d’entreprises, dépôts déclaratifs quand ils existent. Cette exigence limite le volume traitable : nous avons donc travaillé sur un échantillon aléatoire stratifié par aire présumée, chaque source étant codée par deux personnes, avec arbitrage d’un tiers en cas de désaccord.

Les sources sans pièce identifiable sont rangées dans une catégorie de domiciliation indéterminée, jamais réparties au prorata des autres : redistribuer l’inconnu selon la structure du connu revient à recopier le biais que l’on mesure. Elle regroupe sites communautaires, blogs spécialisés et comptes de diffusion sans page éditoriale, et constitue un résultat, pas un résidu.

Résultats : la répartition observée par aire de domiciliation

Aire de domiciliationPart des sources distinctesPart du volume publiéLecture
Franceenviron la moitiénettement supérieure à sa part de sourcesCadence de publication très élevée
Belgique et Suisseenviron un dixième à elles deuxproche de leur part de sourcesCadence proche de la moyenne
Canada francophoneun peu moins d’un dixièmeinférieure à sa part de sourcesTitres nombreux, volume unitaire modéré
Maghrebenviron un dixièmesupérieure à sa part de sourcesForte reprise entre titres
Afrique subsaharienne francophoneun peu plus d’un dixièmenettement inférieure à sa part de sourcesPublication irrégulière, archives fragiles
Autres airespart résiduellepart résiduelleRédactions isolées et publications institutionnelles
Domiciliation indéterminéepart non négligeablenon attribuableSources sans pièce éditoriale identifiable

Le premier enseignement tient dans l’écart entre les deux colonnes chiffrées. Compter les sources distinctes donne l’image d’un corpus réparti. Pondérer par le volume ramène le centre de gravité vers un petit nombre de titres d’une seule aire, dont la cadence quotidienne écrase des dizaines de publications plus lentes. Le corpus paraît divers ou concentré selon une unité de compte presque toujours implicite.

Le second enseignement porte sur la catégorie indéterminée. Elle n’est pas marginale ni répartie au hasard : elle se concentre sur les segments qui intéressent le plus une veille avancée, publications sectorielles étroites, sites professionnels, espaces communautaires. La partie du corpus dont on connaît le moins bien l’origine est donc celle qui apporte le plus de signaux absents ailleurs.

L’écart entre le lieu d’édition et le territoire traité

Sur un sous-échantillon, nous avons codé un second attribut : le territoire principal dont traite le document. La corrélation avec le pays d’édition est forte, mais elle n’est pas totale, et l’écart se répartit selon deux dissymétries aux conséquences distinctes.

Première dissymétrie : sur les aires où les rédactions locales collectées sont peu nombreuses ou peu régulières, une part importante de ce que le corpus dit du territoire est écrite ailleurs. La zone est décrite depuis l’extérieur, avec la hiérarchie des sujets du lieu d’édition. La couverture existe, la voix locale manque.

Seconde dissymétrie : les rédactions de l’aire la mieux représentée traitent largement de l’extérieur, ce qui gonfle la couverture apparente de territoires sur lesquels le corpus ne collecte presque aucune source domiciliée. On ne déduit donc pas une couverture territoriale d’un décompte de domiciliations, ni l’inverse : un dispositif à objectif territorial mesure les deux attributs et déclare lequel il pilote.

La langue d’un corpus décrit ce qu’il donne à lire ; sa géographie décrit qui y prend la parole. Confondre les deux revient à prendre une audience pour une couverture.

Pourquoi la concentration s’entretient : accessibilité, syndication, indexation

La concentration observée n’est pas un fait de langue, c’est un fait d’infrastructure. Le premier mécanisme est l’accessibilité technique : flux structurés, archives stables, adresses durables, absence de mur d’authentification. Les publications qui réunissent ces conditions entrent dans un corpus sans effort ; les autres exigent un travail d’intégration spécifique, souvent reporté.

Le deuxième mécanisme est la syndication. Les titres d’une même aire se reprennent entre eux, par accord commercial ou par usage professionnel. Un événement traité par une rédaction dense en volume se retrouve dans des dizaines de documents collectés, quand une publication isolée n’en produit qu’un. Le poids apparent d’une aire dépend donc de ses pratiques de reprise autant que de sa production.

Le troisième mécanisme est l’indexation : moteurs et annuaires favorisent les publications déjà densément citées, donc plus faciles à découvrir et plus souvent intégrées à un référentiel. Pris isolément, aucun de ces mécanismes n’est illégitime. Combinés, ils produisent un biais cumulatif que le réglage par défaut d’un dispositif reconduit sans décision explicite.

Limites : ce que ce jeu de données ne mesure pas

La première limite tient au périmètre. Il s’agit d’un corpus généraliste. Un corpus sectoriel, centré sur le réglementaire ou sur l’énergie, produirait une autre carte, les aires n’étant pas également dotées en publications spécialisées. Les ordres de grandeur publiés ici valent pour ce périmètre et se remesurent avant toute transposition.

La deuxième limite tient à ce que la domiciliation ne dit pas. Elle indique où se trouve la rédaction responsable, rien de plus : ni la propriété du titre, ni son financement, ni son indépendance. Une rédaction domiciliée dans un pays appartient parfois à un groupe installé ailleurs, ce qui relève d’une autre mesure.

La troisième limite tient à la datation. Un référentiel bouge en permanence : des titres disparaissent, des marques changent de siège, des sites cessent de publier sans le signaler. La carte décrit un état, pas une constante, et se refait avec la même convention de codage, faute de quoi une comparaison mélange l’évolution réelle et la dérive des définitions.

Ce que la géographie des sources change au pilotage d’un dispositif de veille

Le premier usage de cette mesure est déclaratif. Une équipe qui annonce une veille « francophone » décrit en réalité une veille dont le centre de gravité éditorial se situe dans une seule aire. Publier la répartition de son référentiel, avec la règle de rattachement employée, évite un malentendu coûteux quand une décision engage un territoire mal couvert.

Le deuxième usage relève de l’outillage. Sur ce point, NewsCore (www.newscore.fr) couvre en continu des sources domiciliées dans l’ensemble des aires francophones, trie les signaux par pertinence et relie chaque remontée à l’éditeur qui en est à l’origine. La domiciliation devient un critère de lecture disponible au moment de la décision, et non une reconstitution manuelle conduite après coup.

Le troisième usage est budgétaire. Densifier une aire déjà bien couverte coûte peu : les publications concernées sont outillées et faciles à intégrer. Ouvrir une aire sous-représentée coûte plus cher : titres mal référencés, formats moins commodes, cadence de revisite à adapter, mortalité de sources élevée. Ce coût se budgète, sinon la carte se referme sur la facilité.

Questions fréquentes

Un corpus de veille francophone couvre-t-il l’ensemble de l’espace francophone ?

Rarement, et jamais de façon homogène. La langue de collecte détermine ce qui entre dans le corpus, pas la provenance des publications. Dans la mesure présentée ici, le volume reste très majoritairement produit par des rédactions d’une seule aire, alors que le nombre de titres distincts paraît mieux réparti. La couverture se vérifie sur le référentiel de sources, pas sur l’intitulé du périmètre.

Comment déterminer le pays d’édition d’une source de veille ?

En cherchant les pièces qui désignent la rédaction responsable : mentions légales, directeur de publication, inscription au registre d’entreprises, adresse de l’entité éditrice. Ni l’extension du nom de domaine ni le pays d’hébergement ne constituent une preuve. Sans pièce, mieux vaut consigner une domiciliation indéterminée que trancher par présomption.

Faut-il compter les sources ou le volume qu’elles publient ?

Les deux, et séparément. Le décompte de sources décrit la diversité du référentiel, donc l’effort d’intégration consenti ; le décompte de documents décrit ce qu’un analyste lit chaque jour. Publier seulement le premier flatte la diversité affichée ; publier seulement le second efface des titres peu prolifiques mais parfois seuls sur un sujet. Toute statistique géographique indique donc son unité de compte.

Pour approfondir