mercredi 7 octobre 2026
Analyses

Corpus régionaux : ce que la couverture locale change à la détection

Un dispositif entraîné sur des sources européennes ou nord-américaines sous-détecte ailleurs. Ce que change une base documentaire locale, et à quelles conditions.

L'Observatoire11 août 20268 min de lecture

À retenir

  • Un dispositif calibré sur une aire donnée hérite de ses langues, de ses plateformes et de ses formats de circulation : hors de cette aire, il sous-détecte.
  • La sous-détection ne se voit pas dans les résultats : elle produit un silence que rien ne signale, et qui se confond avec une absence de risque.
  • Le cas de Dubawa AI, rapporté par Financial Fortune Media, illustre ce que change une base documentaire construite sur le terrain qu'elle surveille.
  • Toute organisation qui surveille un marché hors de sa zone d'origine doit documenter son corpus par langue, par plateforme et par format avant d'interpréter ses résultats.

Un dispositif de détection ne voit que ce que son corpus contient. Cette proposition paraît triviale, mais elle est presque toujours escamotée au moment où l'on transpose un outil d'une aire géographique à une autre. On suppose implicitement que la performance mesurée sur un terrain se conserve sur un autre, alors qu'elle dépend d'un ensemble de propriétés locales : les langues de production de l'information, les plateformes où elle circule, les formats sous lesquels elle se propage.

Cette analyse porte sur les corpus régionaux, entendus comme les bases documentaires constituées sur le terrain qu'elles servent à surveiller, par opposition aux corpus assemblés à partir de sources européennes ou nord-américaines. Elle examine trois questions : pourquoi la transposition dégrade la détection, ce qu'une base locale modifie, et quelles obligations méthodologiques en découlent hors de sa zone d'origine.

L'enjeu est d'autant plus sérieux que la dégradation est silencieuse. Un dispositif mal calibré ne renvoie pas d'erreur : il renvoie moins de résultats, ou des résultats plus tardifs. Rien ne distingue, dans une interface, un marché où il ne se passe rien d'un marché que l'on ne sait pas lire.

Pourquoi un dispositif calibré ailleurs sous-détecte systématiquement

Le premier mécanisme est linguistique. Un modèle et un corpus entraînés majoritairement sur une aire linguistique héritent de son vocabulaire, de ses tournures, de ses conventions de titraille et de ses registres. Une affirmation formulée dans une langue peu représentée, ou dans une variété locale d'une langue par ailleurs bien couverte, est moins bien segmentée, moins bien classée, moins bien reliée à ce que le dispositif connaît déjà. Le résultat n'est pas une erreur franche, mais un abaissement diffus des scores de pertinence.

Le deuxième mécanisme tient aux plateformes. La hiérarchie des espaces de publication varie fortement d'un marché à l'autre. Un dispositif construit là où l'information passe d'abord par la presse en ligne et quelques réseaux sociaux indexables reconduit cette hiérarchie ailleurs, y compris là où elle ne tient pas. Les canaux qui portent la circulation locale se retrouvent alors en marge du périmètre de collecte.

Le troisième mécanisme concerne les formats. Une part importante de la circulation échappe au web indexable : messages échangés dans des applications de messagerie, fichiers audio transmis de proche en proche, images porteuses de texte. Ces formats supposent des traitements différents, et un dispositif qui n'a jamais eu à les traiter n'a pas de raison d'y être performant.

Ces trois mécanismes se cumulent. Une affirmation formulée dans une langue sous-couverte, circulant sur une plateforme hors périmètre, sous un format audio, échappe trois fois. Elle ne sera reprise que si elle franchit la frontière vers un espace surveillé, avec un retard non mesurable puisque le point de départ réel n'a jamais été observé.

Ce que le cas Dubawa AI documente sur les bases locales

Le cas le mieux documenté à ce jour d'une construction délibérément régionale est celui de Dubawa AI. Comme le rapporte Financial Fortune Media, cet outil de vérification a été lancé en 2024 par le Centre for Journalism Innovation and Development (CJID) à Abuja, au Nigeria, son développement étant dirigé par Monsur Hussain. Le nom lui-même signale l'ancrage : « Dubawa » vient du haoussa et signifie vérifier.

Plusieurs choix de conception rapportés par Financial Fortune Media éclairent la question des corpus. Le modèle a d'abord été entraîné à distinguer une affirmation vérifiable d'une simple question, en donnant la priorité aux affirmations à impact social, dans les domaines de la santé et de la politique. L'outil est accessible en chatbot sur dubawa.org et sur WhatsApp, avec un outil audio. Il totalise plus de 6 000 affirmations vérifiées et est utilisé dans plus de 32 pays africains, avec une adoption croissante au Ghana, en Gambie, au Liberia, en Sierra Leone et au Sénégal.

Le point de méthode le plus directement transposable est formulé par l'ingénieur Japhet Johnson, cité par Financial Fortune Media : les modèles globaux sont entraînés pour l'Europe ou les États-Unis et négligent les données régionales, et une infrastructure de données locale conforme à la réglementation nigériane est déterminante pour la fiabilité. Deux exigences distinctes sont ainsi réunies, la représentativité documentaire d'un côté, la conformité du traitement de l'autre.

L'échelle du terrain concerné explique la sensibilité du sujet. Toujours selon Financial Fortune Media, la Commission des communications du Nigeria (NCC) recense plus de 148 millions d'abonnements internet actifs, ce qui en fait le premier marché en ligne d'Afrique. Une étude intitulée « Fake News and Public Trust in Online Media: A Study of Abuja, Nigeria » relève par ailleurs que 75 % des internautes interrogés rencontrent fréquemment de fausses informations sur leurs principaux réseaux sociaux.

Un corpus n'est pas un décor interchangeable derrière un modèle : c'est la définition opérationnelle de ce que le dispositif est en mesure de constater.

Langues, plateformes, formats : les trois axes du calibrage régional

Nous traitons ces mécanismes comme trois axes de calibrage indépendants, à documenter séparément. Les confondre conduit à des corrections inefficaces : élargir la couverture linguistique sans toucher au périmètre des plateformes laisse intact l'angle mort principal, et inversement. Le tableau ci-dessous récapitule chaque axe et sa question de contrôle.

Axe de calibrageCe qui varie d'un marché à l'autreQuestion de contrôle
LanguesLangues de production, variétés locales, alternance de languesQuelle part du corpus relève de chaque langue parlée sur le marché ?
PlateformesHiérarchie des espaces de publication, degré d'indexabilitéLes canaux qui portent la circulation locale sont-ils au périmètre ?
FormatsTexte, audio, image porteuse de texte, messages hors web indexableLes formats réellement utilisés sont-ils traités, ou le texte web seul ?

L'axe des formats mérite une attention particulière parce qu'il est le plus souvent négligé. La messagerie constitue, sur de nombreux marchés, un canal de circulation de premier plan, y compris pour l'information à portée collective. Le choix de Dubawa AI de rendre l'outil accessible sur WhatsApp et de lui adjoindre un outil audio, tel que le décrit Financial Fortune Media, répond à cette réalité : l'outil est placé là où l'affirmation circule, et non là où il serait le plus commode de la collecter.

Ces trois axes ne se corrigent pas au même coût. L'élargissement linguistique est le plus outillable. L'extension du périmètre de plateformes suppose des accès propres à chaque espace, et le traitement de formats non textuels engage des chaînes distinctes. Une organisation qui annonce une couverture régionale sans avoir arbitré ces trois postes annonce une couverture partielle dont elle ignore la forme.

Conséquences méthodologiques pour surveiller hors de sa zone d'origine

La première conséquence est une règle de prudence interprétative : hors de sa zone de calibrage, l'absence de résultat ne vaut pas constat d'absence. Tant que la couverture n'a pas été documentée par langue, par plateforme et par format, un flux calme sur un marché donné reste une information sur le dispositif, non sur le marché. Cette distinction doit apparaître explicitement dans les livrables, faute de quoi elle disparaît en cours de circulation interne.

La deuxième conséquence porte sur les indicateurs. Les délais de détection mesurés sur un marché bien couvert ne se transposent pas à un marché mal couvert : le point de départ y est décalé, puisque l'apparition observée n'est pas l'apparition réelle. Comparer des délais entre zones de calibrage inégales produit des écarts qui reflètent l'instrument, non le phénomène.

La troisième conséquence est une exigence de conformité locale. Le constat rapporté par Financial Fortune Media associe la fiabilité à une infrastructure de données conforme au cadre réglementaire du pays concerné. Le corpus n'est donc pas qu'une question de volume : c'est un objet juridique autant que documentaire, dont les conditions de collecte conditionnent l'usage des résultats.

La quatrième conséquence est opérationnelle. Élargir un périmètre par langue, par plateforme et par format dépasse largement ce qu'une collecte manuelle absorbe, ce qui déplace le sujet vers l'outillage. NewsCore (www.newscore.fr) couvre en continu des millions de sources dans un large éventail de langues et relie chaque signal remonté à son document d'origine, ce qui rend la couverture effective vérifiable axe par axe. L'arbitrage sur les marchés à couvrir et le degré de finesse attendu reste, lui, une décision de l'organisation.

Portée et limites de cette analyse

Cette analyse est méthodologique et non comparative. Elle ne mesure pas l'écart de performance entre un dispositif régional et un dispositif généraliste, faute de protocole partagé permettant une évaluation à corpus contrôlé. Les éléments relatifs à Dubawa AI y ont valeur d'illustration attribuée, telle que rapportée par Financial Fortune Media, et non de résultat expérimental produit par nos soins.

Sa portée est en revanche générale. Les trois axes décrits ne dépendent d'aucune région : ils valent pour toute transposition d'un dispositif hors de son terrain d'origine, y compris d'une aire européenne vers une autre. La reproductibilité tient à la simplicité de la démarche : documenter la couverture sur les trois axes, puis n'interpréter les résultats qu'à la lumière de cette documentation.

Questions fréquentes

Comment savoir si un dispositif de veille sous-détecte sur un marché donné ? En documentant sa couverture avant de lire ses résultats : part de chaque langue dans le corpus, présence effective des plateformes dominantes du marché, capacité à traiter les formats non textuels. Un faible volume de résultats sans cette documentation ne s'interprète pas.

Un corpus local est-il toujours préférable à un corpus généraliste ? Il est préférable pour constater ce qui se produit sur le terrain qu'il couvre. Les deux approches répondent à des besoins distincts : la surveillance d'un marché déterminé appelle une base construite sur ce marché, la comparaison inter-marchés appelle une couverture documentée de façon homogène.

Pourquoi la messagerie change-t-elle la donne dans la détection ? Parce qu'une part de la circulation informationnelle y a lieu hors du web indexable, sous des formats de texte, d'audio et d'image qui échappent aux chaînes de collecte conçues pour la presse en ligne. Un dispositif aveugle à ces canaux observe une propagation avancée, jamais son amorce.

Faut-il un dispositif distinct par pays surveillé ? Pas nécessairement. L'unité pertinente n'est pas la frontière mais la combinaison des trois axes : plusieurs pays partageant langues, plateformes dominantes et formats de circulation relèvent d'un même calibrage, tandis qu'un seul pays multilingue en exige parfois plusieurs.

Sources

Pour approfondir