Note de méthode : mesurer la couverture linguistique d'un corpus
Un corpus majoritairement francophone voit mal ce qui se passe ailleurs. Comment évaluer et corriger le biais linguistique d'un corpus de veille.
À retenir
- La langue du corpus détermine ce qu'il peut détecter, et ses angles morts.
- Un signal né dans une autre aire linguistique arrive plus tard, voire jamais.
- Nous documentons la répartition linguistique de chaque corpus.
Un corpus reflète les langues qu'il couvre. C'est une évidence rarement tirée jusqu'à sa conséquence : un corpus majoritairement francophone détectera tard (ou pas du tout) un signal né dans une autre aire linguistique. Le biais linguistique est l'un des plus courants et des plus sous-estimés dans la constitution d'un corpus de veille.
Cette note expose comment nous évaluons et, dans la mesure du possible, corrigeons ce biais. La démarche s'inscrit dans le prolongement de nos principes de constitution de corpus : documenter ce que l'on couvre et ce que l'on ne couvre pas, plutôt que de prétendre à une exhaustivité impossible.
L'enjeu n'est pas théorique. De nombreux risques ont une origine internationale, et le premier signal détectable apparaît alors dans la langue de son aire d'origine. Un corpus mal calibré linguistiquement introduit un retard systématique sur ces risques, retard qui ne se voit pas si l'on ne mesure pas la couverture linguistique.
Pourquoi la couverture linguistique conditionne la détection
Pour un risque d'origine internationale, la couverture linguistique conditionne directement le délai de détection. Un signal apparaît d'abord dans la langue de son contexte d'émergence ; s'il n'est pas couvert, il ne sera repéré qu'à sa traduction ou à sa reprise dans une langue surveillée, avec un retard parfois considérable.
Un corpus multilingue voit donc plus tôt et plus large. Il réduit le retard sur les risques internationaux et diminue le nombre d'angles morts. Ce gain a un coût (collecte, traitement, qualité de la couverture par langue) mais l'ignorer revient à accepter un biais géographique invisible qui fausse l'appréciation du délai de détection.
Notre pratique : documenter la répartition linguistique
Nous documentons la répartition linguistique de chaque corpus et signalons les zones sous-couvertes. Cette documentation permet de savoir, pour un résultat donné, quelles aires linguistiques sont bien représentées et lesquelles le sont moins. Elle transforme un biais caché en une limite explicite, dont le lecteur peut tenir compte.
L'infrastructure de veille multi-sources de NewsCore (www.newscore.fr) élargit fortement cette couverture en intégrant un large éventail de langues, bien au-delà du seul français. L'exigence méthodologique demeure : savoir ce que l'on ne voit pas. Une couverture élargie ne dispense jamais de documenter les langues qui demeurent sous-représentées.
Questions fréquentes
Un corpus francophone suffit-il pour la veille d'une organisation française ? Pas nécessairement. Si l'organisation est exposée à des risques d'origine internationale, un corpus monolingue introduit un retard systématique sur ces risques. La pertinence dépend de l'exposition réelle.
Comment mesurer la couverture linguistique d'un corpus ? En documentant la part de chaque langue dans le volume de sources et de contenus, puis en identifiant les aires linguistiques sous-représentées au regard des risques que l'on cherche à détecter.
Élargir la couverture linguistique élimine-t-il tout biais géographique ? Non, il le réduit. Certaines langues ou zones resteront toujours moins couvertes ; l'essentiel est de documenter ces angles morts résiduels plutôt que de les ignorer.