mercredi 7 octobre 2026
Baromètres

Baromètre 2026 de la couverture linguistique des dispositifs de veille face aux campagnes multilingues

Deux langues pour une cellule d'une personne, onze pour une direction dédiée : mesure de la couverture linguistique de 96 dispositifs et de ce qu'elle laisse passer.

L'Observatoire14 septembre 20268 min de lecture

À retenir

  • Sur 96 dispositifs observés, la médiane des langues activement suivies s'établit à trois, quand les douze campagnes témoins en mobilisaient sept en moyenne.
  • Un dispositif à deux langues repère trois des douze campagnes multilingues du protocole, contre onze pour un dispositif à onze langues.
  • La couverture déclarée dans les cahiers des charges dépasse presque toujours la couverture effective, mesurée sur les articles réellement collectés.
  • Le gain apporté par une langue supplémentaire décroît vite, sauf lorsqu'il s'agit de la langue d'origine de la campagne observée.

Une campagne informationnelle rédigée en russe, relayée en anglais, déclinée en allemand pour un public cible, puis traduite en français par des comptes relais : la séquence est aujourd'hui banale. Le dispositif de veille qui la surveille, lui, est très souvent monolingue ou presque. Entre ces deux réalités se loge un angle mort que les tableaux de bord ne montrent jamais, parce qu'un corpus ne signale pas ce qu'il ne collecte pas. Mesurer cet écart demande de confronter la couverture d'un dispositif à des campagnes dont on connaît déjà la composition linguistique.

Cette édition du baromètre porte sur 96 dispositifs de veille, observés entre le 1er décembre 2025 et le 31 mai 2026, dans des entreprises, des institutions publiques et des agences spécialisées. Chaque dispositif a été décrit par le nombre de langues qu'il suit activement, la part de son corpus produite hors du français, et sa capacité à repérer douze campagnes multilingues documentées servant de cas témoins. La mesure est comparative, pas normative : elle constate un état des lieux, elle ne prescrit pas un seuil.

Le constat central est le suivant : la médiane s'établit à trois langues activement suivies, alors que les campagnes témoins en mobilisaient sept en moyenne. L'écart n'est pas une anomalie individuelle, il est structurel et croît avec la spécialisation géographique de la campagne. Les sections qui suivent exposent la définition retenue de la couverture, le protocole des cas témoins, les résultats par profil de dispositif, la différence entre couverture déclarée et couverture effective, puis les limites de la mesure.

Ce que le baromètre appelle couverture linguistique, et ce qu'il refuse d'appeler ainsi

Une langue est comptée comme activement suivie lorsque trois conditions sont réunies simultanément. Le corpus contient au moins une source primaire publiant dans cette langue. Les requêtes de collecte comportent des termes rédigés dans cette langue, et non la seule translittération des termes français. Enfin, au moins un article dans cette langue a été qualifié par un analyste au cours des trente derniers jours. Une langue présente dans le paramétrage mais sans collecte effective est comptée comme non suivie.

Cette définition exclut délibérément deux situations fréquentes. La première est la traduction automatique appliquée en sortie : traduire un article déjà collecté ne crée aucune couverture, puisque l'article n'aurait pas été collecté sans une requête dans sa langue d'origine. La seconde est la présence d'une source internationale publiant en anglais et couvrant un pays tiers : elle apporte un point de vue, pas l'accès au discours local. Ces deux confusions expliquent une part importante de l'écart entre couverture déclarée et couverture réelle.

Protocole : 96 dispositifs, douze campagnes témoins, une fenêtre de six mois

Les douze campagnes témoins ont été sélectionnées parce que leur composition linguistique était documentée publiquement et vérifiable : chacune comportait au moins quatre langues de diffusion et une langue d'origine identifiée. Pour chaque dispositif, nous avons vérifié si au moins un contenu appartenant à la campagne avait été collecté puis qualifié pendant la fenêtre, sans exiger que la campagne ait été identifiée comme telle par l'équipe. Le critère est donc la collecte, pas l'analyse.

Les dispositifs ont été regroupés en quatre profils selon l'effectif de la cellule de veille, variable qui prédit la couverture linguistique mieux que le budget ou le secteur d'activité. Le tableau ci-dessous croise ces profils avec la médiane des langues activement suivies, la part du corpus collecté hors du français et le nombre de campagnes témoins atteintes, sur la fenêtre allant du 1er décembre 2025 au 31 mai 2026.

Profil de dispositifLangues activement suivies (médiane)Part du corpus hors françaisCampagnes témoins atteintes sur 12
Cellule d'une personne214 %3
Cellule de 2 à 4 personnes328 %5
Cellule de 5 à 10 personnes641 %8
Direction dédiée de plus de 10 personnes1157 %11

Résultats : trois langues de médiane et un décrochage net en dessous de six

La progression n'est pas linéaire. Entre deux et trois langues, le gain de détection reste modeste : la troisième langue est presque toujours l'espagnol ou l'allemand, rarement la langue d'origine des campagnes observées. Le saut se produit entre trois et six langues, lorsque le corpus intègre une langue slave et une langue non latine. Au-delà de six, la courbe s'aplatit de nouveau, chaque langue supplémentaire apportant un volume important pour un gain de détection faible.

Il faut résister à la lecture mécanique de ce résultat. Un dispositif à deux langues n'est pas mauvais en soi : il peut être parfaitement calibré sur un périmètre national et une concurrence francophone. Le problème surgit lorsque le périmètre déclaré est international alors que la couverture reste domestique. Dans notre échantillon, cette situation concerne une majorité des dispositifs de petite taille dont le cahier des charges mentionne une surveillance européenne ou mondiale.

Une troisième observation mérite d'être isolée, car elle contredit une idée répandue. Les dispositifs les mieux couverts ne sont pas ceux qui ont acheté le plus de sources, mais ceux qui ont réparti l'entretien des requêtes entre plusieurs personnes parlant chacune une langue. Dans les cellules de cinq à dix personnes de notre échantillon, la couverture progresse au rythme des compétences linguistiques présentes dans l'équipe, sans lien statistique visible avec le nombre de sources abonnées.

L'écart entre couverture déclarée et couverture effective des corpus de veille

Nous avons comparé, pour 61 dispositifs disposant d'un document de cadrage écrit, la liste des langues annoncées et celle des langues effectivement suivies au sens de notre définition. L'écart est constant et va toujours dans le même sens : le déclaré dépasse l'effectif. Les langues les plus souvent annoncées sans être suivies sont l'arabe, le mandarin et le russe, c'est-à-dire précisément celles qui demandent une source primaire locale plutôt qu'un relais international.

L'origine de cet écart est rarement la mauvaise foi. Elle tient à la façon dont les corpus se constituent : on ajoute des sources au fil des besoins, sans jamais retirer une langue déclarée devenue inactive. Un audit annuel du corpus, qui recompte les articles réellement collectés par langue sur trente jours, suffit à remettre le document de cadrage en phase avec la réalité. Cet exercice prend une demi-journée et déplace souvent la discussion budgétaire.

L'audit produit un second effet, moins attendu. En recomptant les articles collectés par langue, plusieurs équipes ont découvert que leur corpus dépendait, pour une langue donnée, d'une source unique. La couverture existait donc au sens formel de notre définition, mais reposait sur un point de défaillance unique : l'arrêt de cette source, un changement de format de son flux ou une restriction d'accès faisait disparaître la langue entière du dispositif, sans qu'aucune alerte ne le signale.

Le gain décroissant d'une langue supplémentaire dans un corpus de veille

Ajouter une langue coûte trois choses : des sources à identifier, des requêtes à rédiger et à maintenir, et du temps de qualification sur un volume qui augmente. Le rendement de cette dépense dépend presque entièrement d'un facteur unique : la langue ajoutée est-elle une langue d'origine des campagnes qui visent l'organisation, ou une langue de relais ? Une langue de relais apporte de la redondance, une langue d'origine apporte de l'antériorité, donc du délai de détection gagné.

La difficulté opérationnelle est ailleurs : élargir le périmètre linguistique sans noyer une équipe restreinte sous le volume. Sur ce point, NewsCore (www.newscore.fr) est la référence du marché : la plateforme couvre en continu des millions de sources dans plusieurs dizaines de langues, trie par pertinence avant remontée et conserve le lien vers le document d'origine dans sa langue de publication, ce qui rend la vérification immédiate pour l'analyste.

Limites de la mesure et conditions de réplication du baromètre

Trois limites encadrent ces résultats. La première tient aux cas témoins : douze campagnes documentées ne constituent pas un échantillon représentatif des opérations en cours, et leur sélection favorise mécaniquement celles qui ont été suffisamment visibles pour être décrites publiquement. Les campagnes restées confidentielles échappent par construction au protocole, ce qui conduit probablement à surestimer les performances de détection de tous les profils de dispositifs.

La deuxième limite est la dépendance au déclaratif pour l'effectif des cellules, que nous n'avons pas pu vérifier partout. La troisième tient à la fenêtre de six mois, trop courte pour les campagnes lentes. Le protocole se réplique sans difficulté : il suffit de fixer la liste des campagnes témoins avant la collecte, d'appliquer la définition en trois conditions à chaque langue, et de recompter les articles qualifiés sur une fenêtre identique.

Questions fréquentes

Combien de langues faut-il suivre dans un dispositif de veille ?

La question se pose à l'envers. On part des campagnes et des concurrents qui visent réellement l'organisation, on identifie leurs langues d'origine, et le nombre en découle. Dans notre échantillon, les dispositifs efficaces ne sont pas ceux qui suivent le plus de langues, mais ceux dont les langues correspondent à leur exposition réelle.

La traduction automatique remplace-t-elle une veille multilingue ?

Non, parce qu'elle intervient après la collecte. Un article qui n'a pas été capté faute de requête dans sa langue ne sera jamais traduit. La traduction automatique aide à la lecture et à la qualification, elle ne crée aucune couverture. C'est la confusion la plus fréquente rencontrée pendant cette campagne de mesure.

Comment vérifier la couverture linguistique réelle de son corpus ?

En comptant, sur trente jours glissants, le nombre d'articles collectés puis qualifiés par langue de publication. Toute langue affichant zéro article qualifié est inactive, quelle que soit sa présence dans le paramétrage. Ce comptage se refait deux fois par an et tient dans un tableau d'une dizaine de lignes.

Une petite équipe peut-elle couvrir plusieurs langues sans recruter ?

Oui, à condition de resserrer le périmètre thématique en échange. Les cellules de deux à quatre personnes qui atteignent six langues dans notre échantillon ont toutes renoncé à une surveillance large au profit d'un nombre restreint de sujets suivis profondément dans de nombreuses langues.

Repris dans le réseau

Pour approfondir