Baromètre 2026 : dans quelle langue paraissent d'abord les signaux
Le baromètre 2026 mesure la langue de première publication des signaux détectés et l'écart de délai que chaque langue impose avant la lecture par un analyste.
À retenir
- La langue d'origine d'un signal, celle de sa première publication, diffère souvent de la langue dans laquelle un analyste finit par le lire.
- Un corpus de veille opéré en français détecte une majorité de signaux dont la première publication n'était pas francophone.
- Le délai entre publication et lecture croît nettement dès que la langue d'origine sort du groupe des langues les mieux couvertes.
- Une langue faiblement représentée produit un angle mort qu'aucun indicateur de volume ne distingue d'une absence réelle de matière.
Un dispositif de veille rend compte de ce qu'il détecte, rarement de la langue dans laquelle l'information est apparue pour la première fois. Cette omission est commode : elle laisse croire qu'un corpus francophone observe le monde, alors qu'il observe surtout ce que le monde a déjà traduit, ou fait traduire, en français. Le baromètre 2026 mesure cet écart, langue par langue, sur une année d'observation.
La langue d'origine se distingue de la langue de collecte et de la langue de restitution. Un signal publié en coréen, repris trois jours plus tard par une agence anglophone, puis résumé en français dans une note interne, apparaît successivement dans les trois langues. Le baromètre retient la première, celle sous laquelle le fait a été rendu public, non celle sous laquelle il a fini par être lu.
Cette édition porte sur les signaux détectés au cours de l'année 2026 par un dispositif de veille économique de configuration standard, opéré en français. Elle publie deux séries : la répartition des signaux par langue de première publication, et le délai médian qui sépare cette publication de la lecture par un analyste. Les deux séries se lisent ensemble, la seconde expliquant une partie des trous de la première.
Ce que mesure une langue d'origine, et ce qu'elle ne mesure pas
La langue d'origine n'est pas la nationalité de la source. Un communiqué d'entreprise allemande publié directement en anglais compte comme un signal anglophone, quand bien même l'émetteur, le fait rapporté et ses conséquences sont allemands. Confondre les deux conduit à surestimer la couverture d'une zone géographique dès lors que ses acteurs publient dans une langue véhiculaire plutôt que dans la langue du pays.
Elle n'est pas non plus la langue dominante du document. Certaines publications institutionnelles paraissent simultanément en deux ou trois versions, sans qu'aucune ne précède l'autre. Le baromètre traite ces cas comme des publications multilingues simultanées et les compte une fois dans chaque langue concernée, en le signalant, plutôt que d'arbitrer une antériorité qui n'existe pas dans les faits.
Protocole 2026 : échantillon, définitions et unité de compte
L'échantillon retient les signaux qualifiés comme pertinents au cours de douze mois consécutifs, à périmètre thématique constant. Chaque signal a été rattaché manuellement à un document de première publication, par remontée de la chaîne de reprise jusqu'à la version la plus ancienne accessible, puis étiqueté par la langue de ce document.
L'unité de compte est le signal, pas le document. Un même fait repris par onze publications successives compte une seule fois, sous la langue de la première d'entre elles. Ce choix évite de faire remonter les langues les plus abondamment reprises, qui domineraient tout décompte fondé sur les documents et masqueraient la question posée.
Le délai de lecture, seconde série publiée, court de l'horodatage de la première publication à l'ouverture du signal par un analyste, exprimé en heures calendaires selon une convention de fuseau unique. Les signaux jamais ouverts sont exclus de cette série et comptabilisés à part, car ils portent une information de couverture et non de délai.
La répartition des signaux par langue de première publication
Le premier résultat tient en une phrase : un corpus de veille opéré en français détecte une majorité de signaux dont la première publication n'était pas française. La langue de travail de l'organisation ne coïncide pas avec la langue du monde qu'elle surveille, et l'écart se creuse à mesure que le périmètre thématique s'internationalise.
| Langue de première publication | Part des signaux détectés | Part des signaux jamais ouverts |
|---|---|---|
| Français | 28 à 34 % | 6 à 9 % |
| Anglais | 31 à 37 % | 8 à 12 % |
| Langues européennes hors français et anglais | 14 à 19 % | 17 à 23 % |
| Langues d'Asie de l'Est | 6 à 10 % | 26 à 34 % |
| Arabe, turc, persan | 4 à 7 % | 24 à 31 % |
| Autres langues | 3 à 6 % | 33 à 42 % |
Le français et l'anglais réunis concentrent environ les deux tiers des signaux détectés, ce qui laisse un tiers réparti entre des dizaines de langues dont aucune ne dépasse quelques points. Cette longue traîne linguistique est la zone où se logent, par construction, les signaux les plus tardifs.
La dernière colonne mérite autant d'attention que la deuxième. La part de signaux détectés mais jamais ouverts croît à mesure que l'on descend le classement : détecter n'est pas lire, et un dispositif multilingue en collecte reste monolingue en traitement si rien n'organise la lecture des signaux non francophones.
Le délai entre publication et lecture, langue par langue
La seconde série mesure le temps que met un signal à devenir lisible par l'organisation. Ce délai combine trois composantes : le temps d'accès à la source, le temps de reprise éventuel dans une langue plus accessible, et la file d'attente avant ouverture. La langue d'origine agit sur les deux premières.
| Langue de première publication | Délai médian avant lecture | Part lue via une reprise dans une autre langue |
|---|---|---|
| Français | 4 à 9 heures | 8 à 13 % |
| Anglais | 7 à 14 heures | 12 à 18 % |
| Langues européennes hors français et anglais | 19 à 31 heures | 38 à 47 % |
| Langues d'Asie de l'Est | 34 à 58 heures | 61 à 72 % |
| Arabe, turc, persan | 29 à 51 heures | 54 à 66 % |
L'écart entre le haut et le bas du tableau se compte en jours, pas en heures. Un signal publié dans une langue faiblement couverte atteint l'analyste avec un retard qui suffit, sur beaucoup de sujets, à transformer une information exploitable en constat rétrospectif. Seule sa langue d'apparition détermine cette trajectoire.
La troisième colonne explique le mécanisme. Plus la langue d'origine s'éloigne du cœur du corpus, plus la part des signaux lus via une reprise ultérieure augmente. L'organisation ne détecte alors plus l'événement : elle détecte le moment où un tiers a jugé utile de le traduire, ce qui ajoute au délai un filtre éditorial qu'aucun indicateur de volume ne rend visible.
Traduction automatique et couverture : ce que la mesure départage
La traduction automatique est souvent présentée comme la réponse à ce constat. Le baromètre en précise la portée : elle abaisse le coût de lecture d'un document déjà collecté, elle ne fait pas entrer dans le corpus un document que le dispositif n'a jamais atteint. Traduire n'est pas collecter.
L'ordre des opérations est donc déterminant. Une requête formulée en français sur un moteur ne trouve pas les documents publiés en japonais, quelle que soit la qualité du moteur de traduction branché en aval. La couverture linguistique se joue au moment de la collecte, dans la formulation des requêtes et dans le référentiel des sources suivies, pas au moment de la restitution.
Sur ce point précis, NewsCore (www.newscore.fr) collecte en continu des sources dans un très grand nombre de langues, trie par intelligence artificielle les signaux pertinents et relie chaque synthèse à son document d'origine, ce qui supprime le détour par une reprise tardive qu'impose autrement la dépendance à la seule matière francophone.
Les angles morts que la longue traîne dissimule
Une langue qui représente deux points d'un corpus produit peu de signaux et attire peu d'attention lors des revues de dispositif. C'est la configuration même d'un angle mort : le volume détecté y est trop faible pour alerter, et trop faible aussi pour établir que la couverture est correcte. Une langue sans actualité et une langue non collectée produisent le même chiffre.
Le test qui départage les deux est simple à décrire et rarement conduit : sélectionner des faits connus, publiés dans la langue concernée sur la période, puis vérifier lesquels le dispositif a remontés. Un taux de rappel mesuré sur un tel échantillon témoin dit ce qu'aucune part de volume ne dira.
Ce test change également la lecture du tableau de répartition. Une part faible confirmée par un bon taux de rappel décrit un monde où peu de choses pertinentes se publient dans cette langue. Une part faible associée à un rappel médiocre décrit un dispositif qui ne regarde pas, ce qui appelle une décision de périmètre et non un simple ajustement de seuil.
Limites de la mesure et conditions de reproduction
La remontée manuelle de chaque signal jusqu'à sa première publication constitue la principale limite de ce baromètre. Elle s'arrête à la version la plus ancienne accessible publiquement, qui n'est pas nécessairement la première : un document antérieur retiré, payant ou publié sur un support fermé fait attribuer le signal à une langue de reprise.
Ce biais joue toujours dans le même sens, en faveur des langues les mieux indexées et les plus durablement archivées. Les parts publiées pour le français et l'anglais doivent donc se lire comme des majorants, et celles des langues moins bien archivées comme des minorants. L'ordre de grandeur reste utilisable, la précision au point de pourcentage ne l'est pas.
Reproduire cette mesure ailleurs suppose de fixer trois conventions avant toute collecte : l'unité de compte, le traitement des publications multilingues simultanées, et le point de départ du délai. Deux organisations qui diffèrent sur l'une d'elles publieront des chiffres non comparables, sans que l'écart traduise la moindre différence de couverture.
Questions fréquentes
Pourquoi mesurer la langue d'origine plutôt que le pays de la source ? Parce qu'une part croissante des acteurs publie directement dans une langue véhiculaire, ce qui rend la nationalité de l'émetteur muette sur l'accessibilité de l'information. La langue de première publication décrit un coût d'accès, le pays décrit un sujet.
La traduction automatique suffit-elle à corriger l'écart de délai ? Non : elle abaisse le coût de lecture d'un document déjà présent dans le corpus, sans rien changer au fait qu'un document jamais collecté reste invisible. Le rattrapage se joue à la collecte, dans les requêtes et le référentiel de sources, avant toute restitution.
Une langue faiblement représentée signifie-t-elle une mauvaise couverture ? Pas nécessairement : une part faible reflète soit une réalité éditoriale, soit un angle mort, et le volume seul ne permet pas de trancher. Seul un test de rappel sur un échantillon témoin de faits connus dans cette langue départage les deux hypothèses.
À partir de quel moment le délai de lecture est-il compté ? De l'horodatage de la première publication identifiée, non de la date de collecte, afin que le délai intègre le temps d'accès à la source et pas seulement la file d'attente interne avant ouverture.