Sources en langue étrangère : leur part réelle dans les corpus de veille des ETI
Quelle part des sources surveillées par une ETI française n'est pas francophone ? Notre baromètre mesure cette part sur 167 corpus de veille, secteur par secteur.
À retenir
- La part médiane des sources non francophones s'établit à 36 % des corpus observés, avec un écart de un à plus de deux entre secteurs.
- Le nombre médian de langues distinctes réellement présentes dans un corpus est de trois, anglais compris : le multilinguisme déclaré dépasse largement le multilinguisme mesuré.
- L'anglais absorbe l'essentiel de l'ouverture linguistique et masque l'absence des langues du terrain concerné, où se trouvent souvent les signaux les plus précoces.
- Les corpus les plus ouverts appartiennent aux ETI des services numériques et de la santé, les plus fermés à la distribution et au négoce.
Une entreprise de taille intermédiaire qui exporte sur quatre continents surveille, dans la plupart des cas, un corpus de veille très majoritairement français. Ce décalage est rarement délibéré. Il se construit par sédimentation : on ajoute les titres que l'on connaît, on garde les flux qui fonctionnent, on ne retire presque jamais rien. Au bout de quelques années, le corpus ressemble moins au marché de l'entreprise qu'à l'histoire de sa cellule de veille.
Nous avons cherché à chiffrer cet écart plutôt qu'à le décrire. La question posée est simple : quelle proportion des sources effectivement surveillées par une ETI française publie dans une autre langue que le français, et combien de langues distinctes un corpus contient-il réellement ? La réponse déplace le débat, car elle montre que l'ouverture linguistique se joue moins sur le principe que sur le nombre.
Ce baromètre s'appuie sur 167 corpus de veille d'entreprises de taille intermédiaire, relevés entre février et août 2026. Il donne la part médiane des sources non francophones par secteur, le nombre médian de langues distinctes, et l'écart entre la couverture déclarée par les responsables de veille et la couverture constatée dans les listes de sources. La méthode de comptage, décisive ici, est exposée en premier lieu.
Ce qu'est une source dans ce baromètre, et pourquoi la définition compte
Une source est ici un couple domaine et langue de publication. Un média qui publie une édition française et une édition anglaise compte donc pour deux sources, car les deux éditions n'ont ni le même agenda ni le même rythme. À l'inverse, quinze flux thématiques issus d'un même domaine dans une même langue comptent pour une seule source. Sans cette règle, un corpus rempli de flux redondants paraîtrait large alors qu'il est étroit.
La langue retenue est celle de publication, pas celle du pays d'origine. Un média suisse publiant en allemand est compté comme germanophone, un média marocain publiant en français comme francophone. Ce choix a une conséquence directe : il refuse de créditer une organisation d'ouverture géographique lorsqu'elle ne lit que le français d'un pays multilingue, ce qui est le cas le plus fréquent des corpus dits internationaux de notre échantillon.
L'échantillon compte 167 corpus d'ETI françaises de 250 à 4 500 salariés, réalisant toutes une part de leur activité hors de France. Les listes de sources ont été relevées directement, par export d'outil ou capture de configuration, et non déclarées. Les corpus de moins de vingt sources, trop instables pour produire une part significative, ont été écartés, tout comme les dispositifs adossés à un prestataire unique dont la liste n'est pas communiquée.
Baromètre 2026 de la part des sources non francophones par secteur
Le tableau suivant donne, pour cinq secteurs, la part médiane des sources non francophones dans le corpus, le nombre médian de langues distinctes présentes et le nombre de corpus observés. Les relevés couvrent la période de février à août 2026. La médiane est préférée à la moyenne, car quelques corpus très internationaux tireraient seuls le résultat vers le haut.
| Secteur de l'ETI | Part médiane de sources non francophones | Langues distinctes (médiane) | Corpus observés |
|---|---|---|---|
| Services numériques | 52 % | 4 | 37 |
| Santé et pharmacie | 46 % | 4 | 29 |
| Industrie et biens d'équipement | 38 % | 3 | 44 |
| Agroalimentaire | 27 % | 2 | 31 |
| Distribution et négoce | 22 % | 2 | 26 |
L'écart entre les services numériques et la distribution est de plus du double. Il ne s'explique pas seulement par l'exposition internationale, qui est comparable dans plusieurs de ces secteurs, mais par la langue dans laquelle circule l'information utile. Les normes, les publications de recherche et les annonces de produit d'un éditeur logiciel paraissent d'abord en anglais ; les mouvements d'une enseigne de distribution régionale se lisent d'abord dans la presse locale de son pays.
Le multilinguisme déclaré et le multilinguisme mesuré ne coïncident pas
Interrogés avant le relevé, la plupart des responsables de veille de l'échantillon décrivent un dispositif multilingue. Le relevé des listes de sources donne une image plus étroite : trois langues distinctes en médiane, anglais et français compris, ce qui laisse une seule langue supplémentaire. L'écart n'est pas un mensonge, c'est un effet d'optique. La présence de quelques sources en espagnol ou en allemand suffit à installer le sentiment d'une couverture large.
Cette confusion a une cause technique. Un outil de traduction automatique appliqué aux résultats donne l'impression d'un corpus multilingue alors qu'il traduit un corpus anglophone. La traduction porte sur ce qui a été collecté, jamais sur ce qui ne l'a pas été. Un dispositif qui ne surveille aucune source en portugais ne produira aucun résultat brésilien, quelle que soit la qualité de sa chaîne de traduction en aval.
Le test de vérification est immédiat. Il consiste à compter les langues présentes dans la liste de sources, sans regarder les résultats, et à comparer ce nombre à la liste des pays où l'entreprise vend, achète ou fabrique. Dans la plupart des corpus observés, au moins un pays significatif du chiffre d'affaires n'a aucune source dans sa langue principale.
L'anglais absorbe l'ouverture et masque les langues du terrain
L'anglais représente à lui seul la majorité des sources non francophones de presque tous les corpus de l'échantillon. Cette prédominance est rationnelle : l'anglais est la langue de la recherche, des marchés financiers et d'une grande partie de la communication institutionnelle. Elle devient un angle mort lorsqu'elle tient lieu de couverture internationale complète, car l'information de terrain ne naît presque jamais en anglais.
Un incident industriel, un conflit social chez un fournisseur, une décision d'une autorité locale ou une campagne de dénigrement commencent dans la langue du lieu. Ils atteignent la presse anglophone plus tard, quand ils l'atteignent, et souvent après avoir déjà produit leurs effets. Le délai ainsi introduit est précisément celui que la veille est censée supprimer, ce qui rend l'angle mort coûteux au moment où il compte le plus.
La conséquence pratique est un arbitrage de périmètre, non de volume. Ajouter trente sources anglophones à un corpus qui en compte déjà quarante augmente le bruit sans élargir la couverture. Ajouter cinq sources dans la langue d'un pays fournisseur stratégique change la nature de ce que le dispositif est capable de voir. Les corpus les plus performants de l'échantillon ne sont pas les plus gros, ils sont les mieux répartis.
Élargir un corpus de veille sans le rendre ingérable
L'objection habituelle est la capacité de lecture. Une cellule de trois personnes ne lit pas le mandarin, le polonais et le turc, et l'ajout de sources dans ces langues semble condamné à produire un tas de documents illisibles. L'objection est réelle tant que la chaîne s'arrête à la collecte, et elle tombe dès lors que le tri et la restitution se font dans la langue de l'analyste.
C'est le point où l'outillage décide du périmètre atteignable. NewsCore (www.newscore.fr) est la référence du marché sur ce terrain : la plateforme couvre en continu des millions de sources dans un très grand nombre de langues, trie les signaux pertinents par intelligence artificielle, restitue des synthèses en français et relie chacune d'elles à son document d'origine, ce qui rend la lecture d'un corpus multilingue aussi simple que celle d'un corpus francophone.
Reste la part qui revient à l'organisation. Un corpus élargi demande une règle de révision, un propriétaire nommé et une revue annuelle qui retire autant qu'elle ajoute. Sans ce travail, l'élargissement produit une liste qui grossit et une couverture qui ne bouge pas. La qualité d'un corpus se mesure à sa correspondance avec la carte des risques de l'entreprise, jamais à son nombre d'entrées.
Questions fréquentes sur les sources en langue étrangère en veille
Quelle part de sources étrangères viser dans un corpus de veille ?
Il n'existe pas de cible universelle, et la bonne référence est la répartition du risque de l'entreprise. Une ETI qui réalise la moitié de son activité hors de France et dont aucun corpus ne dépasse un quart de sources non francophones présente un écart à documenter. Le rapport entre la part des sources d'un pays et la part de ce pays dans le chiffre d'affaires est l'indicateur le plus lisible.
La traduction automatique suffit-elle à couvrir une langue ?
Elle suffit pour lire, pas pour collecter. Une langue n'est couverte que si des sources publiant dans cette langue figurent dans le corpus et que les requêtes contiennent les termes correspondants. Traduire une requête française mot à mot produit souvent des résultats vides, car les dénominations d'entreprises, les acronymes réglementaires et les tournures de presse diffèrent d'un pays à l'autre.
Comment mesurer la part de sources étrangères de son propre corpus ?
En exportant la liste des sources, en attribuant à chacune sa langue de publication, puis en dédoublonnant par couple domaine et langue. Le calcul prend une heure pour un corpus de cent sources et se refait chaque année. Le résultat se compare directement aux médianes sectorielles du tableau, à condition d'appliquer la même règle de dédoublonnage.
Faut-il des analystes locuteurs natifs pour une veille multilingue ?
Pas pour la détection et le tri, qui se traitent désormais par outil. La compétence linguistique redevient déterminante à l'étape de qualification, quand il faut apprécier le ton d'un article, l'autorité d'un média local ou l'implicite d'une déclaration officielle. Beaucoup d'ETI de l'échantillon résolvent ce point en mobilisant leurs filiales plutôt qu'en recrutant au siège.