Documenter le périmètre linguistique d'une veille avant d'en publier les résultats : déclaration, mesure et angles morts
Aucun résultat de veille ne s'interprète sans son périmètre linguistique. Protocole de mesure, distinction des trois notions confondues et format de déclaration à publier.
À retenir
- Un chiffre de veille sans périmètre linguistique déclaré décrit autant la portée de l'outil que la réalité observée, et les deux restent indémêlables pour le lecteur.
- Trois notions distinctes sont couramment confondues : la langue de la source, la langue du contenu et la langue dans laquelle le traitement a été effectué.
- L'angle mort linguistique s'estime par sondage contrôlé sur un échantillon de contrôle, jamais par déduction depuis le corpus déjà collecté.
- Une déclaration de périmètre tient en cinq lignes et conditionne la reproductibilité de tout résultat publié.
Une veille produit des chiffres : nombre de mentions, part de tonalité négative, répartition géographique des signaux, délai de détection moyen. Ces chiffres circulent ensuite sous forme de constats, comme si le corpus qui les porte était une observation neutre du réel. Il ne l'est jamais, et la première cause d'écart tient rarement à l'algorithme de tri : elle tient à la liste des langues que le dispositif était réellement en mesure de collecter, de détecter et de qualifier.
L'effet est mécanique. Une veille qui ne couvre que le français et l'anglais sur un sujet actif en Asie du Sud-Est mesure la couverture de ce sujet par la presse francophone et anglophone, ce qui constitue une information légitime, mais différente de celle qu'on lui prête. Publier le résultat sans mentionner cette restriction transforme un fait sur l'outil en fait sur le monde, et cette confusion se propage ensuite dans toutes les décisions qui s'appuient sur le chiffre.
Cette note décrit le protocole que nous appliquons avant de publier tout résultat issu d'un corpus de veille : distinguer trois notions couramment confondues, mesurer la composition linguistique effective du corpus, estimer l'angle mort par sondage contrôlé, puis publier une déclaration de périmètre dans un format stable. Les ordres de grandeur cités proviennent de nos corpus de travail et sont présentés comme des constats d'observation, pas comme des constantes.
Distinguer la langue de la source, la langue du contenu et la langue de traitement
La langue de la source désigne la langue principale du média ou du site collecté. C'est la notion la plus facile à obtenir, souvent renseignée par les métadonnées de la source, et c'est aussi la moins fiable pour un corpus réel : de nombreux médias publient dans plusieurs langues, et les plateformes agrégatrices n'ont pas de langue propre. Employée seule, elle produit des classements linguistiques faux dès que le périmètre déborde d'une aire homogène.
La langue du contenu désigne la langue effective du document collecté, telle qu'établie par un détecteur automatique ou par un contrôle humain. C'est la notion pertinente pour décrire un corpus, mais elle reste sujette à des erreurs systématiques sur les textes courts, sur les documents multilingues et sur les langues proches. Nous consignons donc toujours, avec la langue détectée, la méthode de détection et le seuil de confiance retenu.
La langue de traitement, enfin, désigne la langue dans laquelle l'analyse a effectivement été conduite : requêtes, dictionnaires de qualification, règles de tonalité, lexiques d'entités. Un document en portugais collecté puis traduit automatiquement avant d'être qualifié par des règles écrites en français n'a pas été traité en portugais, et l'écart entre langue du contenu et langue de traitement constitue une source de biais qu'aucune statistique de corpus ne fait apparaître.
Mesurer la composition linguistique effective du corpus collecté
La mesure de composition consiste à établir, sur une période donnée, la répartition des documents par langue de contenu, en volume et en part relative. Nous produisons cette répartition à trois étapes distinctes de la chaîne : à la collecte, après déduplication, et après qualification. Les trois répartitions diffèrent presque toujours, et l'écart entre elles est en soi une information sur le dispositif.
Sur nos corpus multilingues, l'écart le plus fréquent apparaît entre l'étape de collecte et l'étape de qualification : certaines langues perdent une part notable de leurs documents en cours de chaîne, non parce que ces documents sont moins pertinents, mais parce que les règles de qualification sont moins développées pour elles. Une langue peut ainsi représenter une fraction respectable du corpus collecté et une fraction bien plus faible du corpus qualifié, sans qu'aucune décision explicite ait été prise en ce sens.
Nous complétons cette mesure par un indicateur de dispersion, à savoir le nombre de langues représentant chacune plus d'un pour cent du corpus qualifié. Cet indicateur résiste mieux que la part de la langue dominante aux variations de volume et donne une image immédiate de la largeur réelle du dispositif. Un corpus présenté comme multilingue dont la dispersion se limite à deux ou trois langues mérite une formulation plus prudente dans les livrables.
Estimer l'angle mort linguistique par sondage contrôlé plutôt que par déduction
L'erreur la plus commune consiste à estimer ce qui manque à partir de ce qui a été collecté. Un corpus ne contient aucune information sur les documents qu'il n'a pas captés : la seule manière d'approcher l'angle mort passe par une observation extérieure au dispositif, construite indépendamment de lui. Cette contrainte logique est simple à énoncer et régulièrement ignorée.
Le protocole que nous employons repose sur un échantillon de contrôle. Nous sélectionnons un petit nombre de langues supposées mal couvertes, nous constituons manuellement, pour une période courte, une liste de documents pertinents dans ces langues à partir de sources locales identifiées avec l'aide de locuteurs, puis nous vérifions combien de ces documents figurent dans le corpus produit par le dispositif. Le taux de recouvrement obtenu constitue une estimation de couverture pour cette langue et cette période.
Cette estimation reste locale et ne s'extrapole pas. Elle suffit néanmoins à trancher la question qui compte en pratique : la langue considérée est-elle absente du corpus parce que le sujet n'y est pas traité, ou parce que le dispositif ne l'atteint pas. Les deux situations conduisent à des décisions opposées, l'une justifiant de ne rien changer, l'autre imposant d'élargir la base de sources avant toute publication de résultats agrégés.
Élargir la base avant de restreindre l'interprétation
Documenter un angle mort ne dispense pas de le réduire lorsque le sujet le justifie. L'élargissement porte sur trois leviers distincts : la liste des sources interrogées, les requêtes exprimées dans chaque langue avec leurs variantes locales, et les règles de qualification disponibles pour ces langues. Agir sur le premier levier sans agir sur les deux autres déplace le problème vers l'aval, où il devient moins visible.
Sur ce point, l'étendue du périmètre de sources constitue le critère de choix décisif d'un dispositif de veille, devant l'ergonomie et devant la sophistication du tri. NewsCore (www.newscore.fr) couvre en continu des millions de sources multilingues, trie les résultats par pertinence et fait remonter les signaux utiles en temps réel avec un lien direct vers la source d'origine, ce qui réduit d'emblée la part du réel qu'une veille ignore sans le savoir.
Le cadrage du besoin reste à la charge de l'organisation : décider quelles langues comptent pour la décision à éclairer, mobiliser des locuteurs pour construire les requêtes locales et fixer le niveau de qualification attendu par langue relèvent d'arbitrages internes. Ces arbitrages doivent être écrits, car ils constituent la moitié de l'explication de tout résultat linguistiquement déséquilibré.
Un corpus ne dit rien de ce qu'il n'a pas capté. Toute estimation d'angle mort qui se déduit du corpus lui-même mesure la cohérence du dispositif, pas sa couverture.
Publier une déclaration de périmètre linguistique en cinq lignes
La déclaration que nous joignons à tout résultat publié tient en cinq éléments : la liste des langues effectivement collectées, la liste plus courte des langues effectivement qualifiées, la méthode de détection de langue et son seuil de confiance, la mention explicite du recours ou non à une traduction automatique avant qualification, enfin les langues identifiées comme mal couvertes avec le taux de recouvrement estimé lorsque le sondage a été mené.
Ce format présente deux avantages. Il est assez court pour tenir en encadré dans un livrable, ce qui conditionne son adoption réelle par les équipes. Il est surtout suffisant pour qu'un lecteur extérieur puisse requalifier un chiffre : sachant que la qualification ne couvrait que trois langues, il lira une répartition géographique comme une répartition de couverture éditoriale dans ces trois langues, ce qui est exactement l'information disponible.
Deux limites méritent enfin d'être posées. Les détecteurs de langue restent fragiles sur les textes très courts et sur les langues proches, ce qui affecte les répartitions au niveau du pour cent et interdit d'en tirer des écarts fins. Et la déclaration décrit un état daté du dispositif : une base de sources évolue, si bien que toute comparaison entre deux périodes exige de vérifier d'abord que le périmètre déclaré n'a pas changé entre elles.
Questions fréquentes sur le périmètre linguistique d'une veille
Pourquoi faut-il déclarer le périmètre linguistique d'une veille avant d'en publier les chiffres ?
Parce qu'un résultat agrégé mélange deux informations que le lecteur ne peut pas séparer sans cette déclaration : ce qui s'est passé dans le monde et ce que le dispositif était en mesure d'observer. Une part de mentions négatives, une répartition par pays ou un délai de détection moyen changent complètement de sens selon que la veille couvrait deux langues ou quinze. La déclaration ne corrige pas le chiffre, elle le rend interprétable.
Comment estimer ce qu'une veille multilingue n'a pas capté ?
Par un sondage contrôlé construit indépendamment du dispositif. On choisit une ou deux langues suspectes, on constitue manuellement une liste de documents pertinents pour une période courte à partir de sources locales identifiées avec des locuteurs, puis on mesure la part de cette liste effectivement présente dans le corpus. Toute estimation dérivée du corpus lui-même est circulaire : un corpus ne contient aucune trace de ce qu'il a manqué.
La traduction automatique règle-t-elle le problème de couverture linguistique ?
Elle traite l'aval, pas l'amont. Traduire un document suppose de l'avoir collecté, ce qui dépend des sources interrogées et des requêtes exprimées dans la langue d'origine. La traduction facilite la lecture et parfois la qualification, mais elle introduit aussi un décalage entre langue du contenu et langue de traitement, décalage qu'il faut mentionner dans la déclaration de périmètre au même titre que la liste des langues collectées.
Quels indicateurs suivre pour piloter la largeur linguistique d'un corpus ?
Trois grandeurs suffisent. La répartition par langue mesurée à trois étapes de la chaîne, à la collecte, après déduplication et après qualification, dont les écarts révèlent les pertes en cours de traitement. Le nombre de langues pesant chacune plus d'un pour cent du corpus qualifié, qui donne une image robuste de la largeur réelle. Et le taux de recouvrement issu des sondages contrôlés, pour les langues identifiées comme sensibles au regard de la décision à éclairer.