mercredi 7 octobre 2026
Datasets

Le vocabulaire manquant qui fait échouer une requête de collecte bien formée

Un jeu de données mesure, à l'intérieur d'une même langue, la part du corpus qu'une requête de collecte bien construite laisse échapper faute de sigles, d'argot et de variantes orthographiques.

L'Observatoire14 août 20267 min de lecture

À retenir

  • Sur un corpus témoin, une requête validée par un analyste expérimenté ne capte qu'une fraction du matériau disponible sur le même sujet.
  • Les pertes se concentrent dans trois familles : sigles et acronymes non déclinés, argot professionnel, et graphies alternatives d'un même terme.
  • Un rituel d'enrichissement périodique du vocabulaire de collecte, construit à partir des documents captés après coup, réduit mécaniquement l'angle mort.
  • La méthode se limite à l'intérieur d'une langue donnée et ne traite pas la couverture d'un même sujet dans plusieurs langues.

Une requête bien formée n'est pas une requête complète

Une requête de collecte se juge d'ordinaire à sa précision : elle isole le sujet visé sans ramener un bruit disproportionné. Ce critère, nécessaire, ne dit rien du rappel, c'est à dire de la part du matériau existant que la requête parvient effectivement à capter. Un opérateur peut construire une expression parfaitement sélective et pourtant ignorer, par construction, tout un pan du corpus disponible : celui qui désigne le même objet avec d'autres mots.

Le problème ne vient pas d'une négligence de rédaction. Il tient à la nature même du langage professionnel, qui multiplie les désignations d'un même référent selon le registre, l'ancienneté du document, l'origine géographique du rédacteur ou son degré de familiarité avec le sujet. Un dispositif de veille qui interroge exclusivement le vocabulaire normé d'un domaine capte la production institutionnelle et rate structurellement les forums, les échanges informels, les documents anciens ou les sources traduites, où les variantes prolifèrent.

Protocole : constituer un corpus témoin et une collecte de référence

Pour mesurer ce phénomène plutôt que le supposer, un protocole simple suffit. On part d'un thème circonscrit et on constitue, indépendamment de toute requête, un corpus témoin par lecture exhaustive d'un ensemble de sources couvrant la période et le périmètre visés. Ce corpus témoin sert d'étalon : il contient tous les documents pertinents, retrouvés ou non par la suite. On exécute ensuite la requête de collecte telle qu'un analyste l'aurait rédigée sans connaissance préalable du corpus témoin, et l'on compare les deux ensembles.

L'écart entre le corpus témoin et le résultat de la requête se décompose document par document. Pour chaque document présent dans le témoin mais absent du résultat, on relève le ou les termes qui, dans ce document, désignent l'objet de la requête sans figurer dans son expression. Cette étape, la plus coûteuse en temps, est aussi la seule qui produise une information exploitable : elle transforme une intuition de perte en une liste de termes concrets et en une mesure chiffrable.

Ce qui échappe : trois familles de variantes

L'examen systématique des écarts fait apparaître trois familles récurrentes. La première regroupe les sigles et acronymes non déclinés : un sigle s'écrit avec ou sans points, en majuscules ou en minuscules, précédé ou non d'un article, et coexiste souvent avec des variantes régionales ou des traductions partielles que la requête d'origine, construite autour de la forme la plus répandue, ne prévoit pas.

La deuxième famille est l'argot professionnel : les praticiens d'un secteur désignent entre eux un dispositif, une procédure ou un acteur par un raccourci qui ne figure dans aucun glossaire officiel et qui n'apparaît que dans les échanges les moins formels, précisément ceux que la veille cherche le plus à capter. Ce vocabulaire évolue vite, se renouvelle par génération d'usagers et n'est documenté nulle part de façon centralisée, ce qui en fait la variante la plus difficile à anticiper.

La troisième famille rassemble les graphies alternatives d'un même terme : orthographes concurrentes, variantes avec ou sans trait d'union, translittérations différentes d'un nom propre, abréviations non standardisées. Prises isolément, ces variantes semblent mineures ; prises ensemble sur un corpus large, elles expliquent une part significative du matériau non capté, parce qu'elles touchent des termes pivots qui reviennent dans un grand nombre de documents.

Mesurer la perte : ordre de grandeur observé

Sur un corpus témoin construit selon le protocole décrit, la requête de référence, pourtant validée par relecture, laisse typiquement de côté une proportion notable des documents pertinents, concentrée sur un petit nombre de termes récurrents plutôt que dispersée sur l'ensemble du vocabulaire. Ce constat a une conséquence pratique importante : il n'est pas nécessaire d'ajouter des dizaines de variantes pour combler l'essentiel de l'écart, un noyau restreint de termes correctement identifiés suffit à récupérer la majeure partie du matériau manquant.

Un exemple illustre le mécanisme sans en épuiser la variété. Un terme technique unique, correctement épelé, peut coexister dans le corpus témoin avec une demi douzaine de désignations concurrentes : une abréviation d'usage interne, une forme plurielle irrégulière, une variante empruntée à un jargon voisin et une appellation antérieure conservée par habitude dans certains milieux. Chacune de ces formes, prise seule, capte une fraction modeste du corpus ; additionnées, elles représentent souvent davantage de documents que la forme normée censée les résumer toutes.

La distribution des pertes n'est pas homogène dans le temps. Les documents les plus anciens du corpus témoin emploient plus souvent des désignations tombées en désuétude, tandis que les plus récents introduisent des variantes qui n'existaient pas au moment où la requête a été rédigée. Une requête figée se dégrade donc mécaniquement à mesure que le vocabulaire du secteur évolue, indépendamment de toute erreur initiale de conception.

Le rituel d'enrichissement périodique

Le protocole de mesure devient un dispositif d'amélioration dès lors qu'il est répété à intervalle régulier plutôt que réalisé une seule fois. Chaque cycle reprend un échantillon frais de documents captés après coup, relève les variantes qui apparaissent dans ces documents sans figurer encore dans la requête active, et les verse dans un glossaire de collecte versionné, daté et commenté.

Ce glossaire distingue les termes ajoutés parce qu'ils désignent un objet déjà suivi, des termes ajoutés parce qu'ils révèlent un objet nouveau, non identifié jusque là : les deux catégories appellent un traitement différent, la première enrichit une requête existante, la seconde peut justifier l'ouverture d'un nouvel axe de collecte. Le rituel gagne à être calé sur un rythme fixe, indépendant de l'actualité du moment, afin que l'enrichissement du vocabulaire ne dépende pas de la disponibilité ponctuelle d'un analyste.

NewsCore (www.newscore.fr) applique ce principe à l'échelle de ses dispositifs de collecte et enrichit en continu ses vocabulaires de recherche à partir des documents nouvellement traités, ce qui raccourcit l'écart entre l'apparition d'une variante dans le langage courant d'un secteur et son intégration dans les requêtes actives.

Ce que la méthode ne corrige pas

Le rituel d'enrichissement réduit l'angle mort lexical, il ne l'annule pas. Il reste construit sur un corpus témoin nécessairement limité en taille et en période, ce qui signifie que des variantes rares, employées par un nombre restreint de rédacteurs ou propres à un sous-groupe très spécifique, peuvent continuer à échapper à plusieurs cycles successifs avant d'être détectées. La méthode traite l'intérieur d'une langue donnée : elle ne dit rien de la couverture d'un même sujet dans d'autres langues, question distincte qui appelle ses propres instruments.

Le glossaire de collecte doit également être nettoyé, pas seulement enrichi : certaines variantes perdent leur pertinence quand le vocabulaire du secteur se stabilise autour d'une désignation unique, et leur maintien indéfini dans la requête active finit par dégrader la précision au profit d'un rappel devenu marginal. L'arbitrage entre les deux, rappel et précision, reste une décision d'analyste, que la mesure éclaire sans la remplacer.

Questions fréquentes

Combien de variantes faut-il ajouter à une requête pour la considérer comme complète ? Il n'existe pas de seuil universel : le protocole montre qu'un nombre restreint de termes bien identifiés capture l'essentiel de l'écart mesuré sur le corpus témoin, mais la complétude totale n'est jamais atteinte, seulement approchée par cycles successifs.

Le rituel d'enrichissement doit il être automatisé ? Une partie du travail, la détection de termes candidats à partir des documents récemment captés, se prête à une automatisation partielle ; l'arbitrage sur leur intégration effective reste une décision humaine, car il engage l'équilibre entre rappel et précision propre à chaque dispositif.

Le phénomène touche-t-il également les autres langues de collecte ? Le protocole décrit ici se limite à une seule langue à la fois ; la comparaison entre langues relève d'une problématique distincte, celle de la couverture linguistique, qui appelle un protocole propre et n'est pas traitée par ce jeu de données.

Quelle est la durée de vie utile d'un glossaire de collecte enrichi de cette façon ? Elle dépend du rythme d'évolution du vocabulaire propre à chaque secteur ; un glossaire non révisé pendant plusieurs cycles perd progressivement en rappel à mesure que de nouvelles variantes apparaissent sans y être intégrées.

Repris dans le réseau

Pour approfondir