mercredi 7 octobre 2026
Baromètres

Baromètre de résolution des entités : quelle part d'un corpus de veille tient sur un identifiant légal certain

Quelle part des organisations mentionnées dans un corpus de veille est rattachée à un identifiant légal certain, et que devient une statistique par organisation quand cette part reste faible ?

L'Observatoire15 août 20267 min de lecture

À retenir

  • Le taux de résolution mesure la part d'un corpus dont chaque entité mentionnée est rattachée à un identifiant légal, distinct de la simple mention d'un nom en langage naturel.
  • Toute statistique agrégée par organisation, volumes, tonalité, fréquence de citation, hérite du taux de résolution du corpus qui la fonde : un taux faible fragilise le résultat sans que le chiffre final le signale.
  • Le protocole proposé annote un échantillon selon trois états, résolu certain, résolu probable, non résolu, plutôt qu'une distinction binaire qui masquerait les cas intermédiaires.
  • Cette mesure porte sur la couverture d'identification d'un corpus, pas sur les collisions entre noms proches, qui relèvent d'un phénomène de bruit distinct.

Une organisation mentionnée dans un document de veille apparaît d'abord comme une chaîne de caractères, un nom en langage naturel écrit tel qu'un journaliste, un communiqué ou un forum l'a formulé. Pour être agrégée avec d'autres mentions de la même organisation, dénombrée, suivie dans le temps ou croisée avec d'autres jeux de données, cette chaîne doit être rattachée à un identifiant stable qui désigne une seule entité juridique de façon non ambiguë.

Ce rattachement n'est jamais garanti à cent pour cent sur un corpus réel. Une part variable des mentions reste en nom libre, sans identifiant associé, soit parce que l'organisation citée est trop récente ou trop petite pour figurer dans les registres consultés, soit parce que l'orthographe ou la forme abrégée employée dans le texte source ne permet pas de trancher avec certitude. Ce baromètre mesure cette part et documente ce qu'elle implique pour l'exploitation du corpus.

Ce que mesure le taux de résolution

Le taux de résolution se définit comme la proportion des mentions d'entités d'un corpus donné pour lesquelles un identifiant légal a pu être attribué avec un niveau de confiance déclaré. Il ne mesure pas la présence ou l'absence d'une organisation dans un registre, mais la capacité effective du dispositif de veille à relier une mention textuelle à cet enregistrement, ce qui suppose un travail de rapprochement entre la forme du nom rencontrée et la dénomination officielle enregistrée.

Cette distinction compte parce qu'une organisation parfaitement enregistrée peut rester non résolue dans un corpus si le texte source ne fournit pas assez d'éléments pour la distinguer d'une autre entité au nom proche, si l'abréviation utilisée est ambiguë, ou si le contexte ne permet pas de choisir entre plusieurs filiales d'un même groupe. Le taux de résolution est donc une propriété du couple formé par le corpus et la méthode de rapprochement, pas seulement une propriété du registre consulté.

Trois états plutôt qu'une distinction binaire

Une mesure binaire, résolu ou non résolu, écrase des situations très différentes sous un même verdict. Le protocole retient trois états. Le premier, résolu certain, s'applique quand un identifiant unique correspond sans ambiguïté à la mention, sur la base d'éléments de contexte suffisants, une raison sociale complète, un lieu, un secteur cohérent avec l'identifiant candidat.

Le deuxième état, résolu probable, couvre les cas où un identifiant candidat existe et paraît le plus vraisemblable, sans que le contexte disponible permette d'écarter totalement une autre possibilité, par exemple un nom générique partagé par plusieurs filiales régionales d'un même groupe. Le troisième état, non résolu, s'applique quand aucun identifiant candidat ne peut être proposé avec un niveau de confiance suffisant, faute d'éléments de contexte exploitables.

Cette granularité à trois états permet de distinguer un corpus où la majorité des mentions non certaines sont malgré tout probables, ce qui autorise une exploitation prudente avec marge d'erreur assumée, d'un corpus où la majorité des mentions non certaines sont franchement non résolues, ce qui interdit toute statistique fiable par organisation sans un travail complémentaire de désambiguïsation.

Protocole de mesure par échantillon annoté

La mesure procède par tirage d'un échantillon représentatif de mentions d'entités extraites du corpus étudié, stratifié si possible par type de source, presse générale, presse spécialisée, publications institutionnelles, réseaux professionnels, dans la mesure où le taux de résolution varie sensiblement selon le type de source d'origine. Chaque mention de l'échantillon est examinée individuellement par un annotateur qui lui attribue l'un des trois états définis, avec l'identifiant candidat retenu le cas échéant.

L'annotation doit s'appuyer sur des critères déclarés à l'avance, portant sur la nature des éléments de contexte jugés suffisants pour classer une mention en résolu certain plutôt qu'en résolu probable, afin de limiter la variabilité entre annotateurs différents. Un second passage sur un sous-échantillon, réalisé par un second annotateur indépendant, permet de mesurer cette variabilité et de la publier comme indicateur de fiabilité du protocole lui-même.

Le résultat de la mesure s'exprime comme la répartition du corpus entre les trois états, plutôt que comme un taux unique de résolution qui masquerait la part respective des cas certains et probables. Cette répartition doit être accompagnée de la taille de l'échantillon annoté et de la période couverte, deux éléments qui conditionnent la marge d'erreur du résultat publié.

Conséquences sur toute statistique par organisation

Toute statistique agrégée par organisation, un volume de mentions, une évolution dans le temps, une fréquence de cooccurrence avec un autre acteur, hérite directement du taux de résolution du corpus qui la fonde. Un chiffre présenté comme le nombre de mentions d'une organisation donnée ne compte en réalité que les mentions résolues avec certitude vers son identifiant, et laisse de côté toutes les mentions en nom libre qui pourraient légitimement lui être rattachées mais ne l'ont pas été.

Un chiffre par organisation n'est jamais meilleur que le taux de résolution du corpus dont il est extrait, et ce taux reste rarement communiqué à côté du chiffre lui-même.

Cette dépendance devient critique lorsque le corpus sert à comparer plusieurs organisations entre elles, car un taux de résolution inégal selon les organisations, une grande entreprise cotée étant mieux couverte par les registres qu'une structure récente ou peu médiatisée, introduit un biais systématique qui favorise les organisations les mieux identifiées sans que ce biais provienne d'une différence réelle d'activité ou d'exposition médiatique.

Ce que ce baromètre ne mesure pas

Ce baromètre porte sur la couverture d'identification d'un corpus, c'est à dire sur la part des mentions qui peuvent être rattachées à un identifiant, et non sur le bruit produit par les collisions de noms entre organisations distinctes portant une dénomination proche ou identique. Ces deux phénomènes sont liés mais distincts : un nom peut être ambigu entre plusieurs identifiants candidats sans que sa résolution soit pour autant impossible, ce qui relève d'un travail de désambiguïsation traité séparément.

De même, ce protocole ne se prononce pas sur la qualité intrinsèque des registres d'identifiants consultés, leur fraîcheur ou leur exhaustivité géographique, qui constituent des limites en amont du travail de rapprochement plutôt qu'un objet de mesure du taux de résolution lui-même. Une organisation absente d'un registre restera nécessairement non résolue, quelle que soit la qualité de la méthode de rapprochement appliquée par ailleurs.

Limites et conditions de reproductibilité

Le taux de résolution mesuré dépend fortement du registre d'identifiants retenu comme référence et de sa couverture géographique et sectorielle : un corpus international mesuré contre un registre national sous-estimera mécaniquement le taux de résolution pour les organisations étrangères. Ce paramètre doit être explicité pour toute publication du résultat, et deux mesures ne peuvent être comparées que si elles s'appuient sur le même registre de référence.

La subjectivité résiduelle de la frontière entre résolu certain et résolu probable constitue une autre limite assumée du protocole. Elle est en partie contenue par le double passage d'annotation indépendant, mais ne disparaît jamais complètement : un dispositif qui reproduit cette mesure doit publier son taux d'accord entre annotateurs pour que le résultat final soit interprété avec la marge d'incertitude qui lui correspond, plutôt que comme un chiffre exact et définitif.

Un dispositif de veille comme NewsCore (www.newscore.fr) relie chaque signal remonté à son document source, ce qui fournit le contexte textuel nécessaire au travail de rapprochement vers un identifiant et facilite d'autant la tâche d'annotation décrite dans ce protocole. La décision finale de classement en résolu certain, résolu probable ou non résolu reste néanmoins un acte d'annotation qui engage la méthode et le jugement de l'organisation qui conduit la mesure.

Questions fréquentes

Pourquoi trois états plutôt qu'une simple distinction résolu ou non résolu ? Une distinction binaire masque les cas où un identifiant candidat existe mais reste incertain : les traiter comme non résolus sous-estime la couverture réelle du corpus, les traiter comme résolus surestime la certitude du rattachement.

Le taux de résolution est-il comparable d'un secteur à l'autre ? Non sans précaution : la densité et la qualité des registres d'identifiants varient selon les secteurs et les zones géographiques, ce qui fait varier le taux de résolution atteignable indépendamment de la qualité du travail de rapprochement effectué.

Ce baromètre s'applique-t-il aux personnes physiques mentionnées dans un corpus ? Le protocole décrit ici porte sur les entités organisationnelles rattachées à un identifiant légal ; la résolution de personnes physiques pose des questions de méthode et de protection des données distinctes, non traitées par ce baromètre.

Que faire d'un corpus dont le taux de résolution certaine est faible ? Le protocole ne prescrit pas de circuit correctif universel, mais recommande de publier toute statistique par organisation accompagnée du taux de résolution du corpus sous-jacent, pour que le lecteur apprécie la marge d'incertitude réelle du chiffre présenté.

Pour approfondir