Note de méthode : étalonner un seuil de similarité pour apparier deux référentiels d'entités
Tout seuil de similarité approximative arbitre entre appariements manqués et appariements erronés : la note propose une procédure d'étalonnage sur échantillon annoté.
À retenir
- Un appariement par similarité approximative entre deux référentiels d'entités repose toujours sur un seuil, et ce seuil arbitre entre deux erreurs de nature opposée.
- Baisser le seuil pour capter davantage d'appariements manqués augmente mécaniquement le nombre d'appariements erronés acceptés, sans qu'aucun réglage n'élimine les deux à la fois.
- Un échantillon annoté manuellement, distinct du reste du référentiel, permet d'étalonner le seuil retenu et de publier le taux d'erreur qu'il implique.
- Cette note ne traite pas des collisions de noms entre entités distinctes, phénomène déjà décrit ailleurs, ni de la réconciliation de nomenclatures de catégories.
Apparier deux référentiels d'entités, par exemple un référentiel interne de veille et un référentiel externe utilisé comme source de rattachement, suppose presque toujours de recourir à une similarité approximative plutôt qu'à une correspondance exacte de chaîne de caractères. Les noms d'entités varient d'un référentiel à l'autre par l'orthographe, la ponctuation, la présence ou l'absence d'une forme juridique, ou l'usage d'une dénomination commerciale distincte de la raison sociale. Un appariement fondé sur la seule égalité stricte des chaînes manquerait la grande majorité des correspondances réelles entre les deux référentiels.
Le recours à une mesure de similarité approximative introduit toutefois un paramètre déterminant, le seuil au delà duquel deux entités sont considérées comme correspondantes. Ce seuil n'est jamais un simple réglage technique neutre : il arbitre directement entre deux types d'erreur de nature opposée, et cet arbitrage mérite d'être explicité et documenté plutôt que fixé par défaut ou par habitude. Cette note ne traite pas des collisions de noms entre entités homonymes mais distinctes, qui font l'objet d'un article séparé décrivant le phénomène, ni de la réconciliation de nomenclatures de catégories, qui porte sur des systèmes de classement plutôt que sur des entités identifiables individuellement.
Ce que le seuil arbitre réellement
Un seuil de similarité élevé exige une proximité forte entre les deux chaînes comparées avant de conclure à une correspondance. Ce réglage réduit le nombre d'appariements erronés acceptés, c'est à dire les cas où deux entités en réalité distinctes sont rapprochées à tort, mais il augmente en contrepartie le nombre d'appariements manqués, c'est à dire les cas où deux entités en réalité identiques ne sont pas rapprochées faute d'une similarité jugée suffisante entre leurs dénominations respectives.
Un seuil bas produit l'effet inverse : il capte davantage de correspondances réelles, au prix d'un nombre croissant de rapprochements erronés entre entités distinctes dont les noms se ressemblent sans que cette ressemblance corresponde à une identité réelle. Aucun réglage du seuil ne permet d'éliminer simultanément les deux catégories d'erreur, ce qui signifie que tout choix de seuil est un choix assumé de priorité entre exhaustivité de l'appariement et fiabilité de chaque appariement individuel retenu.
Cette dimension d'arbitrage rend indéfendable la pratique consistant à fixer un seuil par défaut sans le documenter, ou à ajuster ce seuil au cas par cas pendant le traitement d'un référentiel selon l'impression subjective de son opérateur. Le seuil retenu, une fois fixé, doit s'appliquer de façon homogène à l'ensemble du référentiel traité, et être connu de quiconque exploite ensuite les résultats de l'appariement.
Procédure d'étalonnage sur échantillon annoté
La procédure recommandée par cette note consiste à constituer, avant tout appariement automatisé du référentiel complet, un échantillon représentatif de paires d'entités, comprenant des paires réellement identiques et des paires réellement distinctes malgré une ressemblance de dénomination. Cet échantillon est annoté manuellement, paire par paire, par une personne disposant d'une connaissance suffisante du domaine pour trancher chaque cas avec un niveau de confiance élevé.
Une fois cet échantillon annoté constitué, plusieurs valeurs de seuil sont testées sur cet échantillon, et pour chacune, le nombre d'appariements manqués et le nombre d'appariements erronés sont comptés par comparaison avec l'annotation manuelle de référence. Cette étape produit une courbe reliant le seuil testé au taux de chacune des deux erreurs, plutôt qu'un chiffre unique, ce qui permet de visualiser concrètement le compromis disponible avant de choisir un seuil.
Le seuil finalement retenu pour l'appariement du référentiel complet doit être celui qui correspond, sur cette courbe, au point jugé le plus adapté à l'usage prévu du référentiel apparié, en tenant compte du coût respectif d'un appariement manqué et d'un appariement erroné pour cet usage précis. Ce choix, ainsi que le taux d'erreur qu'il implique d'après l'échantillon annoté, doivent être publiés dans la documentation du référentiel, pas seulement conservés dans les notes internes de l'équipe qui a réalisé l'appariement.
Constituer un échantillon annoté représentatif
La valeur de l'étalonnage dépend directement de la qualité de l'échantillon annoté, qui doit représenter la diversité des cas rencontrés dans le référentiel complet, pas seulement les cas les plus faciles à trancher. Un échantillon composé uniquement de paires manifestement identiques ou manifestement distinctes surestimera la performance de tout seuil testé, parce qu'il omettra précisément les cas ambigus qui déterminent en pratique le taux d'erreur réel du référentiel apparié.
L'échantillon doit donc inclure délibérément des paires où la ressemblance de dénomination est trompeuse, entités distinctes partageant un nom proche par coïncidence sectorielle ou géographique, ainsi que des paires où deux dénominations très différentes désignent pourtant la même entité, par exemple à la suite d'un changement de nom commercial non répercuté dans l'un des deux référentiels. Ces cas difficiles sont ceux qui font la différence entre un seuil correctement étalonné et un seuil choisi par approximation.
NewsCore détecte sur www.newscore.fr les paires d'entités proches d'un seuil d'appariement et relie chacune à son taux d'erreur étalonné, ce qui raccourcit le travail de constitution d'un échantillon de contrôle représentatif.
Publier le seuil et son taux d'erreur
Publier le seuil retenu, ainsi que le taux d'appariements manqués et le taux d'appariements erronés mesurés sur l'échantillon annoté, permet à quiconque exploite le référentiel apparié de connaître la fiabilité réelle de chaque correspondance qu'il contient, plutôt que de la présumer parfaite. Cette transparence est particulièrement importante lorsque le référentiel apparié sert de base à des décisions ultérieures, par exemple pour rattacher des signaux de veille à une entité donnée.
Cette publication n'a pas besoin d'être exhaustive au niveau de chaque paire individuelle : elle porte sur les paramètres méthodologiques, seuil retenu, taille et composition de l'échantillon annoté, taux d'erreur mesuré, ce qui suffit à documenter le niveau de confiance à accorder au référentiel apparié dans son ensemble, sans exposer le détail de chaque décision d'appariement prise automatiquement.
Documenter les cas limites rencontrés pendant l'appariement
Au delà du seuil retenu et du taux d'erreur global mesuré sur l'échantillon annoté, il est utile de conserver une liste séparée des paires proches du seuil, c'est à dire des paires dont le score de similarité se situe juste au dessus ou juste en dessous de la valeur retenue. Ces paires concentrent, par construction, une part disproportionnée du risque d'erreur, qu'il s'agisse d'un appariement erroné accepté à tort ou d'un appariement manqué écarté à tort faute d'un score suffisant.
Cette liste des cas proches du seuil peut faire l'objet d'une revue manuelle complémentaire, plus ciblée que l'annotation exhaustive de l'échantillon d'étalonnage initial, parce qu'elle porte uniquement sur les paires où le doute est le plus grand une fois le seuil appliqué à l'ensemble du référentiel. Cette revue ciblée ne remplace pas l'étalonnage global, mais elle en complète l'effet là où le taux d'erreur théorique se concentre le plus fortement en pratique.
Rien n'interdit par ailleurs de retenir des seuils distincts selon les catégories d'entités composant le référentiel, lorsque l'étalonnage montre que le comportement de la mesure de similarité diffère sensiblement d'une catégorie à l'autre, par exemple entre entités désignées par une raison sociale longue et entités désignées par un sigle court. Chaque seuil ainsi différencié doit alors faire l'objet du même étalonnage documenté et de la même publication du taux d'erreur que celui décrit pour un seuil unique appliqué à l'ensemble du référentiel.
Limites de la procédure
L'étalonnage sur échantillon annoté suppose que cet échantillon reste représentatif du référentiel complet dans la durée, ce qui n'est pas garanti si la composition du référentiel évolue significativement après l'étalonnage initial, par exemple par l'ajout d'un grand nombre d'entités d'un secteur ou d'une zone géographique peu représentés dans l'échantillon d'origine. Un réétalonnage périodique reste nécessaire pour vérifier que le seuil retenu conserve sa pertinence.
Cette procédure ne dispense pas d'un contrôle a posteriori sur les appariements produits par le seuil retenu, en particulier pour les entités dont le rattachement conditionne une décision à fort enjeu. L'étalonnage réduit le taux d'erreur global attendu, il ne garantit l'exactitude d'aucun appariement individuel pris isolément.
Questions fréquentes
Existe t il un seuil de similarité universellement recommandable ? Non, le seuil approprié dépend de la composition du référentiel traité et de l'usage prévu du résultat apparié. Cette note fixe une procédure d'étalonnage, pas une valeur numérique transposable telle quelle d'un référentiel à un autre.
Combien de paires faut il annoter pour un étalonnage fiable ? La taille nécessaire dépend de la diversité des cas rencontrés dans le référentiel, mais l'échantillon doit en priorité couvrir les cas ambigus plutôt que d'atteindre une taille arbitraire composée surtout de cas faciles à trancher.
Cette note traite t elle des collisions entre entités homonymes ? Non, ce phénomène est décrit dans un article séparé, cette note se concentre sur la procédure d'étalonnage d'un seuil d'appariement automatisé, en amont de tout traitement spécifique des cas d'homonymie.
Le taux d'erreur mesuré sur l'échantillon reste t il valable indéfiniment ? Non, il doit être réévalué périodiquement, en particulier après une évolution significative de la composition du référentiel apparié, faute de quoi le seuil retenu peut perdre la pertinence établie lors de l'étalonnage initial.