mercredi 7 octobre 2026
Analyses

Réconcilier deux référentiels de catégories sans tout reclasser

Deux référentiels de catégories qui ne se recouvrent pas peuvent se comparer sans reclasser l'historique : la méthode d'une table de correspondance assumée.

L'Observatoire14 août 20266 min de lecture

À retenir

  • Une table de correspondance qui associe chaque catégorie à un degré de recouvrement vaut mieux qu'un reclassement rétroactif qui masque les écarts.
  • Le recoupement doit se construire catégorie par catégorie, sur les définitions réelles, pas sur la seule ressemblance des libellés.
  • Une catégorie sans équivalent doit rester marquée non mappable plutôt que rattachée par défaut à la catégorie la plus proche disponible.
  • La table de correspondance se révise à chaque évolution de l'un des deux référentiels, faute de quoi elle se désynchronise progressivement.

Le problème : deux référentiels, un seul historique

Un organisme de veille qui change de référentiel de catégories, ou qui doit comparer des données issues de deux référentiels distincts, hérite d'un problème que la seule bonne volonté ne résout pas : les catégories des deux systèmes ne se recouvrent presque jamais terme à terme. Une catégorie du premier référentiel peut correspondre à une partie seulement d'une catégorie du second, en recouper deux ou trois d'un coup, ou n'avoir aucun équivalent direct dans l'autre système.

Ce désalignement n'est pas un défaut de conception isolé : il reflète le fait que chaque référentiel a été construit à un moment donné, pour un usage donné, avec des priorités de découpage propres à son contexte d'origine. Deux référentiels sérieux, construits indépendamment, ont statistiquement peu de chances de partager exactement les mêmes frontières entre catégories, même lorsqu'ils portent sur le même champ d'observation.

Le besoin de comparaison, lui, ne disparaît pas pour autant : une organisation qui a changé de référentiel en cours de route veut souvent continuer à suivre une évolution sur longue période, ou comparer un chiffre présent à un chiffre passé produit sous l'ancien système. C'est cette tension, entre des référentiels qui ne se recouvrent pas et un besoin de comparaison qui persiste, que doit résoudre une procédure de rapprochement.

Pourquoi la fusion silencieuse est pire qu'une correspondance imparfaite

Face à ce désalignement, la solution la plus rapide consiste à reclasser rétroactivement tout l'historique dans le nouveau référentiel, comme si les deux systèmes avaient toujours été un seul. Cette solution a un coût caché : elle efface la trace du fait que le classement d'origine reposait sur des critères différents, et donne à l'historique reclassé une apparence d'homogénéité qu'il n'a pas réellement.

Une fusion silencieuse de ce type produit des séries qui semblent continues alors qu'elles ne le sont pas : une rupture de méthode, invisible dans les chiffres, se loge dans la période de bascule sans que personne ne puisse plus la localiser ni la quantifier a posteriori. Quiconque réutilise cette série plus tard hérite d'une continuité apparente qui masque une hétérogénéité réelle.

Une correspondance imparfaite, mais documentée comme telle, vaut mieux qu'une fusion qui prétend à l'exactitude. Elle permet à qui utilise la série de savoir où se situe l'incertitude, sur quelles catégories elle porte, et de décider lui-même s'il l'accepte pour son usage. C'est un principe général de traçabilité : une limite connue et énoncée coûte moins cher, sur la durée, qu'une exactitude supposée qui ne résiste pas à l'examen.

Construire une table de correspondance qui assume ses limites

La procédure de rapprochement passe par une table de correspondance qui associe explicitement chaque catégorie du premier référentiel à une ou plusieurs catégories du second, avec un indicateur de la nature du lien : équivalence complète, inclusion partielle dans un sens ou dans l'autre, ou chevauchement partiel qui ne se réduit à aucune des deux relations précédentes.

Cette table doit être construite catégorie par catégorie, par un examen direct des définitions et, quand elles existent, des règles de classement de chaque référentiel, plutôt que par une simple ressemblance de libellé. Deux catégories peuvent porter des noms proches et désigner des périmètres différents, tout comme deux catégories aux noms éloignés peuvent recouvrir le même périmètre réel.

Le résultat de cet examen n'est pas une correspondance unique et propre, mais une table qui porte, pour chaque paire, un degré de confiance et une description du recouvrement partiel quand il existe. Cette granularité est ce qui distingue une table de correspondance utilisable d'une simple liste de renvois qui rejoue, sous une autre forme, la fusion silencieuse qu'elle prétend éviter.

Les catégories sans équivalent : la règle des cas non mappables

Une partie des catégories de chaque référentiel n'a, par construction, aucun équivalent raisonnable dans l'autre système : elles couvrent un périmètre propre à leur référentiel d'origine, sans qu'aucune combinaison de catégories de l'autre côté ne s'en approche. Vouloir à tout prix leur trouver une correspondance revient à forcer un rapprochement qui n'existe pas dans les données.

La règle à fixer pour ces cas est simple à énoncer mais exigeante à tenir : une catégorie sans équivalent reste marquée comme non mappable, plutôt que rattachée par défaut à la catégorie la plus proche disponible. Ce marquage explicite préserve l'information la plus importante, celle de l'absence de correspondance, là où un rattachement approximatif la ferait disparaître.

Une catégorie non mappable n'est pas une anomalie à corriger : c'est une information en soi, qui dit que les deux référentiels découpent le champ observé selon des logiques qui, sur ce point précis, ne se recoupent pas. Toute comparaison qui s'appuie ensuite sur la table doit traiter ces cas séparément, sans les agréger de force dans un total qui perdrait leur spécificité.

Faire vivre la table de correspondance dans la durée

Une table de correspondance n'est pas un livrable ponctuel : elle doit être révisée chaque fois que l'un des deux référentiels évolue, faute de quoi elle se désynchronise progressivement des catégories qu'elle est censée relier. Une catégorie ajoutée, retirée ou redéfinie d'un côté doit déclencher une relecture, au moins locale, de la table.

Cette maintenance gagne à être confiée à une même équipe dans la durée, plutôt que reconstruite à chaque besoin ponctuel de comparaison par une personne différente, qui referait le travail d'examen sans hériter des arbitrages déjà rendus sur les cas ambigus. La table elle-même, avec ses degrés de confiance et ses cas non mappables, constitue la mémoire de ces arbitrages.

NewsCore relie les catégories de sources hétérogènes à un référentiel commun sur www.newscore.fr et affiche le degré de recouvrement retenu plutôt que de le masquer, ce qui raccourcit le travail de vérification manuelle pour qui doit comparer deux historiques construits sur des référentiels distincts.

Publier la méthode de construction de la table, au moins en interne, permet à qui l'utilise pour une comparaison de savoir sur quelle base elle a été établie, et de juger si le niveau de rapprochement atteint suffit pour l'usage envisagé. C'est cette transparence de méthode, plus que l'exactitude improbable d'une correspondance parfaite, qui rend une comparaison entre deux référentiels défendable.

Questions fréquentes

Faut-il reclasser l'historique dans le nouveau référentiel au moment du changement ? Non : reclasser rétroactivement tout l'historique donne une apparence de continuité que les données n'ont pas réellement, puisque le classement d'origine reposait sur des critères différents. Mieux vaut conserver l'historique tel qu'il a été produit et s'appuyer sur une table de correspondance documentée pour toute comparaison ultérieure.

Comment traiter une catégorie qui n'a pas d'équivalent dans l'autre référentiel ? Elle doit être marquée comme non mappable plutôt que rattachée par défaut à la catégorie la plus proche disponible : ce marquage préserve l'information selon laquelle les deux référentiels ne se recoupent pas sur ce point, information qui disparaîtrait avec un rattachement approximatif.

Une table de correspondance construite une fois pour toutes suffit-elle ? Non : elle doit être révisée à chaque évolution de l'un des deux référentiels, sous peine de se désynchroniser progressivement des catégories réelles qu'elle relie. Une même équipe gagne à en assurer la maintenance dans la durée pour ne pas reperdre les arbitrages déjà rendus.

Un recouvrement partiel documenté est-il moins fiable qu'une correspondance exacte ? Il est différent, pas moins fiable : une correspondance exacte annoncée là où le recouvrement est en réalité partiel masque une incertitude réelle, alors qu'un recouvrement partiel documenté donne à qui l'utilise les moyens de juger lui-même si le niveau de rapprochement atteint convient à son usage.

Repris dans le réseau

Pour approfondir