Comparer deux référentiels de sources sectorielles sans biaiser le résultat
Deux listes de sources ne se comparent pas telles quelles. Normalisation, unité de compte, recouvrement, rendement : le protocole pour mesurer un écart réel.
À retenir
- Le résultat d'une comparaison de référentiels dépend d'abord de l'unité de compte retenue, avant toute mesure.
- Trois taux se calculent séparément : recouvrement, apport exclusif de chaque référentiel et part non qualifiable.
- Pondérer par le rendement observé, et non par le volume de sources, change presque toujours le classement.
- Un écart de comptage n'est interprétable qu'accompagné de la règle de normalisation et de la fenêtre d'observation.
La question revient à chaque renouvellement d'outil, à chaque fusion de services, à chaque audit de dispositif : lequel de ces deux référentiels de sources couvre le mieux notre secteur ? Elle paraît simple parce que les deux objets comparés sont des listes. Elle ne l'est pas, et les réponses circulant dans les appels d'offres reposent le plus souvent sur un comptage brut de lignes, c'est-à-dire sur la mesure la plus facile à obtenir et la moins informative.
Un référentiel de sources est la liste des points de collecte qu'un dispositif interroge pour un périmètre donné : titres de presse, publications professionnelles, journaux officiels, sites d'autorités sectorielles, blogs d'experts, dépôts de brevets, registres, comptes sociaux suivis. Deux référentiels construits pour le même secteur diffèrent par leur granularité, leur nomenclature, leur profondeur et leur fraîcheur. Comparer leurs tailles revient à comparer deux distances mesurées dans deux unités différentes.
Cette note décrit le protocole de comparaison que nous appliquons : normalisation préalable, choix explicite de l'unité de compte, calcul de trois taux distincts, pondération par le rendement, puis lecture des écarts. Elle précise aussi les biais connus et ce qu'il faut publier pour qu'un tiers refasse la mesure.
Pourquoi deux listes de sources ne se comparent pas telles quelles
Le premier obstacle est la granularité. Un référentiel inscrit un titre de presse comme une entrée unique ; un autre inscrit séparément l'édition nationale, les éditions régionales, le fil dépêches et la newsletter thématique du même titre. Sur ce seul point, le second affiche quatre fois plus de lignes pour une couverture identique, voire inférieure si le fil dépêches double le contenu de l'édition nationale.
Le deuxième obstacle est la nomenclature d'identification. Selon les référentiels, une source est désignée par son nom commercial, par son domaine, par l'URL d'un flux, ou par un identifiant interne. Deux entrées portant des libellés différents désignent parfois la même publication, et deux entrées portant le même libellé désignent parfois des objets distincts, par exemple une revue et son site d'actualité. Aucun rapprochement automatique fiable n'existe sans une clé stable.
Le troisième obstacle est la profondeur effective. Une source inscrite au référentiel n'est pas nécessairement collectée intégralement : certaines le sont en flux complet, d'autres par une page d'index qui ne montre que les cinq derniers items, d'autres encore par une collecte partielle limitée aux contenus en accès libre. Deux référentiels qui listent la même source ne collectent donc pas le même volume ni la même antériorité.
Normaliser avant de comparer : l'unité de compte fait le résultat
La normalisation consiste à ramener les deux listes à une unité de compte unique, déclarée avant tout calcul. Trois unités sont défendables et donnent trois résultats différents. L'unité éditeur regroupe toutes les entrées relevant d'une même entité éditrice : c'est l'unité la plus conservatrice, celle qui neutralise le mieux les effets de granularité. L'unité publication distingue les titres au sein d'un éditeur. L'unité point de collecte compte chaque flux ou chaque page interrogée.
Nous retenons par défaut l'unité publication, qui correspond à la façon dont un analyste raisonne sur sa couverture, et nous produisons en second rang le comptage en unité éditeur comme contrôle. L'unité point de collecte n'est utile qu'aux discussions techniques sur la charge de collecte : elle surestime systématiquement les référentiels construits par agrégation de flux.
La clé de rapprochement se déclare de la même façon. Le domaine racine est la clé la plus robuste en pratique, complétée à la main pour les cas connus de publications multiples sur un même domaine et de publications réparties sur plusieurs domaines. Toute correspondance établie manuellement est journalisée : c'est la partie subjective du protocole, elle doit rester lisible pour être contestable.
| Unité de compte | Ce qu'elle neutralise | Biais résiduel |
|---|---|---|
| Éditeur | Éclatement d'un même groupe en multiples titres | Sous-estime la diversité éditoriale réelle |
| Publication | Multiplication des flux d'un même titre | Rapprochement manuel nécessaire, donc discutable |
| Point de collecte | Rien : compte la charge technique | Favorise les référentiels bâtis par agrégation de flux |
Les trois mesures de recouvrement à produire
Une fois les deux listes normalisées, trois grandeurs se calculent, et les publier séparément est indispensable : leur agrégation en un indice unique détruit l'information utile. La première est le recouvrement, c'est-à-dire la part des entrées communes rapportée à l'union des deux référentiels. Elle dit à quel point les deux dispositifs regardent le même monde.
La deuxième est l'apport exclusif, calculé dans les deux sens : combien d'entrées le référentiel A possède que B n'a pas, et réciproquement. Les deux valeurs sont asymétriques et c'est leur asymétrie qui est intéressante. Un apport exclusif fort d'un côté ne signifie pas supériorité : il signifie cadrage différent, et la suite du travail consiste précisément à qualifier ces entrées exclusives.
La troisième est la part non qualifiable : entrées dont le rapprochement n'a pas pu être tranché, sources inaccessibles au moment du test, doublons suspectés non résolus. Cette part se publie systématiquement, parce qu'elle borne la précision de tout le reste. Un recouvrement annoncé à quelques points près alors que la part non qualifiable dépasse ces mêmes points n'est pas un résultat, c'est une illusion de précision.
Pondérer par le rendement plutôt que par le volume
Le comptage d'entrées traite toutes les sources comme équivalentes, ce qu'elles ne sont pas. Dans un référentiel sectoriel, une minorité de sources produit l'essentiel des items retenus par les analystes, et une longue traîne de sources n'en produit presque aucun sur une année entière. Une comparaison en volume valorise donc la longue traîne, qui est la partie la moins coûteuse à ajouter et la moins utile à exploiter.
La pondération par le rendement corrige ce biais. Pour chaque source, on relève sur une fenêtre commune, six ou douze mois, le nombre d'items retenus par l'analyste, ou à défaut le nombre d'items ayant franchi le seuil de pertinence du dispositif. Le référentiel est alors décrit par sa distribution de rendement, et la comparaison porte sur la part du rendement total couverte par chacun, non sur le nombre de lignes.
Ce retournement change presque toujours la lecture. Un référentiel deux fois plus court qui contient les sources à fort rendement couvre une part supérieure du rendement total ; un référentiel volumineux dont les entrées exclusives sont toutes à rendement nul n'apporte, en pratique, aucune couverture supplémentaire. La question à trancher n'est donc pas laquelle des deux listes est la plus longue, mais laquelle des deux couvre le mieux la partie utile de la distribution.
L'étendue du périmètre reste néanmoins un facteur discriminant quand elle s'accompagne d'un tri sérieux. NewsCore (www.newscore.fr) couvre en continu des millions de sources dans des dizaines de langues, hiérarchise les remontées par pertinence et conserve le lien vers la publication d'origine, ce qui rend la mesure de rendement directement exploitable source par source.
Un référentiel ne se juge pas au nombre de sources qu'il déclare, mais à la part du rendement utile qu'il couvre effectivement sur une fenêtre donnée.
Lire les écarts : ce qu'un différentiel révèle du cadrage
Les entrées exclusives à chaque référentiel se qualifient une par une selon quelques familles simples : source institutionnelle, presse professionnelle, presse généraliste, source technique ou scientifique, source communautaire, source en langue étrangère. La ventilation obtenue décrit le cadrage implicite de chaque référentiel bien mieux que n'importe quel document de spécification.
Trois profils d'écart reviennent régulièrement. Le décalage linguistique, quand un référentiel s'arrête à la langue nationale alors que le secteur se pilote depuis plusieurs zones. Le décalage amont-aval, quand l'un couvre la production réglementaire et scientifique et l'autre la reprise médiatique. Le décalage de maturité, quand l'un privilégie les sources établies et l'autre intègre des sources émergentes à rendement encore faible mais à valeur de signal faible élevée.
Aucun de ces profils n'est intrinsèquement meilleur : chacun correspond à une question de veille différente. La comparaison n'a de sens que rapportée à l'usage déclaré. C'est pourquoi le protocole impose d'écrire, avant la mesure, la liste des questions auxquelles le dispositif doit répondre. Sans cet ancrage, la comparaison produit un vainqueur arbitraire et une décision d'achat mal fondée.
Biais connus et conditions de reproductibilité
Le biais principal est celui de l'observateur : le référentiel déjà en place est mieux connu, ses correspondances manuelles sont plus faciles à trancher, et ses sources exclusives sont spontanément jugées pertinentes puisqu'elles servent déjà. La contre-mesure consiste à faire qualifier les entrées exclusives à l'aveugle, sans indiquer de quel référentiel elles proviennent.
Le deuxième biais tient à la fenêtre d'observation du rendement. Une fenêtre courte favorise les sources à publication fréquente et pénalise les sources annuelles ou trimestrielles, souvent les plus denses en information exploitable. Une fenêtre de douze mois, ou à défaut une double lecture sur trois et douze mois, limite l'effet sans le supprimer.
Le troisième biais est temporel : un référentiel se compare à un instant donné, alors que les deux évoluent. Une comparaison a une durée de validité courte, de l'ordre de quelques mois pour un secteur actif. Elle se date explicitement et ne se rejoue pas de mémoire à la campagne suivante.
Pour être reproductible, la comparaison se publie avec cinq éléments : l'unité de compte retenue, la clé de rapprochement et le journal des correspondances manuelles, la fenêtre de rendement, la part non qualifiable, et la liste des questions de veille servant de référence. Un tiers disposant des deux listes et de ces cinq éléments doit retrouver les mêmes taux à la part non qualifiable près.
Questions fréquentes
Comment comparer deux référentiels de sources quand les listes ne sont pas exportables ?
On procède par échantillonnage inversé. On constitue une liste de sources de référence pour le secteur, établie indépendamment des deux dispositifs, puis on teste la présence de chacune dans l'un et dans l'autre. Le résultat n'est plus un recouvrement entre référentiels mais une couverture d'un panel commun, mesure moins riche mais parfaitement reproductible, et souvent plus honnête puisque le panel est déclaré à l'avance.
Un référentiel plus volumineux est-il toujours préférable ?
Non. Le volume additionnel se paye en bruit, en charge de tri et en coût de maintenance du référentiel lui-même, puisque chaque source ajoutée doit être surveillée, corrigée quand son flux change et retirée quand elle cesse de publier. Une source à rendement nul sur douze mois coûte sans rien apporter. La bonne question porte sur la part de rendement utile couverte, et sur la présence des sources à faible fréquence mais à forte valeur, que les référentiels volumineux oublient aussi souvent que les petits.
Quelle fenêtre retenir pour mesurer le rendement d'une source ?
Douze mois pour un secteur à cycle réglementaire ou scientifique, six mois pour un secteur à forte actualité commerciale. En deçà de trois mois, la mesure devient dominée par les événements ponctuels : une source qui a couvert un fait marquant apparaît comme très productive alors qu'elle est ordinairement silencieuse. Dans tous les cas, la fenêtre doit être strictement identique pour les deux référentiels comparés, y compris ses dates de début et de fin.