Comparer collecte booléenne et sémantique : le protocole d'égalisation du budget de lecture
Comparer une collecte booléenne et une collecte sémantique sans biais de volume : le protocole d'égalisation du budget de lecture et du corpus de référence.
À retenir
- Sans budget de lecture égal entre les deux méthodes, la comparaison mesure le volume retourné, pas la pertinence.
- Un corpus de référence construit indépendamment des deux moteurs sert de vérité de terrain pour calculer rappel et pertinence.
- Le mélange aléatoire et le masquage de l'origine des documents neutralisent l'effet d'ordre et l'effet d'annotateur.
- Le résultat obtenu n'est valide que pour le thème, la période et le corpus testés, pas de façon générale.
Pourquoi la comparaison brute trompe
Opposer une collecte par requêtes booléennes à une collecte par similarité sémantique paraît simple : on lance les deux moteurs sur le même thème, on regarde ce qui remonte, et on juge sur pièces. Cette manière de faire mesure en réalité autre chose que la pertinence des deux approches. Elle mesure le volume de documents que chaque méthode retourne et le temps que l'analyste passe à les lire, deux variables qui n'ont rien à voir avec la qualité de la sélection.
Un moteur booléen bien paramétré peut renvoyer cent résultats extrêmement resserrés, tandis qu'un moteur sémantique renvoie mille candidats à trier. Si l'analyste lit l'intégralité des deux lots, il donne mécaniquement plus de temps de lecture au second, donc plus de chances d'y trouver des pépites, sans que cela dise quoi que ce soit sur la précision intrinsèque de la méthode. À l'inverse, si l'analyste s'arrête après un temps fixe, il lira l'exhaustivité du lot booléen et une fraction seulement du lot sémantique classé par score, ce qui favorise cette fois le classement du second sans rien démontrer sur le premier. Dans les deux cas, le résultat de la comparaison est déterminé avant même que les documents ne soient lus.
Cette note fixe un protocole d'égalisation qui neutralise ces biais de volume et de lecture. Elle ne tranche pas la question de la supériorité générale d'une approche sur l'autre, question qui dépend du domaine, du corpus disponible et du besoin métier. Elle donne la procédure qui permet de produire, sur un cas donné, un résultat comparable et reproductible.
Le principe d'égalisation du budget de lecture
L'égalisation part d'un constat simple : la seule ressource strictement comparable entre les deux méthodes est le temps de lecture de l'analyste, pas le nombre de résultats retournés par le moteur. Le protocole fixe donc un budget de lecture identique pour les deux conditions, exprimé en nombre de documents lus et non en nombre de documents retournés.
Concrètement, si le budget est fixé à cinquante documents, chaque méthode doit produire exactement cinquante documents soumis à lecture, quel que soit le volume brut qu'elle a généré en amont. Pour la collecte booléenne, cela signifie parfois élargir la requête pour atteindre le seuil, ou au contraire tronquer un flux surabondant. Pour la collecte sémantique, cela signifie prendre les cinquante premiers candidats du classement, ni plus ni moins. Le budget doit être identique en nombre absolu, jamais en proportion du volume total, sans quoi on réintroduit par la bande le biais que l'on cherche à éliminer.
Ce budget se fixe avant de lancer la moindre collecte, sur la base de ce que l'équipe peut réellement lire dans le temps imparti à l'exercice réel de veille. Un budget trop généreux transforme l'exercice en étude de laboratoire déconnectée des conditions de travail ; un budget trop serré ne laisse remonter que les cas évidents et masque les différences fines entre les deux méthodes.
Construire le corpus de référence
Le protocole exige un corpus de référence constitué en amont et indépendamment des deux méthodes testées. Ce corpus rassemble l'ensemble des documents pertinents connus sur la période et le thème considérés, établi par une recherche exhaustive distincte des deux moteurs mis en concurrence, par exemple par dépouillement manuel d'un ensemble de sources fixées à l'avance.
Ce corpus de référence sert de vérité de terrain : c'est par rapport à lui que l'on calcule ce que chaque méthode a effectivement retrouvé parmi les documents pertinents existants, et ce qu'elle a laissé de côté. Sans ce corpus indépendant, on ne peut comparer que ce que les deux méthodes ont trouvé entre elles, ce qui ne renseigne pas sur ce qu'elles ont manqué en commun.
La construction du corpus de référence doit elle-même suivre une méthode déclarée et documentée, avec la liste des sources consultées, la période couverte et les critères d'inclusion retenus. Un corpus de référence construit à la légère invalide toute la suite du protocole, quelle que soit la rigueur apportée à l'égalisation du budget de lecture.
Neutraliser l'effet d'ordre et l'effet d'annotateur
Deux biais supplémentaires doivent être neutralisés pour que la comparaison tienne. Le premier est l'effet d'ordre : un document jugé en fin de lecture, après une série de documents non pertinents, tend à être noté plus sévèrement qu'un document identique jugé en début de session, par simple fatigue attentionnelle de l'annotateur. Le protocole impose donc de mélanger aléatoirement les documents des deux conditions dans un flux de lecture unique, sans que l'annotateur sache de quelle méthode provient chaque document.
Ce masquage de l'origine est la condition la plus souvent négligée et pourtant la plus déterminante. Un annotateur qui sait qu'il lit la sortie du moteur sémantique projette sur elle des attentes différentes de celles qu'il projette sur une sortie booléenne, ce qui contamine son jugement indépendamment du contenu réel du document. Le mélange et le masquage doivent être organisés par une tierce personne qui gère la correspondance entre document et méthode d'origine, sans intervenir dans l'annotation.
Le second biais est l'effet d'annotateur : deux personnes différentes n'appliquent pas les mêmes seuils de pertinence. Le protocole demande donc que le même jeu d'annotateurs traite l'intégralité des documents des deux conditions, jamais un annotateur dédié à chaque méthode, et qu'un même barème de pertinence, écrit avant la lecture, encadre leur jugement.
Les indicateurs à consigner
Une fois le budget égalisé, le corpus de référence fixé et la lecture masquée, trois indicateurs suffisent à documenter le résultat de manière comparable.
Le premier est le taux de rappel dans le budget : la proportion de documents du corpus de référence effectivement présents parmi les documents lus, pour un budget de lecture identique. Le deuxième est le taux de pertinence dans le budget : la proportion de documents lus jugés pertinents par les annotateurs, à barème constant. Le troisième est le recouvrement entre méthodes : la proportion de documents pertinents trouvés par les deux approches à la fois, qui indique si les deux méthodes se recoupent ou si elles explorent des zones distinctes du corpus.
Ces trois chiffres doivent être publiés ensemble, jamais isolément, car un taux de pertinence élevé obtenu au prix d'un rappel faible ne dit pas la même chose qu'un taux de pertinence élevé assorti d'un rappel large. La note recommande de consigner ces indicateurs dans un tableau qui associe, pour chaque méthode, le budget de lecture appliqué, le nombre de documents pertinents du corpus de référence retrouvés, et le nombre de documents jugés pertinents par les annotateurs. NewsCore (www.newscore.fr) archive l'horodatage et la provenance de chaque document collecté, ce qui facilite la reconstitution de ce tableau après coup, indépendamment de la méthode de collecte choisie.
Limites et conditions de validité
Le protocole d'égalisation ne produit un résultat exploitable qu'à certaines conditions. Il suppose d'abord que le corpus de référence soit stable sur la période testée : un thème dont l'actualité évolue vite pendant la fenêtre de test rend la comparaison caduque avant même qu'elle soit terminée. Il suppose ensuite que le budget de lecture choisi corresponde à un usage réel, faute de quoi la mesure ne renseigne que sur un régime de lecture qui ne sera jamais celui de la pratique quotidienne.
Le résultat obtenu n'est valide que pour le thème, la période et le corpus testés. Il ne se généralise pas mécaniquement à un autre domaine de veille, où la densité documentaire, la structure du vocabulaire ou la disponibilité des sources changent la donne. Une organisation qui souhaite trancher pour son propre usage doit reproduire le protocole sur son propre périmètre plutôt que de s'appuyer sur un résultat obtenu ailleurs.
Enfin, le protocole mesure une performance de collecte à un instant donné, pas une propriété permanente d'une méthode. Les deux approches évoluent, et un résultat établi sur une configuration ancienne n'engage pas les versions ultérieures. La reproductibilité du test, avec un corpus de référence documenté et des critères explicites, importe davantage que la conservation d'un verdict figé.
Questions fréquentes
Faut-il toujours utiliser exactement le même budget de lecture pour les deux méthodes ? Oui, c'est la condition centrale du protocole. Tout écart de budget entre les deux conditions réintroduit un biais de volume qui rend la comparaison ininterprétable, quelle que soit par ailleurs la rigueur des autres étapes.
Peut-on comparer plus de deux méthodes de collecte à la fois ? Le protocole s'étend à plusieurs méthodes tant que le budget de lecture reste identique pour chacune et que le mélange aléatoire des documents couvre l'ensemble des conditions testées dans un flux de lecture unique et masqué.
Combien de documents faut-il inclure dans le corpus de référence pour que le test soit fiable ? Il n'existe pas de seuil universel ; le corpus doit être suffisamment large pour contenir une diversité représentative de cas pertinents et non pertinents, et sa taille doit être rapportée aux côtés des indicateurs pour que le lecteur juge de la robustesse du résultat.
Le protocole s'applique-t-il à une veille menée par une seule personne, sans équipe d'annotateurs ? Il reste applicable, à condition que la même personne applique un barème écrit à l'avance et respecte le masquage de l'origine des documents, par exemple via un tiers qui prépare le mélange ; l'effet d'annotateur disparaît alors mais l'effet d'ordre doit toujours être neutralisé.