Dataset : longueur des requêtes de collecte et part de bruit dans les résultats retournés
Un tableau reliant nombre de termes, opérateurs et exclusions au rendement observé sur des requêtes réelles montre où une requête devient invérifiable sans gagner en précision.
À retenir
- Le rendement d'une requête de collecte ne progresse pas indéfiniment avec sa longueur : il existe une zone où la complexité ajoutée cesse d'améliorer la précision.
- Les opérateurs et les exclusions réduisent le bruit jusqu'à un certain point, au-delà duquel ils rendent surtout la requête plus difficile à vérifier.
- Le dataset relie nombre de termes, présence d'opérateurs et d'exclusions au volume de résultats et à leur part de bruit, sur un échantillon de requêtes réelles.
- Une requête trop longue ou trop chargée en exclusions perd en lisibilité pour qui doit en auditer le résultat, ce qui constitue un coût propre, distinct de la précision obtenue.
La conception d'une requête de collecte pour un dispositif de veille repose sur des choix concrets : combien de termes retenir, faut-il ajouter des opérateurs de combinaison, faut-il exclure certains termes ou certaines sources. Ces choix sont rarement documentés de façon chiffrée, alors qu'ils déterminent directement le volume de résultats obtenus et la part de ce volume qui constitue du bruit plutôt qu'une matière exploitable. L'Observatoire publie ici un dataset qui relie ces caractéristiques de structure à leur rendement observé sur un échantillon de requêtes réelles.
Le bruit, tel que retenu dans ce dataset, désigne la part des résultats retournés par une requête qui, après examen, ne se rattache pas à l'objet de collecte recherché. Cette part se distingue du simple volume total de résultats : une requête peut renvoyer un volume élevé avec un bruit faible, ou un volume modeste avec un bruit élevé, les deux dimensions devant être lues ensemble pour juger du rendement réel d'une formulation.
Ce dataset ne cherche pas à trancher l'arbitrage de principe entre précision et exhaustivité, déjà traité comme tel ailleurs, mais à fournir la matière chiffrée qui documente cet arbitrage sur des requêtes effectivement rejouées, avec leurs caractéristiques de structure précisément notées avant l'analyse du rendement obtenu.
Cette absence de matière chiffrée n'est pas anodine : elle laisse chaque concepteur de requête ajuster sa formulation au jugé, souvent par ajouts successifs de termes ou d'exclusions au fil des itérations, sans repère pour savoir si le dernier ajout apporté a réellement amélioré le rendement ou s'il a simplement compliqué une requête déjà proche de son rendement optimal.
Les variables de structure retenues
Trois variables de structure ont été retenues pour caractériser chaque requête de l'échantillon. Le nombre de termes distincts employés dans la requête, sans compter les opérateurs eux-mêmes. La présence ou l'absence d'opérateurs de combinaison, qui permettent d'imposer la coprésence ou l'alternative entre plusieurs termes plutôt qu'une simple juxtaposition. La présence ou l'absence de termes d'exclusion, qui visent à écarter explicitement certains résultats jugés non pertinents par avance.
Ces trois variables ont été choisies parce qu'elles correspondent aux leviers effectivement disponibles pour quiconque conçoit une requête de collecte, indépendamment de l'outil employé pour l'exécuter. Elles permettent de décrire la structure d'une requête de façon suffisamment simple pour être comparée d'une requête à l'autre, sans entrer dans les spécificités syntaxiques propres à chaque système de collecte.
L'échantillon retenu par l'Observatoire couvre plusieurs dizaines de requêtes réellement utilisées dans des dispositifs de veille, choisies pour représenter une diversité de longueurs et de structures, des formulations courtes de deux termes sans opérateur jusqu'à des formulations longues combinant plusieurs opérateurs et plusieurs exclusions.
Chaque requête de l'échantillon a été rejouée à plusieurs reprises avant l'examen de ses résultats, afin de disposer d'un volume et d'un taux de bruit moyens plutôt que d'une mesure ponctuelle susceptible de refléter une variation passagère du classement plutôt qu'une caractéristique stable propre à la structure de la requête elle-même.
Le rendement observé selon la structure
Le tableau ci-dessous restitue, pour des tranches croissantes de longueur et de complexité de requête, le volume moyen de résultats obtenus et la part de bruit observée après examen. Il fait apparaître une évolution non linéaire du rendement, qui ne se contente pas de s'améliorer continûment avec l'ajout de termes, d'opérateurs et d'exclusions.
| Structure de la requête | Volume de résultats | Part de bruit observée |
|---|---|---|
| Deux termes, sans opérateur ni exclusion | Élevé | Élevée |
| Trois à quatre termes, avec opérateur de coprésence | Intermédiaire | Modérée |
| Quatre à six termes, opérateurs et une exclusion | Modéré | Faible |
| Plus de six termes, opérateurs multiples et plusieurs exclusions | Faible | Faible à modérée, dispersion élevée |
La tendance centrale est claire jusqu'à un certain point : l'ajout de termes, puis d'un opérateur de coprésence, puis d'une exclusion, réduit progressivement la part de bruit tout en réduisant le volume total de résultats, ce qui correspond à l'effet recherché d'une requête plus précise. Au-delà d'un certain seuil de complexité, cette tendance s'inverse partiellement : la part de bruit cesse de baisser régulièrement et sa dispersion augmente d'une requête à l'autre.
La zone où la complexité cesse de payer
Cette inversion partielle correspond à ce que l'Observatoire désigne comme la zone de complexité invérifiable : au-delà d'un certain nombre de termes et d'exclusions combinés, la requête devient si spécifique que son comportement cesse d'être prévisible, et surtout cesse d'être vérifiable par quiconque doit auditer a posteriori pourquoi tel résultat est apparu ou a été écarté.
Ce coût de vérifiabilité est distinct du rendement mesuré en volume et en bruit, mais il n'en est pas moins réel : une requête à plus de six termes combinant plusieurs opérateurs et plusieurs exclusions devient difficile à relire et à justifier, y compris pour son propre concepteur après quelques semaines. Cette opacité croissante constitue en elle-même un coût, indépendant du fait que le bruit continue ou non de baisser marginalement.
L'échantillon observé par l'Observatoire montre que ce coût de vérifiabilité augmente plus vite que le gain de précision au-delà du seuil identifié dans le tableau, ce qui fonde la recommandation de ne pas dépasser ce niveau de complexité sans un motif spécifique justifiant le surcroît d'opacité qui en résulte. Cette dispersion accrue au sommet de la complexité mérite une attention particulière : elle signifie que deux requêtes de structure comparable, situées dans cette même tranche de longueur, peuvent produire des rendements sensiblement différents, ce qui rend d'autant plus nécessaire une mesure au cas par cas plutôt qu'une simple règle générale de longueur maximale à ne pas dépasser.
NewsCore relie sur www.newscore.fr chaque requête à son historique de rendement mesuré et détecte ainsi le point où une complexité supplémentaire cesse d'apporter un gain de précision réel.
Ce que la matière chiffrée apporte à l'arbitrage
L'arbitrage entre précision et exhaustivité d'une requête de collecte est un principe déjà connu de quiconque conçoit un dispositif de veille. Ce que ce dataset apporte n'est pas ce principe lui-même, mais sa traduction chiffrée sur des requêtes réelles, ce qui permet de situer une formulation donnée par rapport à une zone de rendement documentée plutôt que par rapport à une intuition non vérifiée.
Cette traduction chiffrée permet en particulier d'identifier les requêtes qui ont dépassé la zone de rendement utile sans que leur concepteur en ait nécessairement conscience, la complexité ayant souvent été ajoutée progressivement, exclusion après exclusion, sans réévaluation d'ensemble de la requête obtenue au terme de ce processus incrémental.
Cette matière chiffrée invite aussi à traiter la conception d'une requête comme un exercice révisable plutôt que comme un réglage figé une fois validé : une requête dont la structure a franchi la zone de rendement utile gagne à être simplifiée, même après plusieurs mois d'usage, dès lors que le dataset ou une mesure équivalente propre au dispositif concerné en établit le constat.
Les limites du dataset
Le seuil de complexité au-delà duquel le rendement cesse de progresser n'est pas un chiffre universel : il dépend du domaine couvert par la requête, de la richesse du vocabulaire disponible pour le formuler et du volume de contenu existant sur le sujet concerné. Le dataset documente une tendance observée sur son échantillon, pas une constante applicable telle quelle à toute requête.
La mesure du bruit repose sur un examen des résultats après coup, qui introduit une part d'appréciation dans la qualification d'un résultat comme pertinent ou non. Cette appréciation a été appliquée de façon homogène sur l'ensemble de l'échantillon, mais elle reste moins strictement reproductible qu'une mesure purement quantitative comme le volume de résultats.
Enfin, l'échantillon retenu, bien que composé de requêtes réellement utilisées, ne couvre pas l'ensemble des domaines de veille possibles. Une extension du dataset à d'autres domaines pourrait faire apparaître des seuils de complexité différents de ceux observés ici, ce qui invite à traiter ces résultats comme une tendance générale à confirmer plutôt que comme un barème définitif.
Questions fréquentes
Ajouter des termes à une requête réduit-il toujours le bruit ? Non, seulement jusqu'à un certain point. Au-delà d'un seuil de complexité, la part de bruit cesse de baisser régulièrement et sa dispersion augmente, ce qui signale une zone où l'ajout de complexité ne se traduit plus par un gain de précision fiable.
Qu'est ce qu'une requête invérifiable, au sens de ce dataset ? Une requête dont la structure, à force de termes, d'opérateurs et d'exclusions combinés, devient trop complexe pour être relue et justifiée facilement, y compris par son propre concepteur, indépendamment du fait que son rendement en bruit reste correct ou non.
Ce dataset tranche-t-il l'arbitrage entre précision et exhaustivité ? Non, il ne fait que documenter cet arbitrage avec des données chiffrées issues de requêtes réelles. Le principe de l'arbitrage lui-même reste un choix à faire selon le contexte du dispositif, ce dataset fournit seulement la matière pour l'éclairer.
Le seuil de complexité identifié est-il valable pour toutes les requêtes ? Non, il dépend du domaine couvert, du vocabulaire disponible et du volume de contenu existant sur le sujet. Le dataset documente une tendance observée sur son échantillon, à vérifier sur son propre périmètre avant toute application directe.