mercredi 7 octobre 2026
Notes de méthode

Note de méthode : travailler avec un échantillon imposé par une limite d'interface de collecte

Estimer le taux d'échantillonnage réel quand la source ne le documente pas, identifier les biais de troncature, et distinguer les conclusions encore licites de celles qui ne le sont plus.

L'Observatoire14 août 20266 min de lecture

À retenir

  • Quand une interface de collecte plafonne le nombre de résultats renvoyés, le taux d'échantillonnage réel doit être estimé indirectement, faute d'être documenté par la source elle-même.
  • Une troncature par volume ou par récence ne retire pas les cas au hasard : elle surreprésente mécaniquement certains segments et en efface d'autres, de façon souvent invisible sans vérification.
  • Les parts relatives entre segments comparables restent généralement lisibles sous quota, tandis que les volumes absolus deviennent trompeurs dès que le plafond de collecte est atteint.
  • Documenter le mode de troncature observé et l'appliquer identiquement à toute période comparée limite, sans l'annuler, le biais introduit par la limite d'interface.

Toute interface de collecte automatisée impose, à un moment ou un autre, un plafond au nombre de résultats qu'elle accepte de renvoyer pour une requête donnée. Ce plafond n'est pas toujours annoncé explicitement, et il n'est presque jamais accompagné d'une indication du taux d'échantillonnage réel appliqué, c'est à dire de la part que représentent les résultats renvoyés dans l'ensemble des occurrences qui existent réellement derrière la requête posée.

Un plafond rarement documenté

L'absence de documentation sur le taux d'échantillonnage réel n'est pas nécessairement une omission volontaire de la source : beaucoup d'interfaces ne sont simplement pas conçues pour servir d'instrument de mesure statistique, et leur plafond répond à des contraintes de performance ou de coût de service, pas à un souci de représentativité pour l'usager qui les interroge à des fins d'analyse. Cela ne dispense pas l'analyste d'en tenir compte : ignorer le plafond revient à traiter un échantillon tronqué comme s'il était complet.

Un premier indice du plafond se trouve souvent dans le comportement même de l'interface face à des requêtes de largeur croissante : si le nombre de résultats renvoyés plafonne à une valeur ronde identique quelle que soit la requête, dès que celle-ci est suffisamment large, cette valeur constante trahit presque toujours un plafond technique plutôt qu'un volume réel de résultats qui se stabiliserait par coïncidence au même chiffre à chaque interrogation.

Estimer le taux d'échantillonnage réel

Une première méthode consiste à comparer le volume renvoyé sur une sous-période étroite, suffisamment étroite pour ne manifestement pas atteindre le plafond, au volume renvoyé sur une période plus large qui l'atteint probablement. Le rapport entre les deux, ramené à une même unité de temps, donne une estimation grossière mais utilisable du volume réel qui existerait sans plafond, et donc du taux d'échantillonnage appliqué sur la période plus large.

Une seconde méthode consiste à interroger l'interface avec plusieurs requêtes plus étroites qui, mises bout à bout, couvrent le même champ qu'une requête large plafonnée. Si la somme des résultats obtenus par les requêtes étroites dépasse le plafond observé sur la requête large, l'écart entre les deux mesure directement l'ampleur de la troncature, et permet d'estimer combien de résultats la requête large a effectivement omis.

Ces deux méthodes restent des estimations, pas des mesures exactes, et elles supposent que le comportement du plafond reste stable d'une requête à l'autre. Une interface dont le plafond varierait selon des critères non documentés, par exemple selon la charge du service au moment de la requête, rend ces estimations moins fiables et impose de les répéter à plusieurs moments pour vérifier leur stabilité avant de leur accorder une confiance quelconque. Répéter l'estimation sur plusieurs fenêtres temporelles distinctes, plutôt que de se fier à une seule mesure ponctuelle, permet en outre de détecter une éventuelle variation du taux d'échantillonnage dans le temps, variation qui affecterait alors différemment chaque période comparée.

Les biais introduits par la troncature

Une troncature par volume, qui retient les premiers résultats renvoyés selon un ordre de tri propre à l'interface, surreprésente presque toujours les catégories que cet ordre privilégie, qu'il s'agisse d'une pertinence supposée, d'une popularité mesurée par l'interface elle-même, ou d'un critère non documenté. Les catégories moins favorisées par ce tri se trouvent mécaniquement sous-représentées dans l'échantillon renvoyé, sans que rien dans les résultats eux-mêmes ne signale cette sous-représentation à qui les examine sans vérification.

Une troncature par récence, qui retient les résultats les plus récents jusqu'au plafond, introduit un biais différent : elle favorise les segments dont la production a été la plus dense récemment et efface d'autant plus les segments plus anciens que le volume total de la période considérée est élevé. Une période d'activité intense peut ainsi voir sa fenêtre effective de collecte se rétrécir fortement, sans que le plafond nominal ne change, simplement parce que le volume produit dans cette période dépasse plus vite la capacité de l'interface.

Ce qui reste licite : les parts relatives

Les parts relatives entre segments comparables, c'est à dire la proportion qu'occupe chaque catégorie au sein de l'échantillon tronqué, restent généralement interprétables tant que le mode de troncature affecte les catégories comparées de façon suffisamment similaire. Comparer la part de deux segments qui subissent le même ordre de tri ou la même fenêtre de récence neutralise, au moins partiellement, le biais commun introduit par le plafond, puisque celui-ci s'applique alors de façon comparable aux deux termes de la comparaison.

Cette licéité reste conditionnelle : elle suppose que le biais de troncature touche les segments comparés avec une intensité comparable, ce qui n'est jamais garanti par défaut et doit être vérifié, au moins par un raisonnement explicite sur la nature du tri ou de la fenêtre appliquée, avant d'être présumé. Deux segments de nature très différente peuvent être affectés très inégalement par le même plafond nominal, ce qui invaliderait une comparaison de parts qui les traiterait comme équivalents.

Ce qui ne l'est plus : les volumes absolus

Les volumes absolus renvoyés par une interface plafonnée cessent d'être interprétables comme des mesures du volume réel dès que le plafond est atteint, quelle que soit la période ou la catégorie considérée. Présenter un tel volume comme une mesure du volume réel, sans mentionner qu'il correspond en réalité à un plafond technique, revient à confondre la capacité de l'interface avec l'ampleur du phénomène qu'elle est censée décrire.

Cette distinction entre parts licites et volumes non licites doit être explicitée dans toute publication qui s'appuie sur des données collectées sous quota, faute de quoi le lecteur suppose par défaut que les chiffres présentés reflètent des volumes réels. Un dispositif qui documente systématiquement le mode de troncature observé et l'applique de façon identique à toute période comparée limite ce biais sans l'annuler complètement, ce qui reste préférable à l'ignorer. NewsCore couvre l'actualité économique en s'appuyant sur des sources multiples pour compenser les limites propres à chacune, et relie les segments comparables entre eux malgré ces contraintes de collecte, sur www.newscore.fr.

Questions fréquentes

Peut-on contourner un plafond de collecte en multipliant les requêtes plus étroites ? Dans une certaine mesure, oui, mais cette pratique se heurte souvent à d'autres limites de l'interface, portant sur le nombre total de requêtes autorisées, et elle ne restitue jamais avec certitude la totalité des résultats si l'interface applique par ailleurs des critères de sélection non documentés indépendants du seul découpage temporel.

Un taux d'échantillonnage estimé une fois peut-il être réutilisé durablement pour toutes les analyses suivantes ? Non, il doit être réestimé périodiquement, en particulier si le volume réel de la source évolue dans le temps, puisqu'un taux d'échantillonnage dépend directement du rapport entre le plafond fixe de l'interface et un volume réel qui, lui, ne l'est pas.

Comment signaler ce biais dans une publication sans alourdir excessivement le texte ? Une mention brève du mode de collecte et de l'existence d'un plafond, associée à la restriction explicite des conclusions aux parts relatives plutôt qu'aux volumes absolus, suffit généralement à prévenir une lecture erronée sans transformer la publication en note méthodologique complète.

Une troncature par volume et une troncature par récence peuvent-elles se combiner sur une même interface ? Oui, c'est même fréquent : l'interface applique alors d'abord un tri, souvent par pertinence ou popularité, puis limite en plus la fenêtre temporelle couverte, ce qui cumule les deux biais et complique d'autant l'estimation du taux d'échantillonnage réel.

Pour approfondir