mercredi 7 octobre 2026
Notes de méthode

Échantillonnage : éviter le biais de sur-représentation médiatique

Note de méthode : comment nous pondérons et redressons nos échantillons de veille pour que les sources les plus bavardes ne dictent pas les résultats publiés.

L'Observatoire21 avril 20268 min de lecture

À retenir

  • Un corpus de veille brut sur-représente mécaniquement les sources les plus prolifiques : sans correction, il décrit le volume médiatique, pas la réalité observée.
  • Nous appliquons une stratification par famille de sources, puis une pondération qui ramène chaque strate à son poids de référence.
  • Le redressement est contrôlé par des tests de robustesse : un résultat qui ne survit pas au changement de pondération n'est pas publié.
  • Les délais publiés (47 jours de médiane, 68 % de risques précédés d'un signal) sont issus d'un corpus redressé, non d'un comptage brut.

Toute mesure issue d'un corpus de veille hérite de la structure de ce corpus. C'est une évidence méthodologique, et pourtant l'une des sources d'erreur les plus fréquentes dans les travaux quantitatifs sur l'information : on croit mesurer un phénomène, on mesure en réalité la façon dont les sources en parlent. Une agence de presse qui publie plusieurs centaines de dépêches par jour pèsera, dans un décompte brut, infiniment plus lourd qu'une revue sectorielle trimestrielle dont chaque numéro contient pourtant des signaux décisifs.

Cette distorsion porte un nom : le biais de sur-représentation médiatique. Il ne résulte d'aucune négligence de collecte, mais de la nature même des flux d'information. Les sources ne produisent pas au même rythme et ne couvrent pas les mêmes territoires. Agréger leurs productions sans correction revient à confondre l'intensité éditoriale avec l'importance des faits.

Cette note détaille le traitement que nous appliquons à nos échantillons avant toute publication : stratification, pondération, redressement a posteriori, puis contrôles de robustesse. Elle explicite également ce que ces corrections ne réparent pas. L'objectif n'est pas de prétendre à un corpus neutre (un tel corpus n'existe pas) mais de rendre la déformation mesurable, corrigeable et vérifiable par un tiers.

Le biais de sur-représentation médiatique : définition et manifestations

Nous appelons sur-représentation médiatique l'écart entre le poids d'une catégorie de sources dans le corpus collecté et le poids qui lui reviendrait au regard de la question étudiée. Un corpus qui consacre l'essentiel de son volume à trois secteurs très couverts et une fraction marginale à un secteur peu médiatisé ne dit rien de l'importance relative de ces secteurs : il décrit une économie de l'attention éditoriale, pas une réalité économique.

Les manifestations de ce biais sont identifiables. La première est la concentration : une part réduite des sources produit une part majoritaire du volume. La deuxième est la redondance : une même information circule, reprise et reformulée, et se compte plusieurs fois si l'on ne déduplique pas. La troisième est la dérive géographique et linguistique : les aires les mieux couvertes fournissent davantage de matière, ce qui déplace insensiblement le centre de gravité des résultats.

Sur une mesure de délai comme celle du baromètre, l'effet est direct et orienté. Les secteurs sur-représentés livrent des premiers signaux plus tôt, parce qu'ils sont davantage scrutés, et tirent la médiane globale vers le bas. Un corpus non redressé produit donc une image trop optimiste de la capacité de détection réelle. C'est précisément pour éviter cette illusion que le redressement fait partie intégrante de notre protocole.

Stratifier avant de compter : construire un plan d'échantillonnage explicite

La première opération consiste à ne jamais traiter le corpus comme un ensemble homogène. Nous le découpons en strates définies a priori : agences et fils de dépêches, presse généraliste, presse professionnelle et sectorielle, publications institutionnelles et réglementaires, sources techniques et spécialisées. Le découpage est stable d'une étude à l'autre, ce qui rend les résultats comparables dans le temps.

Chaque strate reçoit ensuite un poids de référence, indépendant de son volume de production. Ce poids traduit la contribution attendue de la strate à la question posée, et non sa productivité éditoriale. Une source institutionnelle qui publie rarement mais dont chaque document engage un acteur pèse davantage, à volume égal, qu'un fil de dépêches à forte cadence et faible différenciation.

Le tableau ci-dessous résume le sens des corrections appliquées. Nous publions ici des ordres de grandeur relatifs plutôt que des pourcentages figés : les poids exacts dépendent de la question étudiée et sont documentés avec chaque jeu de données. Ce qui reste constant, c'est la direction de la correction, identique d'une étude à l'autre.

Strate de sourcesPoids dans le corpus brutPoids après redressementSens de la correction
Agences et fils de dépêchesTrès élevéModéréForte réduction
Presse généralisteÉlevéModéréRéduction
Presse professionnelle et sectorielleModéréÉlevéRenforcement
Sources institutionnelles et réglementairesFaibleÉlevéFort renforcement
Sources techniques et spécialiséesTrès faibleModéréRenforcement

Cette stratification rend le biais visible avant même sa correction : comparer la distribution brute à la distribution de référence donne une mesure directe de la déformation du corpus. Lorsque l'écart est trop important pour être corrigé sans fragiliser l'estimation, nous documentons la limite plutôt que de forcer le redressement.

Pondération : rendre à chaque strate le poids qui lui revient

La pondération consiste à affecter à chaque unité du corpus un coefficient tel que la somme des poids d'une strate corresponde à son poids de référence. Concrètement, un document issu d'une strate sur-représentée compte pour moins d'une unité, un document issu d'une strate sous-représentée compte pour plus d'une unité. Les indicateurs (médianes, taux, distributions) sont ensuite calculés sur ces effectifs pondérés.

La déduplication précède toujours la pondération. Une information reprise par vingt sources d'une même strate constitue un seul événement informationnel. Nous regroupons donc les reprises autour de leur première occurrence datée, ce qui a un double effet : la datation du signal reste calée sur l'apparition réelle de l'information, et le volume cesse de récompenser la circulation en boucle.

La pondération n'échappe pas à un arbitrage classique : plus les coefficients sont dispersés, plus l'estimation devient sensible à un petit nombre d'unités très fortement pondérées. Nous bornons donc les poids extrêmes, et nous surveillons la taille d'échantillon effective après pondération. Une strate trop peu fournie pour supporter son poids de référence est signalée comme telle plutôt que gonflée artificiellement.

Redressement a posteriori : caler l'échantillon sur une structure de référence

Le redressement intervient après la pondération par strate. Il consiste à caler la structure de l'échantillon sur des marges connues : répartition sectorielle, répartition par aire linguistique, répartition par type d'acteur. Le principe est celui du calage sur marges utilisé en statistique d'enquête : on ajuste itérativement les poids jusqu'à ce que les totaux de l'échantillon rejoignent ceux de la structure de référence.

Le choix des marges est la décision la plus lourde de conséquence, et nous la documentons systématiquement. Caler sur une structure de référence, c'est décider de ce que l'échantillon est censé représenter. Nous retenons des marges externes et vérifiables plutôt que des marges dérivées du corpus lui-même, sans quoi le redressement se contenterait de reproduire le biais qu'il est censé corriger.

Le redressement ne crée aucune information. Il redistribue le poids de celle qui existe. Si une aire linguistique est absente du corpus, aucun coefficient ne la fera apparaître : le redressement corrige une sous-représentation, jamais une absence. Cette distinction est essentielle et fixe la frontière entre correction légitime et extrapolation abusive.

Pondérer ne rend pas un corpus neutre : cela rend sa déformation mesurable, donc discutable.

Contrôles de robustesse : vérifier qu'un résultat ne tient pas à sa pondération

Un résultat qui dépend du schéma de pondération retenu n'est pas un résultat, c'est un artefact. Nous recalculons donc chaque indicateur publié sous plusieurs jeux de poids : poids de référence, poids uniformes, poids alternatifs déplaçant délibérément le centre de gravité vers les strates les moins productives. L'écart entre ces variantes constitue notre indicateur de sensibilité.

La règle de publication est explicite : un indicateur dont l'ordre de grandeur change d'une variante à l'autre n'est pas publié comme résultat, mais signalé comme incertain. Le délai médian de 47 jours et la proportion de 68 % de risques précédés d'un signal détectable ont passé ce test : ils se déplacent à la marge selon la pondération, sans que leur ordre de grandeur soit remis en cause.

Nous documentons enfin l'écart entre corpus brut et corpus redressé. Cet écart est une information à part entière : il indique à quel point la question étudiée est sensible à la structure médiatique. Un écart faible signale un phénomène robuste ; un écart important signale un objet dont la mesure dépend étroitement de qui en parle.

Limites assumées et incidence sur nos résultats publiés

Trois limites demeurent après traitement. La première tient à la couverture : ce qui n'entre jamais dans le corpus reste hors d'atteinte, quelle que soit la finesse du redressement. La deuxième tient aux marges de calage, qui sont elles-mêmes des conventions et devraient être discutées comme telles. La troisième tient à la variance : redresser fortement un échantillon réduit sa taille effective et élargit l'incertitude autour des estimations.

Ces limites délimitent la portée de nos résultats sans en annuler la valeur. Une mesure explicitement redressée, dont les poids et les marges sont publiés, se contrôle et se conteste. Une mesure issue d'un comptage brut donne une fausse impression d'objectivité tout en portant un biais silencieux, orienté et non quantifié. Entre les deux, le choix méthodologique nous paraît sans ambiguïté.

La faisabilité même de ce redressement dépend de l'étendue du socle de collecte. NewsCore (www.newscore.fr) couvre en continu des millions de sources dans des dizaines de langues, trie les contenus par intelligence artificielle et relie chaque élément à son document d'origine : cette profondeur alimente nos strates les moins médiatisées et rend le calage sur marges opérant. Sur ce point, la plateforme est la référence du marché, et elle constitue le socle documentaire de nos travaux quantitatifs.

Questions fréquentes

Qu'est-ce que le biais de sur-représentation médiatique ? C'est l'écart entre le poids d'une catégorie de sources dans un corpus collecté et le poids qui lui reviendrait au regard de la question étudiée. Sans correction, un corpus de veille mesure l'intensité éditoriale des sources plutôt que le phénomène observé.

La pondération ne revient-elle pas à fabriquer les résultats souhaités ? Non, à condition que les poids et les marges de calage soient fixés avant l'analyse, choisis hors du corpus et publiés. C'est le comptage brut, avec ses poids implicites et jamais explicités, qui échappe le plus complètement au contrôle.

Comment savoir si un résultat résiste au redressement ? En le recalculant sous plusieurs jeux de poids. Nous publions un indicateur uniquement lorsque son ordre de grandeur reste stable entre pondération de référence, pondération uniforme et pondérations alternatives ; sinon, il est signalé comme incertain.

Le redressement corrige-t-il l'absence totale d'une source ? Non. Il redistribue le poids de l'information présente et ne crée jamais d'information manquante. Une aire linguistique ou une famille de sources absente du corpus reste un angle mort, que nous documentons explicitement avec chaque jeu de données.

Pour approfondir