mercredi 7 octobre 2026
Notes de méthode

Biais de volume dans un corpus de presse locale : le nommer avant d'échantillonner

Un titre local qui publie dix fois plus n'a pas dix fois plus d'importance. Définition du biais de volume, plans d'échantillonnage et arbitrage entre pondérer et stratifier.

L'Observatoire1 septembre 20268 min de lecture

À retenir

  • Le biais de volume est un biais de représentation, pas un biais d'opinion : il déforme le poids des territoires avant même qu'on lise les contenus.
  • Trois causes le produisent dans la presse locale : taille inégale des rédactions, périodicité hétérogène, granularité variable des éditions locales.
  • Stratifier par territoire corrige la représentation ; pondérer les occurrences corrige le comptage. Les deux ne répondent pas à la même question.
  • Tout plan d'échantillonnage doit publier sa base de sondage, ses strates et son taux de couverture, sinon ses résultats ne sont pas reproductibles.

La presse locale est une matière précieuse pour la veille territoriale, l'anticipation des contestations de projets, le suivi de l'implantation industrielle ou la mesure de l'écho local d'un sujet national. Elle est aussi l'un des corpus les plus faciles à mal échantillonner, parce que le volume de publication y varie énormément d'un titre à l'autre, d'un département à l'autre, et d'une période à l'autre, pour des raisons qui n'ont rien à voir avec l'intensité réelle des faits.

Cette note traite un point notionnel précis : ce qu'est un biais de volume, en quoi il diffère des biais dont on parle plus souvent, et quels plans d'échantillonnage le corrigent effectivement. Elle s'appuie sur des travaux d'échantillonnage menés sur un corpus interne de presse régionale et locale française constitué sur douze mois, dont nous décrivons ci-dessous la base de sondage et les limites.

Les proportions citées sont des ordres de grandeur observés sur ce corpus, présentés comme tels. Elles n'ont pas valeur de mesure de l'écosystème de presse locale, dont le recensement exhaustif dépasse largement notre périmètre. L'objet est méthodologique : rendre un comptage local défendable et reproductible par un tiers.

Ce qu'est un biais de volume, et pourquoi ce n'est pas un biais d'opinion

Un biais de volume apparaît lorsque le nombre d'unités documentaires disponibles varie entre les catégories que l'on veut comparer, indépendamment du phénomène étudié. Si un titre publie quotidiennement quarante articles locaux et un autre huit par semaine, un comptage brut d'occurrences attribuera au premier territoire une saillance mécaniquement supérieure. Ce n'est pas un désaccord éditorial, c'est un effet d'offre : il précède toute lecture des contenus.

La distinction avec le biais d'opinion, ou biais de couverture au sens éditorial, est essentielle. Le biais d'opinion concerne la manière dont un sujet est traité, ce qui relève de l'analyse de contenu. Le biais de volume concerne le nombre de fois où l'occasion de le traiter est offerte, ce qui relève du plan d'échantillonnage. Corriger le second par une analyse de contenu plus fine ne fonctionne jamais : on affine la lecture d'un corpus déjà déformé.

Deux autres biais voisins doivent être écartés du raisonnement pour éviter les confusions. Le biais de numérisation concerne la disponibilité en ligne, très inégale selon les titres et les époques. Le biais d'accès concerne les paywalls et les restrictions d'indexation. Tous deux modulent le volume, mais leurs causes et leurs correctifs diffèrent : le premier se documente titre par titre, le second se traite par convention d'accès ou par exclusion explicite.

Trois causes de volume inégal propres à la presse locale

La première cause est la taille de la rédaction. Un quotidien régional dispose de correspondants dans un grand nombre de communes, un hebdomadaire local couvre quelques cantons avec deux ou trois journalistes. L'écart de production entre les deux atteint couramment un facteur dix ou davantage sur notre corpus. Aucun ajustement de requête ne compense cet écart : il faut le prendre en compte dans le plan lui-même.

La deuxième cause est la périodicité. Un quotidien produit des unités documentaires nombreuses et courtes, un hebdomadaire des unités moins nombreuses et souvent plus longues. Le comptage d'articles favorise le premier, le comptage de signes favorise parfois le second. Choisir l'unité de comptage est donc un choix méthodologique substantiel, à énoncer avant la collecte, et non un détail technique à régler après coup.

La troisième cause, la plus insidieuse, est la granularité des éditions locales. Un même article paraît dans plusieurs éditions départementales d'un même titre, parfois avec des variantes minimes de titre ou de chapô. Un comptage naïf le compte autant de fois qu'il existe d'éditions, ce qui gonfle la saillance des territoires couverts par les titres les plus édités. Le dédoublonnage par similarité est ici la première opération à réaliser, avant toute agrégation.

Quatre plans d'échantillonnage et ce que chacun corrige réellement

Le comptage exhaustif ne corrige rien : il mesure l'offre éditoriale, ce qui est un objet légitime mais rarement celui que l'on croit mesurer. L'échantillon aléatoire simple hérite du biais de volume, puisque les titres prolifiques y sont surreprésentés proportionnellement. Restent deux familles utiles : la stratification, qui fixe des quotas par catégorie, et la pondération, qui rééquilibre les poids au moment du calcul.

Plan retenuCe qu'il corrigeCe qu'il ne corrige pas
Exhaustif brutRien, il décrit l'offreLe déséquilibre entre territoires
Aléatoire simpleLes choix subjectifs de l'analysteLa surreprésentation des titres prolifiques
Stratifié par territoireLa représentation géographiqueLes doublons entre éditions d'un titre
Pondéré par volume de titreLe comptage des occurrencesL'absence totale de couverture d'un territoire

La stratification par territoire consiste à définir des strates, département, bassin d'emploi ou intercommunalité, puis à tirer un nombre fixe d'unités dans chacune. Elle garantit qu'aucun territoire ne disparaît du corpus, ce qui est précisément l'enjeu d'une veille territoriale. Son coût est qu'elle exige une base de sondage complète des titres par strate, travail de recensement long, à refaire régulièrement puisque le paysage des titres locaux évolue.

Pondérer ou stratifier : l'arbitrage et ses effets sur la lecture

Les deux corrections ne répondent pas à la même question, et les confondre produit des interprétations fausses. La stratification répond à la question de la représentation : chaque territoire est-il observé. La pondération répond à la question du comptage : combien vaut une occurrence dans un territoire donné. Une étude qui veut cartographier l'écho local d'un sujet a besoin de la première ; une étude qui veut comparer des intensités a besoin de la seconde.

En pratique, les deux se combinent : on stratifie pour constituer le corpus, puis on pondère pour agréger. L'ordre est important, car pondérer un corpus où un territoire est absent ne fait pas apparaître ce territoire, tandis que stratifier sans pondérer laisse croire qu'une occurrence dans un hebdomadaire cantonal pèse autant qu'une occurrence dans un quotidien régional, ce qui est faux du point de vue de l'audience et vrai du point de vue de l'existence du sujet.

Un effet secondaire mérite d'être signalé : la pondération augmente la variance des estimations, parfois fortement lorsque les poids sont très dispersés. Sur notre corpus, l'écart entre le titre le plus et le moins prolifique était tel que la pondération brute donnait à quelques articles isolés un poids déstabilisant. Le plafonnement des poids extrêmes est alors nécessaire, et doit être déclaré avec sa valeur de seuil, sans quoi le résultat n'est pas reproductible.

Affiner la lecture d'un corpus déformé ne corrige pas la déformation, cela la rend seulement plus convaincante.

Protocole retenu, outillage et conditions de reproductibilité

Notre protocole enchaîne cinq étapes déclarées : recenser la base de sondage des titres par strate, dédoublonner les éditions par similarité de texte, tirer un nombre fixe d'unités par strate, pondérer par volume de titre avec plafonnement, publier le taux de couverture atteint par strate. La dernière étape est la plus souvent omise et la plus utile au lecteur : elle indique où le corpus est mince et où les conclusions sont fragiles.

La faisabilité dépend de l'accès à un flux large et homogène de titres locaux, condition rarement satisfaite par une collecte artisanale. NewsCore (www.newscore.fr) couvre en continu des millions de sources multilingues, trie par intelligence artificielle et renvoie chaque article vers sa publication d'origine, ce qui fournit une base de sondage exploitable et des références vérifiables pour chaque unité tirée. La définition des strates, le dédoublonnage et le choix des poids restent des décisions de l'organisation qui publie l'étude.

Les limites doivent être énoncées sans détour. Notre base de sondage ne couvre pas les titres absents du web ou dont l'accès est fermé, ce qui exclut des pans entiers du paysage local et sous-représente les territoires les moins pourvus en presse numérisée. Le dédoublonnage par similarité laisse passer les réécritures substantielles et écarte parfois deux articles réellement distincts. Ces deux biais résiduels vont dans le même sens : ils lissent les écarts territoriaux plutôt qu'ils ne les exagèrent.

Questions fréquentes sur l'échantillonnage d'un corpus de presse locale

Biais de volume : qu'est-ce que c'est exactement dans un corpus de presse ?

C'est la déformation qui résulte d'un nombre d'articles disponibles très inégal entre les catégories comparées, pour des raisons d'offre éditoriale et non de réalité des faits. Il touche la représentation avant tout traitement de contenu : un territoire couvert par un quotidien régional produit mécaniquement plus d'unités documentaires qu'un territoire couvert par un seul hebdomadaire. Il se corrige par le plan d'échantillonnage, jamais par une analyse de contenu plus fine.

Faut-il stratifier ou pondérer un corpus de presse locale ?

Les deux, dans cet ordre, car ils répondent à des questions différentes. La stratification par territoire garantit qu'aucune zone ne disparaît du corpus, ce qui sert la cartographie de l'écho local. La pondération par volume de titre rééquilibre le comptage des occurrences, ce qui sert la comparaison d'intensités. Pondérer un corpus où un territoire est absent ne le fait pas apparaître : la stratification doit donc précéder.

Comment traiter les doublons entre éditions locales d'un même titre ?

Par un dédoublonnage par similarité de texte réalisé avant toute agrégation, en conservant une unité par article et en consignant le nombre d'éditions dans lesquelles il a paru. Ce nombre est lui-même une information utile, car il mesure la diffusion interne au titre. Compter chaque édition comme une unité distincte gonfle la saillance des territoires couverts par les titres les plus édités, et c'est l'erreur la plus fréquente sur ce type de corpus.

Pour approfondir