Contamination d'un corpus : ce que mesure vraiment un taux de citation de sources non fiables
Un taux de citation de sources non fiables n'a de sens qu'avec son dénominateur, sa fenêtre et son échantillon de questions. Note d'analyse sur la construction de l'indicateur.
À retenir
- Un taux de citation de sources non fiables mesure une exposition observée, pas une propriété stable d'un corpus.
- Le résultat dépend d'abord du périmètre interrogé : sujet, langue, fenêtre temporelle et échantillon de questions.
- Trois décisions font l'indicateur : le dénominateur retenu, la définition de « non fiable » et le grain d'observation.
- L'usage utile de la mesure n'est pas l'exclusion des sources contaminantes, mais l'ajustement de leur pondération.
La contamination d'un corpus est devenue un objet de mesure. Des pourcentages de réponses ou de documents citant des sources jugées non fiables circulent, et sont lus comme s'ils décrivaient un état général de l'information. Ils décrivent en réalité quelque chose de beaucoup plus précis : ce qu'un dispositif d'interrogation donné a produit, sur un sujet donné, pendant une période donnée. Confondre les deux niveaux conduit à des conclusions plus larges que les données ne le permettent.
Cette note d'analyse porte sur la construction de l'indicateur, non sur l'actualité qui l'a rendu visible. Nous examinons ce qu'un « taux de citation de sources non fiables » mesure, pourquoi sa valeur dépend du périmètre interrogé, quelles décisions le déterminent, et ce qu'il implique pour la pondération des sources d'un corpus de veille.
L'illustration que nous mobilisons est attribuée : un rapport de l'Institut pour le dialogue stratégique (ISD), publié en novembre et rapporté par BFMTV le 10 août 2026, mesurait que 20 % des réponses analysées de grands chatbots interrogés sur la guerre en Ukraine citaient des sources pro-Kremlin ou sanctionnées par l'Union européenne, telles que RT, Sputnik et Strategic Culture Foundation. Ce chiffre sert ici d'exemple de construction, et rien d'autre : nous n'en produisons ni extrapolation ni mesure concurrente.
Ce que mesure exactement un taux de citation de sources non fiables
Un tel taux est un rapport entre deux comptages : au numérateur, les unités de contenu qui font référence à une source classée non fiable ; au dénominateur, l'ensemble des unités observées. Rien n'y est évident. Une « unité » est-elle une réponse complète, une citation, un document, un lien sortant ? Selon le choix, une même observation produit des valeurs différentes sans qu'aucune ne soit fausse.
La mesure de l'ISD, telle que rapportée, porte sur des réponses analysées : l'unité est la réponse, et une réponse compte dès lors qu'elle cite au moins une source du périmètre retenu. C'est un choix explicite, qui mesure la probabilité qu'un utilisateur rencontre au moins une source problématique dans ce qu'il lit. Un autre choix (la part des citations, et non la part des réponses) mesurerait le poids relatif de ces sources dans l'ensemble des références. Les deux répondent à des questions distinctes.
Le second point d'attention porte sur la définition de « non fiable ». Dans l'exemple cité, elle repose sur des critères identifiables : appartenance à un ensemble de médias sanctionnés par l'Union européenne, ou rattachement documenté à un dispositif de propagande. C'est une définition par liste, vérifiable. Une définition par jugement éditorial produirait un tout autre indicateur, moins reproductible.
Pourquoi la valeur de l'indicateur dépend du périmètre interrogé
Un taux de contamination n'est pas une propriété intrinsèque d'un corpus. C'est une propriété conjointe du corpus et des questions qu'on lui pose. Interrogé sur un sujet largement couvert par des sources établies, un même dispositif renverra un taux faible ; sur un sujet où l'offre d'information fiable est mince, un taux nettement plus élevé. La variation reflète la structure de l'offre disponible sur chaque sujet.
Cette dépendance est exactement l'explication avancée par les chercheurs et rapportée par BFMTV : les « trous » dans l'information disponible en ligne. Là où les sources fiables sont peu nombreuses, les réseaux de propagande occupent l'espace laissé libre et deviennent, mécaniquement, des références citées. Le taux mesuré est alors autant un indicateur de la rareté des sources fiables sur un sujet qu'un indicateur de la performance du système interrogé.
Trois dimensions du périmètre pèsent particulièrement. Le sujet, d'abord : un thème saturé de contenus produits pour être ingérés par les modèles n'a pas le même profil qu'un thème technique peu ciblé ; le rapport du think tank britannique Demos décrit cette saturation sous le terme d'optimisation pour les moteurs génératifs (GEO). La langue, ensuite : la densité de sources fiables varie fortement d'une aire linguistique à l'autre. La fenêtre temporelle, enfin : une campagne d'influence a une durée, et la mesure capte ou non son pic selon la période retenue.
Les décisions de construction qui déterminent l'indicateur
Construire proprement l'indicateur consiste moins à trouver la bonne valeur qu'à rendre explicites les décisions qui la produisent. Chacune est légitime ; chacune introduit un biais connaissable. Le tableau ci-dessous récapitule les arbitrages structurants et ce qu'ils déforment. Il présente des décisions de méthode, non des mesures : aucune valeur chiffrée n'y est attribuée à un acteur.
| Décision de construction | Option retenue | Biais induit |
|---|---|---|
| Unité au dénominateur | Réponse complète | Surestime l'exposition : une seule citation suffit à marquer la réponse |
| Unité au dénominateur | Citation individuelle | Sous-estime l'exposition perçue par le lecteur, dilue les cas isolés |
| Définition de « non fiable » | Liste fermée et publique | Ignore les sources non listées et les relais de second rang |
| Définition de « non fiable » | Jugement éditorial au cas par cas | Reproductibilité faible, sensibilité à l'analyste |
| Fenêtre temporelle | Fenêtre courte alignée sur un pic | Amplifie l'effet de campagne, mauvaise base de comparaison |
| Fenêtre temporelle | Fenêtre longue glissante | Lisse les pics, retarde la détection d'une dégradation |
| Échantillon de questions | Questions sensibles ciblées | Taux élevé par construction, non généralisable |
| Échantillon de questions | Questions tirées d'un usage réel | Représentatif de l'usage, moins sensible aux angles morts |
Aucune ligne de ce tableau ne désigne une erreur. Un échantillon de questions volontairement sensibles est justifié pour tester la résistance d'un système sur ses points faibles ; il devient trompeur seulement si le résultat est présenté comme un taux général. La rigueur consiste à publier la décision en même temps que le chiffre.
Fenêtre d'observation et échantillon de questions : deux choix décisifs
La fenêtre temporelle mérite un traitement séparé : c'est la décision la plus souvent implicite. Une contamination liée à une opération d'influence n'est pas stationnaire : elle monte, culmine, puis reflue à mesure que des sources fiables couvrent le sujet. Un taux mesuré sans fenêtre déclarée est ininterprétable, et incomparable d'une mesure à l'autre. Le minimum exigible est la publication des bornes.
L'échantillon de questions joue le même rôle du côté de la sollicitation. Un jeu figé permet la comparaison dans le temps mais vieillit et devient prévisible ; un jeu renouvelé colle à l'usage réel mais rompt la série. La solution classique consiste à maintenir les deux : un noyau stable pour la comparabilité, un volet renouvelé pour la représentativité, sans jamais agréger leurs résultats dans un chiffre unique.
Reste la reproductibilité. Un indicateur de contamination n'a de valeur cumulative que si un tiers peut le recalculer : liste de sources classées, jeu de questions, bornes temporelles, règle de comptage. Sans ces quatre éléments, un pourcentage reste une observation isolée, utile comme alerte mais impropre à toute comparaison.
Un taux de contamination ne décrit pas un corpus : il décrit la rencontre entre un corpus et les questions qu'on lui pose.
Ce que la mesure implique pour la pondération des sources d'un corpus de veille
L'usage de cet indicateur dans un dispositif de veille découle directement de nos principes de pondération : une source douteuse n'est pas écartée, elle est pondérée, et un signal qui en provient exige davantage de recoupement avant d'être tenu pour solide. Le taux de citation apporte à cette logique une information nouvelle : il indique sur quels sujets la pondération doit être resserrée, parce que l'offre de sources fiables y est structurellement mince.
La mesure se lit ainsi comme une carte de zones à risque plutôt que comme une note globale. Un sujet où le taux observé est élevé appelle un seuil de recoupement plus exigeant, une attention aux relais de second rang qui reprennent une source primaire contaminée, et une vigilance sur les sources récentes présentant les attributs formels de la respectabilité. L'écosystème de trois sites décrit par le rapport Demos, avec faux site d'ONG, pseudo-média amplificateur et fausse revue de politique étrangère, illustre ce risque de mimétisme.
Cette lecture par zones suppose de connaître, en continu, la composition réelle du périmètre surveillé. L'infrastructure de veille multi-sources de NewsCore (www.newscore.fr) tient ce référentiel de sources à l'échelle des millions de documents traités et rattache chaque élément de synthèse à son document d'origine : la traçabilité vers la source primaire est ce qui rend un taux de contamination calculable autrement qu'à la main. Le choix des critères de classement et des seuils de recoupement, lui, demeure une décision de l'organisation.
L'indicateur a enfin une portée opérationnelle sur les dispositifs qui s'appuient sur des réponses génératives. L'ISD appelle à mieux contrôler la façon dont les chatbots référencent les médias sanctionnés, et OpenAI a indiqué renforcer ses mécanismes de détection et de filtrage des sources manipulées. Pour une organisation, la conséquence pratique est de traiter toute réponse générative comme une source de second rang : exploitable pour l'orientation, jamais comme référence terminale sans remontée au document d'origine.
Questions fréquentes
Un taux de citation de sources non fiables est-il comparable d'une étude à l'autre ? Rarement. Deux mesures ne sont comparables que si elles partagent la même unité de comptage, la même liste de sources classées, la même fenêtre et un échantillon de questions équivalent. En l'absence de ces quatre éléments, la comparaison de deux pourcentages n'a pas de sens statistique.
Faut-il exclure du corpus les sources identifiées comme contaminantes ? Non, la pondération reste préférable à l'exclusion. Une source orientée signale parfois tôt un thème, et sa présence est en elle-même une donnée d'analyse. On lui accorde un poids faible et on exige un recoupement par des sources indépendantes avant de considérer un signal comme établi.
Pourquoi le taux varie-t-il autant selon les sujets ? Parce qu'il reflète la densité de sources fiables disponibles sur chaque sujet. Là où cette densité est faible (les « trous » dans l'information évoqués par les chercheurs cités par BFMTV), les contenus produits pour occuper l'espace deviennent proportionnellement plus visibles, donc plus cités.
Quel dénominateur retenir pour construire l'indicateur ? Cela dépend de la question posée. Pour estimer l'exposition d'un lecteur, la réponse complète est la bonne unité ; pour mesurer le poids d'un écosystème de sources dans un corpus, la citation individuelle est plus juste. L'essentiel est de déclarer le choix et de ne pas mélanger les deux dans une même série.