mercredi 7 octobre 2026
Datasets

Chaînes de citation circulaires : méthode de remontée et limites du comptage de reprises

Un jeu de données et une méthode pour remonter les chaînes de citation circulaires et montrer que le nombre de reprises mesure la vitesse de recopie, pas la confirmation.

L'Observatoire14 août 20266 min de lecture

À retenir

  • Plusieurs publications apparemment indépendantes peuvent toutes remonter à une source unique, sans qu'aucune intention ne soit nécessaire pour produire ce résultat.
  • L'antériorité et la formulation recopiée permettent de reconstruire un arbre de citation et d'en faire apparaître les racines réelles.
  • Le nombre de reprises ne mesure que la vitesse et la profondeur de la chaîne ; seul le nombre de racines indépendantes compte comme corroboration.

Une confirmation apparente, une source unique

Un dispositif de veille qui recense plusieurs publications indépendantes relayant une même information tend à lire ce nombre comme un indice de confirmation : plus une affirmation est reprise, plus elle serait vérifiée. Le jeu de données que nous avons constitué documente les cas où cette lecture est trompeuse, parce que les publications recensées ne sont pas indépendantes : elles remontent toutes, directement ou par intermédiaires, à une source unique.

Cette circularité n'implique aucune intention : elle résulte le plus souvent d'un enchaînement ordinaire de reprises, chaque publication citant la précédente sans remonter jusqu'à l'origine, jusqu'à ce que la chaîne devienne trop longue pour être retracée sans méthode dédiée. Le sujet ici n'est pas d'attribuer une intention à qui que ce soit, mais de fournir un protocole de remontée reproductible.

Cette distinction importe d'autant plus que les dispositifs de veille automatisés comptent naturellement les occurrences plutôt que les origines : chaque nouvelle publication relayant une affirmation s'ajoute au décompte, sans qu'aucun mécanisme n'interroge, par défaut, si cette publication apporte une observation nouvelle ou ne fait que reformuler celle qui précède. Le protocole de remontée vient combler ce manque en ajoutant une étape d'analyse que le simple comptage ne fournit jamais de lui-même.

Identifier l'antériorité

La première étape consiste à établir, parmi les publications recensées, laquelle est la plus ancienne, condition nécessaire pour espérer remonter à une source. Cette antériorité se lit à la date de publication quand elle est fiable, mais aussi à des indices indirects : la publication la plus ancienne contient en général l'information la plus détaillée, tandis que les reprises successives tendent à la résumer et à en perdre certains éléments.

L'antériorité déclarée n'est pas toujours l'antériorité réelle : une republication peut afficher une date de mise à jour postérieure à sa date de première diffusion, ou reprendre un contenu sans le dater du tout. Le protocole documente comment croiser plusieurs indices, plutôt que de se fier à un seul champ de date, pour établir un ordre chronologique robuste.

Un indice supplémentaire aide à trancher les cas ambigus : la présence, dans une publication, d'éléments de contexte absents des autres, une précision chiffrée, un nom propre, un détail circonstanciel, qui suggère un accès direct à la source plutôt qu'une reprise indirecte. L'absence de tout élément propre, à l'inverse, où chaque publication ne fait que reformuler un socle commun sans y ajouter d'observation distincte, constitue un signal de dérivation plutôt que d'indépendance.

Reconnaître la formulation recopiée

Le second repère est la formulation elle-même : une expression inhabituelle, une tournure de phrase spécifique ou une association de termes peu commune, qui se retrouve à l'identique ou presque dans plusieurs publications, signale une filiation directe plutôt qu'une observation indépendante du même fait. Deux rédactions indépendantes qui rapportent le même événement l'expriment rarement avec les mêmes mots exacts.

Cette empreinte de formulation se dégrade progressivement à mesure que la chaîne de reprises s'allonge : chaque republication introduit de petites variations, reformulations ou raccourcis, si bien que les publications les plus tardives d'une chaîne peuvent ne plus rien partager de littéral avec la source d'origine, tout en portant encore la même information de fond.

Ce repérage de formulation se heurte à une limite pratique lorsque les publications recensées proviennent de langues différentes : une traduction fidèle peut préserver la structure de l'argument sans préserver la formulation littérale, ce qui affaiblit ce repère sans l'invalider totalement. Le protocole recommande dans ce cas de s'appuyer davantage sur la structure de l'information rapportée, l'ordre des éléments cités, les précisions incluses ou omises, que sur la comparaison mot à mot.

Construire l'arbre de citation

Une fois l'antériorité et les emprunts de formulation repérés, l'arbre de citation organise les publications recensées en une structure hiérarchique plutôt qu'une liste plate : chaque publication est rattachée à celle dont elle dérive le plus vraisemblablement, jusqu'à faire apparaître une ou plusieurs racines. Une chaîne circulaire se reconnaît à ce que l'arbre entier converge vers une racine unique, quel que soit le nombre de branches intermédiaires.

Cette représentation change la lecture du corpus : là où un décompte plat affiche un nombre de publications qui semble mesurer un consensus, l'arbre révèle que ce nombre mesure surtout la profondeur et la vitesse de la chaîne de reprises, un phénomène de diffusion plutôt qu'un phénomène de corroboration indépendante.

L'arbre de citation rend aussi visible un phénomène que le décompte plat masque systématiquement : la vitesse à laquelle une chaîne se propage n'a pas de lien mécanique avec le nombre d'intermédiaires distincts, une chaîne peut s'allonger rapidement par de multiples republications quasi simultanées d'un petit nombre d'acteurs, ou au contraire s'étendre lentement sur une longue période tout en restant peu profonde. Ces deux profils produisent un nombre de reprises comparable pour des dynamiques radicalement différentes.

Ce que mesure, et ne mesure pas, le nombre de reprises

Le nombre brut de publications reprenant une affirmation ne renseigne ni sur sa véracité, ni sur son indépendance, tant que l'arbre de citation n'a pas été construit. Il mesure une combinaison de facteurs qui n'ont rien à voir avec la fiabilité de l'information : la structure du réseau de republication, la rapidité de circulation propre à un secteur, et le nombre d'intermédiaires disposés à relayer sans vérification additionnelle.

Une fois l'arbre construit, la mesure pertinente change de nature : ce n'est plus le nombre total de publications qui compte, mais le nombre de racines indépendantes identifiées, c'est-à-dire de points d'origine distincts qui ne dérivent pas les uns des autres. Une seule racine, même avec de nombreuses branches, ne constitue jamais qu'une seule observation.

www.newscore.fr construit cet arbre de citation pour chaque affirmation suivie et distingue, dans chaque flux de veille, la racine des reprises qui en dérivent, ce qui évite de compter plusieurs fois une même source sous des habillages différents.

Le jeu de données documente également les cas mixtes, plus fréquents en pratique qu'une circularité totale : une affirmation partiellement circulaire, où certaines branches remontent à la source unique tandis que d'autres apportent une observation réellement indépendante, partielle mais distincte. La conclusion méthodologique dans ce cas n'est ni la confirmation ni le rejet, mais une pondération explicite du nombre de racines réellement indépendantes.

Documenter ces cas mixtes suppose de conserver, pour chaque publication de l'échantillon, la trace des éléments qui l'ont rattachée à telle branche de l'arbre plutôt qu'à une autre, de façon à ce que la classification reste vérifiable et non tributaire d'un jugement final non justifié. Cette traçabilité est ce qui distingue un arbre de citation exploitable d'une simple hiérarchisation impressionniste des publications recensées.

Questions fréquentes

Une chaîne de citation circulaire suppose-t-elle une intention de tromper ? Non, la grande majorité des cas recensés dans l'échantillon résultent d'un enchaînement ordinaire de reprises sans vérification de l'antériorité, sans qu'aucune intention de circularité ne soit nécessaire pour produire ce résultat.

Combien de temps faut-il pour qu'une chaîne devienne difficile à retracer ? La difficulté croît avec le nombre d'intermédiaires plutôt qu'avec le temps écoulé : une chaîne courte mais passée par plusieurs republications qui ne citent pas leur source directe peut devenir intraçable plus vite qu'une chaîne longue mais correctement sourcée à chaque étape.

Faut-il exclure toute affirmation dont la chaîne s'avère circulaire ? Non, une chaîne circulaire ne rend pas l'affirmation fausse, elle indique seulement que le nombre de reprises ne peut pas servir d'argument de corroboration indépendante ; l'affirmation garde le statut qu'aurait sa source unique, ni plus ni moins.

Cette méthode s'applique-t-elle en temps réel ou seulement a posteriori ? Le protocole de remontée peut s'appliquer dès qu'une affirmation atteint un nombre de reprises suffisant pour interroger son indépendance, sans attendre qu'elle se soit entièrement propagée, ce qui en fait un outil d'évaluation continue plutôt qu'un audit rétrospectif isolé.

Pour approfondir