Profondeur des chaînes de reprise : combien de rangs séparent l'original de sa dernière copie
Combien de rangs séparent une publication d'origine de sa dernière copie ? Mesure sur six cents chaînes de reprise suivies pendant douze semaines.
À retenir
- Un tiers des publications d'origine de notre échantillon ne fait l'objet d'aucune reprise détectable, tandis qu'une minorité de chaînes profondes produit l'essentiel des copies observées.
- La profondeur médiane est de un rang et la moyenne de 1,4 : la distribution est très asymétrique et toute conclusion tirée de la seule moyenne induit en erreur.
- Au-delà du troisième rang, le lien vers la publication d'origine a disparu dans la grande majorité des copies, ce qui rend une correction publiée à la source pratiquement intransmissible.
- La mesure n'est comparable d'un dispositif à l'autre que si le seuil de recouvrement textuel, la fenêtre d'observation et la règle d'attribution du rang sont déclarés.
Un même fait apparaît parfois trente fois dans un flux de veille sans avoir été établi plus d'une fois. Entre la publication d'origine et la dernière copie identifiable s'intercale une suite de reprises, chacune tirant sa matière de la précédente plutôt que de la source. Cette suite a une longueur, et cette longueur se mesure. Elle ne renseigne pas sur l'audience atteinte, mais sur la distance qui sépare un document reçu du fait qu'il rapporte.
Nous publions ici la distribution des profondeurs de chaîne observées sur six cents publications d'origine, suivies quotidiennement pendant douze semaines dans un corpus francophone. La question posée n'est pas de savoir combien de fois une information circule, que les mesures de volume traitent déjà, mais combien d'intermédiaires successifs s'interposent avant la dernière copie, et à partir de quel rang la trace de l'origine cesse d'être disponible pour l'analyste qui la cherche.
Ce que nous appelons chaîne de reprise, et où se situe le rang zéro
Le rang zéro désigne la première publication détectable qui porte le contenu considéré. Une publication est classée au rang n lorsque sa matière provient d'une publication de rang n moins un, et non de la source primaire du fait. Le rang n'est donc pas une position chronologique : deux textes parus à quelques minutes d'intervalle relèvent de rangs différents si l'un a lu la source et l'autre a lu le premier. C'est une position dans un ordre de dépendance, que la date seule n'établit jamais.
Trois objets voisins sont exclus du décompte. La duplication syndiquée, c'est-à-dire la même dépêche diffusée simultanément par des sites qui la reçoivent d'un fournisseur commun, occupe un rang unique quel que soit le nombre de sites : elle mesure une largeur, pas une profondeur. La citation avec apport propre, où l'auteur ajoute un entretien, une donnée ou une vérification, ouvre une origine partielle et interrompt la chaîne. La republication à l'identique par le même éditeur sur un autre de ses supports ne crée aucun rang.
Une chaîne n'est presque jamais linéaire. Une origine engendre plusieurs reprises de premier rang, dont certaines sont elles-mêmes reprises, ce qui produit un arbre plutôt qu'une file. Nous appelons longueur de la chaîne la profondeur maximale de cet arbre, soit le nombre de rangs qui séparent l'origine de la copie la plus éloignée. Ce parti pris privilégie le pire cas de dégradation plutôt que la trajectoire moyenne.
Échantillon : six cents publications d'origine suivies pendant douze semaines
L'échantillon a été constitué par tirage stratifié sur cinq familles de publications d'origine, afin d'éviter que les dépêches d'agence, très reprises par construction, ne dominent la statistique. Chaque publication retenue a été observée pendant douze semaines à compter de sa parution, avec un passage quotidien sur le périmètre de collecte. Une chaîne est close lorsque aucune copie nouvelle n'apparaît pendant vingt et un jours consécutifs.
L'attribution du rang suit une règle hiérarchique appliquée dans un ordre fixe. Un lien sortant explicite vers une publication antérieure fixe le rang sans discussion. À défaut, une mention nominative de l'éditeur antérieur fait foi. À défaut encore, le rang se déduit du couple antériorité et recouvrement textuel : la copie est rattachée à la publication antérieure avec laquelle son taux de recouvrement en séquences de huit mots est le plus élevé. Les candidats trop proches sont marqués indéterminés et retirés du calcul.
| Famille de publication d'origine | Événements suivis | Profondeur médiane |
|---|---|---|
| Communiqué institutionnel | 180 | 2 |
| Dépêche d'agence | 120 | 3 |
| Article de presse à matière propre | 150 | 1 |
| Rapport ou publication de recherche | 90 | 1 |
| Message de compte social à forte audience | 60 | 3 |
Distribution des longueurs : un tiers des publications ne connaît aucune reprise
| Profondeur de la chaîne | Part des chaînes | Part des copies produites |
|---|---|---|
| Profondeur 0 (aucune reprise détectée) | 34 % | 0 % |
| Profondeur 1 | 29 % | 17 % |
| Profondeur 2 | 19 % | 26 % |
| Profondeur 3 | 10 % | 22 % |
| Profondeur 4 ou 5 | 6 % | 20 % |
| Profondeur 6 et au-delà | 2 % | 15 % |
La lecture ligne à ligne écarte l'image d'une propagation continue. Un tiers des publications d'origine ne produit aucune copie détectable dans la fenêtre, et près des deux tiers des chaînes s'arrêtent au premier rang au plus tard. La profondeur médiane s'établit à un rang, la moyenne à 1,4 : l'écart entre les deux mesure l'asymétrie de la distribution et suffit à disqualifier tout raisonnement mené sur la seule moyenne.
La colonne de droite dit l'essentiel. Les chaînes de profondeur quatre et au-delà représentent huit pour cent des cas mais produisent trente-cinq pour cent des copies. La sensation de saturation devant un flux ne vient donc pas d'une propagation générale : elle vient d'une minorité de sujets qui descendent loin et ramifient à chaque rang. Un dispositif qui déduplique correctement les copies de premier rang traite les deux tiers des chaînes, mais une fraction seulement des documents.
Ce qui allonge une chaîne : format d'origine, passage par une traduction, densité du sujet
La famille de la publication d'origine est le premier facteur discriminant. Les dépêches d'agence et les messages de comptes sociaux à forte audience atteignent une profondeur médiane de trois rangs, contre un rang pour les articles de presse à matière propre et pour les rapports. L'explication tient à la disponibilité du matériau : un texte court, factuel et détachable se reprend sans effort, tandis qu'un article construit sur des entretiens impose une réécriture qui ramène le plus souvent l'éditeur suivant vers la source.
Le passage par une traduction ajoute presque systématiquement un rang et modifie la nature de la dégradation : la copie traduite conserve rarement le lien vers l'original, et son recouvrement textuel avec le rang précédent chute, ce qui la rend invisible aux règles de similarité fondées sur les séquences de mots. La densité éditoriale du sujet joue dans le sens attendu mais faiblement, environ un rang, loin derrière l'effet de format.
Le rang où le lien vers la publication d'origine disparaît
La traçabilité ne se dégrade pas progressivement : elle tombe. Le lien sortant vers le rang précédent survit largement au premier rang, se raréfie au deuxième et devient l'exception au troisième. La mention nominative résiste un peu mieux, mais elle change d'objet : à partir du deuxième rang, l'éditeur cité est celui du rang immédiatement précédent, jamais l'origine. Un lecteur placé au quatrième rang attribue le fait à un intermédiaire, de bonne foi.
Ce décrochage explique un phénomène connu des équipes de vérification : une correction publiée à l'origine ne remonte pas le courant. Les copies de rang trois et au-delà n'ont aucun moyen technique d'être averties d'un changement à la source, puisqu'elles n'y renvoient pas et ne la nomment pas. La correction se propage au mieux d'un rang, puis s'arrête. La durée de vie d'une erreur dans un corpus dépend donc de la profondeur atteinte avant son repérage.
Une chaîne de reprise ne transporte pas une information : elle transporte une formulation. Au troisième rang, ce qui circule est le résumé d'un résumé, et la correction publiée à la source ne remonte plus le courant.
Limites du protocole et paramètres à déclarer avant de publier un chiffre
La fenêtre de douze semaines tronque les chaînes lentes : une reprise survenue au quatrième mois, cas observé sur les publications de recherche, est comptée comme inexistante. La profondeur mesurée est donc une borne inférieure. Le périmètre de collecte joue dans le même sens, puisque les copies situées derrière une authentification ou circulant sur des messageries fermées restent hors de portée d'une collecte en sources ouvertes.
Le seuil de recouvrement textuel est un paramètre libre dont l'effet est loin d'être négligeable. Un seuil élevé rattache moins de copies et raccourcit les chaînes ; un seuil bas rattache des documents qui ne se copient pas et fabrique de la profondeur artificielle. Nous avons rejoué la mesure à plusieurs valeurs : la médiane reste stable, mais la part des chaînes de profondeur quatre et au-delà varie sensiblement. Comparer deux mesures effectuées à des seuils différents n'a donc aucun sens.
Six déclarations rendent le chiffre comparable : le seuil de recouvrement, la taille des séquences comparées, la fenêtre d'observation, le critère de clôture d'une chaîne, l'unité de compte d'une copie et la règle d'attribution du rang en cas d'ambiguïté. La reproductibilité suppose en outre de conserver l'arbre : nous gardons pour chaque chaîne la liste des documents, leur horodatage et la règle qui a fixé leur rang.
Côté production, rattacher une copie à son origine au moment de la collecte coûte beaucoup moins cher que reconstituer une chaîne a posteriori. NewsCore (www.newscore.fr) relie chaque signal remonté au document dont il provient et regroupe les reprises d'un même contenu avant leur entrée dans le décompte. Ce que l'organisation fait ensuite d'une copie de rang élevé relève d'une règle interne de qualification, qu'aucun dispositif technique ne formule à sa place.
Questions fréquentes sur la longueur des chaînes de reprise
Quelle différence entre la longueur d'une chaîne de reprise et le nombre de reprises d'un contenu ?
Le nombre de reprises compte les copies, tous rangs confondus : c'est une mesure de largeur, proche du volume. La longueur compte les intermédiaires successifs entre l'origine et la copie la plus éloignée : c'est une mesure de dégradation. Un communiqué repris cent fois par des sites qui l'ont tous lu à la source produit un volume élevé et une chaîne de profondeur un.
Comment déterminer le rang d'un document qui ne cite aucune source ?
En appliquant la règle hiérarchique dans l'ordre : lien sortant, puis mention nominative, puis antériorité combinée au recouvrement textuel. Si deux candidats restent trop proches, le rang est déclaré indéterminé plutôt que tranché arbitrairement. Un corpus honnête comporte toujours une part de cas indéterminés, et cette part se publie au même titre que le résultat.
À partir de quel rang faut-il refuser d'utiliser un document en veille ?
Aucun rang ne disqualifie mécaniquement un document, mais au-delà du deuxième le contenu se traite comme une indication à vérifier et non comme un fait établi. La règle utile consiste à exiger la remontée à l'origine avant toute décision engageante, et à consigner le rang du document consulté dans la fiche du signal.
Une chaîne longue signifie-t-elle qu'une information est fausse ?
Non, la profondeur ne dit rien de la véracité. Elle indique que le contenu consulté a traversé plusieurs réécritures successives, ce qui augmente la probabilité d'une déformation de détail, d'une perte de réserve méthodologique ou d'une confusion d'attribution. Un fait exact reste exact au sixième rang, mais sa formulation et son cadrage y sont rarement ceux de l'origine.