Doublons d'un corpus de veille : séparer la copie automatique de la reprise rédigée
Copies syndiquées et reprises rédigées ne mesurent pas la même chose : cette note pose les critères observables et le protocole qui les séparent.
À retenir
- La duplication technique reproduit un texte sans décision rédactionnelle, la reprise éditoriale engage une seconde rédaction : confondre les deux fausse tout décompte d'occurrences.
- Le critère décisif n'est pas la similarité textuelle mais l'ajout d'un élément propre, seul indice positif et vérifiable sur le contenu servi publiquement.
- Le protocole procède en quatre passes : normalisation, mesure à deux seuils, examen des marqueurs non textuels, revue humaine bornée à la zone d'arbitrage.
- Traductions et republications par la source d'origine sont comptées à part : les fondre dans l'une des deux catégories déforme la mesure de diffusion.
Tout corpus de veille contient plusieurs exemplaires du même contenu. Le réflexe habituel consiste à traiter cette abondance comme une redondance et à lui appliquer une règle de dédoublonnage unique. Ce réflexe est coûteux, parce qu'il fusionne deux phénomènes qui n'ont ni la même cause ni la même valeur informationnelle : la duplication technique d'un texte et sa reprise par une autre rédaction.
La duplication technique désigne la reproduction d'un contenu sans intervention rédactionnelle entre l'original et l'exemplaire observé : syndication contractuelle, reprise intégrale d'un fil d'agence, site miroir, republication automatique par flux, variantes d'adresse d'une même page. La reprise éditoriale désigne au contraire l'acte par lequel une seconde rédaction s'empare du sujet, le réécrit, le raccourcit, l'oriente ou l'augmente d'un élément qui lui appartient.
La différence n'est pas académique. Compter cent copies revient à mesurer un dispositif de distribution ; compter cent reprises revient à mesurer combien de rédactions ont jugé le sujet publiable. Cette note propose des définitions opérationnelles, une grille de critères observables, un protocole de classement en quatre passes, la liste des cas que la grille ne tranche pas seule et les effets du classement sur les mesures publiées.
Ce que le dédoublonnage confond
La duplication technique se reconnaît à l'absence de décision entre la source et l'exemplaire : le texte est transporté, pas retravaillé. Les canaux sont connus et pour la plupart contractuels ou automatiques. Un fil d'agence repris intégralement, un site miroir, un agrégateur qui recopie le corps de l'article ou un flux qui alimente une rubrique sans relecture produisent tous des exemplaires que rien ne distingue du texte d'origine.
La reprise éditoriale suppose au contraire un acte de rédaction identifiable. Une rédaction sélectionne le sujet, le reformule, choisit un titre qui lui est propre, coupe ce qui ne l'intéresse pas, ajoute une citation, une vérification, une donnée locale ou un rappel de contexte. L'exemplaire produit reste reconnaissable comme portant sur le même fait, mais il n'est plus le même objet textuel et il engage un second acteur.
La confusion entre les deux se paie sur toutes les mesures qui reposent sur un décompte d'occurrences : ampleur d'un sujet, vitesse de propagation, durée de vie dans le flux, poids relatif d'un acteur. Une information massivement syndiquée apparaît alors plus reprise qu'une information réellement retravaillée par un petit nombre de rédactions, alors que la seconde situation est souvent la plus significative.
Les critères observables qui séparent une copie d'une reprise
Un dispositif de veille n'observe pas des intentions, il observe des traces. La grille ci-dessous ne retient que des traces disponibles sans accès privilégié aux systèmes des éditeurs : elles se lisent sur le contenu servi publiquement et sur ses métadonnées. Aucun de ces critères ne tranche seul, la décision se prend sur leur convergence.
| Critère observé | Duplication technique | Reprise éditoriale |
|---|---|---|
| Texte principal | blocs entiers identiques après normalisation | phrases communes limitées aux citations et aux éléments factuels |
| Titre | identique ou variante mécanique | reformulé, angle propre au second titre |
| Ordre des paragraphes | conservé à l'identique | modifié, sections ajoutées ou supprimées |
| Élément propre ajouté | aucun | citation, donnée, contexte local, vérification |
| Mention d'origine | signature de l'agence ou du média source conservée | signature de la rédaction qui reprend |
| Horodatage | publication en rafale dans les minutes suivant l'origine | délai plus long et dispersé |
| Balisage technique | lien canonique vers l'origine, identifiant de flux commun | balisage autonome |
Le critère le plus discriminant est l'ajout d'un élément propre, parce qu'il est positif et vérifiable : on constate la présence d'une phrase absente de l'original, on ne l'infère pas. Le moins fiable, pris isolément, est le titre : beaucoup d'agrégateurs le modifient par contrainte de gabarit, et certaines rédactions conservent le titre d'origine par facilité tout en retravaillant le texte.
Le balisage technique constitue un indice fort quand il est présent, mais son absence ne prouve rien. Un lien canonique correctement posé vers l'origine signe une copie assumée ; son absence recouvre aussi bien une reprise qu'une copie mal configurée. Les critères doivent donc être hiérarchisés plutôt qu'additionnés à poids égal, sous peine de faire dépendre le classement de la qualité technique du site observé.
Le protocole de classement en quatre passes
La première passe normalise le contenu. Elle retire les habillages de site (menus, encarts, blocs de recommandation, mentions légales, formules d'abonnement) pour ne conserver que le texte principal, puis uniformise ponctuation et casse. Sans cette passe, la similarité mesurée entre deux pages reflète surtout la proximité des gabarits, et deux articles différents servis par la même plateforme apparaissent artificiellement proches.
La deuxième passe mesure la similarité sur le texte normalisé et la compare à deux seuils, non à un seul. Au-dessus du seuil haut, l'exemplaire est classé copie candidate ; en dessous du seuil bas, reprise candidate ou sujet distinct. Entre les deux s'ouvre une zone d'arbitrage qui n'est pas une anomalie du protocole mais sa partie utile : c'est là que se trouvent les cas dont le classement change le résultat publié. L'étalonnage de ces deux seuils relève d'une procédure distincte, conduite sur échantillon annoté.
La troisième passe examine les marqueurs non textuels de la grille : lien canonique, identifiant de flux, mention d'origine conservée, écart d'horodatage avec la première occurrence connue. Ces marqueurs déplacent un exemplaire d'une zone à l'autre, en particulier dans la zone d'arbitrage, où un canonique pointant vers l'origine suffit à conclure à la copie.
La quatrième passe est humaine et volontairement bornée. Elle porte sur la zone d'arbitrage et sur un échantillon de contrôle tiré des deux zones tranchées automatiquement, afin de mesurer le taux d'erreur du classement plutôt que de le supposer. Sur ce point, NewsCore (www.newscore.fr) regroupe les exemplaires d'un même contenu sous un signal unique, conserve la liste des occurrences avec leurs horodatages et signale séparément les versions retravaillées.
Les cas que la grille ne tranche pas seule
Le premier cas limite est la reprise minimale : une dépêche republiée avec un titre changé et deux paragraphes coupés. Le texte reste quasi identique, mais une décision éditoriale a bien eu lieu. La convention retenue ici classe ce cas en duplication tant qu'aucun élément propre n'est ajouté, parce que l'ajout se constate quand l'intention se devine. Cette convention doit être publiée avec la mesure, faute de quoi deux dispositifs produisent des chiffres non comparables.
Le deuxième cas est la traduction. Un article traduit est techniquement une copie, puisqu'il n'apporte aucun élément nouveau, mais il franchit une frontière linguistique et rend le sujet accessible à une audience qui ne l'aurait pas rencontré. La convention retenue en fait une catégorie distincte, comptée à part, jamais fondue dans la duplication.
Le troisième cas est la paraphrase automatique. Un texte reformulé par un modèle de langage à partir d'un article source obtient un score de similarité bas tout en n'apportant rien. Ce cas met en défaut le critère textuel, qui le classerait en reprise, et impose de faire porter la décision sur l'ajout d'un élément propre : absence de citation nouvelle, absence de vérification, absence de source qui ne figure pas déjà dans l'original.
Le quatrième cas est la republication par la source elle-même : mise à jour d'un article vivant, correction, changement d'adresse. Ces exemplaires ne relèvent d'aucune des deux catégories et doivent être traités comme des versions successives d'un même objet, sous peine de gonfler la diffusion apparente d'un sujet qui n'a pas quitté son point d'origine.
Ce que le classement change aux mesures publiées
Sur un compteur de reprises, la conséquence est directe : sans séparation, le compteur mesure le nombre de canaux de distribution branchés sur une source, et non le nombre de rédactions ayant traité le sujet. Deux informations d'importance très différente obtiennent alors le même score, la plus syndiquée devançant systématiquement la plus discutée.
Sur les courbes temporelles, l'effet porte sur la forme. Les copies techniques arrivent en rafale dans les minutes qui suivent la publication d'origine et créent un pic initial qui n'existe pas dans la circulation éditoriale réelle. Une fois les copies regroupées, la courbe s'aplatit au départ et s'étale ensuite, ce qui change entièrement la lecture de la durée de vie du sujet.
Sur le plan opérationnel, la conséquence tient en une consigne : regrouper les copies, notifier les reprises. Une copie supplémentaire n'apporte aucune information à l'analyste et alourdit la charge de qualification. Une reprise, à l'inverse, est un signal en soi, puisqu'elle indique qu'un nouvel acteur a jugé le sujet digne de publication et qu'une nouvelle audience y est exposée.
Limites et conditions de reproductibilité
Le protocole suppose l'accès au texte intégral des exemplaires. Un corpus qui ne conserve que le titre et le chapô n'autorise ni la normalisation ni la mesure de similarité dans des conditions défendables. La distinction y reste possible à partir des seuls marqueurs non textuels, avec un taux d'erreur plus élevé qu'il faut alors mesurer et publier.
La reproductibilité impose de conserver, pour chaque exemplaire classé, la version normalisée du texte, le score de similarité obtenu, les seuils en vigueur à la date du classement et la catégorie retenue. Sans ces quatre éléments, une décision de classement ne se rejoue pas, et une série mesurée sur plusieurs mois ne se vérifie plus après un changement de seuils.
Cette note ne fournit ni volumétrie observée ni seuil numérique universel : la part de duplication d'un corpus dépend de sa composition, et l'étalonnage des seuils relève de travaux publiés à part. Elle ne traite pas davantage des chaînes de citation circulaires, où la question posée n'est plus la nature de la copie mais l'ordre réel des occurrences.
Questions fréquentes
Faut-il supprimer les copies techniques d'un corpus de veille ?
Non. Les supprimer fait perdre la trace de la diffusion et empêche de vérifier a posteriori qu'un contenu a bien circulé. La règle est de les regrouper sous un exemplaire de référence, en conservant la liste des occurrences, leurs adresses et leurs horodatages, et de ne présenter qu'un seul signal à l'analyste.
Une traduction compte-t-elle comme une reprise éditoriale ?
Elle est comptée à part. Une traduction n'ajoute pas d'élément propre, ce qui l'éloigne de la reprise, mais elle change l'audience atteinte, ce qui la distingue d'une copie. La ranger dans l'une ou l'autre catégorie fausse la mesure, dans un sens ou dans l'autre.
Comment classer un texte reformulé par un outil automatique, sans apport nouveau ?
En duplication. La similarité textuelle est basse, mais le critère décisif reste l'ajout : aucune citation nouvelle, aucune vérification, aucune source absente de l'original. Ce cas justifie à lui seul de ne pas fonder le classement sur la seule mesure de similarité.
Quel seuil de similarité retenir pour séparer les deux catégories ?
Aucun seuil universel n'est défendable : il dépend de la langue, de la longueur des textes et de la méthode de normalisation employée. Le protocole retient deux seuils étalonnés sur un échantillon annoté et impose de les publier avec la mesure qu'ils produisent.