mercredi 7 octobre 2026
Datasets

Taux de quasi-duplication entre sites : mesurer le seuil qui change la statistique

Un jeu de données qui mesure la quasi-duplication de contenus entre domaines par empreintes de fragments et montre l'effet du seuil sur toute statistique de volume.

L'Observatoire14 août 20267 min de lecture

À retenir

  • La quasi-duplication commence là où l'égalité stricte s'arrête : des contenus reformulés qui restent le même contenu de fond.
  • Une mesure par empreintes de fragments donne un taux de recouvrement continu, converti en décision par un seuil qui n'a rien d'universel.
  • Un seuil trop bas ou trop haut fausse dans des sens opposés toute statistique de volume construite sur le corpus.

Du contenu identique au contenu presque identique

Un contenu recopié à l'identique d'un domaine à l'autre se détecte sans ambiguïté : une comparaison de hachage suffit à établir l'égalité stricte entre deux documents. Le sujet ici commence là où cette égalité s'arrête : des contenus reformulés, réordonnés, augmentés ou tronqués d'un site à l'autre, qui restent reconnaissables comme le même contenu de fond sans être identiques au caractère près.

Le jeu de données que nous avons constitué mesure ce phénomène de quasi-duplication sur un échantillon de contenus suivis sur plusieurs domaines, et documente comment le choix d'un seuil de similarité change la conclusion que l'on peut tirer d'une même mesure.

Cette zone intermédiaire concentre en pratique l'essentiel du volume de contenus republiés sur plusieurs domaines, bien plus que la copie strictement identique, plus rare et plus facilement filtrée en amont. Ignorer cette zone revient à sous-estimer largement l'ampleur réelle de la republication d'un même contenu, en ne comptant que sa forme la plus grossière.

Mesurer la similarité par empreintes de fragments

La méthode retenue découpe chaque contenu en fragments de taille fixe qui se chevauchent partiellement, puis calcule une empreinte compacte pour chacun de ces fragments. Deux contenus partagent d'autant plus d'empreintes qu'ils partagent de fragments de texte, y compris quand l'ordre global des phrases a été modifié ou que des passages ont été ajoutés ou retirés.

Cette approche par fragments est plus robuste qu'une comparaison globale du texte entier, car elle tolère les modifications locales sans perdre la trace des passages inchangés. Elle produit, pour chaque paire de contenus comparés, un taux de recouvrement d'empreintes, une mesure continue plutôt qu'une réponse binaire d'identité ou de différence.

La taille des fragments retenue influence elle-même la sensibilité de la mesure : des fragments courts détectent des similarités plus fines mais multiplient les correspondances fortuites entre contenus qui partagent un vocabulaire commun sans être liés, tandis que des fragments longs réduisent ce bruit de fond au prix d'une moindre sensibilité aux reformulations importantes. Ce paramètre doit donc être choisi et documenté au même titre que le seuil de similarité final.

Où placer le seuil

Un taux de recouvrement continu n'a d'utilité pratique que converti en décision : à partir de quel taux deux contenus doivent-ils compter comme un seul dans une statistique de volume plutôt que comme deux occurrences distinctes. Ce seuil n'a rien d'une constante universelle, il dépend de la nature du contenu suivi et de ce que la statistique en aval doit représenter.

Un seuil placé trop bas fusionne des contenus qui traitent du même sujet sans se recopier, ce qui sous-compte artificiellement la diversité réelle des publications. Un seuil placé trop haut laisse subsister comme distincts des contenus qui ne sont, de fait, qu'une reformulation l'un de l'autre, ce qui surcompte le volume et fait apparaître comme un phénomène large ce qui n'est qu'une poignée de contenus recopiés sous des habillages différents.

Le jeu de données documente plusieurs points de seuil sur le même échantillon, plutôt qu'un seuil unique recommandé, précisément parce que le choix pertinent dépend de l'usage : une étude de diversité éditoriale et une étude de propagation d'une même information n'appellent pas le même seuil sur le même corpus.

Un autre facteur complique le choix du seuil : la longueur du contenu comparé. Deux contenus longs partageant une même proportion de fragments communs qu'un couple de contenus courts n'obtiennent pas nécessairement le même degré de parenté perçue, ce qui pousse à normaliser le taux de recouvrement par la longueur plutôt qu'à appliquer un seuil brut identique quelle que soit la taille des textes comparés.

L'effet du seuil sur les statistiques de volume

L'illustration la plus directe de cet effet tient dans le comptage lui-même : un même corpus de contenus, recompté à plusieurs seuils successifs, donne des volumes de contenus distincts très différents, alors que rien n'a changé dans les contenus eux-mêmes. Toute statistique de volume qui ne précise pas le seuil de quasi-duplication retenu reste, à ce titre, incomparable à une autre statistique construite sur un seuil différent.

Cet effet se propage à toute mesure dérivée du volume : une part de couverture éditoriale exprimée en nombre de publications, une fréquence de reprise d'un sujet, une intensité de couverture, changent de valeur selon le seuil choisi, sans qu'aucune de ces valeurs ne soit fausse en elle-même. Elles répondent simplement à des définitions différentes de ce qui compte comme un contenu distinct.

Le jeu de données recommande, à défaut d'un seuil universel, une pratique de transparence méthodologique : documenter systématiquement le seuil retenu et la méthode d'empreintes utilisée à côté de toute statistique de volume, de façon à rendre deux mesures comparables entre elles, ou à expliquer pourquoi elles ne le sont pas.

Cette exigence de transparence rejoint une pratique plus large de la mesure en sciences sociales, où deux chiffres ne se comparent jamais sans que leur définition opératoire ne soit explicitée : un taux de quasi-duplication n'échappe pas à cette règle, quand bien même la méthode qui le produit repose sur un calcul automatisé plutôt que sur un codage manuel.

Ce que documente le jeu de données

L'échantillon croise, pour chaque paire de contenus comparés, le taux de recouvrement d'empreintes mesuré, une évaluation qualitative de la relation entre les deux contenus, allant de la reformulation légère à l'ajout substantiel de matière nouvelle, et le domaine d'origine de chacun. Cette structure permet de rejouer l'analyse à différents seuils sans recollecter les contenus.

www.newscore.fr applique cette mesure de similarité par empreintes de fragments à chaque contenu qu'il ingère et raccourcit ainsi le délai entre la republication d'un contenu sur un nouveau domaine et sa détection comme quasi-duplication d'un contenu déjà suivi, plutôt que comme une publication distincte.

Le jeu de données ne prétend pas non plus mesurer l'antériorité entre les deux contenus d'une paire quasi dupliquée : établir lequel des deux domaines a publié en premier relève d'une méthode distincte, fondée sur l'horodatage et non sur la similarité de contenu, hors du périmètre strict de cette étude.

Le jeu de données précise enfin que la similarité mesurée porte sur le texte, et non sur la mise en forme ou les éléments visuels qui l'accompagnent : deux contenus textuellement quasi identiques peuvent être présentés sous des habillages graphiques très différents d'un domaine à l'autre, sans que cela modifie le taux de recouvrement d'empreintes mesuré sur le texte lui-même.

Questions fréquentes

Une reformulation complète d'un contenu échappe-t-elle nécessairement à la détection de quasi-duplication ? Non, tant qu'une part suffisante de fragments structurants reste partagée entre les deux versions, la méthode par empreintes détecte encore une similarité significative, même en l'absence de phrases identiques.

Faut-il un seuil unique pour tout un dispositif de veille ? Non, le jeu de données montre au contraire qu'un seuil adapté à l'usage de la statistique produite est préférable à un seuil unique appliqué indifféremment à toute mesure de volume.

Un faible taux de recouvrement d'empreintes garantit-il l'indépendance de deux contenus ? Non, un faible taux indique seulement l'absence de recouvrement de fragments détectable par cette méthode ; deux contenus indépendants sur le fond peuvent aussi obtenir un taux faible sans lien de duplication entre eux.

Cette méthode fonctionne-t-elle sur des contenus traduits d'une langue à l'autre ? Non, telle que documentée ici, la méthode par empreintes de fragments suppose une même langue de part et d'autre ; la détection de quasi-duplication entre langues différentes relève d'un protocole distinct, non couvert par ce jeu de données.

Le seuil retenu doit-il rester identique dans le temps sur un même corpus suivi ? Pas nécessairement : si la nature des contenus suivis évolue, la longueur moyenne des textes ou leur structure par exemple, le seuil adapté à cette population peut évoluer avec elle, à condition que ce changement soit documenté au même titre que le seuil initial.

Pour approfondir