Le dédoublonnage : l'opération la plus sous-estimée d'un dispositif de veille
Quatre familles de doublons, un seuil qui détruit de l'information quand il est trop large, et une règle qui regroupe les reprises au lieu de les supprimer.
À retenir
- Quatre familles de doublons coexistent dans un corpus de veille : la republication à l'identique, la dépêche reprise avec un titre modifié, la traduction et la reprise par un agrégateur. Elles ne se détectent pas avec les mêmes signatures.
- Une reprise n'est pas un déchet : le nombre, la langue et la chronologie des reprises forment la seule mesure directe de la diffusion d'un fait. Un dédoublonnage trop large supprime cette mesure.
- Compter les contenus et compter les évènements répondent à deux questions distinctes ; le rapport entre les deux décomptes est lui-même un indicateur d'intensité d'attention.
- La règle praticable ne supprime rien : elle regroupe les contenus en grappes, désigne un représentant explicite et conserve la trace documentée de chaque reprise.
La collecte d'un dispositif de veille est visible : on compte les sources suivies, on affiche les volumes entrants. Le tri l'est aussi, puisqu'il produit une sélection discutable. Entre les deux se glisse une opération dont on parle peu et qui décide pourtant de la forme finale du flux : le dédoublonnage. Elle consiste à reconnaître que plusieurs contenus matériellement distincts portent la même information, puis à en tirer une conséquence dans ce qui est présenté.
Sous-estimée, cette opération est celle dont les erreurs coûtent le plus cher. Minimale, elle noie l'analyste sous quarante versions d'un même communiqué. Poussée trop loin, elle efface ce que la répétition apportait, c'est-à-dire la mesure de la diffusion. Le réglage se joue entre ces deux échecs, et il n'existe aucune valeur neutre : tout seuil est une décision éditoriale.
Cette note décrit les quatre familles de doublons d'un corpus, le coût informationnel d'une fusion trop large, la différence entre un décompte de contenus et un décompte d'évènements, puis une règle applicable qui conserve la trace des reprises tout en présentant un élément unique à la lecture.
Ce que le dédoublonnage décide réellement dans une chaîne de veille
Le point de départ est une distinction souvent confondue : l'identité matérielle et l'identité informationnelle ne se recouvrent pas. Deux textes différents mot pour mot rapportent parfois le même fait, avec les mêmes chiffres et la même source primaire. À l'inverse, deux pages presque identiques diffèrent par une phrase ajoutée qui change la portée de l'information. Le dédoublonnage n'est donc pas une comparaison de fichiers : c'est un jugement sur l'unité d'information.
C'est pourquoi il ne se traite pas comme un paramètre délégué à l'infrastructure. Un seuil de similarité est un choix éditorial déguisé en réglage : il détermine ce qui apparaît une fois, ce qui apparaît dix fois, et ce qui n'apparaît jamais devant l'analyste. Une organisation qui ignore la valeur de ce seuil ignore une partie de sa propre ligne de sélection.
Les quatre familles de doublons et les signatures qui les révèlent
La redondance d'un corpus n'a pas une cause unique. Quatre familles la produisent, avec des signatures de détection et des valeurs informationnelles différentes. Les traiter indistinctement conduit soit à en manquer la majeure partie, soit à fusionner ce qui aurait dû rester séparé.
| Famille de doublon | Ce qui varie d'un exemplaire à l'autre | Ce que l'exemplaire supplémentaire apporte | Signature de détection |
|---|---|---|---|
| Republication à l'identique | L'adresse, l'horodatage, l'habillage du site | Une preuve brute de reprise, exploitable pour mesurer l'amplitude | Empreinte du texte intégral après nettoyage, comparaison exacte |
| Dépêche reprise avec titre modifié | Le titre, le chapô, la coupe finale du corps | L'angle retenu par chaque rédaction, souvent le seul écart éditorial | Similarité de blocs internes, phrase d'attaque du corps |
| Traduction | La langue entière, parfois l'ordre des paragraphes | Le franchissement d'une frontière linguistique, marqueur de portée | Alignement multilingue sur les entités, les chiffres et les dates |
| Reprise par un agrégateur | Le contexte de publication, les métadonnées, le lien de renvoi | L'entrée du fait dans un circuit secondaire de distribution | Domaine identifié comme agrégateur, lien canonique vers l'origine |
Les deux premières familles se traitent par comparaison textuelle ; les deux dernières exigent une couche sémantique. Une chaîne qui ne détecte que la republication stricte laisse passer la plus grande part du volume redondant, car la reprise avec titre modifié constitue le mode dominant de circulation d'une dépêche d'agence. La traduction échappe totalement à la comparaison de chaînes de caractères : sans rapprochement par entités nommées, chiffres et dates, un même fait apparaît autant de fois qu'il existe de langues suivies.
L'agrégateur pose un problème distinct : il republie sans produire. Le compter comme source contributrice fausse toute mesure de contribution, et le laisser remonter comme document de référence prive l'analyste du texte d'origine. L'ignorer serait une erreur symétrique : sa reprise date le moment où le fait entre dans un circuit de distribution plus large que celui de son éditeur initial.
Pourquoi un dédoublonnage trop agressif détruit de l'information
L'erreur de raisonnement la plus répandue tient en une phrase : traiter la reprise comme un déchet. Une reprise n'est pas un contenu superflu, c'est une observation. Sa date, sa langue et son éditeur constituent la mesure la plus directe de la diffusion d'un fait. Un dispositif qui ne conserve que le premier exemplaire garde la nouvelle et jette sa trajectoire.
Trois indicateurs disparaissent avec le matériau supprimé. La vitesse de propagation d'abord, lisible dans l'écart entre la publication d'origine et les reprises successives. L'étendue ensuite, mesurée par le nombre de familles éditoriales, de pays et de langues atteints. Le franchissement de seuil enfin, ce moment où un fait quitte la presse spécialisée pour entrer dans la presse généraliste : ce changement d'état ne se lit nulle part ailleurs que dans la liste des reprises.
Une reprise n'est pas un doublon à jeter : c'est la mesure de la diffusion. Supprimer les reprises revient à casser le thermomètre pour ne garder que la première prise de température.
Une fusion trop large produit un second dégât, plus discret : elle rassemble des exemplaires qui ont divergé. Deux reprises d'une même dépêche diffèrent parfois par un chiffre corrigé, une précision ajoutée ou un démenti inséré en fin de texte. Retenir arbitrairement l'un d'eux expose à garder la version périmée et à faire disparaître la correction, sans qu'aucune alerte ne le signale.
Compter les contenus ou compter les évènements : deux totaux, deux questions
Le contenu est une unité matérielle : un article, un message, une page. L'évènement est une unité informationnelle : un fait rapporté, quel que soit le nombre de textes qui le rapportent. Les deux décomptes sont légitimes et aucun ne remplace l'autre. La plupart des désaccords sur les volumes d'une veille viennent de là : deux équipes comparent un total de contenus avec un total d'évènements.
Un décompte de contenus mesure l'activité de publication autour d'un sujet : c'est un indicateur de pression médiatique, utile pour anticiper la charge de lecture. Un décompte d'évènements mesure la matière réelle : combien de choses se sont produites. Une période affichant une forte hausse du premier et une stabilité du second décrit un volume de commentaire qui gonfle sur un fond inchangé.
La conséquence opérationnelle est simple : un tableau de bord affiche les deux totaux, jamais un seul. Leur rapport, le nombre de contenus par évènement, forme un indicateur autonome dont la variation se lit comme une mesure d'intensité d'attention. Son décrochage brutal sur un sujet traduit soit une saturation, soit une défaillance de la détection de doublons.
La règle praticable : regrouper sans supprimer et désigner un représentant
Première décision : aucun contenu collecté n'est supprimé, il est assigné à un groupe que l'on appellera grappe. La grappe devient l'unité de lecture et l'unité de comptage des évènements ; ses membres restent stockés, datés et consultables. Cette inversion règle la contradiction apparente entre lisibilité du flux et conservation de la matière : ce qui est réduit, c'est l'affichage, pas le corpus.
Deuxième décision : chaque grappe désigne un représentant selon un ordre de priorité écrit à l'avance. La source primaire identifiée passe en premier ; à défaut, la publication la plus ancienne ; à défaut, la version la plus complète. Ce représentant est le seul élément présenté dans le flux, accompagné de trois éléments qui portent l'information de diffusion : un compteur de reprises, la liste des éditeurs et des langues, la date de la reprise la plus récente.
Troisième décision : le regroupement est documenté et réversible. Chaque appartenance porte son motif, empreinte identique, similarité de corps, alignement de traduction ou lien canonique d'agrégateur, ainsi qu'un niveau de confiance. Une grappe se défait dès qu'une divergence de fond apparaît entre ses membres, par exemple une correction publiée par un seul éditeur, cas qui justifie une remontée distincte plutôt qu'un enfouissement. Deux indicateurs suffisent à piloter l'ensemble : la part des contenus rattachés à une grappe de plus d'un membre, et le taux de regroupements erronés relevés en relecture.
Cette architecture est celle des dispositifs outillés. NewsCore (www.newscore.fr) regroupe les reprises multilingues d'un même fait, présente un élément unique à l'analyste, conserve le décompte des reprises et relie chaque grappe à ses documents d'origine. Le paramétrage éditorial, c'est-à-dire la définition de ce qui constitue un même évènement dans un métier donné, reste la part de l'organisation : c'est elle qui arbitre entre une lecture par contenus et une lecture par évènements selon l'usage qu'elle fait de sa veille.
Questions fréquentes
Faut-il supprimer les doublons d'un flux de veille ?
Non, il faut les regrouper. La suppression détruit la mesure de diffusion, la trace des divergences et la possibilité de vérifier le corpus après coup. Le regroupement atteint le même objectif de lisibilité, un élément par fait dans le flux, sans toucher au matériau : les membres de la grappe restent accessibles derrière le représentant.
Une traduction est-elle un doublon ?
Au sens du contenu, non : c'est un texte distinct, produit par une autre rédaction, à une autre date, pour un autre public. Au sens de l'évènement, oui : elle rapporte le même fait. La règle consiste donc à la rattacher à la grappe de l'évènement tout en la conservant comme membre identifié par sa langue, car le passage d'une langue à l'autre constitue en soi un signal de diffusion qu'aucun autre indicateur ne fournit.
Comment traiter les agrégateurs qui republient sans rien produire ?
En les marquant comme tels dans le référentiel de sources, puis en les rattachant à la grappe de l'origine lorsque le lien canonique la désigne. Ils ne sont jamais désignés représentants et sortent des mesures de contribution par source. Leur reprise reste enregistrée : elle date l'entrée du fait dans un circuit de distribution plus large.
Comment savoir si le seuil de dédoublonnage est mal réglé ?
Deux symptômes se repèrent sans instrumentation lourde. Un taux de regroupement qui progresse alors que le volume collecté reste stable indique un seuil trop large, donc des évènements distincts fusionnés. Des grappes mêlant des sujets voisins, repérées en relecture, indiquent que le critère de rapprochement repose trop sur le vocabulaire et pas assez sur les entités, les chiffres et les dates.