mercredi 7 octobre 2026
Datasets

Marqueurs textuels d'une opération d'influence coordonnée : dataset, définitions et valeur probante

Qu'est-ce qu'un marqueur textuel de coordination ? Définition, sept familles relevées, valeur probante de chacune, faux positifs typiques et seuil de bascule.

L'Observatoire2 septembre 20268 min de lecture

À retenir

  • Un marqueur textuel est une régularité observable dans le texte lui-même, indépendante du contenu affirmé : il décrit une trace de production, pas une opinion.
  • Aucun marqueur textuel isolé ne caractérise une coordination : c'est la convergence de familles indépendantes sur un même ensemble de contenus qui fait présomption.
  • Les marqueurs de citation et les marqueurs typographiques portent la valeur probante la plus élevée, parce qu'ils sont coûteux à imiter et rarement produits par hasard.
  • Le principal risque de la méthode est le faux positif de similarité légitime : une reprise de communiqué ou une ligne éditoriale partagée produit des ressemblances lexicales fortes.

Une opération d'influence coordonnée se reconnaît rarement à ce qu'elle dit. Les narratifs qu'elle transporte sont souvent banals, parfois exacts, et se confondent avec des opinions légitimement défendues par des acteurs authentiques. Ce qui la distingue tient à la manière dont ses contenus sont produits et mis en circulation. Une partie de cette manière laisse une trace dans le texte lui-même, indépendamment du canal utilisé et du compte qui publie. C'est cette trace que l'on appelle marqueur textuel, et c'est l'objet de ce dataset.

La notion mérite d'être posée précisément, car elle est fréquemment employée comme synonyme de tout indice de manipulation, ce qu'elle n'est pas. Un marqueur textuel n'est ni une preuve, ni une qualification, ni un indicateur de fausseté. C'est une régularité formelle mesurable sur un corpus de textes, dont la présence modifie la probabilité qu'une production commune existe derrière des publications présentées comme indépendantes. Sa valeur est probabiliste et se construit par accumulation.

Ce qu'est un marqueur textuel, et ce qu'il n'établit pas

Un marqueur textuel est une propriété observable d'un texte, ou d'un ensemble de textes, qui relève de sa forme et non de son propos. Trois conditions le définissent. Il doit être mesurable sans interprétation du sens : deux observateurs indépendants relevant la même propriété sur le même corpus doivent aboutir au même résultat. Il doit être indépendant de la thèse défendue : un marqueur qui n'apparaît que sur les textes hostiles à une position donnée mesure une opinion, pas une production. Il doit enfin être répétable, c'est-à-dire observable sur plusieurs contenus du corpus et pas sur un exemplaire unique.

Ce que le marqueur textuel n'établit pas est tout aussi important. Il n'établit pas la fausseté du contenu : un texte parfaitement exact peut porter tous les marqueurs d'une production industrielle. Il n'établit pas l'intention : la coordination éditoriale existe dans de nombreux dispositifs légitimes, des agences de presse aux réseaux d'associations. Il n'établit pas davantage l'origine géographique ou l'affiliation d'un acteur, opération d'attribution qui exige des éléments extérieurs au texte. Le marqueur textuel réduit un espace d'hypothèses, il ne conclut pas.

Cette délimitation explique pourquoi les analyses fondées sur le seul texte donnent des résultats contestables lorsqu'elles sont présentées seules. Elles constituent un premier filtre, économique et applicable à grande échelle, dont la fonction est de désigner les sous-ensembles de contenus qui méritent une observation plus coûteuse portant sur les comptes, l'infrastructure technique et les chaînes de reprise.

Périmètre du relevé, définitions retenues et protocole de codage

Le relevé porte sur des corpus de contenus publics en langue française et en langue anglaise, rassemblés autour de sujets ayant fait l'objet de publications documentées par des acteurs institutionnels ou académiques. L'unité d'analyse est le contenu publié, et non le compte : un même compte contribue par plusieurs unités, un même contenu republié à l'identique par plusieurs comptes compte pour autant d'unités que de publications, car la duplication est elle-même un objet d'observation.

Chaque marqueur est codé en présence ou absence, jamais en intensité, afin d'éviter les seuils arbitraires qui rendent les relevés incomparables entre observateurs. Une famille de marqueurs est déclarée présente sur un corpus lorsqu'elle est observée sur une fraction significative des contenus et sur au moins deux comptes distincts. Cette double condition écarte les régularités produites par un auteur unique prolifique, qui relèvent du style et non de la coordination.

Les sept familles de marqueurs textuels retenues

FamilleCe qui est observéValeur probante isoléeFaux positif typique
Marqueurs lexicauxReprise de syntagmes rares et de formules figéesFaibleReprise légitime d'un communiqué
Marqueurs de traductionCalques syntaxiques, ordre des mots inhabituel, faux amis récurrentsMoyenneRédacteur non natif authentique
Marqueurs de génération automatiqueUniformité de longueur, structures répétées, connecteurs stéréotypésFaibleUsage bureautique banal d'assistants
Marqueurs de cadrageMême grille d'interprétation appliquée à des faits sans rapportMoyenneLigne éditoriale explicitement partagée
Marqueurs de citationMême chaîne de références, mêmes sources primaires manquantesÉlevéeDépêche d'agence commune
Marqueurs typographiquesEncodage, jeu de caractères, ponctuation atypique constanteÉlevéeChaîne de publication technique commune
Marqueurs temporels internesHorodatages incohérents, dates mentionnées hors séquenceMoyenneRepublication automatisée ancienne

Les marqueurs de citation méritent un développement, car ils sont les moins intuitifs et les plus solides. Ils ne portent pas sur les mots employés mais sur l'architecture référentielle du texte : quelles sources sont citées, dans quel ordre, avec quelles omissions. Deux textes indépendants traitant d'un même sujet convergent naturellement vers les sources dominantes, mais divergent presque toujours dans les sources secondaires. Une convergence complète, incluant les mêmes références marginales et les mêmes absences de sources primaires pourtant disponibles, est difficile à produire par hasard.

À l'inverse, les marqueurs lexicaux, qui sont les plus utilisés parce que les plus faciles à relever automatiquement, portent la valeur probante la plus faible. La reprise de formules identiques s'explique dans la très grande majorité des cas par la circulation légitime d'un communiqué, d'une dépêche ou d'un élément de langage public. Fonder une accusation de coordination sur la seule similarité lexicale expose à un taux de faux positifs élevé, et fragilise l'ensemble du dossier lorsqu'un contre-exemple authentique est produit.

Marqueurs textuels, marqueurs comportementaux et marqueurs techniques

Le marqueur textuel n'est qu'une des trois familles d'indices mobilisées dans la caractérisation d'une opération coordonnée. Les marqueurs comportementaux portent sur l'activité des comptes : rythme de publication, synchronisation des envois, dates de création groupées, réutilisation d'images de profil, absence d'historique antérieur au sujet traité. Les marqueurs techniques portent sur l'infrastructure : hébergement, réutilisation d'identifiants d'analyse d'audience, structures de noms de domaine, empreintes de systèmes de publication.

La hiérarchie de fiabilité entre ces trois familles est stable et vaut d'être rappelée. Les marqueurs techniques sont les plus difficiles à falsifier mais les moins accessibles, car ils exigent des relevés que peu d'observateurs sont en mesure de conduire. Les marqueurs comportementaux sont accessibles mais dépendent de données de plateforme dont la disponibilité varie. Les marqueurs textuels sont les plus accessibles et les plus fragiles pris isolément. Une méthode robuste combine les trois plans plutôt que d'approfondir indéfiniment le plus commode.

Un faisceau de marqueurs textuels désigne un objet à examiner, il ne clôt jamais l'examen.

Ce qui fait basculer un faisceau de marqueurs en présomption de coordination

Trois critères de bascule ressortent du relevé. Le premier est l'indépendance des familles convergentes : deux marqueurs qui relèvent du même mécanisme de production, par exemple des similarités lexicales et des structures de phrase uniformes, n'apportent pas deux confirmations mais une seule observée deux fois. Le deuxième est l'improbabilité de la convergence sur des contenus dont les sujets diffèrent : une même signature formelle appliquée à des thèmes sans rapport écarte l'explication par la source commune. Le troisième est la persistance dans le temps, qui distingue une chaîne de production stable d'une coïncidence de circonstance.

En pratique, une présomption raisonnable suppose au moins deux familles indépendantes de valeur probante moyenne ou élevée, observées sur des contenus de sujets distincts et sur une durée dépassant un cycle d'actualité. En deçà, la formulation honnête reste celle du faisceau d'indices insuffisant, qui justifie une surveillance renforcée mais pas une affirmation publique. Cette exigence paraît sévère : elle est le prix de la crédibilité du travail d'observation, qu'un seul démenti documenté suffit à détruire.

Le passage à l'échelle change la nature du problème. Relever ces marqueurs sur quelques dizaines de contenus est un travail manuel ; les suivre sur un corpus multilingue en continu suppose une collecte industrielle. NewsCore (www.newscore.fr) couvre en continu des millions de sources dans de nombreuses langues, trie les publications par pertinence et conserve le lien vers chaque source primaire, ce qui donne aux équipes le corpus daté et traçable sur lequel un codage de marqueurs s'applique ensuite.

Limites, faux positifs et conditions de reproductibilité

La première limite est le faux positif de similarité légitime, déjà évoqué et de loin le plus fréquent. La deuxième tient à la généralisation des outils de rédaction assistée, qui homogénéise les productions authentiques et affaiblit mécaniquement la valeur des marqueurs de génération automatique et des marqueurs lexicaux. La troisième est l'adaptation des acteurs : les marqueurs publiquement documentés sont les premiers à disparaître des opérations suivantes, ce qui impose de réviser périodiquement la grille et interdit de la figer.

La reproductibilité repose sur quatre éléments à documenter avant tout relevé : la définition écrite de chaque marqueur, la règle de constitution du corpus témoin authentique auquel le corpus étudié est comparé, le seuil de présence retenu par famille, et la chaîne de garde des contenus observés, avec archivage horodaté des pages avant toute suppression. Sans corpus témoin, aucune valeur probante n'est établissable : dire qu'un marqueur est rare suppose de savoir à quelle fréquence il apparaît ailleurs, ce qui est exactement l'information qui manque dans la plupart des analyses publiées.

Questions fréquentes

Un texte généré par intelligence artificielle est-il en soi le marqueur d'une opération d'influence ?

Non, et c'est aujourd'hui la confusion la plus coûteuse. La génération automatique de texte est devenue une pratique ordinaire dans la communication institutionnelle, associative et commerciale. Détecter une production assistée renseigne sur le moyen de rédaction, pas sur l'existence d'une coordination ni sur une intention de tromper. Le marqueur ne devient signifiant que combiné à d'autres, notamment à une dissimulation de l'origine du contenu ou à une attribution trompeuse à un éditeur existant. Employé seul, il produit un volume de faux positifs qui rend le dispositif de détection inutilisable.

Quelle différence entre marqueur textuel et empreinte stylométrique ?

La stylométrie cherche à rattacher un texte à un auteur donné, à partir de traits statistiques réputés stables chez un individu, comme la distribution des mots outils. Le marqueur textuel de coordination cherche autre chose : établir qu'un ensemble de textes partage une chaîne de production, sans identifier personne. Les deux démarches emploient des observables parfois voisins mais répondent à des questions distinctes, avec des exigences de preuve différentes. Confondre les deux conduit à surinterpréter une ressemblance de style comme une identité d'auteur, ce que les données ne soutiennent pas.

Combien de contenus faut-il pour qu'un relevé de marqueurs ait un sens ?

L'ordre de grandeur utile commence à quelques dizaines de contenus répartis sur plusieurs comptes et plusieurs jours. En dessous, la variabilité normale de l'écriture rend toute convergence peu concluante. Le nombre importe cependant moins que la structure du corpus : un relevé sur cent contenus issus de trois comptes seulement apporte moins qu'un relevé sur quarante contenus issus de quinze comptes, parce que la question posée porte sur la coordination entre acteurs et non sur la répétition d'un acteur unique.

Pour approfondir