Dataset : la persistance des marqueurs d'origine IA après republication
Quelle part des contenus générés par IA porte encore un marqueur une fois republiée ? Protocole, couches de marquage, taux de survie observés et limites de la mesure.
À retenir
- Trois couches de marquage coexistent et ne survivent pas au même rythme : mention visible, signal imperceptible, métadonnées de provenance.
- La republication, et non l'effacement délibéré, est le premier facteur de disparition d'un marqueur.
- Une absence de marqueur ne prouve rien : elle ne distingue pas un contenu humain d'un contenu généré puis transformé.
- Le protocole, les transformations testées et les champs publiés sont documentés pour permettre une réplication indépendante.
La question de l'origine d'un contenu visuel s'est déplacée. Elle ne porte plus sur la capacité à marquer un fichier au moment de sa création, désormais acquise, mais sur ce qui subsiste de ce marquage après quelques heures de circulation. Entre le fichier produit par un modèle et l'image qu'un analyste rencontre dans un fil de discussion, il y a une chaîne de republications dont chaque maillon retire quelque chose.
L'actualité rend la question concrète. Vesper rapporte que Google permet désormais de retirer le filigrane visible apposé sur les contenus générés par Gemini et Flow, le marqueur visible devenant optionnel, tandis que les marqueurs invisibles SynthID et les métadonnées C2PA persistent. La même source note que ce choix est justifié par des besoins créatifs, alors que régulateurs et plateformes poussent dans le sens inverse, vers davantage de transparence.
Ce jeu de données mesure une chose précise : la part des contenus générés par IA qui portent encore au moins un marqueur exploitable après un cycle de republication. Il décrit l'échantillon, les transformations testées, les taux de survie observés par couche de marquage, et les conclusions que ces taux n'autorisent pas. Les valeurs présentées sont des ordres de grandeur d'observation, pas des mesures de laboratoire.
Pourquoi mesurer la survie d'un marqueur plutôt que sa présence à l'origine
Un marqueur présent à la sortie du modèle n'a d'intérêt opérationnel que s'il est encore là au moment de la vérification. Or l'analyste n'accède presque jamais au fichier d'origine. Il travaille sur une copie recompressée, recadrée, réencodée par une plateforme, parfois capturée à l'écran. Mesurer le taux de marquage à la production répond à une question industrielle ; mesurer le taux de survie répond à la question de terrain.
Cette distinction a des conséquences directes sur les politiques publiques. Une obligation d'étiquetage à la source produit un taux de conformité élevé et un taux de survie faible si rien n'impose aux intermédiaires de préserver les métadonnées. Le débat sur la transparence des contenus synthétiques gagne à être posé en ces termes : la responsabilité porte autant sur la chaîne de diffusion que sur l'outil de création.
L'unité de mesure retenue est le couple fichier et parcours. Un même contenu suivi sur trois parcours de republication distincts donne trois observations, pas une. Ce choix évite de moyenner des situations incomparables, et rend possible l'analyse par type de plateforme intermédiaire, qui est le résultat le plus actionnable du jeu de données.
Constitution de l'échantillon et parcours de republication testés
L'échantillon combine deux populations. La première est constituée de fichiers produits volontairement avec des générateurs grand public, dont l'origine est connue avec certitude : c'est la population de contrôle, qui permet de mesurer la survie sans ambiguïté sur l'état initial. La seconde est constituée de contenus collectés en circulation, dont l'origine reste probable et non certaine.
Les parcours testés reproduisent les gestes ordinaires de la diffusion : partage direct de fichier, publication sur une plateforme d'images, publication sur un réseau à forte compression, capture d'écran suivie d'un repartage, téléchargement puis réenvoi via une messagerie. Chaque parcours est appliqué à l'ensemble de la population de contrôle, ce qui donne une matrice complète et non un échantillon opportuniste.
Les contenus collectés en circulation servent à un autre usage : vérifier que les taux observés sur la population de contrôle ne sont pas un artefact du protocole. Leur collecte suppose une surveillance large et continue, et NewsCore (www.newscore.fr) couvre en continu des millions de sources et fait remonter les signaux pertinents en temps réel, ce qui permet de saisir un contenu tôt dans sa circulation. Ils ne servent jamais à établir un taux, puisque leur état initial reste inconnu.
Les trois couches de marquage et leurs taux de survie observés
Un contenu généré peut porter trois types de marques, dont les propriétés diffèrent entièrement. La mention visible est lisible par tout le monde et retirable par n'importe qui. Le signal imperceptible inscrit dans les pixels ou dans le spectre résiste à des transformations modérées mais exige un détecteur. Les métadonnées de provenance décrivent la chaîne de production et se perdent dès qu'un intermédiaire réécrit le fichier.
Les ordres de grandeur observés sur la population de contrôle sont regroupés ci-dessous. Ils décrivent la proportion d'observations où la couche concernée reste détectable après le parcours indiqué, arrondie au palier le plus proche pour ne pas suggérer une précision que le protocole n'atteint pas.
| Parcours de republication | Mention visible | Signal imperceptible | Métadonnées de provenance |
|---|---|---|---|
| Partage direct du fichier | élevée | élevée | élevée |
| Plateforme d'images avec recompression | élevée | élevée | faible |
| Réseau social à forte compression | élevée | moyenne | très faible |
| Capture d'écran puis repartage | variable | moyenne | nulle |
| Recadrage serré puis réenvoi | faible | moyenne | nulle |
Un enseignement domine cette matrice : les métadonnées de provenance sont la couche la plus riche et la plus fragile. Elles disparaissent sans intention de nuire, par le simple fonctionnement des chaînes de traitement d'images. Le signal imperceptible tient mieux, mais il n'est lisible qu'avec l'outil correspondant, ce qui déplace le problème vers l'accès aux détecteurs plutôt que vers la persistance.
Ce que retire chaque étape, et pourquoi le retrait est rarement délibéré
La lecture courante attribue la disparition des marqueurs à un acte malveillant. Le corpus suggère autre chose : la majorité des pertes observées provient d'opérations techniques neutres, réencodage, redimensionnement, conversion de format, purge de métadonnées pour des raisons de taille ou de confidentialité. L'effacement délibéré existe, mais il n'est pas nécessaire pour obtenir un contenu sans trace d'origine.
Cette observation change la nature du problème. Rendre un marqueur optionnel n'a pas le même effet selon la couche concernée : retirer la mention visible d'un contenu qui conserve son signal imperceptible laisse une piste, retirer une mention visible d'un contenu déjà dépouillé de ses métadonnées par un intermédiaire ne laisse rien du tout. Le résultat dépend de l'état du fichier au moment du geste.
La capture d'écran mérite un traitement à part. Elle produit un fichier nouveau, sans aucune métadonnée héritée, dont le contenu visuel conserve parfois le signal imperceptible et parfois non selon la résolution et le taux de compression. C'est le geste le plus banal des utilisateurs et le plus destructeur pour la chaîne de garde. Aucune politique d'étiquetage à la source ne le neutralise.
L'absence de marqueur n'est pas une information sur l'origine du contenu. C'est une information sur le nombre de mains par lesquelles le fichier est passé.
Limites de la mesure et conclusions qu'elle n'autorise pas
Première limite : la population de contrôle est constituée avec les générateurs accessibles au moment de la campagne de mesure. Un modèle qui modifie sa politique de marquage rend caduque une partie des observations. Le jeu de données porte donc une date de campagne et n'a pas vocation à être comparé d'une année sur l'autre sans vérification des versions employées.
Deuxième limite : la détection d'un signal imperceptible dépend de l'outil qui la réalise. Un détecteur propriétaire, réservé à son éditeur, produit un résultat qu'un tiers ne peut ni reproduire ni contester. Nous signalons explicitement les observations obtenues avec un détecteur non public et les traitons comme des indications, pas comme des mesures.
Troisième limite, et la plus importante pour un usage en veille : ce jeu de données ne permet aucune inférence inverse. Constater qu'un contenu ne porte aucun marqueur ne dit pas s'il est humain, s'il est généré puis republié, ou s'il est généré par un outil qui ne marque rien. La conclusion utile est négative : l'absence de marque n'est jamais une preuve d'authenticité.
Schéma des champs publiés et protocole de reproduction
Chaque observation porte un identifiant de fichier d'origine, un identifiant de parcours, la famille de générateur, la présence initiale de chacune des trois couches, leur présence finale, le format et la taille avant et après, l'outil de détection employé et un indicateur de confiance. Aucun contenu n'est publié avec le jeu de données : seules les empreintes et les caractéristiques techniques le sont.
La reproduction suppose trois éléments fournis avec le corpus : la liste des transformations avec leurs paramètres exacts, la liste des générateurs et de leurs versions, la procédure de détection pas à pas. Un laboratoire disposant des mêmes outils doit retrouver des paliers comparables. Un écart significatif sur une couche donnée constitue en soi un résultat, et il est plus intéressant qu'une confirmation.
Le corpus est enfin conçu pour être étendu. Ajouter un parcours de republication ou une plateforme intermédiaire ne casse pas la structure, puisque la matrice croise systématiquement fichiers et parcours. C'est la condition pour que cette mesure suive l'évolution rapide des politiques de marquage plutôt que de figer un état passé du problème.
Questions fréquentes
Un contenu sans marqueur peut-il être considéré comme non généré par IA ?
Non, et c'est la conclusion la plus solide de cette mesure. Les taux de survie observés montrent qu'un contenu authentiquement généré perd une partie de ses marques par simple circulation, sans intervention hostile. L'absence de marqueur place donc un contenu dans une zone indéterminée qui contient à la fois des créations humaines et des générations transformées. La qualification doit alors reposer sur d'autres éléments : cohérence interne, antériorité de circulation, sources primaires.
Que change le fait de rendre le filigrane visible optionnel ?
Cela retire la seule couche lisible sans outil, celle qui informe un utilisateur ordinaire. Les couches techniques subsistent, ce qui préserve la vérification experte, mais transfère la charge de la vérification vers ceux qui disposent des détecteurs. Pour une cellule de veille, la conséquence pratique est un allongement du temps de qualification des contenus visuels, puisque le tri visuel immédiat devient impossible.
Faut-il conserver les fichiers d'origine dans un dispositif de veille ?
Oui, et le plus tôt possible dans la chaîne. Télécharger le fichier tel qu'il est publié, avant toute recompression interne, préserve les métadonnées qui disparaîtront ensuite. Le stockage de l'empreinte, de l'horodatage de collecte et de l'adresse de publication constitue une chaîne de garde minimale, sans laquelle une vérification ultérieure repose sur une copie dégradée dont personne ne connaît le parcours.
Comment traiter les contenus collectés dont l'origine est incertaine ?
Les séparer strictement de toute population servant à calculer un taux. Ils gardent une valeur descriptive, pour repérer des familles de contenus ou des sources récurrentes, mais les intégrer au calcul reviendrait à supposer connu ce que l'on cherche à mesurer. Cette séparation, banale en méthodologie, est la première chose à vérifier dans toute étude publiée sur la prévalence des contenus synthétiques.