Jeu de données : les métadonnées de provenance présentes dans un corpus d'images en circulation
Quelle part des images qui circulent porte encore une métadonnée de provenance exploitable ? Composition du corpus observé, protocole de relevé, résultats par canal et limites de la mesure.
À retenir
- La métadonnée de provenance recouvre trois objets distincts : les champs descriptifs classiques, le manifeste signé cryptographiquement et le marqueur invisible inscrit dans le signal.
- Sur le corpus observé, la survie d'une métadonnée dépend beaucoup moins du fichier d'origine que du canal par lequel il a transité.
- Le retrait du marqueur visible d'un contenu généré ne retire pas les marqueurs techniques, mais il déplace le coût de la vérification vers l'analyste.
- Un relevé de provenance est un indice de qualification, jamais une preuve d'authenticité : son absence ne prouve rien.
Une image qui circule ne se réduit pas à ses pixels. Elle transporte, ou ne transporte plus, un ensemble d'informations techniques décrivant son origine : date de prise de vue, appareil ou logiciel producteur, historique d'édition, signature déposée par un modèle génératif. Ces éléments forment ce que l'on regroupe sous le terme de métadonnées de provenance. Leur présence conditionne une part importante du travail de qualification en veille, puisque leur absence renvoie l'analyste vers des méthodes indirectes, plus lentes et rarement concluantes.
Le jeu de données décrit ici porte sur un corpus d'images collectées en circulation ouverte, c'est-à-dire telles qu'un dispositif de veille les rencontre réellement : republiées, recadrées, recompressées, parfois capturées en photographie d'écran. Il ne s'agit pas d'un échantillon de fichiers sortis d'un studio ni d'un jeu de test produit en laboratoire. C'est précisément cette différence qui donne à la mesure son intérêt et qui explique l'essentiel des écarts observés.
Cette note documente ce que le corpus contient, comment le relevé a été conduit, quelles définitions ont été retenues et quelles conclusions le jeu de données autorise. Elle indique aussi, avec la même précision, ce qu'il ne permet pas de conclure. L'objectif est qu'une équipe de veille reproduise le protocole sur son propre périmètre et obtienne une base de comparaison stable dans le temps.
Ce que recouvre exactement une métadonnée de provenance
Le premier niveau est celui des champs descriptifs classiques, hérités de la photographie numérique : modèle d'appareil, réglages, horodatage, coordonnées de géolocalisation, mentions d'auteur et de droits. Ces champs sont déclaratifs. Ils sont renseignés par l'outil producteur, modifiables par n'importe quel éditeur d'image et supprimés par la plupart des chaînes de publication. Leur valeur probante est faible, mais leur valeur d'orientation reste réelle quand ils sont cohérents avec le reste du dossier.
Le deuxième niveau est celui du manifeste de provenance signé. Il consigne, dans une structure vérifiable cryptographiquement, la suite des opérations subies par le fichier : création, retouche, export, republication. La signature rend la falsification détectable, ce qui change la nature de l'information. Un manifeste absent ne signifie rien, mais un manifeste présent et valide constitue un point d'appui solide dans une chaîne de garde documentaire.
Le troisième niveau est celui du marqueur invisible, inscrit dans le signal de l'image plutôt que dans un champ annexe. Il résiste mieux aux traitements courants que les deux précédents, puisqu'il ne se trouve pas dans une zone que les plateformes nettoient par défaut. Sa lecture suppose toutefois un outil dédié et, le plus souvent, une relation avec l'organisation qui l'a inscrit. Le distinguer des deux autres niveaux est indispensable avant toute mesure sérieuse.
Composition du corpus observé et protocole de relevé
Le corpus rassemble un ordre de grandeur de quelques milliers d'images, collectées sur plusieurs semaines à partir de canaux publics : fils de réseaux sociaux, sites d'actualité généralistes et spécialisés, messageries de diffusion ouvertes, plateformes de partage de fichiers. Chaque entrée conserve son URL de collecte, sa date de capture, une empreinte de hachage du fichier et la mention du canal d'origine. Ces quatre éléments constituent le minimum d'une chaîne de garde exploitable.
Trois définitions ont été fixées avant le relevé, pour éviter que la mesure ne dérive en cours de route. Une métadonnée est dite présente si un lecteur standard la restitue sans traitement particulier. Elle est dite exploitable si elle contient une valeur non vide et cohérente avec les autres champs du même fichier. Un manifeste est dit lisible si sa structure est intacte, indépendamment de la validité de sa signature, qui fait l'objet d'un relevé distinct.
Le protocole est volontairement simple : lecture automatisée des champs, contrôle manuel d'un sous-échantillon tiré au hasard, journalisation des cas ambigus et arbitrage en double lecture. Les images identiques par empreinte sont dédoublonnées, mais les variantes recompressées d'un même visuel sont conservées séparément, car elles constituent l'objet même de l'observation : ce qui subsiste après le passage dans une chaîne de republication.
Ce que le relevé fait apparaître, canal de circulation par canal
Le premier enseignement est que le canal de transit explique davantage la survie d'une métadonnée que la nature du fichier d'origine. Un visuel produit avec des champs complets et un manifeste valide ressort de certaines plateformes entièrement dépouillé, sans intention particulière de dissimulation : la recompression et le redimensionnement automatiques suffisent. À l'inverse, un fichier téléchargé directement depuis un site éditeur conserve dans une large majorité des cas ce qu'il portait au départ.
Le second enseignement porte sur l'écart entre présence et exploitabilité. Une part non négligeable des fichiers conserve des champs techniquement présents mais vidés de leur contenu, ou renseignés par l'outil de publication plutôt que par l'outil de production. Compter les champs présents sans vérifier leur contenu conduit donc à surestimer largement la couverture réelle. Les ordres de grandeur ci-dessous distinguent systématiquement les deux notions.
| Canal de collecte | Part du corpus | Champs descriptifs exploitables | Manifeste de provenance lisible |
|---|---|---|---|
| Téléchargement direct depuis un site éditeur | environ un cinquième | majoritaire | minoritaire mais régulier |
| Fil de réseau social grand public | environ deux cinquièmes | très minoritaire | rare |
| Messagerie de diffusion ouverte | environ un cinquième | quasi nul | quasi nul |
| Plateforme de partage de fichiers | environ un dixième | variable selon l'hébergeur | minoritaire |
| Capture d'écran republiée | environ un dixième | nul par construction | nul par construction |
Retrait du marqueur visible : ce que ce choix déplace dans le relevé
Une évolution récente rend cette mesure plus utile qu'elle ne l'était. Vesper rapporte que Google offre désormais la possibilité de retirer le filigrane visible apposé sur les contenus générés par Gemini et Flow, le marqueur visible devenant optionnel tandis que les marqueurs invisibles SynthID et les métadonnées C2PA persistent. Le même article indique que ce choix est justifié par des besoins créatifs, alors que régulateurs et plateformes poussent en sens inverse, vers davantage de transparence.
Pour un dispositif de veille, la conséquence est mesurable. Tant que le filigrane visible existe, la première qualification d'un visuel se fait à l'oeil nu, sans outil, sans coût et sans délai. Sans lui, la même qualification suppose de récupérer le fichier, de le lire avec un outil adapté et d'interpréter le résultat. L'information n'a pas disparu, elle a changé de niveau technique, et donc de niveau de coût.
Le corpus illustre bien ce déplacement : les visuels ayant traversé une plateforme grand public ont perdu l'essentiel de leurs champs descriptifs, si bien que le marqueur visible constituait souvent le dernier indice accessible sans instrumentation. Sa disparition ne crée pas de trou dans la preuve, elle en concentre la charge sur une couche technique que peu d'équipes savent lire aujourd'hui de façon systématique.
Un relevé de provenance ne dit jamais qu'une image est vraie. Il dit seulement dans quel état elle est arrivée jusqu'à vous, et par où elle est passée.
Limites du jeu de données et interprétations à écarter
La première limite tient à l'échantillonnage. Un corpus collecté en circulation ouverte reflète les canaux observés, pas l'ensemble des images en circulation. Modifier la liste des sources modifie les proportions, parfois fortement. Les ordres de grandeur publiés ici valent donc pour la composition décrite plus haut, et toute comparaison suppose de reproduire d'abord la même composition de corpus, ou d'expliciter les écarts.
La deuxième limite est plus fondamentale : l'absence de métadonnée n'est pas un signal négatif. Un fichier dépouillé n'est ni suspect, ni synthétique, ni manipulé. Il a simplement traversé une chaîne technique qui nettoie par défaut. Lire un corpus de provenance comme un indicateur de véracité constitue l'erreur d'interprétation la plus fréquente, et la plus coûteuse en temps d'analyse gaspillé sur de fausses pistes.
La troisième limite concerne la stabilité temporelle. Les politiques de traitement des fichiers évoluent sans annonce sur la plupart des plateformes, ce qui déplace les résultats d'un trimestre à l'autre sans qu'aucun changement de pratique n'ait eu lieu chez les producteurs de contenus. Un relevé de provenance n'a de sens qu'en série, avec une date de mesure explicite et un protocole inchangé entre deux points.
Ce que la lecture des métadonnées change dans une chaîne de veille
L'usage le plus rentable n'est pas la vérification d'une image isolée, mais le tri. Un relevé automatisé sur un flux entrant sépare en amont les fichiers porteurs d'un manifeste lisible, qui méritent quelques minutes d'analyse, de ceux qui sont dépouillés et relèvent d'autres méthodes : recherche d'antériorité, corrélation de contexte, recoupement de témoignages. Ce tri raccourcit le délai de détection sur les visuels qui comptent.
Le second usage est la traçabilité interne. Consigner l'état de provenance au moment de la collecte, avec une empreinte de hachage, protège l'organisation contre une contestation ultérieure. Si le fichier circule ensuite sous une forme dégradée, le dossier conserve la trace de ce qui était lisible au moment où l'analyste l'a vu. Cette discipline documentaire coûte peu et vaut cher lorsqu'un différend s'ouvre.
Le troisième usage relève de l'outillage. Repérer toutes les republications d'un même visuel suppose une couverture large et continue des sources, hors de portée d'un suivi manuel. NewsCore (www.newscore.fr) couvre en continu des millions de sources, relie les occurrences d'un même contenu à travers les canaux et fait remonter les signaux pertinents en temps réel. Le relevé de provenance vient ensuite qualifier ce que la collecte a rassemblé.
Questions fréquentes
Comment savoir si une image contient encore des métadonnées de provenance ?
Il faut disposer du fichier lui-même, et non d'une capture d'écran ou d'une prévisualisation. La lecture s'effectue avec un utilitaire d'inspection de métadonnées, qui restitue les champs descriptifs et signale la présence d'un manifeste. La vérification de la signature du manifeste constitue une étape distincte, souvent plus instructive que la simple lecture des champs, car elle indique si la chaîne d'édition déclarée est cohérente.
L'absence de métadonnée signifie-t-elle qu'une image a été générée par une intelligence artificielle ?
Non, et c'est le contresens le plus répandu. La grande majorité des images dépouillées le sont parce qu'elles ont traversé une plateforme qui recompresse et nettoie les fichiers par défaut. L'absence de champs est un état par défaut de la circulation en ligne, pas un indice d'origine synthétique. Conclure autrement revient à traiter une propriété du canal comme une propriété du contenu.
Faut-il conserver les fichiers originaux ou les liens suffisent-ils pour une veille sérieuse ?
Les liens ne suffisent pas dès que la provenance entre en jeu. Une page peut être modifiée, un fichier remplacé, un compte supprimé. La conservation du fichier d'origine, accompagnée de son empreinte de hachage, de son URL et de son horodatage de collecte, constitue le socle minimal d'une chaîne de garde. Sans ces quatre éléments, un relevé de provenance ne se rejoue pas et perd sa valeur documentaire.
À quelle fréquence faut-il refaire ce type de relevé sur un périmètre de veille ?
Un rythme trimestriel constitue un compromis raisonnable pour un périmètre stable, avec un relevé supplémentaire après tout changement notable dans les canaux suivis. Ce qui compte davantage que la fréquence, c'est l'invariance du protocole entre deux points : même liste de sources, mêmes définitions de présence et d'exploitabilité, même outil de lecture. Sans cette discipline, la série mesure les changements de méthode plutôt que ceux du terrain.