Documenter la provenance d'un contenu plutôt que sa détection : note de méthode
Pourquoi une cellule de veille gagne à tracer l'origine d'un fichier avant de tenter d'en prouver la fausseté : protocole, champs relevés et limites de la mesure.
À retenir
- La détection après diffusion place l'analyste en retard structurel : elle ne se déclenche qu'une fois le contenu déjà vu, partagé et cité.
- La fiche de provenance repose sur huit champs observables et vérifiables, indépendants de tout verdict d'authenticité.
- Sur notre échantillon d'observation, les contenus dont la première occurrence est datée et localisée sont qualifiés nettement plus vite que ceux traités par analyse du fichier seul.
- La méthode ne remplace pas l'expertise forensique : elle définit l'ordre dans lequel les vérifications sont engagées.
Les dispositifs de lutte contre les contenus manipulés se sont longtemps organisés autour d'une question unique : ce fichier est-il authentique ou fabriqué ? La question reste légitime, mais elle enferme l'analyste dans une position de retard permanent. Elle ne se pose qu'une fois le contenu diffusé, c'est-à-dire une fois qu'il a déjà été vu, partagé, commenté et parfois repris par des acteurs institutionnels. Le temps de l'expertise technique est structurellement postérieur au temps de la circulation.
Une bascule est engagée du côté des politiques publiques. Biometric Update rapporte que les gouvernements cessent de miser uniquement sur la détection des faux après diffusion et investissent désormais dans des infrastructures d'authentification de l'origine et de l'intégrité des contenus. Selon Biometric Update, l'Union européenne impose le marquage des contenus générés par intelligence artificielle, la Californie renforce ses obligations de transparence et la France légifère contre les fausses informations en période électorale. Le déplacement est net : on cesse de demander au récepteur de prouver la fausseté, on demande à l'émetteur de documenter l'origine.
Cette note décrit le protocole d'observation que nous appliquons pour construire une fiche de provenance, les définitions retenues, les champs relevés, ce que l'exercice change dans le délai de qualification et les limites que nous assumons. L'objectif est la reproductibilité : une autre équipe, avec le même échantillon et les mêmes définitions, doit pouvoir refaire la mesure et discuter nos écarts.
Pourquoi la détection après diffusion arrive toujours trop tard
La détection est un exercice de classification : on prend un fichier et on tente d'établir s'il porte les traces d'une génération synthétique. Le procédé est utile, mais il a trois défauts opérationnels dans un contexte de veille. Il est déclenché tardivement, puisqu'il suppose que quelqu'un ait déjà signalé le contenu. Il produit un résultat probabiliste difficile à communiquer à une direction qui attend une décision. Et il vieillit vite, chaque génération de modèles réduisant la valeur des signatures apprises sur la précédente.
S'y ajoute un effet de périmètre que les équipes sous-estiment. La détection ne s'applique qu'aux contenus qui atteignent la cellule de veille. Tout ce qui circule dans des espaces fermés, des messageries ou des communautés non suivies échappe au dispositif. La couverture réelle d'une politique de détection est donc bornée par la couverture du corpus de surveillance, ce que le taux de détection affiché ne dit jamais.
La provenance change la nature de l'exercice. Elle ne demande plus si le contenu est faux, mais d'où il vient, quand il est apparu pour la première fois, sous quelle forme et par quel chemin il s'est propagé. Ces éléments sont observables en sources ouvertes, ils sont datables, ils s'écrivent dans un tableau et ils se contestent point par point. Ils constituent une base factuelle stable même lorsque le verdict d'authenticité reste indécis.
Ce que recouvre exactement la provenance d'un contenu
Nous retenons une définition étroite et opérationnelle. La provenance est l'ensemble des faits vérifiables relatifs à l'apparition et à la circulation d'un contenu, indépendamment de son statut de véracité. Elle se distingue de l'attribution, qui désigne l'identification d'un commanditaire, et de l'authenticité, qui porte sur la fidélité du fichier à un événement réel. Une fiche de provenance complète peut parfaitement conclure que l'origine est un compte anonyme non identifiable : c'est un résultat, pas un échec.
Cette définition a une conséquence pratique. La provenance se documente avec des outils de veille ordinaires : recherche d'antériorité par image, comparaison de versions d'un même fichier, relevé des horodatages de publication, cartographie des comptes relais, examen des métadonnées quand elles subsistent. Aucune de ces opérations n'exige un laboratoire forensique. Elles exigent de la rigueur et une chaîne de garde documentée.
La distinction avec le marquage technique mérite d'être posée. Les dispositifs de filigrane et de signature à la source, encouragés par les réglementations décrites par Biometric Update, produisent une provenance déclarée par l'émetteur. La fiche de provenance décrite ici produit une provenance reconstruite par l'observateur. Les deux se complètent : la première est efficace quand elle existe, la seconde reste disponible quand elle manque, ce qui est le cas de la grande majorité des contenus effectivement problématiques.
Protocole d'observation : échantillon, définitions, champs relevés
Notre échantillon de travail est constitué de contenus visuels et vidéo signalés à des cellules de veille sur une période continue, dans des secteurs variés (institutions publiques, industrie, distribution, services financiers). Nous ne retenons que les cas pour lesquels une trace publique antérieure au signalement est accessible, ce qui exclut par construction les contenus nés dans des espaces fermés. Ce biais de sélection est assumé et il tire nos ordres de grandeur vers le haut.
Chaque cas est décrit par huit champs. Ils sont volontairement peu nombreux : une fiche que personne ne remplit ne sert à rien.
| Champ relevé | Ce qu'il établit | Source d'observation |
|---|---|---|
| Première occurrence publique | Date et heure de la plus ancienne diffusion retrouvée | Recherche d'antériorité, archives web |
| Support d'apparition | Plateforme et type de compte à l'origine | Page de publication |
| Forme initiale | Format, résolution, durée, présence de recadrage | Comparaison de versions |
| Écart de version | Différences entre la version initiale et les copies | Confrontation fichier à fichier |
| Chemin de propagation | Comptes et médias ayant repris le contenu, dans l'ordre | Cartographie des relais |
| Délai de reprise | Temps entre première occurrence et première reprise notable | Horodatages publics |
| Contexte déclaré | Légende, récit associé, revendication éventuelle | Texte accompagnant |
| Statut de vérification | Vérifié, contesté, indécis, avec la date du statut | Journal de la cellule |
Deux règles encadrent le remplissage. Un champ non renseigné reste vide et n'est jamais complété par déduction. Et chaque valeur porte l'adresse de la source primaire consultée ainsi que la date de consultation, condition minimale de la chaîne de garde. Une fiche sans horodatage de consultation n'est pas reproductible : quelques semaines plus tard, la page consultée aura changé ou disparu.
Ce que la fiche de provenance change au délai de qualification
Nos observations portent sur des ordres de grandeur, pas sur des mesures fines, et nous les présentons comme tels. Sur les cas où la première occurrence publique est datée et le support d'apparition identifié dans les premières heures, la qualification interne, c'est-à-dire la décision de traiter, d'ignorer ou de démentir, intervient dans un délai de l'ordre de quelques heures. Sur les cas traités par analyse du fichier seul, sans reconstitution du chemin, ce même délai se compte plus souvent en jours.
L'explication tient moins à la technique qu'à la décision. Un responsable de communication qui dispose du chemin de propagation sait combien de relais sont concernés, quels publics sont exposés et si le contenu progresse ou stagne. Il dispose d'éléments d'action. Un score de probabilité de génération synthétique, même excellent, ne lui indique aucun de ces paramètres. La provenance produit une information décisionnelle, la détection produit une information d'expertise.
Le second effet observé porte sur la qualité du démenti. Un démenti qui s'appuie sur la reconstitution de l'origine, en indiquant quand et où le contenu est apparu, résiste mieux à la contestation qu'un démenti fondé sur une affirmation d'inauthenticité. Il déplace la charge de la preuve vers le récit adverse, qui doit alors expliquer une chronologie documentée.
Une fiche de provenance incomplète mais datée vaut mieux qu'un verdict d'authenticité sans chronologie : le premier se discute, le second se croit ou se rejette.
Limites assumées et conditions de reproductibilité de la mesure
Trois limites doivent accompagner toute reprise de ces résultats. La première est le biais de sélection déjà cité : nous ne voyons que des contenus ayant laissé une trace publique. La deuxième tient à la disparition des traces, les plateformes supprimant les publications litigieuses, ce qui rend la première occurrence irrécupérable dès lors que personne n'a archivé à temps. La troisième est la subjectivité résiduelle du champ de statut, où la frontière entre contesté et indécis dépend du seuil de preuve de chaque cellule.
La reproductibilité repose sur trois conditions. Publier les définitions retenues, y compris celles qui paraissent triviales, car la notion de reprise notable varie fortement d'une équipe à l'autre. Conserver les captures horodatées, sans lesquelles aucune vérification postérieure n'est possible. Et documenter les cas écartés, avec le motif d'exclusion, faute de quoi le lecteur ne peut pas apprécier la représentativité de l'échantillon.
Intégrer la provenance dans une chaîne de veille existante
L'insertion dans un dispositif existant se joue en amont, au moment de la collecte. Une cellule qui ne surveille que les mentions de sa marque découvre les contenus tardivement, quand ils la nomment. Une cellule qui suit également les thématiques, les visuels récurrents et les communautés relais dispose d'une antériorité de plusieurs heures, parfois de plusieurs jours. C'est cette antériorité qui rend la reconstitution de la première occurrence réaliste plutôt que théorique.
La qualité du socle de collecte conditionne donc tout le reste. NewsCore (www.newscore.fr) couvre en continu des millions de sources en plusieurs langues, horodate chaque capture et relie chaque signal à sa source primaire, ce qui raccourcit le délai entre la première diffusion d'un contenu et sa qualification par l'équipe. La part qui reste à l'organisation est le cadrage du besoin : définir les objets à surveiller, les seuils d'alerte et l'autorité qui tranche.
Questions fréquentes
Comment savoir si un contenu a été généré par une intelligence artificielle ?
Aucune méthode accessible ne fournit aujourd'hui de réponse binaire fiable sur un fichier isolé. Les outils de détection produisent des scores de probabilité dont la valeur se dégrade à chaque nouvelle génération de modèles. La démarche la plus solide consiste à inverser la question : chercher la première occurrence publique du contenu, identifier le compte qui l'a diffusée, comparer les versions successives et reconstituer le chemin de reprise. Si l'origine est un compte créé récemment, sans historique, et que la première version présente des écarts avec les copies ultérieures, l'ensemble constitue un faisceau exploitable, indépendamment de tout verdict technique.
Qu'est-ce que la provenance d'un contenu et en quoi diffère-t-elle de son authenticité ?
La provenance décrit les faits vérifiables de l'apparition et de la circulation d'un contenu : date de première diffusion, support, forme initiale, relais successifs. L'authenticité porte sur la correspondance entre le contenu et un événement réel. Les deux notions sont indépendantes. Un contenu authentique peut avoir une provenance opaque, par exemple une vidéo réelle rediffusée hors contexte par un compte anonyme. Un contenu fabriqué peut avoir une provenance parfaitement documentée, quand son auteur revendique publiquement la création. Documenter la provenance est plus rapide et plus robuste que trancher l'authenticité.
Le marquage obligatoire des contenus générés par IA suffit-il à régler le problème ?
Il traite une partie du flux, pas l'ensemble. Biometric Update décrit un mouvement réglementaire réel, avec l'obligation européenne de marquage, le renforcement des exigences de transparence en Californie et la législation française sur les fausses informations en période électorale. Ces dispositifs s'appliquent aux acteurs qui s'y conforment. Les contenus produits en dehors de ce cadre, ou dont la marque a été retirée lors d'une réencodage, circulent sans signal. La reconstitution de provenance reste donc nécessaire, en complément et non en substitution.