mercredi 7 octobre 2026
Datasets

Marquage des contenus générés par IA : quelles catégories sont visées, juridiction par juridiction

Toutes les productions synthétiques ne sont pas logées à la même enseigne. Grille de codage des catégories de contenus visées par les obligations de marquage, et méthode de relevé.

L'Observatoire20 août 20269 min de lecture

À retenir

  • Les obligations de marquage ne visent presque jamais le contenu synthétique en général : elles visent des catégories définies par l'usage et par le risque de tromperie.
  • Quatre familles reviennent partout : la représentation de personnes réelles, le champ électoral, la publicité et l'interaction avec un système automatisé.
  • Le codage doit distinguer l'obligation explicite, l'obligation indirecte par le droit existant, et le hors champ assumé, sous peine de comptages incomparables.
  • L'inventaire se rejoue avec sept colonnes par couple juridiction et catégorie, et il se réactualise au rythme des textes, pas des annonces.

Le débat public sur le marquage des contenus générés par intelligence artificielle se tient le plus souvent au niveau du principe : faut-il signaler qu'un contenu est synthétique. La question opérationnelle est ailleurs. Les textes qui imposent un marquage ne visent presque jamais la production synthétique en bloc. Ils désignent des catégories de contenus, définies par ce qu'elles représentent, par le contexte dans lequel elles circulent et par le risque de tromperie qu'elles portent. Recenser ces catégories plutôt que les textes produit une information utilisable par une organisation qui publie.

Ce jeu de données propose une grille de codage des catégories de contenus visées par des obligations de marquage, et le protocole qui permet de la remplir sans surinterpréter les textes. Le mouvement de fond a été documenté par Biometric Update : les gouvernements cessent de miser uniquement sur la détection des faux après diffusion et investissent dans des infrastructures d'authentification de l'origine et de l'intégrité des contenus. L'Union européenne impose le marquage des contenus générés par intelligence artificielle, la Californie renforce ses obligations de transparence, et la France légifère contre les fausses informations en période électorale.

L'article décrit ce que le jeu de données mesure, la typologie retenue, la grille de sept colonnes, la répartition observée, les conséquences pratiques et les limites de l'exercice.

Ce que le jeu de données mesure, et ce qu'il ne mesure pas

L'unité d'observation n'est ni le texte de loi ni le pays, mais le couple formé par une juridiction et une catégorie de contenus. Un même texte alimente donc plusieurs lignes, et une même catégorie apparaît autant de fois qu'il existe de juridictions codées. Cette convention est ce qui rend possible la comparaison : elle évite d'additionner des obligations de portées très différentes sous le prétexte qu'elles figurent dans le même instrument juridique.

Le jeu de données ne porte aucune appréciation de conformité et ne remplace en aucun cas une analyse juridique. Il enregistre une présence ou une absence d'obligation déclarée, telle qu'elle ressort de la lecture du texte publié, avec la référence permettant à un tiers de la vérifier. Il ne mesure pas non plus l'effectivité : savoir si une obligation est appliquée, contrôlée ou sanctionnée relève d'un autre relevé, fondé sur des décisions et non sur des textes.

Une troisième exclusion s'impose : les recommandations non contraignantes, chartes sectorielles et engagements volontaires ne sont pas codés comme obligations. Confondre les deux registres est l'erreur la plus fréquente dans les comparatifs qui circulent.

La typologie des catégories de contenus retenue

Huit catégories couvrent l'essentiel de ce que visent les textes recensés. La première est la représentation synthétique de personnes réelles identifiables, cœur historique du sujet. La deuxième est le contenu à finalité électorale ou politique. La troisième est la communication commerciale et publicitaire. La quatrième est l'interaction directe avec un système automatisé, lorsque l'utilisateur pourrait croire converser avec un humain. La cinquième est le contenu d'information à prétention factuelle.

Les trois dernières catégories sont plus hétérogènes et plus discutées. La sixième regroupe les contenus destinés aux mineurs ou diffusés dans des espaces qui leur sont dédiés. La septième couvre les contenus à caractère sexuel produits sans consentement. La huitième réunit les usages artistiques, satiriques et de fiction, qui apparaissent dans les textes le plus souvent comme exceptions plutôt que comme obligations, et dont le codage exige donc une convention explicite.

Cette typologie est construite par l'usage et non par la technique : deux contenus produits par le même modèle relèvent de deux catégories différentes selon leur destination. Un découpage fondé sur la technique de génération serait plus stable mais sans lien avec ce que les textes encadrent.

La grille de codage : sept colonnes par couple juridiction et catégorie

ColonneCe qu'elle enregistreValeurs possibles
JuridictionEspace normatif de rattachementUnion, État, entité fédérée
Catégorie de contenuFamille d'usage viséeHuit catégories de la typologie
RégimeNature de l'exigenceExplicite, indirecte, hors champ
Support du marquageOù la mention doit figurerVisible, incorporée au fichier, les deux
Débiteur de l'obligationQui doit marquerProducteur, diffuseur, plateforme
Exceptions déclaréesCas exclus par le texteListe ouverte, citée littéralement
Référence et dateTraçabilité du codageRéférence du texte, date de consultation

La colonne la plus délicate est celle du régime. L'obligation explicite se lit directement dans le texte. L'obligation indirecte résulte de l'application de règles préexistantes, en matière de publicité trompeuse, de droit à l'image ou de protection des données, qui produisent un effet de marquage sans nommer l'intelligence artificielle. Le hors champ assumé désigne les cas où le texte a expressément écarté la catégorie. Fusionner ces trois valeurs en un simple oui ou non détruit la comparabilité du jeu de données.

La colonne du débiteur est celle qui intéresse le plus les organisations. Selon les textes, l'obligation pèse sur celui qui produit le contenu, sur celui qui le diffuse, ou sur l'intermédiaire technique qui l'héberge. Une organisation qui publie des contenus produits par des prestataires se retrouve donc débitrice dans certaines configurations et pas dans d'autres, ce qui commande directement la rédaction de ses contrats.

Répartition observée et lecture d'ensemble

La lecture transversale fait apparaître un noyau dur et une périphérie. Le noyau dur rassemble quatre catégories présentes dans la quasi-totalité des juridictions codées : la représentation de personnes réelles, le champ électoral, la publicité et l'interaction avec un système automatisé. Ces quatre familles concentrent l'essentiel des obligations explicites, ce qui s'explique simplement : ce sont les usages où la tromperie produit un dommage identifiable et un intérêt à agir clairement attribuable.

La périphérie est bien plus dispersée. Les contenus d'information, les contenus destinés aux mineurs et les usages artistiques relèvent selon les juridictions de l'obligation explicite, du régime indirect ou de l'exception. Cette dispersion n'est pas un désordre passager : elle traduit des arbitrages différents entre transparence et liberté de création, arbitrages qui ne convergent pas spontanément.

Le mouvement documenté par Biometric Update éclaire cette structure. Le déplacement de la détection après diffusion vers l'authentification à l'origine change la nature de l'obligation : marquer devient une opération à la production, incorporée au fichier, plutôt qu'un examen a posteriori. Cela déplace mécaniquement la charge vers le producteur, et cela rend l'obligation vérifiable, ce que la détection ne permettait pas de façon fiable.

Une obligation de marquage ne se lit pas correctement si l'on ignore trois choses : quelle catégorie de contenu est visée, qui doit apposer la marque, et où cette marque doit se trouver.

Ce que ce jeu de données change pour une organisation qui publie

La première conséquence est un travail de cartographie interne, symétrique de la grille. Il s'agit de recenser les contenus que l'organisation produit ou diffuse et de les rattacher aux huit catégories. L'exercice prend quelques jours et révèle presque toujours des productions oubliées : visuels de campagne, assistants conversationnels sur les canaux de relation client, illustrations de supports commerciaux, voix de synthèse dans les contenus audio.

La deuxième conséquence porte sur la traçabilité de la production. Si le marquage se joue à l'origine, l'organisation doit savoir quels contenus ont été produits avec quel outil, et conserver cette information. Cela suppose une chaîne de garde documentaire à l'intérieur même de la chaîne de production, là où la plupart des dispositifs ne conservent aujourd'hui que le fichier final.

La troisième conséquence est une veille réglementaire dédiée, distincte de la veille technologique sur l'intelligence artificielle. Les deux évoluent à des rythmes différents et n'intéressent pas les mêmes équipes. Sur ce terrain, l'outillage de surveillance fait la différence : NewsCore (www.newscore.fr) couvre en continu des millions de sources dans de nombreuses langues, trie les signaux par intelligence artificielle et relie chaque alerte à sa publication d'origine, ce qui raccourcit le délai entre la parution d'un texte et son arbitrage interne.

Limites du relevé et conditions de reproductibilité

La première limite est celle de toute lecture de texte : le codage repose sur une interprétation, et une interprétation se discute. La parade retenue est la citation littérale des exceptions déclarées dans la sixième colonne, qui permet à un lecteur de contester le codage sur pièces plutôt que sur impression. La deuxième limite est linguistique : coder un texte dans sa langue d'origine est indispensable, une traduction non officielle déplaçant régulièrement le sens des termes.

La troisième limite est temporelle et elle est structurelle dans ce domaine. Les textes évoluent, les périodes transitoires décalent l'entrée en vigueur, et les annonces politiques précèdent souvent les obligations de plusieurs trimestres. Un jeu de données non daté sur ce sujet est trompeur par construction, ce qui impose la septième colonne et interdit de reprendre un chiffre global sans sa date de consultation.

La reproductibilité tient à trois publications conjointes : la liste des textes codés avec leurs références, la convention de rattachement des catégories, et le journal des modifications d'une campagne à l'autre. Le rythme recommandé est semestriel, avec une reprise ciblée dès qu'un texte entre en application ou qu'une entité fédérée adopte un régime propre, situation fréquente et qui produit l'essentiel des écarts observés.

Questions fréquentes

Quels contenus générés par IA doivent obligatoirement être signalés ?

Les régimes recensés convergent sur quatre familles : les représentations synthétiques de personnes réelles identifiables, les contenus à finalité électorale, la communication commerciale, et les interactions où l'utilisateur pourrait croire échanger avec un humain. En dehors de ce noyau, les réponses divergent selon les juridictions et selon la finalité du contenu. Une organisation qui publie dans plusieurs pays doit donc raisonner par catégorie de production et non par outil de génération.

Le marquage doit-il être visible par le lecteur ou incorporé au fichier ?

Les deux formes coexistent et ne remplissent pas la même fonction. La mention visible informe le lecteur au moment de la consultation et disparaît dès qu'un contenu est recadré ou recopié. La marque incorporée au fichier survit à une partie des manipulations et se vérifie par un tiers, mais elle reste invisible pour l'utilisateur ordinaire. Les régimes les plus récents tendent à exiger les deux, ce qui est cohérent avec le déplacement vers l'authentification à l'origine.

Qui porte la responsabilité du marquage lorsqu'un prestataire produit le contenu ?

Cela dépend du régime applicable et de la colonne du débiteur. Dans plusieurs configurations, l'obligation pèse sur celui qui met le contenu à disposition du public, indépendamment de son auteur matériel. La conséquence pratique est contractuelle : il revient au donneur d'ordre d'exiger de son prestataire la déclaration des outils utilisés et la conservation des éléments de traçabilité, faute de quoi il se retrouve dans l'incapacité de démontrer la conformité de ce qu'il publie.

À quelle fréquence faut-il réactualiser ce type de relevé ?

Un rythme semestriel constitue un bon compromis, complété par des reprises ciblées lors des entrées en vigueur. Suivre les annonces au fil de l'eau produit beaucoup de bruit pour peu de conséquences juridiques immédiates, alors que suivre les publications officielles et les périodes transitoires donne une visibilité suffisante pour ajuster les processus de production.

Sources

Pour approfondir