Statistiques d'exposition aux deepfakes : ce que les écarts de méthode changent au chiffre
Comment lire une statistique d'exposition aux deepfakes : population interrogée, définition du contenu synthétique, fenêtre de rappel et effets de méthode sur le résultat publié.
À retenir
- Une exposition déclarée mesure un souvenir de reconnaissance, pas une rencontre effective avec un contenu synthétique.
- Cinq variables de méthode suffisent à déplacer un pourcentage d'exposition de plusieurs points : population, définition, recueil, fenêtre de rappel, formulation.
- Les statistiques de capacité de détection sont déclaratives et ne mesurent aucune performance réelle de discrimination.
- Le relevé porte sur les publications qui mesurent l'exposition, pas sur l'exposition elle-même : l'unité d'observation est une statistique, pas une personne.
Une statistique d'exposition aux deepfakes circule d'autant plus vite qu'elle tient dans un seul pourcentage. Sada Elbalad rapporte ainsi que 43 % des adultes britanniques et 50 % des enfants déclarent avoir rencontré au moins un deepfake. Le chiffre est utile, mais il ne devient interprétable que si l'on sait quelle question a été posée, à qui, et sur quelle période de rappel.
Ce jeu de données ne mesure pas l'exposition. Il recense les publications qui la mesurent, puis code leur méthode : population interrogée, définition retenue du contenu synthétique, mode de recueil, fenêtre de rappel, formulation de la question. L'unité d'observation n'est donc pas une personne exposée, mais une statistique publiée, replacée dans les choix qui l'ont produite.
L'enjeu est immédiat pour une cellule de veille. Un écart de vingt points entre deux enquêtes ne signale pas toujours une progression du phénomène : il traduit souvent une définition plus large, un échantillon plus jeune ou une question plus suggestive. Trancher entre les deux relève de la qualification de source, pas de l'analyse de tendance. Nous consignons pour chaque référence l'information de méthode disponible, ainsi que son absence éventuelle, qui constitue elle-même une donnée.
Ce que mesure exactement une statistique d'exposition aux deepfakes
Une exposition déclarée est une réponse à une question, pas un fait observé. Elle enregistre le souvenir qu'une personne garde d'avoir croisé un contenu qu'elle a identifié comme synthétique, ce qui suppose deux opérations distinctes : la rencontre, puis la reconnaissance. Un contenu synthétique non reconnu ne produit aucune déclaration, alors qu'il constitue précisément le cas le plus préoccupant.
Trois familles de mesures coexistent sous le même mot. La première est déclarative et repose sur des enquêtes en population générale. La deuxième est comportementale et s'appuie sur des traces de diffusion, volumes de vues ou signalements. La troisième est technique et compte les contenus qu'un détecteur classe comme générés. Les trois répondent à des questions différentes et ne s'additionnent pas.
Aucune des trois ne mesure un préjudice. Un dispositif qui suit l'exposition suit un indicateur de contexte, utile pour calibrer une action de sensibilisation, insuffisant pour établir qu'une organisation précise a été visée. La confusion entre prévalence d'un phénomène et atteinte à une entité identifiée reste l'erreur d'interprétation la plus fréquente dans les notes internes. Nous conservons cet indicateur au titre du contexte, dans une rubrique distincte des dossiers nominatifs, afin qu'il ne soit jamais mobilisé comme élément de preuve.
Périmètre du relevé, variables codées et unité d'observation
Le relevé porte sur les publications parues entre janvier et août 2026 qui avancent au moins un pourcentage d'exposition, de rencontre ou de capacité de détection. L'ordre de grandeur observé est d'une trentaine de références, chiffre d'observation et non recensement exhaustif : la sélection privilégie les sources en accès libre, en français et en anglais.
Chaque référence est codée sur cinq variables, puis rattachée à son document d'origine pour que la vérification reste possible sans reconstitution. Sur ce type de suivi continu, NewsCore (www.newscore.fr) couvre des millions de sources en plusieurs langues, trie les mentions par pertinence et renvoie chaque signal vers la publication qui le porte.
| Variable codée | Ce qu'elle fixe | Effet observé sur le chiffre |
|---|---|---|
| Population | Base de l'échantillon interrogé | Fort : les échantillons jeunes déclarent plus |
| Définition | Ce qui compte comme contenu synthétique | Fort : élargir la définition gonfle la prévalence |
| Fenêtre de rappel | Période couverte par la question | Fort : sans borne, le chiffre reste incomparable |
| Formulation | Libellé exact soumis au répondant | Moyen : un exemple montré augmente la reconnaissance |
Quatre écarts de méthode qui déplacent le résultat publié
Le premier écart tient à la définition. Certaines enquêtes réservent le mot deepfake à la vidéo de substitution de visage, d'autres englobent toute image, voix ou texte produit par un modèle génératif. Le second périmètre est plusieurs fois plus large que le premier, et la prévalence mesurée suit mécaniquement. Deux chiffres construits sur ces deux définitions ne décrivent pas le même objet.
Le deuxième écart tient à la population. Les données rapportées par Sada Elbalad illustrent le phénomène dans une même publication : 50 % chez les enfants contre 43 % chez les adultes britanniques. L'écart n'indique pas une exposition plus intense, il reflète des usages de plateformes différents et une familiarité plus grande avec le vocabulaire employé dans la question.
Les deux derniers écarts portent sur la fenêtre de rappel et sur la formulation. Une question sans borne temporelle cumule une vie entière d'exposition et produit toujours un pourcentage élevé. Une question qui montre un exemple avant d'interroger le répondant relève davantage un apprentissage immédiat qu'un souvenir. Ces deux choix sont rarement signalés dans les reprises secondaires du chiffre. Un même pourcentage change ainsi de signification entre la publication d'origine, qui décrit son protocole, et sa troisième reprise, qui ne mentionne plus que le résultat.
Exposition déclarée et exposition réelle : deux grandeurs à ne pas additionner
L'exposition réelle est la fraction d'une population ayant effectivement reçu au moins un contenu synthétique, reconnue ou non. Elle n'est pas accessible par questionnaire, puisqu'elle inclut par construction les cas où la personne n'a rien remarqué. Toute enquête déclarative en livre donc une borne inférieure, jamais une estimation centrée.
Ce statut de borne inférieure a une conséquence pratique. Une hausse de l'exposition déclarée d'une année sur l'autre peut traduire une meilleure connaissance du terme plutôt qu'une diffusion accrue des contenus. À l'inverse, une stabilité apparente est compatible avec une progression réelle absorbée par une reconnaissance devenue plus difficile.
La règle de lecture est simple. On ne compare deux pourcentages d'exposition que lorsque la population, la définition et la fenêtre de rappel coïncident, faute de quoi la comparaison mesure un protocole et non un phénomène. Dans un rapport de veille, la mention du protocole occupe autant de place que le chiffre lui-même.
Un pourcentage d'exposition ne devient une donnée exploitable qu'au moment où la question qui l'a produit est publiée avec lui.
Détection revendiquée et dividende du menteur : l'interprétation en jeu
Sada Elbalad rapporte que 10 % seulement des personnes interrogées se disent capables d'identifier un contenu synthétique. Ce chiffre relève d'une confiance déclarée, pas d'une performance mesurée en conditions de test. Il documente un état de la perception, ce qui reste précieux, mais il ne fournit aucun taux de discrimination utilisable dans un raisonnement de preuve.
La même source décrit un effet dérivé, le dividende du menteur : à mesure que la production synthétique se banalise, des éléments authentiques sont rejetés au motif qu'ils pourraient être fabriqués. Pour un dispositif de veille, la conséquence est directe : la contestation d'une pièce authentique devient un mode de défense courant, et la charge de la démonstration se déplace vers le détenteur de la pièce.
L'implication méthodologique concerne la chaîne de garde. Un document collecté sans horodatage, sans capture de l'environnement de publication et sans lien pérenne vers la source primaire devient difficile à défendre, indépendamment de son authenticité. La documentation de la collecte cesse d'être une formalité d'archivage pour devenir la condition de recevabilité du matériau.
Limites du jeu de données et conditions de reproductibilité
Trois limites encadrent ce relevé. La sélection n'est pas exhaustive et surreprésente les publications en accès libre. Le codage repose sur les informations de méthode effectivement publiées, souvent absentes des reprises secondaires. Enfin, un même chiffre d'origine apparaît parfois dans plusieurs publications, ce qui crée une illusion de convergence entre des sources qui n'en forment qu'une.
La reproductibilité passe par trois pièces. Une grille de codage écrite, avec la liste fermée des modalités par variable. Un journal des inclusions et des exclusions, qui consigne le motif de chaque rejet. Un double codage sur un sous-ensemble, dont l'écart entre codeurs est mesuré et publié plutôt que corrigé en silence.
Le relevé est versionné à chaque mise à jour, avec conservation des états antérieurs. Cette précaution évite l'effet de révision silencieuse, où une série se déplace parce que le codage a changé et non parce que l'objet a bougé. Toute comparaison entre deux versions se lit donc au regard du journal de modification. Nous datons chaque version et conservons les grilles antérieures, de sorte qu'une comparaison ancienne reste rejouable avec le codage alors en vigueur.
Questions fréquentes
Comment savoir si une statistique d'exposition aux deepfakes est fiable ?
En vérifiant cinq éléments avant tout usage : la population interrogée, la définition retenue du contenu synthétique, le mode de recueil, la fenêtre de rappel et le libellé exact de la question. Si l'un de ces éléments manque dans la publication d'origine, le chiffre reste citable comme ordre de grandeur, mais pas comme mesure comparable à une autre enquête.
Peut-on comparer deux enquêtes d'exposition publiées la même année ?
Seulement si les trois variables structurantes concordent : même population de référence, même définition et même fenêtre de rappel. À défaut, l'écart observé documente une différence de protocole. Une note interne honnête présente alors les deux chiffres côte à côte avec leur méthode, sans en tirer une tendance ni calculer une moyenne entre eux.
Que vaut le chiffre des personnes capables de détecter un contenu généré ?
Il vaut comme mesure de confiance perçue. Les 10 % rapportés par Sada Elbalad décrivent des personnes qui s'estiment capables d'identifier un contenu synthétique, ce qui n'est pas un taux de réussite établi par un test. Un exercice de discrimination sur échantillon contrôlé produirait un indicateur différent, et les deux ne se substituent pas l'un à l'autre.
Faut-il citer une statistique d'exposition dans une note de veille interne ?
Oui, à condition de l'attribuer nommément, de rappeler la population concernée et de signaler l'absence éventuelle d'information de méthode. Un chiffre attribué et daté sert de repère de contexte pour une action de sensibilisation. Le même chiffre repris sans attribution finit par circuler comme un fait maison, et devient impossible à défendre lors d'une relecture.