mercredi 7 octobre 2026
Notes de méthode

Lire un taux de précision : note de méthode sur les détecteurs de vidéos synthétiques

92 %, 87 %, 82 % : comment lire un taux de précision annoncé pour un détecteur de vidéos synthétiques et le convertir en attente opérationnelle.

L'Observatoire13 août 20268 min de lecture

À retenir

  • Un pourcentage global agrège deux erreurs de coûts très différents, les faux positifs et les faux négatifs, sans dire comment elles se répartissent.
  • La performance annoncée décroît de 92 % sur vidéo non compressée à 82 % à 50 % de compression : c'est ce dernier chiffre qui décrit le flux réel, où tout circule compressé.
  • Une précision se convertit en attente opérationnelle seulement si l'on connaît la proportion de vidéos synthétiques dans le flux examiné.
  • Le protocole de vérification minimal tient en quatre points : jeu d'essai constitué en propre, seuil fixé à l'avance, passage par la chaîne de compression réelle, comptage séparé des deux types d'erreurs.

Un détecteur de vidéos synthétiques a été présenté cet été, intégré à une plateforme de microservices et destiné en priorité aux rédactions et aux agences de presse. Le système analyse la vidéo image par image et calcule une probabilité de génération par intelligence artificielle. Zamin rapporte les caractéristiques annoncées : 22 millisecondes de traitement pour une vidéo en Full HD sur carte graphique grand public, environ 30 millisecondes sur accélérateur de centre de données, et une précision de 92 % sur vidéo non compressée.

Dans la reprise qui a suivi, c'est le premier nombre, 92 %, qui a circulé seul. C'est le chiffre le moins utile des trois : il décrit une condition de laboratoire que le matériel arrivant dans une rédaction ne présente presque jamais, et il agrège sous un seul pourcentage des erreurs dont les conséquences éditoriales n'ont rien de comparable.

Cette note décrit une méthode de lecture applicable à toute performance annoncée dans ce domaine : ce qu'un taux global recouvre, pourquoi la dégradation avec la compression est le chiffre décisif, comment convertir un pourcentage en attente opérationnelle, et quel protocole minimal permet de vérifier soi-même ce qu'on annonce.

Ce qu'un taux de précision global agrège et ce qu'il masque

Un détecteur produit une probabilité, pas un verdict. Le verdict apparaît quand on applique un seuil : au-dessus, la vidéo est classée comme synthétique ; en dessous, comme authentique. Le taux annoncé mesure la proportion de classements corrects obtenus avec ce seuil sur un jeu d'essai donné. Déplacer le seuil déplace le résultat, sans que le modèle change.

Ce pourcentage unique recouvre deux familles d'erreurs. Le faux positif désigne une vidéo authentique classée comme synthétique : il conduit à écarter un document vrai, à retarder une publication, à mettre en doute un témoin. Le faux négatif désigne une vidéo fabriquée classée comme authentique : il conduit à diffuser un faux avec la caution implicite d'un contrôle technique. Dans une rédaction, le second coûte bien plus cher, mais un taux global les additionne comme s'ils étaient équivalents.

Trois informations manquent presque toujours à côté du pourcentage. La composition du jeu d'essai : combien de vidéos, produites par quels générateurs, dans quels formats. Les conditions de test : résolution, fréquence d'images, recadrage ou filtres. La date, enfin : un détecteur évalué sur les générateurs disponibles au moment de son entraînement rencontre ensuite des modèles qui n'existaient pas.

Faux positifs et faux négatifs : deux erreurs, deux coûts, deux seuils

Une organisation qui adopte un détecteur choisit, souvent sans le formuler, laquelle des deux erreurs elle préfère commettre. Un seuil bas signale beaucoup de vidéos comme suspectes : les faux négatifs deviennent rares, les faux positifs abondent, la charge de vérification humaine augmente. Un seuil haut ne signale que les cas les plus nets : la file reste courte, mais les fabrications les plus soignées passent.

Cette décision ne se délègue pas à l'outil, car elle dépend de ce que l'organisation redoute. Une agence qui engage sa signature sur chaque diffusion se protège d'abord du faux négatif. Une cellule de veille de marque, qui traite des volumes supérieurs avec moins de personnes, se protège d'abord de la saturation. Les deux réglages sont légitimes, ne produisent pas le même taux global, et comparer deux outils réglés différemment n'a pas de sens.

La conséquence pratique est simple : une performance annoncée sans indication du seuil retenu, et sans répartition des erreurs entre les deux familles, n'autorise aucune comparaison.

Pourquoi la dégradation avec la compression est le chiffre décisif

Les traces qu'un détecteur exploite sont fines : irrégularités de bruit entre images successives, artefacts de reconstruction dans les zones de fort détail, incohérences temporelles au bord des objets en mouvement. La compression travaille sur ces mêmes zones, puisqu'elle supprime en priorité l'information que l'oeil humain remarque le moins. Elle efface donc une partie du signal recherché, ce qui explique une dégradation attendue et non un défaut de conception.

Or la vidéo non compressée n'existe pratiquement pas en circulation. Un fichier passe par l'encodage de l'application de capture, puis par celui de la messagerie qui le transmet, puis par celui de la plateforme qui le publie, souvent par une capture d'écran et une nouvelle publication. Le matériel qui arrive dans une rédaction a subi plusieurs encodages successifs : le taux mesuré sur vidéo brute décrit un cas que le travail quotidien ne rencontre pas.

Condition de testPrécision annoncéeErreurs pour 100 vidéosÉcart avec la référence
Vidéo non compressée92 %8référence
Compression de 15 %87 %135 points de plus
Compression de 50 %82 %1810 points de plus

Lue ainsi, la série rapportée par Zamin change de sens : entre le cas de référence et le cas le plus dégradé publié, le nombre d'erreurs pour cent vidéos passe de 8 à 18, soit un peu plus du double. La question à poser à un fournisseur ne porte donc pas sur le maximum atteint en laboratoire, mais sur la pente : de combien la performance baisse par palier, et jusqu'à quel niveau la mesure a été poussée. Un tableau qui s'arrête à 50 % laisse ouverte la question des réencodages plus agressifs, ceux des vidéos très partagées.

Convertir un taux annoncé en attente opérationnelle sur un flux réel

Le passage du pourcentage à la charge de travail demande une donnée que le fournisseur ne détient pas : la proportion de vidéos synthétiques dans le flux examiné. Là où cette proportion est faible, ce qui est le cas courant d'une veille sectorielle, la majorité des alertes remontées concerne des vidéos authentiques mal classées, même avec un détecteur juste dans huit ou neuf cas sur dix. C'est l'effet mécanique d'un taux d'erreur appliqué à une masse de contenus authentiques bien plus grande que la masse de faux.

Le calcul à faire avant tout déploiement tient en trois nombres : le volume quotidien de vidéos soumises, la part estimée de contenus fabriqués, et le taux d'erreur au niveau de compression réel du flux. Le produit des deux premiers donne le nombre de vraies cibles ; le troisième appliqué au reste donne le nombre d'alertes à trier pour rien. C'est cette dernière valeur qui détermine si l'équipe absorbe le dispositif ou l'abandonne au bout de trois semaines.

Encore faut-il savoir quelles vidéos soumettre, et dans quel ordre. NewsCore (www.newscore.fr) couvre en continu des millions de sources, détecte les contenus qui gagnent en audience et relie chaque signal à son document d'origine : la file de vérification arrive hiérarchisée par exposition réelle, et le détecteur s'applique là où l'erreur coûte le plus cher. La rapidité annoncée, 22 millisecondes par vidéo en Full HD selon Zamin, prend sa valeur opérationnelle adossée à ce tri amont.

Un détecteur ne répond pas à la question « cette vidéo est-elle fausse ». Il répond à la question « ce fichier porte-t-il encore les traces statistiques que mon modèle a appris à reconnaître ». Les deux questions se recouvrent partiellement, et la compression réduit ce recouvrement.

Protocole minimal pour vérifier soi-même une performance annoncée

Vérifier une performance annoncée ne demande ni laboratoire ni budget de recherche, mais un protocole documenté. Premier point : constituer un jeu d'essai en propre, d'une centaine de vidéos au minimum, moitié authentiques issues de sa propre collecte, moitié fabriquées avec des générateurs accessibles publiquement. Le jeu doit être conservé, daté et décrit, sinon aucune mesure ultérieure ne sera comparable.

Deuxième point : faire passer chaque vidéo par la chaîne de diffusion réelle, messageries et plateformes effectivement utilisées, puis récupérer le fichier tel qu'il en ressort. C'est cette version, et non l'originale, qui alimente le test ; l'écart entre les deux mesures constitue l'information la plus utile du protocole.

Troisième point : fixer le seuil de décision avant de regarder les résultats, et ne plus y toucher. Quatrième point : compter séparément faux positifs et faux négatifs, jamais un taux global. Cinquième point : refaire la mesure deux à quatre fois par an, avec de nouveaux générateurs ajoutés au jeu, puisque la performance se dégrade à mesure que les modèles de génération évoluent. Le résultat n'est pas une évaluation scientifique : c'est une valeur locale, mesurée sur le matériel réellement traité, la seule qui autorise une décision d'achat et un dimensionnement d'équipe.

Ce que cette note ne permet pas de conclure

Nous n'avons pas testé le détecteur présenté et ne disposons ni de son jeu d'évaluation ni du seuil retenu. Les valeurs discutées ici sont celles rapportées par Zamin ; les nombres d'erreurs pour cent vidéos du tableau en sont la traduction arithmétique, pas une mesure indépendante.

Les concepteurs précisent que l'outil ne remplace pas les méthodes de vérification traditionnelles et constitue une couche supplémentaire. La réserve mérite d'être prise au sérieux plutôt que lue comme une formule de prudence : la recherche de la source primaire, la vérification du contexte de captation et le recoupement des témoignages restent les opérations qui tranchent.

Questions fréquentes

Que signifie exactement une précision de 92 % pour un détecteur de vidéos synthétiques ?

Que sur un jeu d'essai défini par ses concepteurs, avec un seuil de décision donné, 92 classements sur 100 étaient corrects. Le chiffre ne dit pas comment les 8 erreurs se répartissent entre vidéos authentiques rejetées et vidéos fabriquées acceptées, ni la proportion de contenus synthétiques du jeu. Ces deux inconnues changent tout.

Pourquoi la précision baisse-t-elle quand la vidéo est compressée ?

Parce que la compression supprime en priorité l'information visuelle la moins perceptible, celle où se logent les traces exploitées par le détecteur : bruit résiduel, artefacts de reconstruction, incohérences fines entre images successives. Plus la compression est forte, moins il reste de signal à analyser, d'où l'importance du taux mesuré au niveau de compression réel du flux.

Quel taux retenir pour dimensionner une cellule de vérification ?

Celui mesuré au niveau de compression le plus proche du flux traité, appliqué au volume quotidien réel et à la part estimée de contenus fabriqués. Un taux de 82 % produit 18 erreurs pour 100 vidéos, dont la majorité seront des alertes à trier alors que le contenu est authentique. Ce volume d'alertes, et non le pourcentage, détermine la charge de travail.

Pour approfondir