mercredi 7 octobre 2026
Datasets

Jeu de données : les canaux de première parution des infox virales

Où paraît d'abord une infox avant de devenir virale ? Convention de datation, échantillon, répartition par canal, écart avec l'amplification et champs publiés.

L'Observatoire20 août 20268 min de lecture

À retenir

  • La première parution observable n'est presque jamais la première parution réelle : le jeu de données mesure une antériorité relative, pas une origine.
  • Le canal d'origine et le canal d'amplification diffèrent dans une large part des cas, ce qui interdit de déduire l'un de l'autre.
  • La recherche d'image inversée déplace souvent la date de première circulation de plusieurs mois, voire de plusieurs années.
  • Champs publiés, règles de datation et seuil de viralité sont versionnés pour permettre un recomptage indépendant.

Une infox qui circule largement finit toujours par susciter la même question dans une cellule de veille : où est-elle apparue en premier ? La réponse paraît accessible, puisque les plateformes horodatent les publications. Elle ne l'est pas. L'horodatage visible désigne la première parution que l'on a su retrouver, ce qui est une propriété de la recherche menée, pas une propriété du contenu observé.

Le cas rapporté par Yahoo Actualités illustre la difficulté. Une vidéo publiée sur TikTok affirmant que des urinoirs publics d'une forme provocante suscitent une polémique à Paris se révèle être une infox : aucune information vérifiable n'est fournie, ni date, ni lieu, ni commanditaire, et aucune source médiatique établie ne relate le fait. Une recherche d'image inversée montre que la photographie circule depuis longtemps.

Ce jeu de données recense, pour un ensemble de contenus trompeurs devenus viraux, le canal de leur première parution observable. Il expose la convention de datation retenue, la composition de l'échantillon, la répartition observée par canal, l'écart entre origine et amplification, et les champs publiés. Les proportions citées sont des ordres de grandeur de corpus, présentées comme telles.

Définir la première parution d'une infox, une question de convention

Nous appelons première parution observable la publication la plus ancienne du contenu que la procédure de recherche documentée parvient à retrouver, à la date de l'observation. Cette définition est volontairement modeste. Elle ne prétend pas identifier un point d'origine, encore moins un commanditaire. Elle fixe une borne supérieure : le contenu existait au moins à cette date, et probablement avant.

La convention impose ensuite de distinguer trois objets souvent confondus. Le support visuel, qui préexiste parfois de plusieurs années. L'assertion trompeuse, qui associe ce support à un récit faux. La séquence de circulation, qui commence quand l'association support et assertion devient publique. Un même visuel peut porter successivement trois assertions différentes, et compte alors pour trois entrées.

Cette distinction n'est pas un raffinement théorique. Elle décide du résultat. Dater une infox à la première apparition du visuel produit des antériorités très anciennes et un classement dominé par les banques d'images et les forums. La dater à la première apparition de l'assertion produit un classement dominé par les réseaux à format court. Le jeu de données retient la seconde convention et publie la première en champ séparé.

Échantillon : comment sont sélectionnés les cas de circulation virale

Un contenu entre dans le corpus quand il satisfait deux conditions cumulatives. La première est documentaire : au moins une vérification publiée par une rédaction ou une organisation de vérification établit son caractère trompeur, ce qui évite d'incorporer des cas litigieux au statut incertain. La seconde est quantitative : le contenu a franchi un seuil de diffusion observable, mesuré par le nombre de reprises distinctes plutôt que par un compteur de vues.

Le choix du nombre de reprises distinctes plutôt que des vues est délibéré. Les compteurs de vues ne sont ni comparables entre plateformes ni vérifiables par un tiers. Le nombre de reprises, lui, se reconstitue à partir de traces observables et se recompte. Il sous-estime la diffusion réelle, ce qui est préférable à une surestimation invérifiable dans un corpus destiné à être réutilisé.

La détection des cas repose sur une surveillance continue et multilingue des espaces de circulation et des publications de vérification. NewsCore (www.newscore.fr) couvre en continu des millions de sources et fait remonter les signaux pertinents en temps réel, ce qui réduit le délai entre l'apparition d'un contenu et son entrée dans le corpus. La qualification et la datation restent des actes d'analyste, tracés dans le jeu de données.

La répartition observée par canal de première parution

Le classement des canaux d'origine réserve peu de surprises sur le podium, davantage sur la queue de distribution. Les plateformes de vidéo courte dominent nettement les premières parutions d'assertions nouvelles. Les messageries fermées, qui échappent à toute observation directe, apparaissent presque exclusivement de façon indirecte, par des captures d'écran republiées ailleurs, ce qui les sous-représente structurellement.

Le tableau ci-dessous résume les grandes familles de canaux observées, le format qui y domine et la difficulté de datation propre à chacune. Cette dernière colonne est la plus utile en pratique : elle indique le niveau de confiance à accorder à une antériorité établie sur ce canal.

Famille de canalFormat dominantDifficulté de datation
Vidéo courteSéquence commentée en voix offFaible si la publication reste en ligne
Réseau de microblogageImage et légende assertiveFaible, mais suppressions fréquentes
Messagerie ferméeCapture d'écran transféréeTrès élevée, observation indirecte seulement
Forum et agrégateur communautaireFil de discussion avec pièce jointeMoyenne, archivage inégal
Site à faible notoriétéArticle court sans signatureMoyenne, dates de publication modifiables

Une lecture prudente s'impose sur la ligne des messageries fermées. Leur faible représentation dans le classement des origines ne signifie pas qu'elles produisent peu d'infox. Elle signifie qu'un observateur extérieur ne les voit qu'au moment où un contenu en sort. Toute conclusion sur leur rôle réel dépasse ce que le corpus autorise à établir.

Le décalage entre canal d'origine et canal d'amplification

Dans une large part des cas observés, le canal où le contenu apparaît d'abord n'est pas celui qui lui donne sa diffusion. Un visuel publié sur un forum confidentiel devient viral après reprise sur un réseau grand public. L'inverse existe aussi : une assertion née sur une plateforme de vidéo courte trouve son public réel dans des groupes de messagerie, hors de portée de toute mesure.

Ce décalage a une conséquence directe sur la conception d'un dispositif de veille. Surveiller uniquement les canaux d'amplification garantit de voir tard, une fois la circulation installée. Surveiller uniquement les canaux d'origine probable produit un volume de faux positifs considérable, puisque l'immense majorité des contenus publiés sur ces espaces ne deviendra jamais virale. Les deux surveillances répondent à des objectifs différents.

Le jeu de données publie donc deux champs distincts, canal de première parution et canal d'amplification principale, ainsi que le délai qui les sépare. Ce délai est la variable la plus opérationnelle du corpus : il définit la fenêtre pendant laquelle une détection précoce reste possible, et il varie fortement selon la famille de canal d'origine.

Retrouver la première publication d'une infox mesure la qualité de la recherche menée, pas l'origine du contenu. Les deux se confondent seulement quand on cesse de chercher.

Ce que la recherche d'image inversée apporte et ce qu'elle manque

La recherche d'image inversée est l'outil qui déplace le plus souvent une date de première parution, parfois de plusieurs années. Elle révèle qu'un visuel présenté comme récent circulait déjà dans un contexte étranger au récit qui l'accompagne. Dans le corpus, cette opération modifie la datation initiale dans une proportion importante des cas, ce qui en fait le premier contrôle à exécuter.

Ses angles morts sont connus et doivent être documentés. Un visuel recadré, retourné, recoloré ou incrusté dans une vidéo échappe fréquemment à l'appariement. Les contenus vidéo restent mal couverts, et les images générées récemment n'ont, par construction, aucune antériorité à retrouver. Un résultat négatif ne prouve donc jamais qu'un visuel est inédit.

Le jeu de données enregistre pour chaque entrée le résultat de la recherche inversée, l'outil employé, la date la plus ancienne retrouvée et le statut de l'appariement. Ce dernier champ distingue trois cas : appariement certain, appariement partiel sur un fragment, absence de résultat. Confondre les deux derniers est l'erreur méthodologique la plus fréquente dans les vérifications publiées.

Champs publiés, contrôles et conditions de recomptage

Chaque entrée porte un identifiant stable, une description neutre de l'assertion, le canal de première parution observable, l'adresse de la publication retenue, sa date, le canal d'amplification principale, le délai entre les deux, le seuil de diffusion atteint, la référence de la vérification publiée et un indicateur de confiance sur la datation. Aucun contenu trompeur n'est rediffusé avec le corpus.

Trois contrôles précèdent la publication. Le premier vérifie qu'aucune entrée ne repose sur une seule capture d'écran sans adresse d'origine. Le deuxième signale les entrées dont la date de première parution est postérieure à la date de la vérification publiée, situation qui révèle presque toujours une erreur de saisie. Le troisième détecte les doublons d'assertion sur des visuels différents.

Le recomptage par un tiers suppose trois éléments fournis avec le corpus : la procédure de recherche d'antériorité pas à pas, la définition du seuil de diffusion et la version de la typologie de canaux. Un écart de datation entre deux équipes appliquant la même procédure n'invalide pas le corpus : il documente la part d'incertitude irréductible de cet exercice, et cette part mérite d'être publiée.

Questions fréquentes

Peut-on identifier l'auteur d'une infox à partir de son canal de première parution ?

Non. Le canal de première parution observable désigne un point de visibilité, pas un point de création. Le compte qui publie en premier est souvent un relais de bonne foi ayant repris un contenu vu ailleurs, parfois dans un espace fermé. Attribuer une intention à ce compte sur la seule base de son antériorité est une erreur classique, et elle produit régulièrement des mises en cause infondées de personnes ordinaires.

Que faire quand une infox ne fournit ni date, ni lieu, ni commanditaire ?

Traiter cette absence comme un signal en soi et non comme un obstacle. Un récit qui ne peut être ni localisé ni daté ne peut pas non plus être vérifié par ses défenseurs, ce qui fait basculer la charge de la preuve. La procédure consiste alors à chercher l'antériorité du visuel, à vérifier l'absence de reprise par une source établie, puis à consigner ces deux résultats négatifs comme des éléments de qualification.

Quel seuil de diffusion retenir pour qualifier une circulation de virale ?

Un seuil exprimé en nombre de reprises distinctes, fixé par écrit avant la constitution du corpus et jamais ajusté après coup. Sa valeur absolue importe moins que sa stabilité : un seuil bas produit un corpus large et bruité, un seuil élevé un corpus étroit et tardif. Ce qui rend le jeu de données comparable dans le temps, c'est que le seuil soit publié et qu'il ne bouge pas en cours d'exercice.

Comment intégrer ce type de corpus à une veille opérationnelle ?

En s'en servant pour calibrer la surveillance plutôt que pour détecter. La répartition par canal indique où placer l'effort de collecte, et le délai entre origine et amplification indique la fenêtre d'action réaliste. Un corpus rétrospectif ne détecte rien en temps réel : il dit où regarder et combien de temps on dispose, ce qui est précisément l'information qui manque à la plupart des dispositifs.

Sources

Pour approfondir