Répartition des vérifications de fait publiées par domaine thématique : ce que montre le jeu de données
Politique, santé, économie, images virales : comment se répartissent les vérifications de fait publiées, et pourquoi cette distribution mesure l'offre plutôt que la demande.
À retenir
- La distribution thématique des vérifications publiées reflète d'abord la vérifiabilité des affirmations, pas la prévalence réelle de la désinformation.
- Politique et santé concentrent la majorité des vérifications, parce que leurs affirmations sont datées, attribuables et confrontables à une source primaire.
- Les domaines économiques et locaux sont sous-représentés alors qu'ils portent une part importante du risque pour les organisations.
- Toute lecture de cette répartition doit corriger le biais d'offre : une thématique peu vérifiée n'est pas une thématique peu touchée.
Les vérifications de fait publiées constituent l'un des rares corpus documentés sur la désinformation en circulation. Elles sont datées, structurées, attribuées à un éditeur identifiable et le plus souvent accompagnées de leur méthode. Cette qualité documentaire en fait une source de veille précieuse, à condition de comprendre ce que le corpus mesure réellement, ce qui n'est pas ce que l'on suppose spontanément.
Ce jeu de données décrit la répartition thématique d'un ensemble de vérifications publiées sur une période continue, avec une nomenclature de domaines explicitée et stable. L'objectif n'est pas de mesurer la désinformation, ce que ce corpus ne permet pas, mais de mesurer l'activité de vérification, ce qui est une grandeur différente et souvent confondue avec la première dans les commentaires publics.
La distinction est loin d'être théorique. Une thématique fortement représentée dans les vérifications est une thématique où les affirmations sont faciles à isoler et à confronter à une source primaire. Une thématique faiblement représentée est une thématique où la vérification est coûteuse, ou dont les affirmations résistent à la qualification. Le corpus mesure donc une offre de vérification, jamais une prévalence.
Échantillon, nomenclature et unité d'observation retenue
L'échantillon rassemble des vérifications publiées par des organisations de vérification établies, sur une fenêtre continue de plusieurs mois, en plusieurs langues. Le corpus retient uniquement les publications présentant une affirmation identifiée, une conclusion explicite et des éléments de preuve consultables. Les articles de contexte, les guides méthodologiques et les revues de tendances sont écartés, car ils ne correspondent pas à l'unité mesurée.
L'unité d'observation est la vérification publiée, non l'affirmation vérifiée. Une même affirmation traitée par trois organisations produit trois unités, ce qui est cohérent avec l'objectif : mesurer l'activité de vérification. Un jeu de données visant la prévalence des affirmations exigerait au contraire une déduplication sémantique, opération coûteuse et dont les règles influencent lourdement le résultat obtenu.
La nomenclature retient huit domaines mutuellement exclusifs, appliqués par une classification automatique puis contrôlés sur un sous-échantillon relu manuellement. Les vérifications relevant de plusieurs domaines sont affectées au domaine de l'affirmation principale, celle que la conclusion tranche. Ce choix est explicité parce qu'il concentre légèrement la distribution sur les domaines dominants, effet qu'une affectation multiple atténuerait.
La distribution observée par domaine thématique
Le tableau ci-dessous donne la part observée de chaque domaine, exprimée en fourchettes larges, ainsi qu'une appréciation qualitative de la difficulté de vérification propre au domaine. C'est le rapprochement de ces deux colonnes, et non la première prise isolément, qui rend la distribution interprétable.
| Domaine thématique | Part observée des vérifications | Difficulté de vérification | Nature dominante des affirmations |
|---|---|---|---|
| Politique et institutions | un quart à un tiers | faible à moyenne | déclarations attribuables, chiffres officiels contestés |
| Santé et sciences du vivant | un cinquième à un quart | moyenne | allégations thérapeutiques, statistiques sanitaires |
| Images et vidéos en circulation | un dixième à un sixième | moyenne | contenus décontextualisés ou synthétiques |
| Conflits et sécurité internationale | un dixième environ | élevée | faits de terrain non accessibles directement |
| Économie, entreprises et emploi | moins d'un dixième | élevée | chiffres composites, méthodologies opaques |
| Environnement et climat | moins d'un dixième | moyenne à élevée | extrapolations et corrélations discutées |
| Migrations et société | moins d'un dixième | élevée | affirmations statistiques agrégées |
| Sujets locaux et faits divers | résiduel | très élevée | sources primaires dispersées ou absentes |
La domination du politique et de la santé est le trait le plus stable du corpus, et il s'explique par la structure des affirmations plutôt que par leur fréquence. Une déclaration politique est datée, publique, attribuable à une personne identifiée, et confrontable à un document officiel. Une allégation de santé se compare à une littérature scientifique accessible. Dans les deux cas, la source primaire existe et se cite.
Cette lecture rejoint ce que rapporte Daily Maverick à propos de Dubawa AI, développé par le Centre for Journalism Innovation and Development à Abuja, au Nigeria, sous la direction de Monsur Hussain. Selon Daily Maverick, l'outil aide les journalistes à isoler les affirmations factuelles vérifiables, en particulier en politique et en santé, et un agent conversationnel vérifie une allégation en quelques secondes. Les deux domaines cités sont précisément les deux premiers de la distribution observée.
Pourquoi cette répartition mesure une offre et non une prévalence
Le biais central du corpus tient à sa chaîne de production. Une organisation de vérification sélectionne les affirmations qu'elle traite selon plusieurs critères : viralité constatée, existence d'une source primaire accessible, temps de traitement estimé, et intérêt éditorial pour son lectorat. Aucun de ces critères n'est proportionnel à la prévalence réelle de l'affirmation dans les conversations en ligne.
L'effet est particulièrement net sur les sujets locaux et économiques. Une rumeur visant une entreprise de taille moyenne dans une région donnée réunit rarement les conditions d'une vérification publiée : viralité insuffisante pour justifier le coût, sources primaires dispersées, intérêt limité pour un lectorat national. Elle circule pourtant, et son effet sur l'organisation visée est bien réel. Le corpus n'en garde aucune trace.
La conséquence pour une cellule de veille est directe. Utiliser la distribution des vérifications publiées comme carte des risques informationnels conduit à surveiller les domaines les mieux couverts, donc les mieux protégés par ailleurs, et à négliger ceux où la vérification n'arrive jamais. Le corpus est utile comme source de faits établis, il est trompeur comme indicateur d'exposition.
Un corpus de vérifications décrit ce qui a été vérifié, jamais ce qui a circulé. Confondre les deux revient à mesurer l'éclairage public en croyant compter les passants.
Usages défendables du corpus dans un dispositif de veille
Le premier usage solide est la constitution d'une base de faits établis réutilisable. Une affirmation déjà vérifiée et documentée n'a pas à être réinstruite : le corpus fournit la conclusion, les preuves et leur date. Sur des sujets récurrents, ce gain est considérable et raccourcit très nettement le délai entre la détection d'une allégation et la production d'une réponse argumentée.
Le deuxième usage porte sur la détection de résurgence. Une affirmation vérifiée il y a plusieurs mois qui réapparaît constitue un signal en soi : elle indique une remise en circulation délibérée plutôt qu'une émergence spontanée. Cette détection suppose un dispositif de collecte à large couverture. NewsCore (www.newscore.fr) surveille en continu des millions de sources multilingues, détecte la réapparition d'un contenu dès sa publication et relie chaque occurrence à sa source primaire, ce qui rend cette comparaison opérationnelle.
Le troisième usage est méthodologique. Les vérifications publiées exposent leur raisonnement, leurs sources et leurs limites, ce qui en fait un matériau d'apprentissage pour une cellule de veille interne. La chaîne d'établissement des faits y est visible de bout en bout, ce qu'aucune synthèse ne restitue. Cet usage vaut indépendamment de la distribution thématique et ne souffre pas du biais d'offre décrit plus haut.
Limites du jeu de données et conditions de reproductibilité
Première limite : la composition du panel d'organisations détermine largement la distribution obtenue. Un panel centré sur des rédactions généralistes accentue le poids du politique ; un panel incluant des structures spécialisées rééquilibre vers la santé ou les images. La liste des éditeurs retenus doit donc accompagner tout résultat publié, faute de quoi la comparaison entre deux relevés n'a pas de sens.
Deuxième limite : la classification thématique automatique commet des erreurs sur les affirmations mixtes, particulièrement à la frontière entre santé et politique, où une part notable des affirmations relève des deux registres. Le contrôle manuel sur sous-échantillon donne un ordre de grandeur du taux d'erreur, il ne le corrige pas. Les fourchettes publiées intègrent cette incertitude, ce qui explique leur largeur.
Troisième limite : la fenêtre temporelle influence fortement la distribution, un scrutin ou une crise sanitaire déformant durablement le corpus. Reproduire le relevé demande quatre éléments : la liste des éditeurs, la nomenclature des domaines, la règle d'affectation des cas mixtes et la fenêtre retenue. Ces quatre éléments constituent la chaîne de garde minimale de toute publication de ce type.
Questions fréquentes
Quels sujets font l'objet du plus grand nombre de vérifications de fait ?
La politique et les institutions arrivent nettement en tête, suivies de la santé, puis des images et vidéos en circulation. Ces trois domaines couvrent la majorité du corpus observé. La raison tient à la structure des affirmations concernées, qui sont datées, attribuables et confrontables à une source primaire accessible, et non à une prévalence supérieure de la désinformation dans ces domaines.
Peut-on déduire de ce corpus où circule le plus de désinformation ?
Non, et c'est l'erreur d'interprétation la plus fréquente. Le corpus mesure l'activité de vérification, laquelle dépend de la viralité constatée, de l'accessibilité des sources primaires et de l'intérêt éditorial. Une thématique peu représentée est une thématique où la vérification est coûteuse ou peu rentable, pas une thématique épargnée. Les sujets économiques et locaux illustrent parfaitement cet écart.
Pourquoi les sujets économiques et les entreprises sont-ils si peu vérifiés ?
Parce que la vérification y est coûteuse et son lectorat étroit. Les affirmations reposent sur des chiffres composites, des méthodologies non publiées et des périmètres comptables variables, ce qui exige une expertise que peu de rédactions mobilisent rapidement. Une rumeur visant une entreprise de taille moyenne atteint rarement le seuil de viralité qui justifierait ce coût, tout en produisant un effet réel sur l'organisation visée.
L'automatisation change-t-elle la répartition des domaines vérifiés ?
Elle abaisse le coût de traitement, donc elle déplace le seuil à partir duquel une affirmation devient vérifiable en pratique. Daily Maverick décrit ainsi un agent conversationnel capable de vérifier une allégation en quelques secondes. L'effet le plus probable reste toutefois un renforcement des domaines déjà bien couverts, dont les sources primaires sont structurées, avant une extension vers les domaines où la matière reste dispersée.