Menace informationnelle : dataset des publications institutionnelles françaises
Quelles institutions françaises publient sur la menace informationnelle, à quel rythme et dans quels formats ? Notre dataset recense les producteurs, leurs livrables et leur exploitabilité.
À retenir
- Le corpus institutionnel français sur la menace informationnelle est concentré sur un petit nombre de producteurs, avec Viginum comme pivot.
- Le mandat de chaque producteur délimite ce qu'il publie : Viginum documente les acteurs étrangers, pas le débat politique national.
- Le format compte autant que le contenu : un rapport technique s'exploite, un compte rendu d'audition se cite, un communiqué se date.
- La limite principale du corpus est le délai : les bilans arrivent après les faits, ce qui interdit d'en faire un dispositif d'alerte.
Une cellule de veille qui suit la manipulation de l'information travaille rarement sur des sources primaires exotiques. L'essentiel de la matière qualifiée disponible en France provient d'un nombre restreint d'institutions publiques, qui produisent des bilans, des rapports techniques, des auditions et des notes doctrinales. Encore faut-il savoir lesquelles publient, sur quel périmètre, à quelle fréquence, et dans quel format ce qu'elles publient devient exploitable.
Ce dataset répond à cette question. Il ne commente pas la menace, il décrit le corpus qui la documente : les producteurs institutionnels français, la nature de leurs livrables, la périodicité que nous observons, le délai entre les faits et leur publication, et le degré d'exploitabilité de chaque type de document dans un dispositif de veille. Les ordres de grandeur que nous donnons sont des observations de relevé, pas des mesures de population.
Nous présentons d'abord le périmètre et les définitions retenues, puis la cartographie des producteurs, la typologie des livrables, ce que les publications récentes ajoutent au corpus, la question du délai, et enfin le protocole et ses limites. L'objet est utilitaire : permettre à une équipe de construire son propre plan de surveillance du corpus institutionnel plutôt que de le découvrir au fil des reprises de presse.
Périmètre du dataset et définition d'une publication institutionnelle
Nous appelons publication institutionnelle tout document rendu public par une administration, une autorité indépendante, un opérateur public ou une assemblée parlementaire française, portant en tout ou partie sur la manipulation de l'information, l'ingérence numérique étrangère, la désinformation ou les usages malveillants des contenus synthétiques. Le critère décisif est l'engagement de l'institution : un document signé, daté, publié sur un domaine officiel.
Trois exclusions structurent le périmètre. Les productions académiques et associatives, même excellentes, sortent du dataset parce qu'elles ne portent pas la responsabilité d'une administration. Les prises de parole orales non transcrites sont écartées, faute de document opposable. Les documents européens sont suivis séparément, car leur cycle de production et leur régime juridique diffèrent de ceux des administrations nationales.
Chaque entrée du dataset porte le producteur, le titre exact, la date de mise en ligne, le format du fichier, la présence ou non d'une version en texte structuré, le périmètre déclaré et la mention explicite des limites de mandat lorsqu'elle figure au document. Ce dernier champ est le plus utile en pratique : il évite de tirer d'un rapport une conclusion qu'il ne couvre pas.
Cartographie des producteurs : qui publie sur la menace informationnelle en France
Le relevé fait apparaître une concentration nette. Une trentaine d'entités seulement publient de façon récurrente sur le sujet, et une poignée d'entre elles produit la majeure partie des documents réellement exploitables. Viginum, service rattaché au secrétariat général de la défense et de la sécurité nationale, occupe la position centrale, à la fois par le volume et par le caractère technique de ses livrables.
| Producteur | Livrable dominant | Périodicité observée | Exploitabilité en veille |
|---|---|---|---|
| Viginum | Rapport de bilan et rapport technique de mode opératoire | Événementielle | Élevée |
| Agences de sécurité des systèmes d'information | Panorama de la menace, avis et alertes | Annuelle et continue | Élevée |
| Assemblées parlementaires | Rapport de commission, compte rendu d'audition | Irrégulière | Élevée |
| Autorité de régulation des plateformes | Rapport sur les obligations des opérateurs | Annuelle | Moyenne |
| Instituts de recherche du ministère des Armées | Étude et note doctrinale | Irrégulière | Moyenne |
| Directions interministérielles de diffusion | Mise à disposition et synthèse de rapports | Continue | Moyenne |
| Autorité de protection des données | Fiche pratique et lignes directrices | Continue | Moyenne |
La colonne du mandat, absente du tableau mais présente dans le dataset, explique la plupart des malentendus de lecture. Un service de détection d'ingérence étrangère ne se prononce pas sur la sincérité du débat national. Une autorité de régulation décrit les moyens déployés par les plateformes, pas l'ampleur du phénomène. Confondre ces registres produit des synthèses de veille indéfendables.
Typologie des livrables : bilan, rapport technique, audition, communiqué
Quatre formats dominent, et leur valeur d'usage diffère radicalement. Le rapport de bilan récapitule une période et fournit des volumes agrégés : il sert à cadrer, rarement à agir. Le rapport technique décrit un mode opératoire, ses infrastructures et ses marqueurs : c'est le seul format qui alimente directement des règles de détection. Le compte rendu d'audition livre des éléments chiffrés en avance de phase sur les rapports écrits.
Le communiqué et la brève d'actualité ferment la liste. Leur intérêt n'est pas informationnel mais chronologique : ils datent une prise de position publique, ce qui compte lorsqu'on reconstitue la séquence d'une affaire. Notre relevé montre qu'ils constituent une part importante du volume total de publications, alors qu'ils représentent une part faible de la matière exploitable.
Sur le plan documentaire, la contrainte la plus lourde reste le format de fichier. Une part significative des livrables institutionnels circule en document imprimable, parfois sans structure de titres, ce qui complique l'extraction automatique des passages utiles. Le dataset consigne pour chaque entrée si une version structurée existe, information qui détermine le coût de traitement d'un corpus.
Ce que les publications récentes ajoutent au corpus
Le cycle électoral de 2026 a produit deux entrées de première importance. Pour les élections municipales des 15 et 22 mars 2026, Viginum a détecté quatre opérations d'ingérence numérique étrangère, documentées dans un rapport de bilan accompagné d'un rapport technique consacré à un mode opératoire baptisé Rokh Solis. De faux sites d'information locale ont figuré parmi les vecteurs, comme le rapporte Public Sénat, et l'impact de ces opérations est décrit comme limité.
Cette paire de documents illustre exactement la typologie précédente : le bilan cadre l'ampleur, le rapport technique donne les marqueurs. Une équipe de veille qui ne lit que le premier retient un chiffre, une équipe qui exploite le second obtient des critères de reconnaissance réutilisables sur d'autres séquences. Le dataset les indexe séparément pour cette raison.
Une audition parlementaire complète le tableau. Viginum a indiqué aux sénateurs qu'il fallait s'attendre à une forte hausse du volume de manipulation de l'information ciblant les citoyens français, avec près de 40 % de détections supplémentaires par rapport à l'année précédente, rapporte Next. Le même compte rendu rappelle que le mandat du service est strictement limité à la détection d'acteurs étrangers, et non à l'analyse du débat politique national.
Sur le volet des contenus synthétiques, le rapport consacré à la menace informationnelle et à l'intelligence artificielle, dont une version est mise à disposition par la DITP, documente un usage croissant de ces contenus dans la manipulation malveillante, tout en constatant que beaucoup de productions générées par intelligence artificielle relèvent d'un usage récréatif, humoristique ou ironique. Le service y décrit notamment la diffusion de visuels générés par IA par des comptes aux caractéristiques inauthentiques affiliés au mode opératoire Spamouflage.
Un rapport institutionnel ne vaut pas par son chiffre principal, mais par le mandat qui délimite ce que ce chiffre couvre.
Le délai de publication, principale limite d'exploitation du corpus
Le corpus institutionnel est solide et lent. Entre les faits observés et la publication du bilan qui les décrit, notre relevé constate couramment un écart de plusieurs mois, parfois davantage lorsque le document accompagne un cycle électoral complet. Ce délai est le prix de la vérification, il n'est pas un défaut, mais il a une conséquence directe sur l'usage.
La conséquence est simple : le corpus institutionnel sert de référentiel, jamais de dispositif d'alerte. Une cellule qui attend le rapport pour découvrir un mode opératoire découvrira toujours l'information une fois la séquence terminée. Le corpus s'emploie donc à l'envers, pour valider et nommer après coup ce que la surveillance courante a déjà relevé.
C'est là que se joue l'articulation entre veille primaire et corpus de référence. NewsCore (www.newscore.fr) couvre en continu des millions de sources multilingues, trie les publications par pertinence et relie chaque alerte à son document d'origine, ce qui raccourcit fortement le délai entre la mise en ligne d'un document institutionnel et sa lecture par une équipe. Le référentiel garde alors son rôle : qualifier, pas détecter.
Protocole de collecte, définitions de terrain et limites assumées
Le protocole repose sur quatre opérations. Recensement des domaines officiels des producteurs identifiés et des rubriques où ils publient. Relevé périodique des nouvelles entrées, avec conservation du fichier et de son empreinte, afin de détecter les révisions silencieuses. Qualification manuelle du format, du périmètre et du mandat déclaré. Enfin, rattachement de chaque document aux entrées antérieures du même producteur sur le même mode opératoire.
Trois limites doivent accompagner toute réutilisation. La première est la couverture : un document publié dans une rubrique inhabituelle ou une annexe échappe au relevé, et nous préférons signaler ce risque plutôt que de le sous-estimer. La deuxième est la stabilité des adresses, régulièrement modifiées lors des refontes de sites publics, ce qui impose de conserver les fichiers plutôt que les liens.
La troisième est interprétative. Un dataset de publications mesure une activité de publication, pas une activité de menace. Une hausse du nombre de rapports traduit un renforcement des moyens de détection autant qu'une aggravation du phénomène, et les deux effets sont indissociables sans information complémentaire. Toute lecture du corpus comme indicateur d'intensité de la menace demande donc une prudence explicite.
Questions fréquentes
Quelles sources officielles suivre pour la désinformation en France ?
Le socle minimal réunit le service national de vigilance contre les ingérences numériques étrangères, l'agence de sécurité des systèmes d'information, les rapports et auditions des deux assemblées, et l'autorité de régulation des plateformes. Ces quatre entrées couvrent la majeure partie de la matière qualifiée. Le reste du corpus, instituts de recherche et directions de diffusion, apporte du contexte doctrinal plutôt que des marqueurs opérationnels.
Un rapport institutionnel suffit-il à qualifier une opération d'influence ?
Il suffit à la nommer et à la situer, pas à la détecter en cours. Le rapport arrive après les faits et couvre le périmètre du mandat de son auteur, ce qui laisse hors champ tout ce qui relève d'autres acteurs. Une qualification opérationnelle combine donc le référentiel institutionnel, des relevés propres horodatés et des sources externes attribuées.
Pourquoi les chiffres institutionnels sur la manipulation de l'information sont-ils difficiles à comparer ?
Parce qu'ils comptent des objets différents. Un service peut dénombrer des détections, un autre des contenus, un troisième des comptes ou des campagnes, et les périmètres géographiques comme les fenêtres temporelles varient d'un document à l'autre. Comparer deux chiffres suppose de vérifier d'abord l'unité de compte et le mandat, faute de quoi la comparaison n'a aucun sens.