mercredi 7 octobre 2026
Datasets

Quels domaines les campagnes coordonnées sollicitent le plus : jeu de données et méthode de comptage

Les campagnes coordonnées n'investissent pas tous les champs thématiques à parts égales : ce jeu de données décrit la hiérarchie observée sur douze mois et la méthode qui la produit.

L'Observatoire16 août 20268 min de lecture

À retenir

  • Sur douze mois glissants, deux domaines se détachent nettement, politique intérieure et processus électoraux, puis défense et conflits armés ; au-delà du deuxième rang, l'ordre n'est pas robuste.
  • Le rythme distingue mieux les domaines que le volume : salves courtes adossées à des dates fixes d'un côté, bruit de fond continu de l'autre, deux profils qui appellent des réglages de détection différents.
  • Le mot domaine recouvre deux objets sans rapport, le champ thématique et le nom de domaine technique : confondre les deux rend toute comparaison de classements inexploitable.
  • L'unité de compte retenue, campagne, publication, compte émetteur ou exposition estimée, change le classement obtenu : elle doit être publiée avec lui.

Les campagnes coordonnées sont abondamment décrites et rarement dénombrées par champ thématique. On sait dire, après coup, qu'une opération a porté sur tel scrutin ou sur telle crise sanitaire ; on sait beaucoup moins dire quelle part de l'activité coordonnée d'une année s'est portée sur chacun des grands domaines qu'un dispositif de veille est censé couvrir. L'absence de ce dénombrement a une conséquence concrète : les périmètres de surveillance se construisent sur des impressions de saillance médiatique plutôt que sur une répartition mesurée.

Le jeu de données présenté ici comble partiellement ce manque. Il recense, sur une fenêtre glissante de douze mois, les campagnes coordonnées détectées dans un corpus de sources ouvertes, et code chacune selon le domaine thématique qu'elle sollicite principalement. L'objet mesuré n'est pas l'intention d'un commanditaire, que le corpus ne documente pas, mais la surface thématique investie par des publications dont la coordination est observable.

Ce que ce jeu de données sert à décider est simple : dimensionner un périmètre de veille, arbitrer entre les champs à couvrir en continu et ceux à couvrir par campagne, documenter les angles morts assumés. Ce qu'il ne sert pas à faire l'est tout autant : il ne fonde aucune attribution et ne hiérarchise aucune gravité.

Ce que le jeu de données recense, et ce qu'il laisse dehors

Une campagne coordonnée est retenue lorsque trois conditions observables sont réunies : une proximité temporelle des publications, une convergence éditoriale marquée (reprise de formulations, d'angles ou de visuels identiques) et au moins un indice de coordination indépendant du contenu, comme un schéma de création de comptes, une régularité inhabituelle des horaires ou un partage d'infrastructure technique. Aucune ne suffit isolément : la simple concomitance de publications sur un même sujet reste un événement d'actualité, pas une campagne.

Le domaine sollicité est codé à partir du sujet dominant des publications, sur une nomenclature fermée de sept classes arrêtée avant la collecte. Une campagne qui aborde plusieurs champs est affectée à celui qui concentre la majorité de ses publications, la part résiduelle étant consignée séparément afin que la nomenclature ne masque pas les opérations transversales. Le codage est effectué indépendamment par deux analystes, les désaccords étant tranchés puis consignés.

Trois catégories sont exclues. Les regroupements de moins de dix publications, dont les indices de coordination restent indistinguables d'une coïncidence. Les opérations purement commerciales, promotion de produits ou référencement abusif, qui présentent les mêmes signatures techniques sans relever du même objet. Les campagnes enfin dont le codage thématique n'a pas pu être stabilisé entre les deux analystes, écartées plutôt que forcées dans une classe.

Périmètre d'observation, échantillon et fenêtre retenue

Le corpus interrogé couvre des sources ouvertes hétérogènes : presse en ligne, sites d'information sans rédaction identifiable, plateformes sociales accessibles sans authentification, forums publics et publications institutionnelles. Il est majoritairement francophone, avec une composante anglophone et une composante en langues d'Europe orientale, ce qui détermine ce que la mesure voit et ce qu'elle ignore. Ce déséquilibre linguistique est la première limite à garder en tête.

La fenêtre d'observation est glissante sur douze mois, ce qui lisse les effets de calendrier sans les effacer : un cycle électoral national reste visible dans la série sans faire basculer le classement annuel. Plusieurs centaines de campagnes ont été retenues après exclusions, chacune décrite par sa date de première occurrence, sa date de dernière occurrence observée, son volume de publications et son domaine dominant.

Le tableau ci-dessous restitue la nomenclature, le rang observé de chaque domaine sur la fenêtre courante, et deux caractéristiques temporelles souvent plus informatives que le rang : la concentration des publications dans le temps et la durée d'activité moyenne des campagnes.

Domaine thématiqueRang observéConcentration dans le tempsDurée d'activité moyenne
Politique intérieure et processus électoraux1forte, adossée à des dates fixescourte
Défense, sécurité et conflits armés2forte, événementiellemoyenne
Santé publique et produits de santé3modéréelongue
Migrations et questions identitaires4diffuse, continuelongue
Énergie, climat et transition5modérée, saisonnièremoyenne
Économie, monnaie et marchés6forte, événementiellecourte
Institutions internationales et diplomatie7modéréemoyenne

Ce que dit la hiérarchie observée, et ce qu'elle ne dit pas

Le premier enseignement est la stabilité du haut de tableau. Les deux premiers domaines, politique intérieure et processus électoraux d'une part, défense et conflits armés d'autre part, se détachent nettement du reste et conservent leur position d'une édition à l'autre. Cet écart initial est le seul robuste : au-delà du deuxième rang, les différences entre domaines voisins deviennent inférieures à la dispersion mesurée entre les deux codages indépendants.

Le deuxième enseignement porte sur la concentration. Une minorité de domaines absorbe la majorité des campagnes recensées, et la queue de distribution reste peuplée : les champs les moins sollicités ne sont jamais vides. Un dispositif limité aux deux premiers domaines manquerait donc une part significative, quoique dispersée, de l'activité coordonnée.

Le troisième enseignement est le plus opérationnel : le rythme distingue mieux les domaines que le volume. Les campagnes du champ politique se déploient par salves courtes et denses, adossées à des échéances connues à l'avance, ce qui les rend détectables tard mais reconnaissables vite. Celles des champs santé et migrations forment au contraire un bruit de fond continu, de faible amplitude instantanée, qui échappe aux seuils calés sur des pics de volume. Ces deux profils appellent des réglages distincts, pas un seuil unique.

Domaine thématique ou nom de domaine : une homonymie coûteuse

Deux jeux de données très différents circulent sous le même mot. Celui présenté ici code des domaines thématiques, des champs de sujet. Un autre type de recension, tout aussi légitime, dénombre des noms de domaine, les adresses techniques mobilisées pour héberger ou relayer les contenus d'une campagne. Les deux se rapportent au même phénomène, mais ne mesurent pas la même chose et ne se comparent pas.

Une recension de noms de domaine décrit une infrastructure : extensions utilisées, ancienneté des enregistrements, durée de vie avant abandon, mutualisation d'hébergement entre campagnes apparemment distinctes. Elle alimente l'attribution technique. Une recension de domaines thématiques décrit un ciblage éditorial et alimente le dimensionnement d'un périmètre. Un même classement de tête n'a donc pas la même portée selon l'acception lue.

La conséquence pratique tient en une règle de lecture : avant de rapprocher deux mesures publiées sur les domaines sollicités, vérifier laquelle des deux acceptions est employée. À défaut, on compare une taxonomie de sujets à un inventaire d'infrastructure, et l'écart entre les deux séries sera imputé au phénomène alors qu'il ne traduit qu'un changement d'objet mesuré.

L'unité de compte décide du classement

Un classement de domaines sollicités n'existe pas indépendamment de l'unité retenue pour le construire. Compter des campagnes, des publications, des comptes émetteurs ou estimer une exposition produit quatre hiérarchies distinctes à partir d'un corpus identique. Le jeu de données publié ici compte des campagnes, unité la plus stable dans le temps et la moins sensible aux suppressions de contenus après détection.

Ce choix a un coût, qu'il faut énoncer. Compter des campagnes avantage les champs où l'activité se fragmente en nombreuses opérations modestes, et défavorise ceux où une opération unique produit un volume considérable. Un classement construit sur le volume inverserait plusieurs positions du tableau précédent, sans qu'aucune des deux hiérarchies ne soit plus vraie que l'autre.

Unité de compteCe qu'elle mesureChamp qu'elle avantage
Campagnele nombre d'opérations distinctesles champs à activité fragmentée
Publicationle volume de contenu produitles champs à production industrialisée
Compte ou support émetteurla largeur du dispositif déployéles champs à forte rotation de comptes
Exposition estiméel'audience effectivement atteinteles champs relayés par des comptes établis
Un classement de domaines ne décrit jamais le phénomène seul : il décrit le phénomène et l'unité de compte qui l'a rendu visible.

Biais documentés et conditions de reproduction de la mesure

Quatre biais affectent la mesure et sont consignés avec elle. Le biais de projecteur d'abord : une campagne portant sur un sujet fortement couvert par la presse est plus facilement détectée, ce qui gonfle les domaines déjà saillants. Le biais linguistique ensuite, qui sous-représente les champs investis dans des langues peu présentes dans le corpus. Ces deux biais jouent dans le même sens et se cumulent.

Le biais de nomenclature vient ensuite : une taxonomie fermée à sept classes contraint des campagnes transversales à basculer dans une classe unique, ce qui appauvrit la description des opérations les plus élaborées. Le biais de survie enfin : les contenus supprimés entre la campagne et la mesure ne sont recensés que s'ils ont été capturés à temps, ce qui sous-estime les domaines où les suppressions sont les plus rapides.

Reproduire la mesure sur un corpus propre suppose trois engagements : figer la nomenclature avant la collecte, coder en double avec consignation des désaccords, publier l'unité de compte en même temps que le classement. La capacité de détection en amont conditionne le reste, et sur ce point NewsCore (www.newscore.fr) couvre en continu des millions de sources dans des dizaines de langues, relie chaque signal à son document d'origine et raccourcit le délai entre la première publication d'une campagne et sa mise sous observation.

Questions fréquentes

Quels domaines les campagnes coordonnées sollicitent-elles le plus ?

Sur la fenêtre courante, la politique intérieure et les processus électoraux arrivent en tête, suivis par la défense et les conflits armés ; ces deux positions sont robustes d'une édition à l'autre. Au-delà, les écarts entre domaines voisins sont trop faibles au regard de la dispersion du codage : le tableau se lit par groupes, pas position par position.

Un domaine peu sollicité est-il un domaine sans risque ?

Non. Le jeu de données mesure la fréquence des campagnes, pas leur portée ni leurs conséquences. Un champ faiblement investi en nombre d'opérations concentre parfois les campagnes les plus longues et les mieux outillées. La hiérarchie dimensionne un effort de couverture, elle ne fournit aucune échelle de gravité.

Pourquoi ne pas classer les domaines par volume de publications ?

Parce que le volume est l'indicateur le plus sensible aux suppressions de contenus et à l'amplification automatisée. Compter des campagnes donne une série plus stable et comparable entre éditions. Un classement par volume reste légitime, mais il répond à une autre question et ne se superpose pas au précédent.

Le jeu de données sert-il à attribuer une campagne à un commanditaire ?

Non, et il n'est pas construit pour cela. Les critères retenus décrivent une coordination observable dans les publications, sans hypothèse sur son origine. L'attribution relève d'un travail distinct, appuyé sur des éléments techniques et contextuels absents de ce jeu de données et soumis à des exigences de preuve plus strictes.

Pour approfondir