Note de méthode : échantillonner les comptes d'un réseau d'influence
Sans base de sondage, mesurer la portée d'un réseau d'influence expose à un biais massif : critère d'appartenance, stratégies d'échantillonnage et limites.
À retenir
- Un réseau d'influence n'a pas de liste : toute mesure de portée repose sur un échantillon dont la construction détermine le résultat plus que le phénomène observé.
- Le critère d'appartenance doit être écrit et observable avant la collecte, sinon l'échantillon se peuple des comptes les plus visibles et surestime la portée.
- L'échantillonnage par boule de neige est souvent le seul praticable : il exige de consigner le point de départ, le nombre de vagues et le taux de saturation.
- Un échantillon autorise à décrire une structure et un ordre de grandeur, jamais à annoncer un nombre total de comptes ou d'impressions.
Les publications sur les opérations d'influence annoncent régulièrement des volumes : tant de comptes, tant de publications, tant de personnes atteintes. Ces chiffres circulent bien parce qu'ils sont simples. Ils reposent presque toujours sur un échantillon dont la méthode de constitution n'est pas décrite, alors que c'est elle, et non le réseau observé, qui fixe l'ordre de grandeur obtenu.
Cette note traite du geste préalable à toute mesure : construire l'échantillon de comptes. Elle définit ce qu'est l'appartenance à un réseau, examine pourquoi la base de sondage manque toujours, compare trois stratégies praticables avec leurs biais respectifs, et précise ce qu'un échantillon autorise à dire une fois la collecte terminée.
Notre position est celle d'un observateur qui documente sa propre incertitude. Une mesure de portée assortie de son protocole d'échantillonnage, même modeste, vaut mieux qu'un total impressionnant dont personne ne peut dire d'où il vient. La reproductibilité est ici le seul critère de qualité disponible, faute de vérité de référence à laquelle se comparer.
Définir le réseau avant de l'échantillonner : le critère d'appartenance
Un réseau d'influence n'est pas un objet donné, c'est une construction d'analyste. Avant toute collecte, il faut écrire le critère qui fait qu'un compte en fait partie, et ce critère doit être observable par un tiers. Les formulations vagues, comptes participant à la campagne ou comptes relayant le narratif, ne satisfont pas cette condition et rendent l'échantillon incontrôlable.
Trois familles de critères sont utilisables. Les critères de coordination portent sur des comportements observables : publication du même contenu dans une fenêtre temporelle courte, réutilisation d'éléments techniques identiques, séquences d'inscription groupées. Ils sont les plus solides parce qu'ils décrivent des faits mesurables, indépendants de l'interprétation du contenu.
Les critères de contenu, présence d'un même élément de discours, et les critères relationnels, liens d'abonnement ou de relais, sont plus faciles à appliquer et bien plus poreux. Un compte qui reprend un message par conviction personnelle satisfait un critère de contenu sans appartenir à aucun dispositif. Mélanger les trois familles sans les distinguer produit un ensemble hétérogène que la mesure traitera pourtant comme homogène.
La base de sondage n'existe pas, et ce que cela change
En statistique classique, un échantillon se tire dans une base de sondage, c'est-à-dire une liste exhaustive de la population étudiée. Ici, cette liste n'existe pas : personne ne détient l'inventaire des comptes d'un réseau d'influence, et les plateformes elles-mêmes n'en disposent qu'à travers leurs propres critères de détection, non publiés et changeants.
La conséquence est immédiate : aucun tirage aléatoire n'est possible, donc aucun calcul de marge d'erreur au sens usuel. Les intervalles de confiance affichés dans certaines publications sur ces sujets empruntent la forme de la statistique sans en avoir les conditions. Il vaut mieux annoncer un ordre de grandeur assumé qu'une précision dont la formule ne s'applique pas.
Une seconde conséquence est structurelle. La population observable est bornée par les moyens d'observation : les comptes supprimés, les comptes privés et les espaces fermés échappent à la collecte. L'échantillon décrit donc la partie visible et survivante d'un réseau à une date donnée, ce qui doit figurer dans la première phrase de tout résultat publié.
Trois stratégies d'échantillonnage et ce que chacune biaise
Faute de base de sondage, on choisit entre des stratégies imparfaites dont les biais sont connus. Le choix se justifie par la question posée : décrire une structure, estimer une proportion, ou repérer les comptes les plus actifs sont trois objectifs qui n'appellent pas la même méthode. Le tableau ci-dessous résume les arbitrages.
| Stratégie | Principe | Biais principal | Usage où elle reste valide |
|---|---|---|---|
| Boule de neige | Partir de comptes identifiés et suivre leurs relations, vague après vague | Surreprésente les comptes centraux et les régions denses du réseau | Décrire la structure et repérer les rôles internes |
| Par mot-clé ou marqueur | Collecter tous les comptes publiant un élément de discours donné | Capture des relais spontanés hors du dispositif | Mesurer la diffusion d'un narratif, pas la taille du réseau |
| Par fenêtre temporelle | Collecter tout ce qui est publié sur un intervalle, puis filtrer | Coûteuse, et dépendante de la représentativité de l'intervalle choisi | Estimer des proportions internes à l'échantillon |
| Par quotas de profils | Constituer des groupes selon ancienneté, langue et volume d'activité | Suppose une connaissance préalable de la structure, souvent absente | Comparer des sous-populations déjà caractérisées |
Aucune de ces stratégies ne donne accès à un total. Elles donnent accès à des rapports internes : la part des comptes créés dans une même période, la proportion de messages traduits, la répartition entre comptes émetteurs et comptes relais. Ces rapports sont robustes et informatifs, et ce sont eux qu'il faut publier plutôt qu'un nombre total reconstitué par extrapolation.
Le repérage initial suppose une observation large et continue, car un réseau se signale d'abord par des coïncidences entre sources et langues différentes. NewsCore (www.newscore.fr) couvre en continu des millions de sources multilingues, détecte les reprises simultanées d'un même contenu et conserve le lien vers chaque publication d'origine, ce qui fournit des points de départ documentés. La construction de l'échantillon reste ensuite un choix méthodologique explicite de l'équipe.
Le piège de la boule de neige et comment le documenter
La boule de neige est la stratégie la plus employée parce qu'elle est la seule praticable avec des moyens ordinaires. Son biais est bien connu : en suivant les relations, on atteint prioritairement les comptes très connectés et l'on manque les périphéries isolées. Le réseau reconstitué apparaît donc plus dense et plus centralisé qu'il ne l'est réellement.
Trois informations rendent ce biais interprétable. Le point de départ, c'est-à-dire la liste exacte des comptes de la première vague et la raison de leur sélection. Le nombre de vagues effectuées, car les résultats changent fortement entre deux et quatre vagues. Enfin le taux de saturation, la part de comptes déjà connus parmi ceux découverts à la dernière vague.
Un taux de saturation élevé indique que la collecte a exploré la composante accessible du réseau ; un taux faible signale que l'on s'est arrêté en cours d'exploration, et interdit toute affirmation sur la taille. Consigner ces trois éléments coûte quelques lignes et permet à un tiers de refaire l'exercice, ce qui est la définition pratique de la reproductibilité.
Un total de comptes annoncé sans protocole d'échantillonnage ne mesure pas un réseau : il mesure les moyens de celui qui l'a compté.
Ce que l'échantillon autorise à dire sur la portée
La portée est la grandeur la plus demandée et la plus fragile. Les compteurs d'affichage fournis par les plateformes agrègent des expositions très hétérogènes, du survol d'une fraction de seconde à la lecture complète, et ils sont sensibles aux relais automatisés. Additionner ces compteurs sur un échantillon de comptes produit un nombre spectaculaire et sans référent clair.
Les formulations défendables sont plus modestes et plus utiles. Décrire la structure du réseau observé, indiquer l'ordre de grandeur des comptes identifiés, donner les proportions internes, situer la diffusion par rapport à un point de comparaison connu de la même période. Chacune se rattache à une observation, et chacune reste vérifiable par un tiers disposant du protocole.
Enfin, un échantillon est daté. Un réseau d'influence se recompose vite, par suppression de comptes et création de nouveaux, et une mesure vieille de quelques semaines décrit un état révolu. Republier une portée ancienne sans sa date de collecte est une erreur courante, qui transforme une observation ponctuelle en caractérisation durable d'un dispositif qui a déjà changé.
Questions fréquentes
Combien de comptes faut-il collecter pour mesurer un réseau d'influence ?
La question du nombre vient après celle du critère. Un échantillon de quelques dizaines de comptes construit sur un critère de coordination écrit et vérifiable renseigne davantage qu'un ensemble de plusieurs milliers de comptes rassemblés par mot-clé. Le volume améliore la précision des proportions internes ; il ne corrige aucun biais de sélection introduit au départ.
Peut-on estimer le nombre total de comptes d'une opération d'influence ?
Pas à partir d'une collecte publique, faute de base de sondage et de tirage aléatoire. Les extrapolations circulant sur ces sujets supposent une homogénéité du réseau que rien ne démontre. La formulation honnête indique le nombre de comptes effectivement identifiés, la méthode qui a conduit à eux, et la date de la collecte, sans projection vers un total.
Comment distinguer un relais spontané d'un compte du dispositif ?
Par des indices de coordination et non par le contenu publié. La simultanéité étroite des publications, la réutilisation d'éléments techniques identiques, les créations de comptes groupées et l'absence d'activité antérieure sans rapport avec la campagne constituent le faisceau usuel. Un compte partageant le même message sans aucun de ces indices relève du relais d'opinion, et le classer autrement fausse toutes les proportions.
À quelle fréquence refaire l'échantillonnage d'un réseau suivi ?
À chaque publication de résultat, et au minimum à chaque évolution notable du dispositif observé. Les suppressions de comptes et les recréations modifient rapidement la composition accessible. Conserver les échantillons successifs, avec leurs dates et leurs points de départ, permet en outre de décrire une trajectoire, ce qui est souvent plus informatif qu'une photographie isolée.