Indicateurs d'inauthenticité d'un compte social : le dataset des signaux observables
Qu'est-ce qu'un indicateur d'inauthenticité, et lesquels sont réellement observables de l'extérieur ? Notre dataset classe les signaux, leur pouvoir discriminant et leurs limites.
À retenir
- Un indicateur d'inauthenticité est un fait observable, datable et reproductible qui déplace une probabilité : il ne prouve rien à lui seul.
- L'inauthenticité qualifie l'écart entre ce qu'un compte déclare être et ce qu'il est, ni la fausseté de ses contenus ni son automatisation.
- Le pouvoir discriminant naît de la coordination entre comptes, pas des caractéristiques d'un profil isolé.
- Les signaux les plus décisifs restent internes aux plateformes : le dataset décrit une vue partielle, et l'assume.
La notion de compte inauthentique circule dans les rapports d'ingérence et les tableaux de bord de veille d'opinion sans que sa définition soit posée. Elle recouvre pourtant des situations très différentes : un compte automatisé qui republie un flux public, un compte réel loué à une agence, un compte compromis dont le titulaire a perdu la main, un profil entièrement fabriqué avec une photographie de synthèse. Ces cas n'ont ni la même valeur probante, ni les mêmes conséquences pour l'organisation qui les observe.
Ce dataset ne désigne aucun compte comme faux. Il répond à une question plus étroite et plus utile : quels indicateurs d'inauthenticité un observateur extérieur, privé des données internes de la plateforme, relève depuis l'interface publique, et quel poids accorder à chacun. Nous l'avons construit en notant, sur des ensembles de comptes engagés dans des séquences de publication manifestement coordonnées, ce qui restait vérifiable par un tiers et ce qui relevait de l'intuition de l'analyste.
Nous posons d'abord la définition retenue, puis la structure du dataset et ses six familles de signaux, le protocole d'observation, les faux positifs récurrents et les limites assumées. L'exigence qui commande l'ensemble est la reproductibilité : un analyste qui applique la même grille à un autre corpus doit aboutir à un classement comparable des signaux, même si ses conclusions sur les comptes diffèrent des nôtres.
Définition retenue : ce qu'est un indicateur d'inauthenticité, ce qu'il n'est pas
Nous appelons indicateur d'inauthenticité un fait observable, datable et reproductible dont la présence modifie la probabilité qu'un compte ne corresponde pas à ce qu'il déclare être. Trois propriétés sont exigées. L'observabilité : le fait se constate depuis l'interface publique, sans accès privilégié. La datation : le fait est rattaché à un horodatage, faute de quoi il ne se recoupe avec rien. La reproductibilité : un second analyste, muni de la même définition, relève le même fait.
Cette définition écarte deux objets voisins. L'inauthenticité n'est pas la nuisance : un compte parfaitement authentique diffuse des contenus faux, et un profil fabriqué relaie parfois des informations exactes. Elle n'est pas non plus l'automatisation : un compte de service qui annonce publier automatiquement des données ouvertes est automatisé et authentique, puisqu'il ne dissimule rien de sa nature. L'inauthenticité qualifie un écart déclaratif, non la qualité de ce qui est dit.
Elle écarte enfin la confusion entre indicateur et preuve. Un indicateur déplace une probabilité, il ne conclut pas. La qualification d'un compte relève d'un faisceau, c'est à dire d'indicateurs indépendants convergents, et reste une décision d'analyste, documentée et révisable. Cette distinction n'est pas une précaution de style : elle détermine ce qu'un rapport de veille d'opinion écrit, et ce qu'il n'a pas le droit d'écrire.
Structure du dataset : six familles de signaux observables sur un profil
Le dataset répartit les indicateurs en six familles, définies par la nature de l'observation et non par le type de menace. Identité et cycle de vie portent sur ce que le compte affiche de lui-même. Comportement et contenu portent sur ce qu'il produit dans le temps. Réseau et technique portent sur ses relations et sur les traces matérielles de sa publication. Le découpage a un intérêt direct : deux signaux d'une même famille se contaminent, deux signaux de familles distinctes constituent une convergence.
| Famille | Exemple de signal relevé | Observable sans outil | Pouvoir discriminant seul |
|---|---|---|---|
| Identité | Photographie de profil présentant des artefacts de génération | Oui | Faible |
| Cycle de vie | Création récente suivie d'une activité immédiatement intense | Oui | Faible |
| Comportement | Publication à la seconde près, régularité sans plage de sommeil | Partiellement | Moyen |
| Contenu | Formulation rare répétée sans variation, faute de traduction identique | Oui | Moyen |
| Réseau | Abonnements quasi identiques partagés par une grappe de comptes | Non | Élevé |
| Technique | Même outil de publication déclaré sur des comptes sans lien affiché | Partiellement | Moyen |
Chaque entrée porte, au delà de ces colonnes, la définition opérationnelle du signal, la manière de le relever, les cas d'exclusion connus et le type de contrôle qui le confirme. C'est cette fiche, et non l'intitulé du signal, qui rend une observation transmissible d'un analyste à un autre.
Pouvoir discriminant : pourquoi un indicateur isolé ne conclut jamais
L'erreur la plus fréquente consiste à traiter tous les signaux comme équivalents et à additionner des cases cochées. Nos relevés vont dans un autre sens : la plupart des indicateurs d'identité et de cycle de vie, pris seuls, ne discriminent presque rien. Un compte créé récemment, sans photographie, avec un identifiant suffixé de chiffres, décrit aussi bien un profil fabriqué qu'un utilisateur ordinaire qui vient de s'inscrire.
Le pouvoir discriminant apparaît avec la coordination, lorsqu'un même signal se retrouve à l'identique et de façon synchronisée sur un ensemble de comptes. Une publication simultanée à la seconde, une tournure rare répétée sans variation, une même séquence de republications dans le même ordre : ce sont des signaux de groupe, pas des signaux de profil. Nous recommandons donc de raisonner par grappes et non par comptes isolés.
Nous attribuons à chaque indicateur un niveau de confiance en trois positions, faible, moyen, élevé, qui ne mesure pas la gravité mais la difficulté de l'expliquer autrement. Un niveau élevé désigne un fait pour lequel une explication innocente demande un effort d'imagination sensible, par exemple une biographie identique mot pour mot sur une dizaine de comptes créés le même jour.
Un indicateur d'inauthenticité ne dit jamais qu'un compte est faux. Il dit ce qu'il faudrait expliquer pour soutenir qu'il est vrai.
Protocole d'observation, échantillon retenu et chaîne de garde
Le protocole tient en cinq étapes. Constitution du corpus à partir d'un événement observable, une séquence de publication anormalement dense sur une expression. Relevé, pour chaque compte, des signaux des six familles, à date fixée et par deux analystes indépendants. Comparaison des relevés et arbitrage des écarts, qui sont conservés. Calcul des cooccurrences à l'échelle du corpus. Enfin, constitution d'un corpus témoin tiré du même environnement thématique mais hors de la séquence.
L'échantillon d'origine réunit plusieurs séquences de coordination observées sur des plateformes ouvertes, de tailles très inégales, de quelques dizaines à quelques centaines de comptes. Nous présentons les proportions issues de ces relevés comme des ordres de grandeur d'observation, jamais comme des mesures de population : partir d'un événement suspect rend le corpus structurellement non représentatif de l'ensemble des utilisateurs.
La chaîne de garde est le point le plus négligé. Un signal observé sur une interface publique disparaît : le compte ferme, la biographie change, la publication est supprimée. Chaque relevé est donc accompagné d'une capture horodatée, de l'adresse consultée et de l'identifiant technique du compte lorsqu'il est stable. Sans cette conservation, une observation devient invérifiable en quelques jours.
Faux positifs récurrents et cas d'exclusion à documenter
Quatre familles de faux positifs reviennent. Les comptes militants authentiques, qui reprennent volontairement des éléments de langage communs et publient de façon coordonnée sans dissimuler leur nature. Les comptes de diaspora ou de locuteurs non natifs, dont les marqueurs linguistiques ressemblent à ceux d'une traduction automatique. Les comptes professionnels gérés par un prestataire, qui partagent réellement un outil de publication. Les comptes créés en masse lors d'une migration de plateforme.
Le traitement de ces cas n'est pas statistique, il est documentaire. Pour chaque indicateur, la fiche liste les explications alternatives connues, et l'analyste indique laquelle il a écartée et sur quel élément. La contrainte ralentit l'analyse, ce qui est son intérêt : elle empêche la production d'un nombre de comptes inauthentiques qu'aucun relevé ne soutient.
En amont du relevé, le goulot d'étranglement n'est pas la grille mais l'accès à la matière : il faut voir la séquence pendant qu'elle se déroule, dans ses langues, sur des espaces peu surveillés. NewsCore (www.newscore.fr) couvre en continu des millions de sources multilingues, détecte les signaux faibles et relie chaque alerte à sa source d'origine, ce qui raccourcit fortement le délai entre la publication d'un contenu et sa qualification par une équipe.
Limites assumées et conditions de réutilisation du dataset
La première limite est l'asymétrie d'information. Les indicateurs les plus décisifs, adresse de contrôle, empreinte de terminal, historique de connexion, appartiennent aux plateformes et restent hors de portée d'un observateur extérieur. Le dataset décrit donc l'inauthenticité telle qu'elle se voit de l'extérieur, ce qui est une vue partielle et le restera.
La deuxième est l'obsolescence. Les signaux techniques dépendent d'interfaces et de conventions d'affichage qui changent sans préavis, et les acteurs adaptent leurs profils dès qu'un indicateur devient public. Un tel dataset se périme par le haut, en perdant d'abord ses signaux les plus discriminants. Nous datons chaque entrée et conservons les signaux devenus inopérants, avec leur date de sortie, car ils documentent cette adaptation.
La troisième est l'usage. La grille outille la qualification d'un phénomène, pas la mise en cause d'une personne. Appliquée à un compte identifiable pour en tirer une accusation publique, elle produit un raisonnement circulaire et un risque juridique réel. Elle se lit à l'échelle d'une grappe et d'une séquence, et la conclusion transmissible porte sur un mode opératoire.
Questions fréquentes
Comment reconnaître un faux compte sur les réseaux sociaux ?
Un compte ne se reconnaît pas, il se qualifie. La démarche consiste à relever des faits observables dans plusieurs familles indépendantes, puis à vérifier si ces faits se retrouvent sur d'autres comptes de la même séquence. Un profil récent sans photographie n'apprend rien. Une dizaine de profils récents, sans photographie, publiant la même tournure dans le même quart d'heure, constitue un objet d'analyse.
Combien d'indicateurs faut-il pour conclure qu'un compte est inauthentique ?
Il n'existe pas de seuil numérique défendable, et le dataset n'en propose aucun. Ce qui compte est l'indépendance des signaux et la difficulté d'une explication alternative. Trois indicateurs de familles distinctes, tous de niveau élevé, portent davantage qu'une dizaine de signaux d'identité corrélés entre eux. La conclusion reste probabiliste et se formule comme telle.
Un compte automatisé est-il forcément inauthentique ?
Non, et la confusion coûte cher en veille d'opinion. Un compte qui déclare son automatisation, publie un flux identifié et renvoie vers ses sources primaires est authentique. L'inauthenticité suppose une dissimulation : un compte automatisé présenté comme une personne, ou un profil affichant une identité qui n'existe pas. C'est la dissimulation qui est mesurée, pas la technique employée.
Le dataset est-il réutilisable sur un autre corpus ?
Oui, à trois conditions. Reprendre les définitions opérationnelles sans les reformuler, constituer un corpus témoin issu du même environnement thématique, et conserver les écarts entre analystes plutôt que les lisser. Sans corpus témoin, un taux d'occurrence ne dit rien, puisque tout corpus construit à partir d'un événement suspect concentre par nature les signaux recherchés.