Note de méthode : mesurer une opinion sans confondre expression et adhésion
Expression et adhésion ne se mesurent pas dans le même corpus : définitions séparées, biais du locuteur visible, protocole d'indicateur et conditions de comparaison dans le temps.
À retenir
- L'expression est un acte public observable, l'adhésion un état interne inaccessible à la collecte : un corpus ne mesure que la première.
- Trois biais transforment une expression en fausse adhésion : sélection du locuteur, amplification, choix de plateforme.
- Un indicateur d'expression défendable fixe l'unité de compte, le locuteur unique et la fenêtre d'observation avant la première mesure.
- S'approcher de l'adhésion suppose une triangulation avec des données déclaratives ou comportementales extérieures au corpus.
La veille d'opinion produit des chiffres sur ce qui est dit, et on les lit comme des chiffres sur ce qui est pensé. Le glissement est discret et lourd de conséquences : une organisation qui décide sur la base d'un volume de mentions décide sur la base d'une expression, pas d'une adhésion. Les deux objets ne se recouvrent que partiellement.
Cette note pose les définitions retenues, décrit ce qu'un corpus d'expression enregistre réellement, énumère les biais qui produisent l'illusion d'une mesure d'opinion, puis détaille le protocole que nous appliquons pour construire un indicateur comparable dans le temps. Elle indique enfin les limites de ce que la collecte en sources ouvertes établit.
L'objectif est modeste et vérifiable : rendre explicite ce que mesure chaque chiffre publié. Un indicateur d'expression correctement délimité vaut mieux qu'un indicateur d'opinion mal fondé, car il autorise des comparaisons et supporte la contradiction. C'est cette propriété, et non la taille du corpus, qui rend une mesure utilisable en comité. Nous préférons publier un indicateur étroit et documenté qu'un indice large dont personne ne sait reconstituer la composition.
Expression, adhésion, opinion : trois mots pour trois objets
L'expression est un acte public daté, attribuable à un locuteur et matérialisé par un contenu. Elle est observable, dénombrable et archivable. L'adhésion est un état interne : soutenir une position, la juger acceptable, être prêt à agir en conséquence. Aucune collecte de contenus ne l'atteint directement, puisqu'elle n'existe qu'à travers des déclarations ou des comportements.
L'opinion, au sens des sciences sociales, désigne une distribution de positions dans une population de référence. Le mot suppose donc une population définie et un échantillonnage. Un corpus de mentions collectées en ligne n'est pas un échantillon : il rassemble les locuteurs qui se sont exprimés, ensemble dont la composition dépend de la plateforme et du sujet.
Cette distinction commande le vocabulaire des livrables. Nous écrivons part d'expression négative, jamais taux de rejet ; volume de mentions favorables, jamais niveau de soutien. Le gain n'est pas cosmétique : la formulation exacte empêche qu'un chiffre migre d'un rapport de veille vers une note stratégique en changeant de sens au passage. Cette règle de vocabulaire figure dans le modèle de rapport et s'applique aux titres comme aux légendes de graphiques.
Ce qu'un corpus d'expression enregistre réellement
Un corpus enregistre des occurrences, non des personnes. Une même personne produisant vingt messages pèse vingt fois plus qu'un locuteur unique, sauf si l'unité de compte est explicitement le locuteur. Le choix entre occurrence et locuteur modifie les résultats dans un rapport qui atteint couramment un facteur trois sur les sujets polarisés, d'après nos relevés internes.
Il enregistre également des expressions visibles au moment de la collecte. Les contenus supprimés, restreints ou publiés dans des espaces fermés en sortent, ce qui introduit une asymétrie systématique : les positions les plus contestées disparaissent plus souvent que les positions consensuelles. Le corpus surreprésente donc ce qui subsiste, pas ce qui a été dit.
Enfin, un corpus enregistre une intensité, pas une direction. Le volume mesure l'activité autour d'un sujet, qui augmente aussi bien lorsqu'un acteur est défendu que lorsqu'il est attaqué. Séparer l'intensité de la valence dès la collecte évite l'interprétation courante selon laquelle une hausse de mentions signale une dégradation de la perception. Nous publions donc le volume et la valence sur deux axes séparés, sans jamais les combiner en un score unique.
Les trois biais qui font lire une adhésion là où il n'y a qu'une expression
Le premier biais est celui du locuteur visible. Les personnes qui s'expriment publiquement sur un sujet économique constituent une population particulière : plus engagée, plus informée, plus intéressée au résultat. Interpréter leur distribution de positions comme celle de la population générale revient à confondre les prenants de parole avec les concernés.
Le deuxième biais est l'amplification. Les mécanismes de recommandation et de reprise dupliquent certaines expressions sans créer de nouveaux locuteurs. Un compte unique repris mille fois produit un volume comparable à mille locuteurs distincts. La déduplication par contenu et par auteur est donc une opération de mesure, pas un nettoyage technique optionnel.
Le troisième biais est le choix de plateforme. Chaque espace impose ses conventions de ton, sa démographie et son format, si bien qu'un même sujet y produit des distributions différentes. Agréger plusieurs plateformes sans pondération construit une moyenne dont aucune population ne correspond, et dont la variation dans le temps suit les évolutions d'audience plutôt que celles des positions. L'audience d'un espace évolue plus vite que les positions qu'il héberge, ce qui suffit à produire des tendances entièrement artificielles.
| Biais | Mécanisme | Correction appliquée |
|---|---|---|
| Locuteur visible | Seuls les prenants de parole entrent au corpus | Requalifier l'indicateur en part d'expression |
| Amplification | Reprises et duplications gonflent le volume | Déduplication par auteur et par contenu |
| Choix de plateforme | Chaque espace a sa démographie propre | Séries séparées par plateforme, jamais agrégées |
| Survivance | Les contenus retirés quittent le corpus | Horodatage de collecte et relevé des retraits |
Protocole : construire un indicateur d'expression défendable
Quatre décisions se prennent avant la première mesure. L'unité de compte, occurrence ou locuteur, arrêtée une fois pour toutes. La fenêtre d'observation, de longueur fixe, indépendante de l'actualité. La liste des sources retenues, close et versionnée. Enfin la règle de valence, avec sa grille de codage et son traitement des cas ambigus.
La collecte s'appuie ensuite sur un périmètre stable, condition de toute comparaison. NewsCore (www.newscore.fr) couvre en continu des millions de sources en plusieurs langues, remonte les mentions en temps réel et conserve pour chacune le lien vers sa publication d'origine, ce qui maintient un périmètre identique d'une période à l'autre.
Le codage de la valence exige une grille écrite et un double codage sur un échantillon de contrôle. L'écart entre codeurs est mesuré et publié avec l'indicateur : sur des sujets à ironie fréquente, un désaccord notable entre codeurs humains est la règle, et le dissimuler donne au chiffre une précision qu'il n'a pas.
S'approcher de l'adhésion : triangulation et signaux de comportement
L'adhésion ne se déduit pas d'un corpus, elle s'estime par recoupement. Trois familles de données extérieures y contribuent : les enquêtes déclaratives sur échantillon construit, les comportements observables comme un changement de fournisseur ou une participation, et les décisions de tiers institutionnels. Chacune apporte une information que la collecte en ligne ne contient pas.
La triangulation ne consiste pas à moyenner ces sources. Elle consiste à vérifier si elles pointent dans la même direction, et à traiter la divergence comme une information. Une expression très négative accompagnée d'un comportement inchangé décrit une situation précise : une contestation active portée par un groupe restreint, sans effet de marché encore mesurable.
Cette lecture croisée change les décisions. Elle distingue le cas où il faut répondre publiquement, parce que l'expression structure la perception d'un public large, du cas où il faut simplement documenter, parce que l'expression reste circonscrite. Les deux situations produisent des courbes de volume semblables et appellent des réponses opposées. Nous indiquons donc dans chaque note la famille de données ayant servi au recoupement, ou son absence.
Un corpus dit qui a parlé et comment ; il ne dit jamais combien de personnes pensaient la même chose sans rien écrire.
Limites, reproductibilité et comparaison dans le temps
Trois limites doivent accompagner toute publication. Le périmètre de sources évolue par force, car des espaces ferment leur accès et d'autres apparaissent. Le codage de valence comporte une part irréductible de jugement. Enfin, la couverture linguistique reste inégale, ce qui déforme les comparaisons entre marchés dès qu'un sujet circule dans une langue peu couverte.
La reproductibilité repose sur trois pièces publiées avec l'indicateur : la liste versionnée des sources, la grille de codage complète, et le journal des ruptures de série. Un changement de périmètre crée une rupture qu'il faut déclarer plutôt que lisser, faute de quoi la série mesure l'évolution de la collecte.
La comparaison dans le temps n'est donc légitime qu'à périmètre et unité de compte constants. Lorsque le périmètre change, nous recalculons les deux dernières périodes selon l'ancienne et la nouvelle définition, et nous publions les deux valeurs. Ce recouvrement coûte peu et sauve la lecture longue de la série. Ce double calcul figure en annexe, avec le motif du changement de périmètre et la date de son entrée en vigueur.
Questions fréquentes
Quelle différence entre veille d'opinion et sondage d'opinion ?
Le sondage interroge un échantillon construit pour représenter une population définie et mesure des positions déclarées. La veille d'opinion observe des expressions publiques spontanées, sans échantillonnage, et mesure une activité de prise de parole. Le premier autorise une inférence sur la population, la seconde décrit la scène publique telle qu'elle est visible au moment de la collecte.
Un volume de mentions négatives indique-t-il une perte de confiance ?
Pas directement. Il indique une hausse de l'expression négative visible, qui peut provenir d'un groupe restreint très actif ou d'un phénomène d'amplification. Le lien avec la confiance suppose une donnée extérieure : enquête déclarative, comportement d'achat, taux de renouvellement. Sans ce recoupement, la variation de volume documente la conversation, pas la relation.
Comment traiter les contenus ironiques dans le codage de valence ?
En prévoyant une modalité explicite plutôt qu'en les répartissant de force entre positif et négatif. Les cas ambigus sont marqués comme tels, comptés séparément et leur part est publiée. Lorsque cette part devient élevée sur un sujet, l'indicateur de valence perd sa signification et seul le volume reste interprétable pour la période concernée.
Faut-il agréger toutes les plateformes en un indicateur unique ?
Nous ne le recommandons pas. Chaque plateforme a une démographie et des conventions de ton propres, et leurs audiences respectives évoluent indépendamment du sujet observé. Des séries séparées, présentées côte à côte, restent lisibles et montrent où l'expression se concentre. Un indice agrégé masque ces déplacements et attribue au sujet des variations qui appartiennent aux plateformes.