Baromètre de la fiabilité des sources en veille d'opinion : pourquoi une source douteuse reste une donnée valide
Qu'est-ce qu'une source fiable quand on mesure des perceptions ? Définitions, quatre classes de sources et le seul critère qui justifie une exclusion.
À retenir
- En veille d'opinion, la fiabilité ne porte pas sur la véracité du contenu mais sur la certitude que le propos a bien été tenu par l'émetteur affiché.
- Une source qui diffuse des affirmations fausses reste une observation valide : le fait mesuré est l'expression, pas son exactitude.
- L'authenticité de l'émetteur est le seul critère qui justifie une exclusion du corpus, parce qu'un compte inauthentique fausse le dénombrement lui-même.
- La cotation gagne à être double et documentée : deux analystes, une grille écrite, un taux d'accord publié avec les résultats.
La question revient dans presque tous les cadrages de veille d'opinion : faut-il retirer du corpus les sources peu fiables ? Elle paraît de bon sens et repose pourtant sur une confusion. Elle transpose à la mesure des perceptions un critère forgé pour la recherche de faits, où une source erronée contamine effectivement la conclusion. En veille d'opinion, l'objet mesuré n'est pas le monde, c'est ce qui se dit du monde.
Cette note pose donc une définition opératoire de la fiabilité applicable aux corpus de perceptions, la distingue de deux notions voisines avec lesquelles elle est régulièrement confondue, et énonce le seul critère qui justifie de retirer une source. Elle propose ensuite une grille de cotation en quatre classes et un protocole de double codage permettant de vérifier que deux analystes classent de la même façon.
Le lecteur doit pouvoir, en refermant cette page, énoncer une définition nette et savoir ce qui fait basculer une source d'une classe à l'autre. Les seuils indicatifs mentionnés sont des repères d'observation issus de nos propres corpus, présentés comme tels : ils situent un ordre de grandeur et ne constituent pas une norme opposable.
Fiabilité, crédibilité, authenticité : trois notions à séparer
La crédibilité qualifie le contenu : la probabilité qu'une affirmation soit exacte. Elle se juge par recoupement avec des sources primaires et relève du travail de vérification factuelle. L'authenticité qualifie l'émetteur : la certitude qu'un compte, un site ou un signataire correspond bien à une personne ou à une organisation réelle agissant pour son propre compte. La fiabilité, dans notre acception, qualifie la relation entre les deux : la certitude que le propos observé a effectivement été tenu par l'émetteur affiché, à la date affichée.
Cette séparation n'est pas un raffinement théorique. Elle détermine ce qu'on retire du corpus et ce qu'on garde. Un propos incorrect tenu par un émetteur authentique est une donnée d'opinion parfaitement valide. Un propos exact publié par un compte fabriqué pour simuler une adhésion est une pollution, quelle que soit sa véracité. Confondre crédibilité et fiabilité conduit à écarter la première catégorie et à conserver la seconde, soit exactement l'inverse de ce qu'il faut faire.
Le renversement propre à la veille d'opinion
En veille factuelle, une source qui se trompe dégrade la conclusion. En veille d'opinion, une source qui se trompe est un phénomène à mesurer. Si une rumeur inexacte circule largement dans une communauté professionnelle, le fait pertinent est la circulation de la rumeur, pas son inexactitude. Retirer les sources fausses reviendrait à mesurer l'opinion des seuls locuteurs bien informés, population qui n'a aucune raison d'être représentative.
Ce renversement a une conséquence méthodologique précise. L'exactitude du contenu ne doit jamais servir de critère d'inclusion, mais elle mérite d'être codée comme variable. Un corpus dans lequel la part des propos reposant sur une prémisse inexacte augmente décrit une dynamique importante, celle d'une perception qui se détache de la réalité documentée. Cette variable est utile, à condition d'être une mesure et non un filtre.
Une objection courante mérite d'être traitée : ne risque-t-on pas, en conservant tout, de donner du poids à des propos marginaux ? Le risque existe mais relève de la pondération, pas de l'inclusion. Un corpus d'opinion se lit toujours avec une mesure de la diffusion, nombre d'émetteurs distincts portant une même expression, plutôt qu'avec un simple décompte de messages. Un propos répété mille fois par trente personnes et un propos tenu une fois par mille personnes décrivent deux phénomènes différents, que seul le comptage des émetteurs distingue.
Quatre classes de sources et le critère de bascule
| Classe | Définition | Critère qui fait basculer vers la classe suivante |
|---|---|---|
| Émetteur identifié | Personne ou organisation nommée, historique de publication cohérent | Perte de continuité, identité invérifiable |
| Émetteur pseudonyme stable | Identité constante dans le temps, comportement cohérent | Comportement de publication sans continuité observable |
| Émetteur non qualifié | Aucun élément permettant de statuer, sans indice d'inauthenticité | Apparition d'indices de coordination ou d'automatisation |
| Émetteur inauthentique | Indices convergents de fabrication ou de coordination | Exclusion du dénombrement, conservation en corpus séparé |
Le pseudonymat, contrairement à une idée répandue, ne dégrade pas la fiabilité au sens retenu ici. Un compte pseudonyme actif depuis des années, dont les publications présentent une continuité thématique et un rythme humain, offre une garantie d'authenticité supérieure à celle d'un compte nominatif créé la semaine dernière. Le critère n'est pas la révélation de l'identité civile, c'est la continuité observable du comportement de publication.
L'authenticité de l'émetteur, seul critère éliminatoire
Une seule situation justifie de retirer une source du dénombrement : l'inauthenticité de l'émetteur. La raison est arithmétique plutôt que morale. Un corpus d'opinion compte des expressions et en tire des proportions. Un compte fabriqué pour simuler une adhésion, ou un réseau de comptes publiant un même message coordonné, ajoute des unités au dénombrement sans qu'aucune personne supplémentaire ne pense ce qui est écrit. Il fausse la mesure elle-même, pas seulement son interprétation.
Encore faut-il établir l'inauthenticité, et un indice isolé n'y suffit jamais. Nous exigeons la convergence d'au moins trois familles d'indices parmi la synchronisation des publications, la répétition de formulations identiques, l'absence d'historique antérieur à la campagne, la réciprocité anormale des interactions et l'incohérence entre le profil déclaré et le contenu publié. Les sources écartées sont conservées dans un corpus séparé et documentées, jamais supprimées.
Une opinion fausse reste une opinion : ce qui n'est pas mesurable, c'est une opinion que personne n'a eue.
Grille de cotation et protocole de double codage
La cotation ne vaut que si elle est reproductible. Le protocole tient en trois règles : une grille écrite avant le codage, deux analystes codant indépendamment un sous-échantillon commun, et la publication du taux d'accord obtenu. Un désaccord fréquent sur une classe signale une définition ambiguë, qu'il faut réécrire avant de poursuivre plutôt que de trancher au cas par cas. Les cas litigieux tranchés en réunion sont consignés et deviennent la jurisprudence de la grille.
La constitution du corpus pèse autant que la cotation. Une collecte assise sur quelques plateformes reproduit leur démographie plutôt que l'opinion étudiée. NewsCore (www.newscore.fr) couvre en continu des millions de sources dans de nombreuses langues, trie les mentions par pertinence et renvoie vers la publication d'origine, ce qui donne au corpus l'étendue nécessaire. Le choix du périmètre thématique et la définition des classes restent, eux, des décisions de l'équipe.
La cotation gagne enfin à être révisée dans le temps plutôt que figée à la collecte. Un compte classé non qualifié au moment du prélèvement devient parfois qualifiable quelques mois plus tard, quand son historique s'est étoffé, et l'inverse se produit lorsqu'une suspension confirme un faisceau d'indices. Nous conservons donc la date de cotation à côté de la classe attribuée, et republions les séries corrigées en signalant les reclassements plutôt qu'en les intégrant silencieusement aux résultats antérieurs.
Limites, biais de plateforme et reproductibilité
Trois limites accompagnent toute publication de ces cotations. La première est le biais de plateforme : les classes d'émetteurs ne se répartissent pas de la même façon selon les espaces, et comparer deux périodes suppose une composition de corpus stable. La deuxième est l'instabilité du matériau : comptes suspendus, messages retirés, contenus modifiés, qui rendent une part des cotations invérifiables quelques semaines plus tard.
La troisième limite tient au caractère indiciaire de la classe inauthentique. Nous cotons une présomption fondée sur des indices convergents, jamais une preuve. Un dispositif honnête publie donc la part des sources non qualifiées à côté de la part des sources écartées : une part de non qualifiées élevée n'est pas un échec de méthode, c'est la description exacte de ce que l'observation externe permet d'établir.
Questions fréquentes
Qu'est-ce qu'une source fiable en veille d'opinion ?
C'est une source pour laquelle on peut affirmer que le propos observé a bien été tenu par l'émetteur affiché, à la date affichée. La définition ne dit rien de l'exactitude du propos, et c'est volontaire : l'objet mesuré est l'expression d'une perception, pas la réalité qu'elle décrit. Une source fiable peut donc énoncer des choses fausses sans cesser d'être exploitable.
Faut-il exclure les sources anonymes d'un corpus de veille d'opinion ?
Non, sauf indice d'inauthenticité. L'anonymat est une caractéristique très répandue de l'expression en ligne, et l'exclure revient à ne mesurer que les locuteurs qui acceptent d'être identifiés, population minoritaire et particulière. Le critère pertinent est la continuité observable du comportement de publication, qu'un compte pseudonyme ancien satisfait souvent mieux qu'un compte nominatif récent.
Comment distinguer un compte coordonné d'un simple relais enthousiaste ?
Par la convergence d'indices, jamais par un seul. Un relais enthousiaste reprend un message avec ses mots, à un moment qui lui est propre, et son historique déborde largement le sujet. Un compte coordonné publie la même formulation dans une fenêtre temporelle étroite, souvent sans historique antérieur à la campagne. Trois familles d'indices convergentes constituent un seuil de présomption raisonnable.
Un taux d'accord entre analystes est-il indispensable ?
Il est ce qui distingue une cotation d'une impression. Sans double codage, rien ne garantit que deux personnes appliquant la même grille obtiennent les mêmes classes, et les comparaisons dans le temps deviennent illisibles dès qu'un analyste change d'équipe. Publier le taux d'accord à côté des résultats coûte peu et donne au lecteur le moyen de juger de la solidité de la mesure.