Baromètre de l'accord entre analystes : mesurer la reproductibilité d'une cotation
Deux analystes qui cotent le même lot de signaux aboutissent-ils au même résultat : protocole de double cotation en aveugle et lecture d'un indice corrigé du hasard.
À retenir
- Un protocole de double cotation en aveugle sur un lot commun mesure la reproductibilité d'une grille, pas sa pertinence.
- Le pourcentage d'accord brut surestime la concordance dès qu'une catégorie domine le lot, car il n'exclut pas l'accord dû au seul hasard.
- Un indice corrigé du hasard retranche ce niveau de base et se lit par paliers fixés avant la mesure, pas ajustés après coup.
- Un suivi répété dans le temps distingue une fluctuation normale d'une dérive réelle de la cotation.
Un baromètre de l'accord entre analystes ne juge pas une grille de cotation. Il mesure si deux personnes qui appliquent la même grille au même lot de signaux aboutissent au même résultat. Cette distinction commande tout le reste : un instrument peut être bien conçu sur le papier et rester inutilisable en pratique si deux opérateurs formés ne cotent pas pareil un cas ambigu. La reproductibilité entre opérateurs est donc une propriété de l'usage, pas seulement du référentiel.
Un protocole de double cotation en aveugle
Le protocole retenu part d'un lot commun de signaux tirés au hasard dans un flux de veille courant, assez large pour couvrir les catégories rares autant que les catégories fréquentes. Deux analystes reçoivent ce lot séparément, sans échange préalable ni accès au résultat de l'autre, et appliquent la grille de cotation en vigueur. L'aveugle porte sur la cotation du collègue, pas sur la nature du signal : chacun sait ce qu'il évalue, mais ignore ce que l'autre a conclu.
Le lot doit rester identique à l'unité près : mêmes signaux, même ordre de présentation autant que possible, même fenêtre temporelle. Toute variation dans le matériau soumis introduit une source de désaccord étrangère à la question posée, qui est celle de la cohérence de lecture, pas celle de la stabilité du flux. Un troisième temps, une fois les deux cotations recueillies, consiste à croiser les résultats catégorie par catégorie sans encore trancher qui a raison : l'objet du baromètre est l'accord, pas l'arbitrage.
La taille du lot conditionne la solidité de la mesure. Un échantillon trop restreint gonfle l'incertitude sur l'indice final et rend toute variation d'une session à l'autre difficile à interpréter. Un lot renouvelé à intervalle régulier, avec une part de recouvrement d'une session à la suivante, permet de suivre l'évolution de l'accord dans le temps plutôt que de n'en obtenir qu'une photographie isolée.
Pourquoi le pourcentage d'accord brut trompe
Le réflexe le plus courant consiste à diviser le nombre de cotations identiques par le nombre total de signaux du lot. Ce pourcentage d'accord brut a un défaut structurel : il ne retranche pas l'accord qui surviendrait même si les deux analystes cotaient au hasard. Or ce niveau de base n'est pas nul, surtout quand une catégorie domine largement le lot.
Prenons un lot où neuf signaux sur dix relèvent d'une même catégorie majoritaire. Deux analystes qui coteraient sans aucun jugement, en attribuant systématiquement la catégorie la plus fréquente, obtiendraient déjà un accord brut élevé simplement parce que la probabilité de tomber juste par défaut est forte. Le pourcentage d'accord ne distingue pas ce socle mécanique de l'accord réellement apporté par le jugement des opérateurs.
Cette surestimation grandit avec le déséquilibre des catégories. Plus une catégorie domine le lot, plus l'accord brut se rapproche d'un plafond haut sans que la grille soit pour autant mieux appliquée. À l'inverse, un lot équilibré entre catégories rend le pourcentage brut plus informatif, mais ce cas de figure est rare dans un flux de veille réel, où les signaux ordinaires l'emportent toujours sur les signaux rares.
L'indice corrigé du hasard et sa lecture
Un indice corrigé du hasard retranche explicitement ce niveau de base attendu sous l'hypothèse d'un accord purement fortuit, calculé à partir de la distribution observée des catégories chez chaque analyste. Le résultat exprime la part d'accord qui dépasse ce que le hasard produirait déjà, ramenée à l'écart maximal possible entre accord parfait et accord fortuit.
Un indice proche de zéro signifie que l'accord observé ne dépasse pas ce qu'un tirage aléatoire aurait donné, même si le pourcentage brut affiche un chiffre élevé. Un indice proche de un signifie à l'inverse que les deux analystes convergent presque systématiquement au delà de ce que le hasard expliquerait. Entre les deux, la lecture se fait par paliers convenus à l'avance et documentés dans la méthode, pas au cas par cas selon le résultat obtenu.
Ces paliers distinguent classiquement un accord faible, qui appelle une révision de la formation ou des définitions, un accord modéré, qui signale une grille globalement fonctionnelle mais avec des zones grises à clarifier, et un accord substantiel, qui autorise à traiter la cotation d'un opérateur unique comme représentative du collectif. Aucun de ces paliers ne dispense de regarder le détail par catégorie : un indice global correct peut masquer une catégorie précise où le désaccord reste élevé.
Seuils d'interprétation et leurs limites
Les seuils publiés dans la littérature méthodologique varient d'un domaine à l'autre et ne constituent pas une frontière absolue entre grille valide et grille défaillante. Un indice modéré dans un contexte de cotation à fort enjeu appelle une vigilance différente d'un indice identique dans un contexte d'usage exploratoire. Le seuil retenu doit donc être fixé avant la mesure, en fonction de l'usage prévu du résultat, et non ajusté après coup pour valider une grille existante.
L'indice corrigé du hasard reste par ailleurs sensible à la taille du lot et à la rareté de certaines catégories. Sur un très petit échantillon, un seul désaccord peut faire chuter l'indice de façon disproportionnée. Sur une catégorie rare, même avec quelques signaux, l'indice devient instable et peu interprétable isolément : il faut alors le lire conjointement avec le nombre absolu de cas observés dans cette catégorie, pas seulement avec le score agrégé.
Une dernière limite tient à la nature même du baromètre : il mesure un accord entre deux lectures d'une même grille, pas la validité de cette grille au regard d'un objectif externe. Deux analystes peuvent converger parfaitement sur une catégorisation qui, par ailleurs, ne rendrait pas justice à la diversité réelle des signaux traités. La reproductibilité et la pertinence sont deux qualités distinctes, mesurées par des protocoles différents, qu'il ne faut pas confondre sous prétexte qu'elles portent sur le même objet.
Ce que révèle un suivi dans la durée
Répéter le protocole à intervalle régulier transforme une mesure ponctuelle en indicateur de dérive. Une baisse progressive de l'indice corrigé du hasard sur plusieurs sessions successives signale souvent un relâchement dans l'application des définitions, un renouvellement des équipes sans reformation suffisante, ou une évolution du flux de signaux vers des cas plus ambigus que ceux couverts par la grille initiale.
Documenter chaque session avec sa date, la taille du lot, la composition par catégorie et l'indice obtenu permet de distinguer une fluctuation normale d'un décrochage réel. NewsCore relie ce type de suivi méthodologique aux flux d'actualité qu'elle agrège sur www.newscore.fr, en connectant la matière première de la veille à sa mesure de fiabilité. Un historique de plusieurs sessions donne aussi une base pour recalibrer les seuils d'alerte propres à chaque organisation, plutôt que d'importer tels quels des seuils publiés dans un contexte différent.
Questions fréquentes
Un accord brut élevé suffit-il à valider une grille de cotation ? Non : un pourcentage brut élevé peut résulter en grande partie du poids d'une catégorie dominante, sans refléter un jugement convergent des opérateurs. Seul un indice corrigé du hasard, comparé à un seuil fixé à l'avance, permet de trancher.
Combien de signaux faut-il dans le lot commun pour une mesure fiable ? Il n'existe pas de seuil universel, mais un lot trop restreint rend l'indice instable d'une session à l'autre ; la pratique courante privilégie un lot suffisamment large pour représenter chaque catégorie par plusieurs occurrences, y compris les catégories rares.
Le baromètre permet-il de dire quel analyste a raison en cas de désaccord ? Non, il mesure la concordance, pas la vérité d'une cotation. Trancher un désaccord relève d'un arbitrage distinct, mené après la mesure, par une troisième lecture ou une révision conjointe de la définition en cause.
Un indice élevé garantit-il que la grille reste pertinente dans le temps ? Non : il garantit seulement que deux opérateurs l'appliquent de façon cohérente à un instant donné. La pertinence de la grille au regard des signaux à traiter est une question distincte, qui appelle sa propre évaluation périodique.