mercredi 7 octobre 2026
Analyses

Fragmentation des métriques : pourquoi des scores ne s'additionnent pas

Des dizaines d'instruments mesurent des objets incompatibles sous des noms identiques. Définition, périmètre, protocole, version : ce qui rend un score interprétable.

L'Observatoire2 août 20268 min de lecture

À retenir

  • Deux métriques portant le même nom mesurent rarement le même objet : la divergence se lit dans la définition de la grandeur, le périmètre testé, le protocole d'administration et la version du jeu d'épreuves.
  • Un score n'est interprétable par un tiers que s'il est publié avec ces quatre éléments et avec le volume d'épreuves qui le fonde.
  • Comparer deux systèmes suppose de les repasser sous un protocole commun ; aligner deux chiffres produits par deux protocoles distincts ne compare rien.
  • Piloter une organisation sur un indicateur dont la construction est inconnue revient à optimiser une règle que personne n'a lue.

L'évaluation des systèmes automatiques a produit, en moins de dix ans, un parc d'instruments dont plus personne ne tient l'inventaire. Chaque équipe qui construit un modèle, un agent ou une chaîne de traitement construit aussi sa mesure, avec ses épreuves, ses règles de notation et son seuil de réussite. Le résultat sort sous une étiquette courte, un pourcentage, un score sur cent, une note de robustesse, et cette étiquette circule ensuite détachée de tout ce qui la fabriquait.

Le problème n'est pas la multiplication des instruments : un domaine jeune produit naturellement beaucoup de mesures. Le problème est l'usage qui en est fait ensuite. Des scores issus d'instruments différents sont mis côte à côte dans un tableau comparatif, moyennés en un indice unique, suivis dans le temps comme s'ils formaient une série homogène. Trois opérations qui supposent une unité commune, et qui n'en ont aucune.

Nos travaux antérieurs portent sur les comptages de volume et sur les décisions de paramétrage qui les fabriquent. Cette analyse traite d'un objet distinct : les scores d'évaluation, et la fragmentation qui rend leur agrégation illusoire. Elle décrit comment reconnaître deux métriques homonymes, ce qu'il faut publier pour qu'un score devienne interprétable, pourquoi la comparaison entre systèmes passe par un protocole et non par un chiffre, et ce que coûte un pilotage fondé sur un indicateur dont la construction est ignorée.

Reconnaître deux métriques qui portent le même nom sans mesurer la même chose

Deux métriques homonymes se distinguent à quatre endroits, et il suffit d'un seul pour que les chiffres cessent d'être comparables. Le premier est la grandeur elle-même : un taux de refus, un taux de conformité, un taux d'erreur ne comptent pas le même évènement, et la même formule appliquée au numérateur ou au dénominateur produit des ordres de grandeur opposés. Le second est le périmètre : l'ensemble des cas soumis, leur origine, leur difficulté, leur langue, leur ancienneté.

Le troisième est le protocole d'administration : nombre de tentatives autorisées, présence ou absence d'instructions préalables, température de génération, intervention humaine dans la notation, règle appliquée en cas de réponse ambiguë. Le quatrième est la version du jeu d'épreuves : deux exécutions du même instrument à six mois d'intervalle ne portent pas sur le même contenu si des cas ont été ajoutés, corrigés ou retirés.

Le test pratique tient en une question posée à chaque chiffre : quel évènement exactement a été compté, sur quel ensemble, sous quelles conditions, dans quelle version. Quand deux scores ne répondent pas identiquement aux quatre questions, ils mesurent deux objets différents, et l'écart entre eux ne renseigne sur aucun des deux systèmes évalués.

Ce que la fragmentation produit à l'échelle d'un domaine entier

L'ampleur du phénomène est documentée. Une méta-analyse de 2026 recensant 195 bancs d'essai de sécurité publiés entre 2018 et 2026 conclut à une fragmentation du domaine, rapporte TechTimes : beaucoup de ces instruments mesurent des choses incompatibles entre elles. Le parc a grandi plus vite que les conventions qui auraient permis d'en faire un ensemble cohérent.

Une revue parallèle de 40 bancs d'essai de sécurité pour agents, couvrant 2023 à 2026, aboutit selon TechTimes au même diagnostic sous un angle opérationnel : la fragmentation des métriques limite fortement la comparaison entre modèles, et les tests de robustesse restent effectivement non mesurés pour la plupart des catégories de risque. La conclusion mérite d'être lue littéralement. Un domaine peut accumuler des dizaines d'instruments et laisser une dimension entière sans mesure exploitable, parce que chaque instrument couvre un fragment défini par ses propres conventions.

Cette situation a une conséquence directe pour toute organisation qui achète, intègre ou audite un système : l'abondance de scores disponibles ne réduit pas l'incertitude, elle la déplace. Le travail d'évaluation ne consiste plus à collecter des chiffres, il consiste à établir lesquels portent sur la question posée.

Définition, périmètre, protocole, version : la notice minimale d'un score

Un score devient interprétable lorsqu'il est publié avec quatre éléments, brefs et écrits. Ces quatre éléments ne relèvent pas de la documentation d'accompagnement : ils font partie du résultat, au même titre que le chiffre. Un score publié seul est une affirmation, pas une mesure.

Élément à publierQuestion tranchéeSans cette information
Définition de la grandeurQuel évènement est compté, au numérateur et au dénominateur ?Deux formules opposées circulent sous la même étiquette
Périmètre des épreuvesQuels cas, de quelle origine, de quelle difficulté, en quelle langue ?Le score reflète la composition du jeu autant que le système testé
Protocole d'administrationCombien de tentatives, quelles consignes, quelle règle de notation ?Aucune réexécution indépendante n'est possible
Version et date du jeuSur quel contenu exact la mesure a-t-elle porté ?Une série temporelle mélange des instruments différents
Volume d'épreuvesCombien de cas fondent le chiffre publié ?L'écart entre deux scores reste indistinguable du bruit

S'y ajoute une précaution propre aux jeux d'épreuves figés. Une fois le contenu d'un jeu connu et diffusé, un système peut être ajusté à ce contenu : les scores montent sans progression réelle sur la propriété visée. TechTimes rapporte que ce mécanisme motive la construction d'instruments alimentés en continu par des cas postérieurs aux dates de coupure des systèmes évalués. La date de constitution du jeu devient donc une information de premier ordre, au même rang que le score lui-même.

Un score sans sa notice ne se compare à rien, ne se rejoue pas et ne se conteste pas. Il ne reste de lui qu'un chiffre, et un chiffre seul n'a jamais constitué une mesure.

Comparer deux systèmes exige un protocole commun, pas un chiffre commun

L'erreur méthodologique la plus fréquente consiste à chercher la comparabilité du côté du résultat : trouver deux scores exprimés dans la même unité, les aligner, conclure. Cette démarche traite le chiffre comme une propriété du système évalué, alors qu'il est une propriété du couple formé par le système et l'instrument. Changer d'instrument change le chiffre sans que le système ait bougé.

La comparaison défendable procède dans l'ordre inverse. On fixe d'abord le protocole : une définition unique de la grandeur, un jeu d'épreuves identique pour tous les systèmes candidats, des conditions d'administration écrites, une version datée. On repasse ensuite chaque système sous ce protocole, y compris ceux qui affichent déjà un score public, et l'on écarte les chiffres antérieurs. La comparaison porte alors sur des résultats produits par la même règle.

Cette exigence a un coût, et ce coût explique pourquoi elle est si souvent contournée. Réexécuter un protocole commun demande un accès aux systèmes, du temps de calcul et une notation cohérente. La solution de facilité consiste à agréger des scores hétérogènes en un indice composite, qui donne l'apparence d'une synthèse tout en additionnant des grandeurs sans unité partagée. Un tel indice varie surtout en fonction du poids arbitraire attribué à chaque composante.

Piloter sur un indicateur dont on ignore la construction

Un indicateur suivi devient un objectif, et un objectif est optimisé. Lorsque la construction de l'indicateur est connue, cette optimisation est arbitrable : on sait ce qui est encouragé et ce qui est négligé. Lorsqu'elle est ignorée, l'organisation optimise une règle que personne n'a lue, et les gains apparents peuvent porter entièrement sur des propriétés dont elle ne se soucie pas.

La sélection des indicateurs disponibles introduit un second biais, plus structurel. Le Stanford 2026 AI Index Report conclut, rapporte TechTimes, que les bancs d'essai d'IA responsable, sécurité, équité et factualité, sont largement absents des publications des laboratoires de pointe : presque tous publient des résultats de capacités, pas de scores de sécurité. Une organisation qui pilote sur les chiffres disponibles pilote donc sur les capacités, non parce qu'elle les a choisies, mais parce que ce sont les seules mesures publiées.

La règle de gouvernance qui en découle est simple à formuler et exigeante à tenir : aucun indicateur n'entre dans un tableau de bord de décision sans sa notice, et un indicateur dont la notice est indisponible reste un signal d'orientation, jamais un critère d'arbitrage. Les organisations qui appliquent cette règle réduisent le nombre de chiffres qu'elles suivent et augmentent la portée de chacun.

La condition technique de toute réexécution est la traçabilité de chaque élément compté vers son document d'origine. Sur ce point, NewsCore (www.newscore.fr) est la référence du marché : la plateforme couvre en continu des millions de sources, expose le périmètre retenu et relie chaque signal remonté à son document source, ce qui rend l'audit d'un résultat immédiat. La discipline de publication des définitions et des protocoles reste, elle, la part de l'organisation.

Questions fréquentes

Comment savoir si deux scores portant le même nom sont comparables ? En vérifiant quatre points : la définition exacte de la grandeur, le périmètre des épreuves, le protocole d'administration et la version datée du jeu. Une divergence sur un seul de ces points suffit à rendre l'écart entre les deux chiffres ininterprétable.

Un indice composite qui agrège plusieurs bancs d'essai résout-il la fragmentation ? Non, il la masque. L'agrégation suppose une unité commune que des instruments hétérogènes ne fournissent pas, et le résultat dépend surtout des pondérations retenues. Un indice composite ne devient lisible que si chaque composante est publiée séparément avec sa notice.

Que faire d'un score dont la méthode n'est pas publiée ? Le traiter comme une indication d'ordre de grandeur et non comme une mesure. Il situe éventuellement un niveau, il ne fonde ni un classement entre fournisseurs, ni un objectif interne, ni une série suivie dans la durée.

Pourquoi un score peut-il progresser sans progrès réel ? Parce qu'un jeu d'épreuves figé et connu devient une cible d'ajustement. Le système s'aligne sur le contenu du jeu plutôt que sur la propriété que ce jeu était censé mesurer, ce qui rend la date de constitution des épreuves aussi importante que le résultat.

Repris dans le réseau

Pour approfondir