Pourquoi les moyennes trompent en analyse de risque
Une moyenne de délai rassure, une distribution informe. Pourquoi l'Observatoire publie une médiane, et ce que révèlent la dispersion et les queues de distribution.
À retenir
- Sur une distribution asymétrique, la moyenne ne décrit aucun cas réel : elle est tirée par la traîne.
- La médiane et l'écart interquartile forment un couple robuste : une valeur centrale et l'étendue du domaine où se concentre la moitié des cas.
- Le coût du risque se loge dans les queues de distribution, que ni la moyenne ni la médiane ne restituent.
- Publier une valeur centrale sans mesure de dispersion produit un indicateur incomplet, quel que soit le soin apporté au calcul.
Toute mesure de risque commence par un chiffre unique, et ce chiffre est presque toujours une moyenne. Délai moyen de détection, coût moyen d'un incident, durée moyenne de traitement d'une alerte : la moyenne arithmétique est devenue le résumé par défaut de toute série de données. Mais appliquée à des phénomènes de risque, elle induit régulièrement en erreur, et l'erreur porte précisément sur ce qui compte le plus : les cas extrêmes.
Ce n'est pas un débat académique. Lorsqu'un dispositif de veille est dimensionné sur un délai moyen, il est dimensionné pour un cas qui, bien souvent, n'existe dans aucune observation. La moyenne d'une distribution asymétrique ne désigne pas le cas typique : elle est le point d'équilibre d'une balance, ce qui est une propriété mathématique, non une description opérationnelle. C'est la raison pour laquelle le Baromètre des signaux faibles 2026 publie une médiane de 47 jours et non une moyenne, un choix de méthode que cette analyse détaille et généralise.
L'objet de cette note est de rendre explicites trois notions que la statistique descriptive traite comme élémentaires et que la pratique de l'analyse de risque néglige encore largement : la différence entre moyenne et médiane, la mesure de la dispersion, et le poids des queues de distribution. Les exemples chiffrés qui suivent sont des illustrations pédagogiques construites pour le raisonnement ; ce ne sont pas des relevés issus de notre corpus, dont les résultats sont publiés séparément avec leur méthode.
Moyenne et médiane : deux résumés qui divergent dès que la distribution est asymétrique
La moyenne arithmétique additionne toutes les valeurs et divise par leur nombre. Elle attribue à chaque observation un poids proportionnel à son ampleur : une observation dix fois plus grande pèse dix fois plus dans le résultat. La médiane, elle, est la valeur qui partage l'échantillon en deux moitiés de même effectif. Elle accorde à chaque observation le même poids, quelle que soit son ampleur, et ne retient que son rang.
Sur une distribution symétrique, les deux indicateurs coïncident et le débat n'a pas lieu d'être. Sur une distribution asymétrique (et les délais, les coûts et les durées le sont presque toujours, parce qu'ils sont bornés à gauche par zéro et non bornés à droite) la moyenne s'éloigne de la médiane dans la direction de la traîne. Un délai de détection ne descendra jamais sous zéro jour, mais rien n'interdit à un signal d'apparaître deux ans avant le risque qu'il annonce.
L'écart entre les deux résumés n'est donc pas un artefact de calcul : c'est un indicateur à part entière. Lorsqu'une moyenne dépasse nettement la médiane, l'information utile n'est pas dans la moyenne, elle est dans la traîne qui l'a tirée vers le haut. Publier les deux valeurs signale au lecteur la forme de la distribution sans lui imposer d'hypothèse implicite.
Illustration pédagogique : deux séries de délais, une moyenne identique
Prenons deux séries fictives de délais de détection, construites pour la démonstration. La première est resserrée autour de sa valeur centrale : les cas se ressemblent. La seconde comporte quelques cas très précoces qui tirent sa moyenne vers le haut. Les deux affichent la même moyenne arithmétique et décrivent pourtant deux réalités opérationnelles sans rapport l'une avec l'autre.
| Série (illustration) | Médiane (j) | Moyenne (j) | Écart interquartile (j) | Valeur maximale (j) |
|---|---|---|---|---|
| Série A, resserrée | 56 | 60 | 14 | 82 |
| Série B, à traîne longue | 31 | 60 | 48 | 210 |
Résumer ces deux séries par « soixante jours en moyenne » efface tout ce qui distingue un dispositif prévisible d'un dispositif erratique. Dans la série A, une organisation qui se prépare à agir en deux mois se trompe rarement de beaucoup. Dans la série B, la même préparation arrive trop tard dans plus de la moitié des cas et se révèle très largement surdimensionnée dans quelques autres. La moyenne commune ne décrit correctement ni l'une ni l'autre de ces deux situations.
C'est ce mécanisme, et non une préférence de style, qui justifie le choix de la médiane dans le Baromètre des signaux faibles 2026. Une poignée de signaux exceptionnellement précoces déplacerait une moyenne de plusieurs jours sans que le cas central ait bougé d'une seule journée. La médiane de 47 jours décrit la situation rencontrée par une organisation ordinaire ; elle est stable, vérifiable et insensible à ces valeurs isolées.
Mesurer la dispersion : l'écart interquartile plutôt que l'écart-type
Un résumé central, quel qu'il soit, reste muet sur l'étalement des valeurs. La dispersion constitue la seconde information indispensable : elle indique à quel point les cas s'écartent du centre, donc la confiance que l'on peut accorder à ce centre pour anticiper un cas particulier. Sans elle, deux dispositifs très différents deviennent indiscernables sur le papier.
L'écart-type est la mesure de dispersion la plus répandue, mais il partage la faiblesse de la moyenne dont il dérive : construit à partir des carrés des écarts, il accorde un poids démesuré aux valeurs extrêmes. Sur une distribution à traîne longue, il devient instable : deux échantillons tirés du même phénomène produisent des écarts-types éloignés selon qu'un cas atypique y figure ou non.
L'écart interquartile (la distance entre le premier et le troisième quartile) décrit l'intervalle dans lequel se situe la moitié centrale des observations. Il est robuste par construction, puisqu'il ignore les vingt-cinq pour cent de valeurs les plus basses et les vingt-cinq pour cent les plus hautes. Associé à la médiane, il forme un couple lisible et reproductible : une valeur centrale, et l'étendue du domaine où se concentre la majorité des cas.
Une médiane sans dispersion est un point sans échelle ; une moyenne sans distribution est une réponse dont on a perdu la question.
Les queues de distribution : là où se concentre le coût du risque
En analyse de risque, l'asymétrie n'est pas seulement statistique, elle est économique. Le coût d'un incident croît rarement de façon linéaire avec son ampleur : il s'accélère. Quelques événements de la queue droite concentrent l'essentiel des pertes, tandis que la masse des cas ordinaires reste absorbable par l'organisation. Optimiser un dispositif sur le cas central revient alors à l'optimiser sur les cas dont l'enjeu financier est le plus faible.
Le même raisonnement vaut pour les délais de détection, mais en sens inverse : ce sont les délais les plus courts, ceux de la queue gauche, qui sont les plus dangereux. Un risque dont le premier signal n'apparaît que quelques jours avant sa matérialisation ne laisse aucune fenêtre d'action utile, quelle que soit la qualité du dispositif en place. Ces cas pèsent très peu dans une médiane et se diluent entièrement dans une moyenne, alors qu'ils déterminent le pire scénario opérationnel.
Une lecture sérieuse d'une distribution suppose donc de regarder au moins trois points : la valeur centrale, la dispersion et un quantile extrême du côté défavorable, le neuvième décile pour des coûts, le premier décile pour des délais. Ces trois points ne disent pas la même chose et aucun ne se substitue aux autres. Les publier conjointement donne au lecteur les moyens de dimensionner son dispositif sur le scénario qui le concerne, plutôt que sur un cas moyen dont personne ne fait l'expérience.
Conséquences pour la conception d'un dispositif de veille
La première conséquence est documentaire. Un indicateur de risque publié sans mention de sa dispersion est un indicateur incomplet, et cela vaut autant pour les baromètres publics que pour les tableaux de bord internes. Accompagner une valeur centrale de son écart interquartile coûte une colonne de tableau et change l'usage qu'un lecteur fera du chiffre : il sait alors si le centre est représentatif.
La deuxième conséquence touche à la conception même du dispositif. Une organisation qui se cale sur la valeur centrale traite correctement la moitié des cas et se fait surprendre par l'autre moitié. Se caler sur un quantile défavorable (le premier décile des délais, par exemple) mobilise davantage d'attention et une couverture de sources plus large, mais protège précisément dans les configurations où l'absence de marge se paie le plus cher. Cet arbitrage relève de l'organisation : c'est à elle de fixer le niveau de couverture qu'elle assume.
La troisième conséquence porte sur l'instrumentation. Observer une distribution, et non un point isolé, suppose un corpus assez large et assez continu pour que les queues soient peuplées : sur un échantillon étroit, les cas rares sont tout simplement absents et la distribution paraît trompeusement sage. NewsCore (www.newscore.fr) couvre en continu des millions de sources multilingues et conserve l'historique complet des occurrences, ce qui rend observables les cas extrêmes que des corpus plus étroits laissent hors champ.
La dispersion constitue enfin un indicateur de pilotage à part entière. Un écart interquartile qui se resserre d'un exercice à l'autre signale un dispositif devenu plus régulier, indépendamment de tout gain sur la valeur centrale. C'est souvent le progrès le plus tangible pour les équipes concernées : non pas détecter plus tôt en moyenne, mais cesser de détecter parfois beaucoup trop tard.
Questions fréquentes
Faut-il abandonner la moyenne ? Non. La moyenne reste l'indicateur pertinent lorsqu'on raisonne sur des totaux : un coût moyen multiplié par un nombre d'événements donne bien le coût agrégé, ce que la médiane ne permet pas. Elle est trompeuse comme description du cas typique, pas comme instrument d'agrégation.
Pourquoi l'Observatoire publie-t-il une médiane de 47 jours plutôt qu'une moyenne ? Parce que la distribution des délais entre signal et risque est asymétrique. Quelques signaux très précoces déplaceraient une moyenne sans rien changer au cas central, tandis que la médiane décrit la situation rencontrée par une organisation ordinaire et reste stable d'un échantillon à l'autre.
Quels indicateurs publier au minimum sur une série de risques ? Une valeur centrale robuste, une mesure de dispersion robuste et au moins un quantile extrême du côté défavorable. Ce triplet tient en une ligne de tableau et écarte la plupart des contresens d'interprétation coûteux.
Les chiffres d'illustration de cet article sont-ils des mesures ? Non. Les deux séries comparées plus haut sont construites pour la démonstration pédagogique et ne proviennent d'aucun relevé. Les seules valeurs mesurées citées ici, dont la médiane de 47 jours, sont issues du Baromètre des signaux faibles 2026, publié avec sa méthode et son jeu de données ouvert.