mercredi 7 octobre 2026
Notes de méthode

Note de méthode : déterminer la taille d'échantillon minimale avant de conclure qu'un dispositif fait mieux qu'un autre

Sur quelques dizaines de cas, un écart apparent reste souvent compatible avec le hasard : la logique d'un intervalle d'incertitude et une règle interdisant le mot progression sans lui.

L'Observatoire14 août 20266 min de lecture

À retenir

  • Sur un échantillon de quelques dizaines de cas, un écart de plusieurs points entre deux dispositifs reste fréquemment compatible avec une simple fluctuation d'échantillonnage.
  • Un intervalle d'incertitude autour d'une proportion observée indique la plage de valeurs réellement compatible avec les données, pas la valeur exacte du taux sous-jacent.
  • Conclure qu'un dispositif fait mieux qu'un autre suppose que leurs intervalles respectifs ne se recouvrent pas, ou qu'un test dédié écarte l'hypothèse d'absence de différence.
  • Une règle de publication interdisant le mot progression sans intervalle d'incertitude affiché protège contre la lecture d'un bruit statistique comme un résultat acquis.

Comparer deux dispositifs de veille sur un nombre restreint de cas traités produit presque toujours un écart de résultat entre les deux, ne serait-ce que parce qu'aucun tirage réel n'est parfaitement égal. La question qui compte n'est pas de savoir si un écart existe, il existe presque toujours, mais s'il est assez large pour ne pas s'expliquer entièrement par le hasard de l'échantillon examiné.

Un écart apparent sur peu de cas

Sur un échantillon de quelques dizaines de cas, deux dispositifs strictement équivalents en performance réelle produiront, par le simple jeu du tirage, des taux de réussite observés différents la plupart du temps. Cette variabilité n'est pas un défaut de la mesure : c'est une propriété mathématique de tout échantillonnage restreint, qui s'atténue à mesure que le nombre de cas augmente mais ne disparaît jamais complètement.

L'intuition trompe particulièrement ici, parce qu'un écart de plusieurs points de pourcentage entre deux dispositifs paraît visuellement significatif dès qu'il est présenté sous forme de chiffre unique, sans que rien n'indique la marge d'incertitude qui l'entoure. Un dispositif qui traite correctement trente cas sur quarante-cinq et un autre qui en traite correctement vingt-sept sur quarante-cinq affichent un écart qui semble parler de lui-même, alors que cette différence peut très bien s'inverser sur un nouveau lot de même taille.

La logique d'un intervalle d'incertitude

Un intervalle d'incertitude construit autour d'une proportion observée indique la plage de valeurs du taux réel sous-jacent qui reste compatible avec les données recueillies, à un niveau de confiance donné. Il ne s'agit pas d'un doute sur la mesure elle-même, le calcul de la proportion observée n'est pas en cause, mais d'une reconnaissance que cette proportion, obtenue sur un échantillon limité, n'égale pas nécessairement le taux réel du dispositif sur l'ensemble des cas qu'il pourrait traiter.

La largeur de cet intervalle dépend directement de la taille de l'échantillon : plus l'échantillon est restreint, plus l'intervalle est large, et plus il devient probable que deux dispositifs aux taux observés différents partagent en réalité un intervalle qui se recouvre largement. Ce recouvrement signale que les données disponibles ne permettent pas de trancher entre les deux dispositifs, quel que soit l'écart affiché entre leurs taux bruts.

Construire cet intervalle ne demande pas d'outillage complexe : la formule standard s'applique à toute proportion observée sur un échantillon, et sa largeur peut être anticipée avant même de lancer la comparaison, ce qui permet de dimensionner l'échantillon nécessaire pour espérer détecter un écart d'une ampleur donnée, plutôt que de le découvrir insuffisant une fois les données recueillies.

Cette anticipation change la conduite même d'une comparaison : plutôt que de fixer arbitrairement un nombre de cas à traiter puis de constater après coup que l'intervalle obtenu est trop large pour trancher, il devient possible de calculer, avant de commencer, la taille d'échantillon nécessaire pour qu'un écart d'une ampleur jugée pertinente se traduise par des intervalles qui ne se recouvrent pas. Un écart faible entre deux dispositifs demande, à ce titre, un échantillon nettement plus grand qu'un écart large pour espérer être détecté de façon fiable, ce qui explique pourquoi tant de comparaisons menées sur un nombre restreint de cas ne parviennent à rien conclure de solide, quelle que soit la qualité par ailleurs du travail de collecte.

Quand conclure qu'un dispositif fait mieux qu'un autre

Une conclusion de supériorité d'un dispositif sur un autre suppose, au minimum, que les intervalles d'incertitude respectifs des deux taux observés ne se recouvrent pas, ce qui indique que l'écart observé dépasse ce qu'une fluctuation d'échantillonnage expliquerait à elle seule au niveau de confiance retenu. Un recouvrement, même partiel, doit conduire à suspendre toute affirmation de supériorité, quelle que soit la différence entre les deux chiffres bruts présentés côte à côte.

Une approche plus rigoureuse consiste à mener un test statistique dédié à la comparaison de deux proportions, qui évalue directement si l'écart observé est compatible avec l'hypothèse d'une performance réellement identique entre les deux dispositifs. Ce test tient compte simultanément de la taille des deux échantillons comparés et de l'ampleur de l'écart, ce qui en fait un instrument plus précis qu'une simple lecture visuelle du recouvrement des intervalles, sans en changer la logique de fond.

Une règle de publication contre le mot progression

Une règle de publication simple consiste à interdire le mot progression, ou tout terme équivalent affirmant qu'un dispositif fait mieux qu'un autre, dans toute communication qui n'affiche pas, à côté du chiffre annoncé, l'intervalle d'incertitude qui l'accompagne. Cette règle ne bride pas la communication d'un résultat réel : elle empêche seulement qu'un écart né du hasard de l'échantillon soit présenté comme un acquis méthodologique.

L'application de cette règle change concrètement la rédaction d'un compte rendu de comparaison : au lieu d'annoncer un taux ponctuel suivi d'un jugement de supériorité, le texte présente le taux accompagné de son intervalle et formule la conclusion en fonction du recouvrement effectivement observé entre les deux dispositifs comparés, y compris quand cette conclusion est qu'aucune différence fiable ne peut être établie sur l'échantillon disponible.

Ce que cette règle ne couvre pas

Cette discipline traite l'incertitude liée à la taille de l'échantillon, pas les autres sources de biais qui peuvent affecter une comparaison : composition différente des deux lots comparés, période de mesure différente, ou critère de réussite appliqué de façon inégale entre les deux dispositifs. Un intervalle d'incertitude bien calculé sur des données biaisées par ailleurs ne corrige aucun de ces défauts, il ne fait que quantifier la part de hasard d'échantillonnage sur des données par ailleurs comparables.

Il ne couvre pas davantage la question de savoir si la différence détectée, une fois jugée statistiquement solide, a une portée pratique suffisante pour justifier un changement de dispositif : un écart confirmé mais de faible ampleur peut rester sans conséquence opérationnelle réelle, tandis qu'un écart plus large mais mesuré sur un échantillon encore insuffisant reste à confirmer avant toute décision. Ces deux questions, la fiabilité statistique de l'écart et sa pertinence pratique, doivent rester distinctes dans la lecture d'un résultat de comparaison.

Un dispositif qui applique cette règle systématiquement dans ses publications gagne en crédibilité ce qu'il perd parfois en simplicité de communication, puisqu'un intervalle affiché à côté d'un chiffre rend le message plus long et parfois moins immédiatement lisible. NewsCore couvre l'actualité économique en s'appuyant sur des méthodes de mesure documentées, et raccourcit le délai entre la collecte d'un fait chiffré et sa mise en perspective, sur www.newscore.fr.

Questions fréquentes

À partir de combien de cas un écart entre deux dispositifs devient-il généralement fiable ? Il n'existe pas de seuil universel : la taille nécessaire dépend de l'ampleur de l'écart recherché, un petit écart réel demandant un échantillon bien plus grand qu'un écart large pour être détecté de façon fiable, ce qui justifie de dimensionner l'échantillon avant la mesure plutôt que de l'apprécier après coup.

Un intervalle d'incertitude qui se recouvre légèrement interdit-il toute conclusion ? Il interdit une conclusion ferme de supériorité, mais autorise à signaler une tendance à confirmer sur un échantillon plus large, formulée explicitement comme provisoire plutôt que comme un résultat acquis.

Faut-il recalculer l'intervalle si la taille de l'échantillon change en cours de comparaison ? Oui, l'intervalle dépend directement de la taille de l'échantillon au moment du calcul ; toute mise à jour du nombre de cas traités doit s'accompagner d'un recalcul de l'intervalle, sans quoi l'intervalle affiché ne correspond plus aux données réellement disponibles.

Cette règle s'applique-t-elle aussi à une comparaison portant sur une seule mesure répétée dans le temps, et non sur deux dispositifs distincts ? Oui, la même logique s'applique : un écart entre deux mesures successives d'un même dispositif reste soumis à la même incertitude d'échantillonnage, et mérite le même intervalle avant qu'on ne parle d'évolution réelle plutôt que de fluctuation.

Pour approfondir