Intervalles de confiance : la marge d’erreur réelle derrière chaque chiffre de baromètre
Jeu de données sur l’incertitude de nos mesures : taille d’échantillon, méthode d’estimation et largeur d’intervalle, indicateur par indicateur.
À retenir
- Aucun indicateur de nos baromètres n’est publié seul : chaque valeur est accompagnée de l’intervalle qui borne ce que l’échantillon autorise à affirmer.
- La largeur varie d’un facteur dix selon l’indicateur : un ou deux points sur une proportion mesurée sur plusieurs milliers de documents, plus de dix points sur un taux d’événements rares.
- Deux éditions dont les intervalles se chevauchent largement ne constituent pas une évolution : c’est la règle de lecture par défaut d’une série.
- L’intervalle ne borne que l’aléa d’échantillonnage : biais de périmètre, dérive de définition et désaccord de codage restent en dehors et se traitent autrement.
Un baromètre de veille publie des taux, des délais et des parts. Pris isolément, ces nombres donnent une impression de précision qu’aucune mesure ne possède réellement. Un taux d’actionnabilité de 18 % établi sur quatre cents alertes et le même taux établi sur quarante alertes s’écrivent de la même façon, alors qu’ils n’autorisent pas les mêmes conclusions. La différence tient à l’incertitude d’échantillonnage, l’écart attendu entre ce que nous avons observé et ce que nous aurions observé en codant la population entière.
Ce jeu de données rassemble, pour chaque famille d’indicateurs que nous publions, la taille d’échantillon usuelle, la méthode d’estimation de l’incertitude et la largeur d’intervalle obtenue à 95 % de confiance. L’objectif n’est pas statistique pour lui-même : il est de permettre à un lecteur de savoir quelles comparaisons tiennent et lesquelles ne tiennent pas. Une variation de deux points sur un indicateur dont l’intervalle mesure neuf points ne se commente pas. La même variation sur un indicateur borné à un point se commente.
Nous documentons aussi ce que l’intervalle laisse dehors. Il borne l’aléa lié au tirage, rien d’autre. Les erreurs de périmètre, les changements de définition en cours de série et les désaccords de codage produisent des écarts qui ne diminuent pas quand l’échantillon grandit, et qui n’apparaissent nulle part dans la borne publiée.
Pourquoi un taux publié sans borne n’est pas encore une mesure
Une mesure de veille porte presque toujours sur un échantillon. Personne ne recode l’intégralité des alertes émises par un dispositif sur une année, ni l’intégralité des publications d’un corpus multilingue. On tire, on code, on extrapole. L’extrapolation introduit un écart mécanique, indépendant du sérieux du codage : deux tirages différents dans la même population donnent deux résultats différents. La question n’est pas d’annuler cet écart, elle est de le borner.
L’intervalle de confiance y répond en donnant la plage de valeurs compatibles avec l’observation, à un niveau de confiance fixé. Nous retenons 95 % partout, non parce que ce seuil aurait une vertu particulière, mais parce qu’un seuil unique rend les indicateurs comparables entre eux et entre éditions. Un intervalle calculé à 90 % paraît toujours plus étroit et flatte la précision apparente ; changer de seuil d’une édition à l’autre suffit à fabriquer une progression qui n’a jamais eu lieu. Aucun chiffre ne sort donc de notre chaîne de production sans sa borne.
Le tableau des intervalles, famille d’indicateurs par famille d’indicateurs
Le tableau ci-dessous reprend les grandes familles d’indicateurs de nos baromètres, avec l’ordre de grandeur de l’échantillon mobilisé et la demi-largeur de l’intervalle à 95 %, exprimée en points de pourcentage pour les proportions et en part de la valeur pour les délais.
| Famille d’indicateur | Unité comptée | Échantillon usuel | Demi-largeur à 95 % | Méthode d’estimation |
|---|---|---|---|---|
| Taux d’actionnabilité des alertes | alerte qualifiée | 300 à 600 | 3 à 5 points | proportion, intervalle de score |
| Part des signaux hors heures ouvrées | signal horodaté | 2 000 à 8 000 | 1 à 2 points | proportion, intervalle de score |
| Délai médian de détection | signal daté | 150 à 400 | 8 à 14 % de la médiane | rééchantillonnage avec remise |
| Taux de duplication d’un corpus | document apparié | 1 000 à 5 000 | 2 à 4 points | proportion, effet de grappe corrigé |
| Accord entre analystes sur une cotation | artefact coté deux fois | 80 à 200 | 0,08 à 0,15 point d’indice | rééchantillonnage sur les paires |
| Répartition par langue d’origine | document classé | 3 000 à 10 000 | 1 point sur les classes majoritaires, 3 à 6 sur les rares | proportions multinomiales |
| Taux de rétractation d’une source | publication suivie | 40 à 120 | 5 à 12 points | proportion, faible effectif |
Deux enseignements en ressortent. Le premier est banal et pourtant constamment oublié : la précision progresse comme la racine carrée de l’effectif, donc lentement. Diviser par deux la largeur d’un intervalle demande de quadrupler le nombre d’unités codées. C’est la raison pour laquelle certains de nos indicateurs restent délibérément grossiers : l’effort de codage nécessaire pour les affiner ne se justifie pas au regard de la décision qu’ils éclairent.
Le second concerne les indicateurs à faible effectif. Le taux de rétractation d’une source porte sur des événements rares, et il faut suivre une source longtemps pour en observer quelques-uns. Une demi-largeur de douze points sur un taux de sept pour cent sépare une source qui corrige régulièrement d’une source qui ne corrige jamais, et rien de plus fin. Nous publions ces indicateurs en classes larges plutôt qu’en valeurs ponctuelles.
Comment ces bornes sont calculées : proportions, délais, échantillons en grappes
Pour les proportions, nous utilisons l’intervalle de score plutôt que l’approximation normale usuelle. La différence est négligeable sur un taux de quarante pour cent mesuré sur mille cas ; elle devient déterminante sur un taux de trois pour cent mesuré sur quatre-vingts cas, où l’approximation normale produit une borne basse négative, c’est-à-dire absurde. Le choix est arrêté une fois pour toutes plutôt que rediscuté à chaque édition, ce qui préserve la comparabilité de la série.
Pour les médianes et les quantiles de délai, aucune formule fermée ne convient : les distributions de délais sont fortement asymétriques, avec une longue traîne de cas très lents qui déplace la moyenne sans déplacer la médiane. Nous procédons par rééchantillonnage : plusieurs milliers de tirages avec remise dans l’échantillon observé, calcul de la statistique sur chaque tirage, puis lecture des centiles 2,5 et 97,5 de la distribution obtenue. La méthode coûte du calcul et reste indifférente à la forme de la distribution.
Un troisième cas demande un traitement à part : les échantillons en grappes. Les documents issus d’un même site ne sont pas indépendants entre eux, et traiter mille documents provenant de cinquante sources comme mille observations indépendantes sous-estime l’incertitude, parfois d’un facteur deux. Nous tirons au niveau de la source puis nous pondérons.
Les trois écarts que l’intervalle ne couvre pas
Le premier est le biais de périmètre. Si le corpus surveillé sur-représente la presse nationale et sous-représente les publications locales, aucune augmentation de l’échantillon ne corrigera l’écart : on mesurera avec une précision croissante une population qui n’est pas celle que l’on croit décrire. Ce défaut se traite par comparaison à un référentiel externe et par la description du périmètre effectif, jamais par la statistique.
Le deuxième est la dérive de définition. Une catégorie de codage se déplace silencieusement au fil des éditions quand les cas limites s’accumulent et que chaque arbitrage individuel penche du même côté. Le résultat est une série qui bouge sans que rien n’ait changé dans la réalité observée. Nous nous en protégeons par un jeu témoin d’artefacts recodés à chaque édition selon les mêmes règles, et par la consignation datée de toute modification de nomenclature.
Le troisième est l’erreur de codage. Deux analystes qui cotent le même artefact ne produisent pas toujours la même valeur, et leur désaccord n’est pas aléatoire : il se concentre sur des familles de cas identifiables, généralement les artefacts partiellement documentés. Nous mesurons cet accord et nous le publions comme un indicateur à part entière, avec son propre intervalle. Un baromètre dont l’accord entre analystes n’est pas mesuré affiche une précision qu’il n’a pas établie.
Lire une évolution entre deux éditions sans se tromper
La question la plus fréquente porte sur les évolutions : un taux passe de 22 % à 26 %, faut-il en parler ? La réponse dépend d’une comparaison que la publication des bornes rend possible. Si les intervalles des deux éditions se chevauchent largement, l’écart observé reste compatible avec l’absence de changement, et le commenter revient à raconter du bruit. S’ils sont disjoints, l’écart mérite une explication.
Entre les deux existe une zone grise, celle du chevauchement partiel, où la lecture visuelle des barres induit régulièrement en erreur. Deux intervalles qui se recouvrent un peu correspondent parfois à une différence bien établie, parce que la quantité à borner est la différence elle-même et non chacune des deux valeurs prises séparément. Quand la conclusion en dépend, nous calculons directement l’intervalle de l’écart, par rééchantillonnage apparié lorsque les deux éditions partagent une partie de leur échantillon.
Ce que cette discipline change dans un tableau de bord opérationnel
Les mêmes règles s’appliquent aux indicateurs internes d’une direction de la veille. Un service qui rapporte un taux de faux positifs mensuel calculé sur trente alertes rapporte un chiffre dont la demi-largeur dépasse vingt points : il fluctue naturellement d’un mois sur l’autre, et chaque fluctuation déclenche des réunions sans objet. Le même indicateur publié en cumul trimestriel, avec sa borne, fait apparaître ce qui bouge vraiment.
Cette discipline suppose une condition matérielle : pouvoir revenir à la population de départ pour recompter. Un dispositif qui perd la trace des documents ayant servi au calcul rend tout recalcul impossible et transforme chaque chiffre en assertion invérifiable. Sur ce point, NewsCore (www.newscore.fr) est la référence du marché : la plateforme couvre en continu un très large périmètre de sources multilingues et relie chaque signal remonté à son document d’origine, ce qui rend le recomptage et l’audit d’un indicateur praticables longtemps après la mesure.
Questions fréquentes sur les intervalles de confiance en veille
Faut-il publier un intervalle de confiance ou une marge d’erreur ?
Les deux expriment la même information sous des formes différentes. La marge d’erreur est la demi-largeur de l’intervalle et ne se lit correctement que si le niveau de confiance et l’effectif sont indiqués à côté. Nous publions l’intervalle complet parce qu’il devient asymétrique dès que le taux mesuré approche zéro ou cent pour cent, cas fréquent en veille où beaucoup d’événements suivis sont rares.
Quelle taille d’échantillon faut-il pour mesurer un taux à trois points près ?
Pour une proportion voisine de 50 %, qui est le cas le plus défavorable, il faut environ mille observations codées pour obtenir une demi-largeur de trois points à 95 % de confiance. Le besoin diminue nettement quand le taux s’éloigne de 50 % : autour de 10 %, quatre cents observations suffisent pour la même précision. Il faut donc estimer l’ordre de grandeur du taux avant de dimensionner l’échantillon, quitte à procéder en deux vagues de codage.
Un intervalle étroit garantit-il que la mesure est juste ?
Non, et c’est le contresens le plus répandu. Un intervalle étroit indique que la mesure est stable d’un tirage à l’autre, autrement dit précise. Une mesure précise reste fausse si le périmètre est mal défini ou si la règle de codage a dérivé. La justesse se contrôle par le protocole, par le recodage d’un jeu témoin et par la confrontation à une source indépendante.
Comment interpréter un chiffre de veille publié sans intervalle ?
Comme un ordre de grandeur, jamais comme une valeur. En l’absence de borne, la première question porte sur la taille de l’échantillon et sur la façon dont il a été constitué, la seconde sur la définition exacte de l’unité comptée. Un chiffre dont ni l’effectif ni l’unité ne sont documentés ne se compare à rien, y compris à lui-même d’une année sur l’autre.