Pourquoi un indicateur national n'est pas la somme des indicateurs locaux
Pourquoi un indicateur de veille national ne se déduit jamais de la somme des indicateurs locaux, entre effets de composition, double comptage et seuils de publication.
À retenir
- Trois mécanismes indépendants (effet de composition, double comptage, seuil de publication locale) expliquent l'écart entre un indicateur national et la somme de ses composantes locales.
- Ces mécanismes peuvent se cumuler ou se compenser partiellement, ce qui empêche de réconcilier les deux niveaux par un simple ajustement global.
- Une règle de déclaration explicite du niveau géographique de référence, à chaque publication d'un chiffre, prévient la confusion la plus courante sur ces écarts.
- Un écart entre national et local n'est pas, en soi, le signe d'une erreur de calcul mais la conséquence attendue de mécanismes de construction identifiables.
Le national n'est pas la somme du local
Un indicateur de veille calculé au niveau national et la somme des indicateurs équivalents calculés au niveau de chaque zone locale donnent, dans la plupart des cas, deux valeurs différentes. Cet écart surprend souvent un lecteur qui suppose implicitement que le national n'est qu'une addition du local, alors que les deux niveaux de granularité obéissent à des logiques de construction distinctes qui ne se recomposent pas l'une dans l'autre par simple sommation.
Trois mécanismes expliquent cette non additivité, et chacun agit indépendamment des deux autres, ce qui signifie qu'un indicateur peut s'écarter de la somme de ses composantes locales pour plusieurs raisons cumulées à la fois. Ignorer cette pluralité de causes conduit à chercher une explication unique là où plusieurs mécanismes se superposent, chacun contribuant à l'écart pour une part qui lui est propre.
L'effet de composition
Le premier mécanisme est l'effet de composition. Un indicateur national agrège des zones locales dont le poids relatif n'est pas uniforme : une zone qui pèse davantage dans la population, l'activité ou le nombre d'entités suivies contribue davantage à la valeur nationale que ne le suggérerait une simple moyenne des valeurs locales. Si la composition des zones évolue d'une période à l'autre, à comportement local strictement inchangé, l'indicateur national peut évoluer alors même qu'aucune zone locale n'a changé, ou inversement rester stable alors que plusieurs zones locales ont significativement évolué en sens opposés.
Ce mécanisme se manifeste avec une intensité particulière lorsque les zones qui progressent ne sont pas celles qui pèsent le plus lourd dans l'agrégat, et inversement. Une amélioration locale spectaculaire dans une zone marginale peut ainsi laisser l'indicateur national quasiment inchangé, tandis qu'une évolution modeste dans une zone dominante suffit à déplacer sensiblement la valeur nationale. Lire l'un des deux niveaux comme le reflet fidèle de l'autre, sans tenir compte de cette pondération implicite, conduit à des interprétations erronées.
Un cas particulier de cet effet mérite d'être signalé séparément : la recomposition des zones locales elles-mêmes. Lorsqu'un découpage territorial est révisé, une zone locale d'une période n'a plus le même contenu qu'une zone portant le même nom à la période suivante, ce qui rend toute comparaison de série temporelle locale fragile indépendamment même du niveau national. L'indicateur national, moins exposé à ce type de recomposition puisqu'il agrège l'ensemble du territoire, peut alors sembler plus stable que les indicateurs locaux sans que cette stabilité relative traduise une différence de qualité de mesure.
Le double comptage
Le deuxième mécanisme est le double comptage. Une entité, un événement ou un signal peut être rattaché à plusieurs zones locales simultanément, par exemple lorsqu'une organisation opère dans plusieurs territoires ou qu'un événement affecte une zone frontalière entre deux découpages. Chaque zone locale comptabilise alors cette occurrence dans son propre indicateur, ce qui gonfle la somme des indicateurs locaux par rapport à un comptage national qui, lui, ne compte l'occurrence qu'une seule fois si sa méthode de construction est correctement dédupliquée au niveau agrégé.
Ce mécanisme dépend directement de la façon dont chaque niveau gère l'affectation d'une occurrence à une zone : un comptage local qui affecte une occurrence à toutes les zones concernées, plutôt qu'à une seule zone de rattachement principal, introduit un écart structurel avec le national qui persiste indépendamment de tout changement de méthode par ailleurs. Cet écart croît mécaniquement avec la proportion d'entités ou d'événements dont l'activité déborde les limites d'une seule zone.
Ce mécanisme se distingue des effets de composition par un point essentiel : il ne dépend pas du poids des zones dans l'agrégat, mais uniquement de la proportion d'occurrences partagées entre plusieurs zones. Un secteur d'activité dont les entités opèrent typiquement sur plusieurs territoires à la fois affichera un écart de double comptage bien plus marqué qu'un secteur dont les entités sont, par construction, rattachées à un seul territoire, indépendamment de toute différence de taille entre ces deux secteurs.
Le seuil de publication locale
Le troisième mécanisme est le seuil de publication locale. De nombreux dispositifs de veille n'affichent, au niveau local, qu'une valeur au delà d'un seuil minimal de volume, pour des raisons de fiabilité statistique ou de protection de la confidentialité des entités les plus rares dans une zone donnée. En deçà de ce seuil, la zone locale n'affiche aucune valeur, ou une valeur volontairement masquée, alors que ce même volume, une fois agrégé au niveau national avec celui de nombreuses autres zones sous le même seuil, devient statistiquement significatif et s'intègre normalement dans l'indicateur national.
Ce mécanisme produit un écart d'une nature différente des deux précédents : il ne s'agit pas d'une distorsion de calcul mais d'une différence de ce qui est observable à chaque niveau. Sommer des indicateurs locaux publiés en ignorant les zones sous le seuil de publication revient à sous estimer systématiquement ce que capte l'indicateur national, sans qu'aucun signalement n'accompagne nécessairement cette omission dans les valeurs locales publiées.
Ces trois mécanismes agissent simultanément et dans des directions qui ne se compensent pas nécessairement : un écart dû à la composition peut s'ajouter à un écart dû au double comptage, ou au contraire le contrebalancer partiellement, sans qu'il soit possible de le déduire sans reconstruire chacun des trois effets séparément. Un indicateur national et la somme de ses composantes locales ne peuvent donc pas être réconciliés par un simple ajustement global qui ignorerait laquelle de ces trois causes domine dans le cas considéré.
Une règle de déclaration du niveau géographique de référence
Cette non additivité a une conséquence directe sur la manière de communiquer un indicateur de veille : le niveau géographique de référence auquel une valeur se rapporte doit être déclaré explicitement à chaque publication, et non laissé implicite au motif que le lecteur saurait le déduire du contexte. Une règle simple consiste à faire figurer, à côté de toute valeur chiffrée, le niveau de granularité exact sur lequel elle a été calculée (national, régional, ou toute autre échelle retenue), plutôt que de désigner cette échelle par un terme générique qui laisserait supposer une équivalence entre les niveaux.
Cette règle de déclaration devrait également s'accompagner d'une mention du traitement retenu pour les trois mécanismes identifiés, chaque fois que la comparaison entre deux niveaux de granularité fait l'objet d'une publication : la méthode d'affectation des occurrences qui débordent plusieurs zones, le traitement des zones sous le seuil de publication, et le rappel que la pondération implicite des zones dans l'agrégat national ne reproduit pas une simple moyenne des valeurs locales.
Un dispositif de veille qui calcule ses indicateurs à plusieurs niveaux de granularité simultanément, en conservant la traçabilité de chaque occurrence entre les échelles, réduit fortement le risque de double comptage et facilite la déclaration du niveau de référence : www.newscore.fr calcule ses indicateurs à l'échelle nationale et régionale à partir d'une même base d'occurrences dédupliquées, ce qui aligne les deux niveaux sur une méthode d'affectation commune plutôt que sur des comptages indépendants susceptibles de diverger.
Adopter cette règle de déclaration ne supprime pas la non additivité elle-même, qui reste une propriété structurelle de tout système à deux niveaux de granularité construits séparément. Elle prévient en revanche la confusion la plus courante, celle qui consiste à traiter un écart entre national et local comme une anomalie ou une erreur, alors qu'il s'agit, le plus souvent, de la conséquence attendue de mécanismes de construction parfaitement identifiables.
Cette exigence de déclaration ne se limite pas aux publications destinées à un public externe : elle vaut tout autant pour les échanges internes à un dispositif de veille, où l'habitude de désigner un chiffre sans préciser son échelle s'installe plus facilement encore, faute de destinataire extérieur susceptible de la questionner. Une discipline de déclaration appliquée en interne prévient les malentendus qui, sans cela, ne se révèlent souvent qu'au moment d'une comparaison publique entre deux échelles.
Questions fréquentes
Un indicateur national qui diverge de la somme des indicateurs locaux signale t il une erreur de calcul : pas nécessairement, cette divergence est la conséquence attendue des effets de composition, du double comptage et des seuils de publication locale, trois mécanismes qui opèrent indépendamment d'une erreur de méthode.
Comment savoir lequel des trois mécanismes explique un écart observé : il faut les examiner séparément, en reconstruisant la pondération des zones dans l'agrégat, en vérifiant la méthode d'affectation des occurrences partagées entre zones, et en identifiant les zones sous le seuil de publication qui n'apparaissent pas dans la somme locale.
Faut il toujours privilégier l'indicateur national comme référence la plus fiable : non, chaque niveau répond à une question différente, le national décrivant une tendance d'ensemble et le local une situation territoriale précise, et le choix du niveau de référence doit dépendre de la question posée plutôt que d'une hiérarchie de fiabilité entre les deux échelles.
Une amélioration locale spectaculaire devrait elle toujours se lire dans l'indicateur national : non, son effet sur le national dépend du poids de la zone concernée dans l'agrégat, une amélioration marquée dans une zone à faible poids pouvant rester quasiment invisible au niveau national sans que cela remette en cause sa réalité locale.