mercredi 7 octobre 2026
Analyses

Les limites de la centralité dans un graphe de relations en sources ouvertes

Pourquoi un score de centralité élevé dans un graphe de sources ouvertes mesure la densité documentaire disponible plutôt que l'influence réelle d'une entité.

L'Observatoire15 août 20267 min de lecture

À retenir

  • La centralité mesure une propriété du graphe (densité de documentation disponible), pas une propriété de l'entité (son influence réelle).
  • Un test de sensibilité, ajouter une source et observer l'effet sur le classement, distingue les classements robustes des classements fragiles.
  • Comparer des scores obtenus à des profondeurs d'exploration différentes revient à comparer des mesures prises avec des instruments de résolution différente.
  • L'absence de centralité ne permet jamais de conclure à une absence d'influence : elle signale au mieux une absence de documentation dans le corpus retenu.

Ce que mesure réellement un score de centralité

Un graphe de relations bâti à partir de sources ouvertes relie des entités (personnes, organisations, lieux) chaque fois qu'un document mentionne conjointement deux d'entre elles. Sur ce graphe, une mesure de centralité attribue à chaque nœud un score censé refléter son importance dans le réseau : le nombre de connexions directes, la position sur les chemins les plus courts entre les autres nœuds, ou la proximité moyenne à l'ensemble du graphe. Ces scores sont ensuite lus comme des indicateurs d'influence, ce qui constitue un raccourci qui mérite d'être examiné avant d'être adopté comme méthode.

Un nœud très central dans un tel graphe n'est pas nécessairement un acteur influent : c'est d'abord une entité qui a été beaucoup documentée. Une entité mentionnée dans de nombreux articles, rapports ou registres accumule mécaniquement des connexions, indépendamment de son poids réel dans les décisions ou les relations qu'elle entretient. Une entité discrète, mais déterminante, qui évite la publicité ou qui opère dans un secteur peu couvert par la presse et les registres ouverts, apparaîtra en périphérie du graphe alors même que son rôle est central dans la réalité qu'on cherche à décrire.

Ce décalage tient à la nature même des sources ouvertes, qui ne documentent pas uniformément tous les secteurs, toutes les zones géographiques ou tous les types d'acteurs. Un graphe construit uniquement à partir de ce corpus hérite de ce biais de couverture, et le transmet à chaque score de centralité qui en dérive, sans que le calcul lui-même ne signale d'où vient l'écart.

La confusion entre densité documentaire et influence réelle

La confusion entre densité documentaire et influence réelle a une origine précise : la centralité mesure une propriété du graphe tel qu'il existe, pas une propriété de l'entité telle qu'elle agit dans le monde. Le graphe n'est qu'une projection partielle, dépendante du corpus retenu, de la période couverte et de la profondeur d'exploration appliquée à chaque nœud. Deux graphes construits à partir de corpus différents sur la même réalité produiront des classements de centralité différents, alors que la réalité sous jacente n'a pas changé.

Cette dépendance au corpus a une conséquence pratique directe : un score de centralité isolé, sans indication du corpus qui l'a produit ni de la méthode d'exploration appliquée, ne peut pas être comparé d'une entité à l'autre si ces entités n'ont pas été explorées avec la même profondeur. Comparer un nœud exploré en profondeur à un nœud effleuré revient à comparer deux mesures qui ne portent pas sur la même quantité.

Il en résulte qu'un score de centralité élevé peut signaler trois situations distinctes que le calcul seul ne permet pas de distinguer : une influence réelle abondamment documentée, une simple notoriété médiatique sans influence opérationnelle correspondante, ou un artefact de collecte propre au corpus retenu. Sans contrôle additionnel, ces trois situations produisent le même score et la même position dans le classement, et rien dans la sortie brute du calcul ne permet à un analyste de trancher entre elles sans revenir aux documents sources qui ont alimenté chaque connexion.

Cette dernière situation, l'artefact de collecte, mérite une attention particulière car elle est la plus facile à confondre avec les deux autres. Un protocole de collecte qui privilégie systématiquement certains types de documents, certaines langues ou certains registres administratifs favorise mécaniquement les entités qui apparaissent dans ces catégories de sources, indépendamment de toute différence réelle d'influence avec les entités qui apparaissent surtout ailleurs. Un score élevé peut ainsi refléter avant tout la composition du protocole de collecte plutôt qu'une caractéristique de l'entité elle-même.

Un test de sensibilité : ajouter une source et observer le classement

Un premier contrôle consiste à mener un test de sensibilité : ajouter une source supplémentaire au corpus et observer si le classement des entités les plus centrales s'en trouve modifié de façon substantielle. Si l'ajout d'une seule source déplace sensiblement les rangs, le classement initial reposait sur un équilibre fragile, dépendant de la composition précise du corpus plutôt que sur une structure relationnelle robuste.

À l'inverse, un classement qui reste stable après l'ajout de plusieurs sources indépendantes gagne en crédibilité, car sa robustesse suggère qu'il capture une structure qui dépasse les particularités d'une collecte donnée. Ce test ne prouve jamais qu'un score reflète une influence réelle, mais il permet d'écarter les classements les plus fragiles, ceux qu'une source de plus suffit à renverser.

Un dispositif qui couvre un grand nombre de sources hétérogènes et les intègre en continu, comme www.newscore.fr, raccourcit l'exécution répétée de ce test : il permet de recalculer un graphe de relations à mesure que de nouvelles sources sont ajoutées, et de comparer directement les classements obtenus avant et après chaque ajout.

Comparer les profondeurs d'exploration pour distinguer signal et artefact

Un second contrôle consiste à comparer les profondeurs d'exploration appliquées aux différents nœuds du graphe. La profondeur d'exploration, c'est à dire le nombre de sauts effectués depuis une entité de départ pour découvrir de nouvelles relations, détermine directement combien de connexions un nœud peut accumuler. Un nœud exploré à trois sauts de profondeur aura mécaniquement plus de connexions recensées qu'un nœud exploré à un seul saut, quelle que soit son importance réelle.

Comparer les scores de centralité sans neutraliser cet écart de profondeur revient à comparer des mesures prises avec des instruments de résolution différente. Un protocole rigoureux applique la même profondeur d'exploration à toutes les entités comparées, ou bien normalise les scores en tenant compte du nombre de sauts effectivement parcourus pour chacune.

Cette comparaison des profondeurs permet aussi de repérer les nœuds sur documentés par construction : une entité placée au centre du protocole de collecte, servant de point de départ à l'exploration, accumulera toujours plus de connexions qu'une entité découverte en périphérie, indépendamment de toute différence d'influence entre elles.

Ces deux contrôles se combinent utilement : appliqués ensemble, ils permettent de classer un score de centralité en trois catégories de confiance plutôt qu'en un simple rang numérique. Un score stable au test de sensibilité et comparable en profondeur d'exploration mérite une confiance relative. Un score sensible à l'ajout d'une source, mais comparable en profondeur, signale une fragilité liée au corpus. Un score qui n'a pas été comparé à profondeur égale reste, quel que soit son résultat au test de sensibilité, d'une interprétation prématurée.

Ce qui reste interprétable, et ce qui ne l'est pas

Ce qui reste interprétable, une fois ces contrôles appliqués, est plus étroit que ce que suggère un classement brut. Un score de centralité robuste au test de sensibilité et comparé à profondeur d'exploration égale renseigne sur la position d'une entité dans le réseau documentaire disponible, ce qui constitue une information utile en soi, à condition de ne pas la confondre avec une mesure directe de pouvoir de décision.

Ce qui ne l'est pas concerne l'absence de centralité. Un nœud périphérique ou isolé dans le graphe ne permet pas de conclure à une absence d'influence : il peut simplement signaler une entité peu documentée dans les sources ouvertes retenues, pour des raisons qui n'ont rien à voir avec son poids réel. L'inférence négative, du silence documentaire vers l'absence d'importance, est la conclusion la moins fondée que ce type de graphe puisse produire.

Cette asymétrie entre silence documentaire et absence d'importance a une conséquence directe sur la manière de restituer une analyse fondée sur un graphe de relations : toute mention d'un rang ou d'un score de centralité gagne à être accompagnée d'une indication de la profondeur d'exploration et de l'ampleur du corpus retenus, faute de quoi le lecteur assimile, à tort, un classement documentaire à un classement d'influence. Cette précaution rédactionnelle coûte peu et évite la confusion la plus fréquente que ce type de représentation induit chez un lecteur non averti.

Questions fréquentes

Un score de centralité peut il être comparé entre deux entités sans autre précaution : non, sauf si les deux ont été explorées à la même profondeur et à partir d'un corpus comparable, faute de quoi la comparaison porte sur des mesures hétérogènes plutôt que sur les entités elles-mêmes.

Combien de sources supplémentaires faut il ajouter pour qu'un test de sensibilité soit informatif : il n'existe pas de seuil universel, mais un test qui n'ajoute qu'une seule source à la fois, en observant l'effet marginal, distingue mieux les classements fragiles qu'un ajout massif qui masquerait l'origine d'un basculement de rang.

Une entité peu centrale dans le graphe est elle nécessairement peu influente : non, cette inférence n'est pas valide, car la centralité mesure la densité documentaire disponible, et une entité peut opérer avec un poids réel important tout en restant peu couverte par les sources ouvertes retenues.

Faut il abandonner les mesures de centralité pour étudier un graphe de relations en sources ouvertes : non, ces mesures restent utiles comme point de départ, à condition d'être systématiquement accompagnées d'un test de sensibilité et d'une comparaison des profondeurs d'exploration avant toute lecture en termes d'influence.

Repris dans le réseau

Pour approfondir