mercredi 7 octobre 2026
Notes de méthode

Agréger des informations publiques et repérer le seuil de sensibilité franchi

Comment mesurer le moment où des données isolées et anodines, une fois recoupées en sources ouvertes, deviennent une information sensible : protocole, critères et limites.

L'Observatoire20 août 20269 min de lecture

À retenir

  • Le risque d'agrégation ne se lit sur aucun élément pris isolément : il naît du recoupement, ce qui le rend invisible aux contrôles portant sur les documents un par un.
  • Nous retenons trois critères observables pour situer le seuil : la complétude, la fraîcheur et l'actionnabilité de l'ensemble reconstitué.
  • Le protocole consiste à reconstituer soi-même son propre agrégat, avec des sources ouvertes uniquement, et à dater chaque brique.
  • La méthode mesure une exposition à un instant donné : elle ne prédit ni l'intention d'un adversaire ni l'usage effectif des données.

Les politiques de protection de l'information raisonnent presque toujours document par document. On classe une note, on restreint un fichier, on marque un plan. Ce découpage est cohérent avec la manière dont les organisations produisent leurs contenus, mais il laisse ouvert un angle mort : le risque qui ne réside dans aucune pièce prise séparément et qui apparaît uniquement dans leur assemblage.

L'alerte a été formulée récemment sur le terrain politique. The Daily Tribune rapporte que Adel Al Assoomi, membre du Conseil de la Choura de Bahreïn, met en garde contre le danger des micro-fuites de données pour la sécurité nationale : des informations isolées, photographies, noms, horaires, peuvent, par recoupement en sources ouvertes, révéler des infrastructures et des failles. Selon The Daily Tribune, il appelle à un renforcement des dispositions législatives contre l'espionnage et à un devoir civique de protection de l'information.

Cette note décrit le protocole que nous appliquons pour objectiver ce phénomène. Elle définit ce que nous appelons seuil de sensibilité, précise les critères qui permettent de constater son franchissement, détaille l'échantillon et les règles de collecte, puis expose les limites de l'exercice. L'objectif reste la reproductibilité : une autre équipe doit pouvoir refaire la mesure sur son propre périmètre et discuter les écarts constatés.

Pourquoi le risque d'agrégation échappe aux contrôles classiques

Un dispositif de classification évalue la sensibilité d'un contenu au moment où il est produit, en fonction de ce qu'il révèle à lui seul. Une photographie d'équipe prise devant un bâtiment ne révèle rien. Un organigramme public non plus. Un avis de marché indiquant des créneaux d'intervention non plus. Chaque décision, prise isolément, est défendable. C'est leur combinaison qui produit une information nouvelle, absente de chacune des pièces.

Le second facteur est temporel. Les fragments s'accumulent sur des années, à travers des canaux hétérogènes : sites institutionnels, appels d'offres, réseaux professionnels, registres légaux, publications scientifiques, comptes personnels de collaborateurs. Aucune instance interne n'a de vue d'ensemble sur cette accumulation, parce qu'aucune n'a pour mandat de suivre ce que l'organisation laisse échapper, seulement ce qu'elle publie délibérément.

Le troisième facteur est le coût d'assemblage, qui s'est effondré. Ce qui demandait autrefois des semaines de collecte manuelle relève désormais d'une recherche outillée. Ce déplacement ne change pas la nature des données publiques, il change le volume de recoupements qu'un observateur motivé réalise dans un temps donné. C'est cette bascule qui justifie de mesurer l'exposition plutôt que de la supposer maîtrisée.

Définir le seuil de sensibilité : trois critères observables

Nous appelons seuil de sensibilité le point à partir duquel un ensemble de données publiques permet de répondre à une question à laquelle aucune de ses composantes ne répond. Cette définition a l'avantage d'être testable : on formule la question, on tente d'y répondre avec le seul matériau ouvert, on constate le résultat. Elle a l'inconvénient de dépendre de la question posée, ce que nous traitons en fixant à l'avance une liste de questions de référence.

Trois critères qualifient l'ensemble reconstitué. La complétude mesure la proportion des éléments nécessaires à la réponse qui sont effectivement retrouvés. La fraîcheur mesure l'ancienneté du fragment le plus récent, une reconstitution parfaite mais périmée n'ayant qu'une valeur historique. L'actionnabilité mesure si la réponse obtenue est suffisamment précise pour fonder une action concrète, distinction qui sépare une information intéressante d'une information exploitable.

Le seuil est considéré comme franchi lorsque les trois critères sont simultanément élevés. Une complétude forte avec une fraîcheur faible signale un risque résiduel plutôt qu'un risque actif. Une actionnabilité forte sur un ensemble incomplet signale généralement que la question de référence était mal calibrée et qu'il faut la reformuler avant de conclure.

Protocole d'observation : échantillon, granularité, unité d'analyse

L'unité d'analyse n'est pas le document mais la question de référence. Nous partons de quatre familles de questions, dérivées des usages hostiles documentés : localiser une capacité, identifier une personne clé et son cycle de présence, reconstituer une chaîne de dépendance fournisseur, établir un calendrier d'opération. Pour chaque question, la collecte est menée exclusivement en sources ouvertes accessibles sans contournement technique ni usurpation d'identité, contrainte déontologique qui borne le résultat vers le bas.

Chaque fragment retenu est décrit selon une grille stable, ce qui rend le travail comparable d'un périmètre à l'autre.

Attribut du fragmentCe qu'il documenteUsage dans la mesure
Canal d'origineType de source ouverte où le fragment a été trouvéIdentifie les canaux les plus contributifs
Date de publicationAncienneté du fragmentAlimente le critère de fraîcheur
ÉmetteurOrganisation, prestataire, collaborateur, tiersSitue le levier de correction
Apport marginalCe que le fragment ajoute que les autres ne disent pasDistingue redondance et information nouvelle
RéversibilitéRetrait possible, difficile ou impossibleOriente le plan de traitement
Coût d'obtentionTemps de recherche mesuré, en minutesApproxime l'effort adverse

Deux règles encadrent la collecte. Aucun fragment n'est retenu sans son adresse de source primaire et la date de consultation, condition minimale de chaîne de garde. Et le temps de recherche est relevé en continu, parce qu'il constitue l'estimateur le plus honnête de la difficulté réelle : une reconstitution obtenue en vingt minutes et une reconstitution obtenue en trois jours ne décrivent pas la même exposition.

Ce que la mesure fait apparaître sur les organisations observées

Nos résultats sont des ordres de grandeur d'observation, présentés comme tels, et non des mesures statistiques généralisables. Le constat le plus régulier tient à la répartition des émetteurs : la majeure partie des fragments décisifs ne provient pas des publications officielles de l'organisation, mais de son écosystème, prestataires, partenaires, collaborateurs à titre personnel, documents administratifs obligatoires. La correction est donc rarement à portée directe de la direction de la communication.

Le deuxième constat porte sur l'apport marginal. Une minorité de fragments concentre l'essentiel de la valeur de reconstitution, tandis que la masse restante est redondante. Cela invite à cibler le traitement plutôt qu'à engager des politiques de silence général, qui coûtent cher, dégradent la visibilité légitime et laissent souvent intacts les fragments réellement déterminants.

Le troisième constat concerne l'écart entre sensibilité perçue et sensibilité effective. Les éléments que les équipes internes désignent spontanément comme sensibles sont rarement ceux qui font franchir le seuil. Les données de calendrier, de logistique et de sous-traitance, jugées banales, pèsent davantage que les contenus techniques, mieux protégés par réflexe.

Une organisation ne protège bien que ce qu'elle a d'abord tenté de reconstituer contre elle-même, avec les mêmes outils qu'un observateur extérieur.

Limites de la méthode et précautions déontologiques

La première limite est logique : la méthode établit qu'une reconstitution est possible, jamais qu'elle a eu lieu. Elle mesure une exposition, pas une compromission. Confondre les deux conduit à surestimer la menace et à justifier des restrictions disproportionnées, y compris sur des informations dont la publicité est d'intérêt général.

La deuxième limite tient à la dépendance aux questions de référence. Un adversaire réel poursuit ses propres objectifs, qui ne figurent pas nécessairement dans notre liste. La mesure est donc conservatrice par construction : elle sous-estime l'exposition plutôt qu'elle ne la surestime. Publier les questions retenues est indispensable pour que le lecteur situe le résultat.

La troisième limite est déontologique. L'exercice manipule des données concernant des personnes physiques, notamment des collaborateurs. Nous imposons trois règles : aucune donnée nominative n'est conservée au delà de la mesure, aucun compte personnel n'est cité individuellement dans les livrables, et le rapport final présente des catégories de fragments plutôt que des individus. Sans ces garde-fous, une démarche de protection se transforme en dispositif de surveillance interne.

Passer de la mesure ponctuelle au suivi continu

Une mesure d'exposition vieillit vite, puisque de nouveaux fragments apparaissent en permanence. L'intérêt d'un premier exercice est de produire une cartographie de départ et d'identifier les canaux les plus contributifs. La valeur durable vient du suivi, qui consiste à surveiller ces canaux et à détecter l'arrivée d'un fragment à fort apport marginal avant qu'il ne complète un ensemble déjà presque constitué.

Cette surveillance suppose une couverture large et multilingue, parce que les fragments décisifs apparaissent fréquemment hors de la langue et du pays de l'organisation, dans des publications de partenaires ou des documents réglementaires étrangers. NewsCore (www.newscore.fr) couvre en continu des millions de sources dans de nombreuses langues, trie les remontées par pertinence et relie chaque signal à sa source primaire, ce qui raccourcit le délai entre la publication d'un fragment et sa qualification par l'équipe. Le cadrage du besoin, lui, reste la part de l'organisation : définir les questions de référence, fixer les seuils et désigner qui tranche.

Un dernier point conditionne la portée de tout le dispositif. Les fragments les plus difficiles à traiter ne relèvent pas de la sécurité mais de la gestion des tiers : clauses contractuelles avec les prestataires, cadrage des publications de partenaires, sensibilisation des collaborateurs à ce que révèle un profil professionnel détaillé. Ce sont des chantiers d'organisation, lents, et c'est précisément pour cela qu'il vaut mieux les engager sur la base d'une mesure que d'une intuition.

Questions fréquentes

Qu'appelle-t-on risque d'agrégation en sources ouvertes ?

Il désigne la situation où plusieurs informations publiques, anodines prises séparément, produisent une fois recoupées une information que leurs auteurs n'ont jamais publiée ni voulu publier. L'exemple classique associe un organigramme, des photographies datées, un avis de marché et des horaires de service pour reconstituer la localisation et le rythme d'activité d'une capacité donnée. The Daily Tribune relaie exactement cette mécanique lorsque Adel Al Assoomi décrit des micro-fuites, photographies, noms, horaires, qui révèlent par recoupement des infrastructures et des failles. La particularité du risque est qu'il n'est imputable à aucune publication en particulier.

Comment savoir si mes données publiques ont franchi le seuil de sensibilité ?

En tentant la reconstitution soi-même. On fixe d'abord une question précise à laquelle un observateur hostile chercherait à répondre, par exemple identifier le site de production d'un composant critique et son calendrier d'approvisionnement. On mène ensuite la collecte en sources ouvertes uniquement, en chronométrant l'effort et en notant chaque fragment avec sa date. On évalue enfin la complétude, la fraîcheur et l'actionnabilité du résultat. Si la question trouve une réponse actionnable en quelques heures avec des fragments récents, le seuil est franchi et le plan de traitement doit cibler les fragments à fort apport marginal.

Faut-il réduire au maximum ce que l'organisation publie ?

Non, et c'est la conclusion la plus fréquemment mal comprise. Nos observations montrent qu'une minorité de fragments porte l'essentiel de la valeur de reconstitution, et qu'ils proviennent majoritairement de tiers plutôt que des canaux officiels. Une politique de silence général pénalise donc la visibilité légitime, le recrutement et la relation client, sans traiter les éléments décisifs. La démarche efficace est sélective : identifier les quelques fragments qui font basculer l'ensemble, vérifier lesquels sont réversibles, et agir en priorité sur les canaux tiers où l'organisation dispose d'un levier contractuel.

Sources

Pour approfondir