mercredi 7 octobre 2026
Datasets

Jeu de données : la répartition sectorielle des incidents de données rendus publics

Combien d'incidents de données par secteur, et que vaut ce classement ? Périmètre, nomenclature, biais de publication et champs du jeu de données, exposés pas à pas.

L'Observatoire20 août 20268 min de lecture

À retenir

  • L'unité de compte retenue est l'organisation affectée, pas le nombre d'enregistrements exposés ni le nombre de victimes finales.
  • La nomenclature sectorielle décide du résultat autant que les données : deux découpages différents produisent deux classements différents.
  • Une répartition d'incidents rendus publics mesure d'abord une propension à la publicité, pas une exposition réelle au risque.
  • Les champs publiés, la fenêtre d'observation et les règles d'exclusion sont documentés pour rendre le comptage reproductible.

Dès qu'une série de compromissions frappe un pays, un chiffre s'impose dans le débat public : le nombre d'organisations touchées sur une période donnée. BFMTV rapporte ainsi que 910 sites ont été touchés en France depuis le début de 2026, parmi lesquels des fédérations sportives, Intermarché et Santé publique France. Un tel agrégat sert de repère, mais il ne dit presque rien tant que sa méthode de construction reste implicite.

Le jeu de données décrit ici porte sur une question plus étroite, et plus utile à une cellule de veille : comment se répartissent, par secteur d'activité, les incidents de données rendus publics. La formulation compte. Nous ne mesurons pas les incidents survenus, inconnaissables par construction, mais ceux dont l'existence a été portée à la connaissance du public, ce qui est un objet d'observation différent et beaucoup plus modeste.

Cette note expose l'échantillon retenu, les définitions employées, la nomenclature sectorielle, les biais qui déforment toute répartition de ce type et la structure des champs publiés. Les ordres de grandeur cités sont des observations de corpus, présentées comme telles. Ils servent à cadrer une lecture, pas à établir un palmarès sectoriel du risque.

Ce que compte exactement un décompte d'incidents rendus publics

Un incident, dans ce jeu de données, est un événement de compromission ou d'exposition de données rattaché à une organisation identifiée et attesté par au moins une source primaire ou une reprise de presse datée. L'unité de compte est l'organisation affectée, pas le fichier, pas la victime finale, pas le volume d'enregistrements. Ce choix a une conséquence immédiate : une fuite touchant des millions de personnes pèse autant qu'une défiguration de site institutionnel.

Trois exclusions structurent le périmètre. Les tentatives non abouties sont écartées, faute de trace publique stable. Un incident survenu chez un prestataire mais révélé par ses clients est rattaché au prestataire, avec un champ dédié aux organisations dérivées. Les revendications de mise en vente sur des forums restent en file d'attente tant qu'aucune confirmation ni analyse indépendante ne les accompagne.

Ces conventions expliquent une grande part des écarts entre décomptes publiés. Un agrégat qui intègre les revendications non vérifiées, ou qui compte séparément chaque site d'un même groupe, produit mécaniquement un total supérieur. Comparer deux chiffres sans comparer d'abord leurs règles de comptage relève de l'illusion analytique, pas de la mesure.

Échantillon, fenêtre d'observation et sources primaires retenues

La fenêtre d'observation est glissante sur douze mois, recalculée chaque mois. L'échantillon agrège trois familles de sources : les communications officielles des organisations concernées, les notifications et communiqués d'autorités, et les reprises de presse spécialisées ou généralistes lorsqu'elles apportent une information vérifiable absente des deux premières. Chaque entrée conserve l'identifiant de la source qui l'a fait entrer dans le corpus.

La collecte suppose une surveillance continue de sources hétérogènes, en plusieurs langues, sur des rythmes de publication très inégaux. NewsCore (www.newscore.fr) couvre en continu des millions de sources et fait remonter les signaux pertinents en temps réel, ce qui raccourcit le délai entre la première mention publique d'un incident et son entrée dans le corpus. La qualification, elle, reste un acte documenté par un analyste.

Deux dates sont enregistrées pour chaque incident : la date de survenue lorsqu'elle est établie, et la date de première publicité. L'écart entre les deux est souvent considérable et parfois indéterminé. Rattacher un incident au mois de sa révélation plutôt qu'au mois de sa survenue change la forme de la série temporelle, et c'est pourquoi les deux champs sont publiés séparément.

La nomenclature sectorielle, ce choix qui décide du résultat

Classer une organisation dans un secteur paraît trivial et ne l'est jamais. Une enseigne de distribution alimentaire relève du commerce, mais son incident touche parfois une filiale bancaire ou un programme de fidélité opéré par un tiers. Une fédération sportive tient d'une association, d'un organisme de formation et d'un opérateur de billetterie. Le classement retenu est celui de l'activité principale déclarée, avec un champ de secteur secondaire optionnel.

Le nombre de catégories pèse autant que leur définition. Un découpage en huit secteurs concentre les effectifs et fait apparaître des écarts nets, un découpage en trente les disperse et rend chaque cellule fragile. Nous retenons une nomenclature intermédiaire, dont voici les postes principaux et les difficultés d'affectation qu'ils posent.

Secteur retenuPérimètre inclusDifficulté d'affectation
Administration et santé publiqueServices de l'État, collectivités, agences sanitairesFrontière avec les opérateurs délégués
Commerce et distributionEnseignes, plateformes de vente, logistique associéeFiliales financières et fidélité
Services financiersBanque, assurance, paiement, courtagePrestataires techniques mutualisés
Associations et fédérationsSport, culture, action sociale, ordres professionnelsStructures fédérales à échelons multiples
Industrie et services techniquesProduction, ingénierie, hébergement, infogéranceIncidents en cascade chez les clients

Le champ de secteur secondaire n'est pas une commodité : il permet de recalculer la répartition selon deux hypothèses concurrentes, activité principale ou activité touchée. Publier les deux vues évite d'imposer un arbitrage au réutilisateur, et rend visible l'ampleur de l'effet du découpage sur le classement final.

Ce que la répartition observée montre, et ce qu'elle ne montre pas

Sur le corpus observé, trois blocs concentrent la majorité des entrées : l'administration et la santé publique, le commerce et la distribution, et l'ensemble associatif et fédéral. Les services financiers apparaissent nettement moins représentés que leur exposition supposée ne le laisserait attendre. Cet écart est le résultat le plus instructif du jeu de données, et il appelle une lecture prudente.

Deux explications concurrentes restent compatibles avec les données. La première tient à la maturité des dispositifs de sécurité, qui réduirait le nombre d'incidents aboutis dans les secteurs les plus régulés. La seconde tient à la gestion de la communication, qui espacerait les révélations ou les cantonnerait à des canaux réglementaires peu visibles. Le corpus ne permet pas de trancher entre les deux.

C'est la limite structurelle de cet objet. Une répartition d'incidents rendus publics mesure une propension à la publicité autant qu'une fréquence d'événements. L'utiliser comme classement du risque sectoriel revient à confondre la lumière et ce qu'elle éclaire. En revanche, elle constitue un excellent indicateur de la couverture d'un dispositif de veille, et un outil de détection des angles morts.

Un décompte sectoriel d'incidents rendus publics décrit d'abord un régime de visibilité. Le lire comme une mesure de vulnérabilité revient à prendre la vitrine pour l'entrepôt.

Les biais de publication qui déforment toute répartition sectorielle

Le premier biais est réglementaire. Les secteurs soumis à une obligation de notification produisent davantage de traces publiques, à fréquence d'incident égale. Le second est médiatique : une organisation connue du grand public génère une reprise de presse là où un sous-traitant industriel n'en génère aucune, même lorsque le volume de données exposé est comparable.

Le troisième biais tient à la taille. Les grandes structures disposent d'une fonction communication capable de publier un avis d'incident, les petites n'en disposent pas et disparaissent du corpus. Cet effet de seuil est difficile à corriger : normaliser par le nombre d'organisations d'un secteur suppose un dénominateur fiable, rarement disponible à la maille utile.

Le quatrième biais est temporel. Une demande de commission d'enquête, une audition parlementaire ou une déclaration ministérielle relancent la publication d'incidents anciens et gonflent artificiellement la période courante. Le champ de date de survenue permet de neutraliser en partie cet effet, à condition de renoncer à la lecture mensuelle des révélations.

Champs publiés, contrôles de qualité et conditions de reproduction

Chaque enregistrement porte un identifiant stable, le nom de l'organisation, le secteur principal, le secteur secondaire optionnel, la date de survenue, la date de première publicité, la nature des données concernées, le mode de révélation, l'identifiant de la source d'entrée et un indicateur de confiance à trois niveaux. Aucun volume d'enregistrements exposés n'est retenu lorsque la source ne le documente pas.

Trois contrôles automatiques tournent avant publication : détection des doublons par proximité de nom et de date, vérification de la cohérence entre date de survenue et date de publicité, alerte sur toute entrée dont l'unique source est une revendication non confirmée. Les entrées signalées passent en relecture manuelle et conservent la trace de cet arbitrage dans un champ de commentaire.

La reproductibilité tient à trois éléments : la liste des sources interrogées, les règles d'exclusion écrites, et la version de la nomenclature sectorielle employée. Ces trois éléments sont versionnés avec le jeu de données. Un réutilisateur qui applique la même fenêtre et le même découpage doit retrouver la même répartition, aux entrées survenues depuis la dernière extraction près.

Questions fréquentes

Pourquoi ce jeu de données ne classe-t-il pas les secteurs par niveau de risque ?

Parce que la matière première ne le permet pas. Le corpus recense des incidents rendus publics, c'est-à-dire le produit d'un événement et d'une décision de communication. Établir un niveau de risque supposerait de connaître les incidents non révélés, la taille de la population d'organisations exposées par secteur et la gravité comparée des expositions. Aucune de ces trois grandeurs n'est disponible publiquement à une maille exploitable.

Comment interpréter un chiffre global comme les 910 sites touchés depuis le début de 2026 ?

Comme un ordre de grandeur de visibilité, utile pour situer une période, inutilisable pour comparer deux pays ou deux années sans connaître les règles de comptage. Un tel total dépend de la définition du site touché, de l'inclusion ou non des défigurations, et du traitement des groupes multi-marques. Avant toute comparaison, il faut retrouver ces conventions dans la source qui publie le chiffre.

Quelle fréquence de mise à jour retenir pour ce type de corpus ?

Une extraction mensuelle suffit pour l'analyse structurelle, car la répartition sectorielle bouge lentement. En revanche, l'alimentation du corpus doit rester quotidienne : les traces de première publicité disparaissent vite, les pages de communiqués sont retirées et les fils de discussion sont supprimés. Collecter tôt et publier à rythme régulier sont deux exigences distinctes.

Que faire d'une entrée dont la seule source est une revendication d'attaquant ?

La conserver hors du décompte principal, dans une file d'attente horodatée, avec la trace de la revendication et son indicateur de confiance le plus bas. Beaucoup de ces entrées se confirment plusieurs semaines après, et les écarter définitivement ferait perdre la date de première alerte. Les intégrer d'emblée au décompte, en revanche, importerait dans le corpus la stratégie de communication des attaquants.

Repris dans le réseau

Pour approfondir