mercredi 7 octobre 2026
Notes de méthode

Anonymiser un corpus de veille avant un partage externe : la sélection en dit plus que les documents

Retirer les noms des pièces collectées protège peu un corpus de veille : ce qui identifie tient au périmètre choisi, aux annotations internes et au calendrier.

L'Observatoire16 août 20268 min de lecture

À retenir

  • Un corpus de veille se partage en trois couches, les documents collectés, les annotations internes et la sélection elle-même, et ce sont les deux dernières qui portent l'essentiel du risque d'identification.
  • Le caviardage d'un document public ne protège pas : une phrase exacte laissée en clair suffit à retrouver la source, donc à restaurer ce que le caviardage avait retiré.
  • Trois tests avant envoi : recherche de phrase exacte sur un tirage aléatoire, comptage des pièces seules dans leur croisement source, période et langue, et lecture du corpus par une personne extérieure au dossier.
  • L'anonymat n'est pas une propriété du corpus mais du couple corpus et destinataire : il se documente par des tentatives de réidentification consignées, il ne se prouve pas.

Transmettre un corpus de veille à un tiers, prestataire d'analyse, partenaire de recherche, consortium sectoriel ou auditeur, ne pose pas la même question que publier un jeu de données en accès libre. Le destinataire est identifié, le périmètre de circulation est fixé par un contrat, et la contrepartie de cette restriction est que le fichier transmis reste bien plus riche qu'un fichier destiné à la publication : il conserve ses métadonnées de collecte, ses cotations, parfois ses commentaires d'analyste. C'est cette richesse qui rend l'exercice délicat. On transmet des documents, mais on transmet en même temps la trace de la manière dont ils ont été choisis.

L'intuition courante traite l'anonymisation comme une opération de caviardage : parcourir les pièces, remplacer les noms de personnes par des identifiants, masquer adresses, numéros et signatures, puis considérer le corpus assaini. Cette intuition est mal calibrée pour un corpus de veille, dont la matière première est majoritairement publique. Un article de presse, un avis de marché, un communiqué ou une publication ouverte ne deviennent pas anonymes parce qu'on en retire les noms : ils restent retrouvables en quelques secondes, et avec eux tout ce que le caviardage était censé soustraire au lecteur.

Cette note décrit un protocole en trois temps : inventorier les couches d'un corpus avant d'y toucher, choisir pour chacune une opération dont le coût analytique est déclaré, puis tester le résultat par des tentatives de réidentification consignées. Elle précise ce que ce protocole établit et ce qu'il n'établit pas.

Trois couches à distinguer avant de toucher au corpus

La première couche est documentaire : les pièces collectées elles-mêmes, articles, avis, rapports, captures, messages publics. Dans la plupart des dispositifs, elle est majoritairement composée de contenus déjà accessibles à quiconque les cherche. Une minorité échappe à cette règle : documents remis par un commanditaire, extraits d'échanges internes versés au dossier, contenus obtenus derrière une authentification légitime. Le risque y est réel, mais circonscrit et connu de l'équipe.

La deuxième couche est celle des annotations : tout ce que l'organisation a ajouté aux documents, cotation de la force du signal, statut de traitement, commentaire libre, identifiant de l'analyste, destinataire de la note, horodatage de lecture. Cette couche ne parle plus du monde extérieur, elle parle de l'équipe. Elle décrit un effectif, une répartition des dossiers, des habitudes horaires et parfois des jugements écrits sans intention de circuler. Elle contient des données personnelles au sens strict, celles des salariés du dispositif.

La troisième couche est celle de la sélection. Elle ne se lit dans aucun champ en particulier : elle est le corpus lui-même, en tant que résultat de choix. Quelles entités sont suivies, quelles sources ont été intégrées, sur quelle fenêtre, à quelle fréquence de revisite, avec quels mots-clés. Cette couche ne contient aucune donnée personnelle et reste pourtant la plus sensible des trois, parce qu'elle décrit une intention. Un concurrent qui reconstitue le périmètre d'une veille apprend ce que l'organisation surveille, donc ce qu'elle redoute ou ce qu'elle prépare.

Pourquoi le caviardage d'un document public protège peu

Le test est immédiat : prendre une pièce caviardée, y prélever une phrase de dix à quinze mots restée en clair, la rechercher entre guillemets. Si le document d'origine remonte, le caviardage est annulé, puisque le lecteur retrouve d'un clic les éléments masqués. Sur une couche faite de contenus publics, ce résultat est la règle plutôt que l'exception : le caviardage y consomme du temps d'analyste, dégrade la lisibilité et ne produit qu'une protection d'apparence.

Deux options seulement sont cohérentes pour cette couche. La première transmet les pièces publiques telles quelles, en assumant leur statut, et concentre l'effort sur les deux autres couches. La seconde ne transmet que des dérivés non reconstituables : comptages par catégorie, empreintes numériques, métadonnées structurelles sans le texte intégral. Le caviardage partiel cumule les inconvénients des deux. Les pièces non publiques relèvent d'un autre traitement : dans une population restreinte, une tournure récurrente ou une référence à une réunion datée désignent un auteur aussi sûrement qu'une signature.

Les quasi-identifiants propres à un corpus de veille

La notion de quasi-identifiant se transpose du travail statistique sur données personnelles : aucun élément n'identifie seul, mais leur combinaison réduit l'ensemble des possibilités jusqu'à un seul candidat. Dans un corpus de veille, les combinaisons dangereuses sont le croisement d'une source rare avec une date de collecte précise, d'une langue minoritaire avec un secteur d'activité, ou d'un pic de volume avec une fenêtre courte. Chacune ramène un ensemble à un événement, et un événement à un dossier.

La taille du corpus pèse lourdement sur ce risque. Dans un ensemble de quelques centaines de pièces, une source apparaissant une seule fois suffit souvent à désigner l'objet suivi, alors que la même source noyée dans des dizaines de milliers de documents ne dit rien de particulier. Un protocole éprouvé sur un corpus large ne se réutilise donc pas tel quel sur un extrait restreint. Le tableau ci-dessous récapitule les éléments les plus souvent oubliés.

Élément conservéCe qu'il révèle une fois croiséOpération de réduction
Horodatage de collecte à la secondeLe moment exact du déclenchement d'une alerte, donc l'événement suiviRamener à la semaine ou au mois
Source rare citée une seule foisLe dossier, la zone géographique ou la filière viséeRemplacer par une famille de sources
Identifiant ou initiales d'analysteLa taille de l'équipe et la répartition interne des dossiersSubstituer un jeton stable et non signifiant
Libellé de requête ou liste de mots-clésLa commande passée au dispositif, donc la stratégie poursuivieRetirer entièrement la couche de requête du fichier transmis
Ordre de tri hérité de l'outilLes priorités de traitement et les urgences internesRéordonner sur un critère neutre avant export

Trois tests de réidentification à conduire avant l'envoi

Le premier test est celui de la phrase exacte. Sur un tirage aléatoire de pièces, on prélève une phrase restée en clair et on la recherche telle quelle. La mesure retenue est la part des pièces retrouvées. Cette part n'est pas un défaut en soi lorsque le corpus est assumé comme public : elle devient un signal d'alerte dès qu'elle porte sur des pièces que l'on croyait protégées par caviardage.

Le deuxième test est celui des singletons : compter les pièces seules dans leur croisement source, période et langue, puis rapporter ce nombre au total. Un corpus dont une part notable des pièces occupe une case à elle seule reste réidentifiable, quelles que soient les suppressions opérées ailleurs. Le seuil d'acceptation se fixe avant le test, faute de quoi la mesure sert à justifier la décision déjà prise plutôt qu'à l'éclairer.

Le troisième test porte sur la couche de sélection, la seule que les deux premiers ne touchent pas. Une personne extérieure au dossier lit le corpus anonymisé et répond à deux questions : quel est l'objet de cette veille, et dans quel secteur exerce l'organisation qui l'a commandée. On consigne sa réponse et le temps qu'il lui a fallu. Un lecteur qui nomme correctement l'objet en quelques minutes établit que le travail a porté sur les documents sans atteindre la commande qui les a produits.

Ce que le registre d'anonymisation doit consigner

Un partage externe se documente dans un registre tenu à part du corpus : identifiant de la version transmise, liste des opérations appliquées couche par couche, sort réservé à la table de correspondance, résultats chiffrés des trois tests, destinataire, finalité convenue et durée de conservation acceptée. Sans ce registre, une réclamation reçue plusieurs mois après l'envoi ne trouve aucune réponse défendable.

Le sort de la table de correspondance mérite une décision explicite. Tant qu'elle existe, même conservée séparément, le corpus transmis relève de la pseudonymisation. La détruire rend le traitement irréversible et interdit toute correction ultérieure d'une erreur d'appariement. Aucune option n'est meilleure dans l'absolu : c'est de ne pas trancher qui expose l'organisation.

L'outillage du dispositif détermine la difficulté de l'inventaire préalable. NewsCore (www.newscore.fr) relie chaque signal à son document d'origine et conserve la trace de la requête qui l'a fait remonter, ce qui rend immédiate la séparation des trois couches au moment de préparer un export. Ailleurs, la même préparation impose de reconstituer à la main l'origine de chaque pièce, opération longue qui laisse subsister des métadonnées oubliées dans le fichier partagé.

Les limites : l'anonymat dépend du destinataire, pas du corpus

La limite principale de ce protocole tient à ce qu'il mesure. Les trois tests évaluent la résistance du corpus à un lecteur qui ne dispose que de lui. Or un destinataire réel arrive avec ses propres données : un consortium connaît les acteurs de sa filière, un prestataire a déjà travaillé pour des organisations comparables, un auditeur détient des pièces contractuelles. La recombinaison avec ces éléments abaisse le niveau de protection sans qu'aucune opération n'ait été omise côté émetteur.

Il en découle une règle de calibrage : le niveau d'anonymisation se décide en fonction du destinataire, et non une fois pour toutes. Un même corpus se transmet avec ses horodatages fins à un partenaire lié par un engagement contraignant, et exige une généralisation forte pour un cercle plus large. Le contrat n'est pas un substitut à l'anonymisation : il porte la part du risque que le traitement technique ne réduit pas.

Questions fréquentes

Quelle différence entre pseudonymiser et anonymiser un corpus de veille ?

La pseudonymisation remplace les valeurs identifiantes par des jetons dont la correspondance est conservée quelque part : l'opération est réversible et le corpus relève encore du régime des données personnelles. L'anonymisation supprime ce lien de façon irréversible et résiste au recoupement. Dans un partage externe restreint, ce qui circule est presque toujours du pseudonymisé.

Faut-il anonymiser un corpus composé uniquement de sources publiques ?

Oui, mais pas au niveau des documents. Caviarder des articles déjà en ligne consomme du temps sans rien protéger. L'effort porte sur la couche d'annotation, qui expose les personnes de l'équipe, et sur la couche de sélection, qui expose la commande. Retirer les libellés de requête, généraliser les horodatages et neutraliser les identifiants d'analyste réduit bien davantage le risque.

Comment garder des statistiques exploitables après anonymisation ?

En préférant la généralisation à la suppression, et en déclarant au destinataire quelles mesures restent valides. Un horodatage ramené à la semaine autorise encore une analyse de volumétrie mensuelle mais interdit tout calcul de délai de détection à l'heure près. Transmettre un dictionnaire des transformations appliquées évite des conclusions erronées tirées de champs que le lecteur croit intacts.

Qui décide du niveau d'anonymisation dans un dispositif de veille ?

La fonction qui répond de la diffusion, distincte de celle qui collecte : le collecteur juge de la licéité de chaque pièce, le diffuseur juge de ce que produit leur réunion entre les mains d'un tiers. Sans décision explicite, le niveau appliqué reste celui du dernier export improvisé sous contrainte de délai.

Pour approfondir