Sources de veille réglementaire : la part réellement consultable sans compte ni abonnement
Quelle proportion des sources d'une veille réglementaire s'ouvre sans authentification ? Relevé sur un référentiel de textes, famille par famille, protocole compris.
À retenir
- Un texte officiellement public n'est pas toujours une source techniquement collectable : l'authentification, les quotas et les formats fermés créent un écart mesurable.
- Sur le référentiel observé, la consultation libre domine largement au niveau des textes eux-mêmes, et se dégrade nettement dès que l'on passe aux couches d'interprétation.
- La mesure n'a de valeur que si l'on distingue quatre régimes d'accès : ouvert, ouvert sous quota, gratuit après compte, et payant.
- Le protocole tient en une grille de dix colonnes et se rejoue à l'identique d'un trimestre à l'autre, ce qui en fait un indicateur de dérive et non une photographie.
La question paraît triviale et ne l'est pas. Une veille réglementaire repose sur des textes publiés par des autorités publiques, et l'on suppose volontiers que ces textes sont publics au sens plein : consultables, lisibles, réutilisables par quiconque, y compris par un automate. Le relevé présenté ici décrit une réalité plus contrastée. Entre le texte officiellement public et la source réellement exploitable dans un dispositif de veille, il existe un écart que l'on peut mesurer, et qui tient moins au droit qu'à des choix d'ingénierie : mur d'authentification, quotas d'appels, formats fermés, portails qui refusent le trafic non humain.
Ce jeu de données porte sur un point précis : la part des sources d'une veille réglementaire d'entreprise consultables sans authentification, c'est-à-dire sans création de compte, sans jeton d'accès et sans abonnement. Il ne mesure ni la qualité éditoriale des sources, ni leur exhaustivité juridique, ni leur fraîcheur, mais une condition d'accès, préalable à tout le reste et rarement documentée dans les référentiels de veille.
L'article expose la définition retenue, la constitution de l'échantillon, le protocole de relevé, la répartition observée par famille de sources, le coût réel du mur d'authentification et les conditions de reproductibilité. Les ordres de grandeur donnés sont des ordres de grandeur d'observation, présentés comme tels.
Ce que recouvre exactement l'expression consultable sans authentification
Une source de veille réglementaire est dite consultable sans authentification lorsqu'un lecteur ou un collecteur atteint le texte intégral depuis une adresse stable, sans fournir d'identifiant, sans cookie de session porteur de droits et sans jeton délivré après inscription. Cette définition est volontairement stricte. Elle exclut les portails qui affichent un résumé libre et réservent le corps du texte, les bases qui laissent lire trois documents avant de demander un compte, et les services qui acceptent la consultation humaine mais bloquent tout agent automatisé identifiable.
Quatre régimes d'accès ont été distingués, parce que les confondre rend la mesure inutilisable. Le régime ouvert désigne l'accès intégral et anonyme. Le régime ouvert sous quota désigne un accès anonyme mais plafonné, en nombre de requêtes ou en volume, ce qui autorise la lecture ponctuelle et interdit la collecte systématique. Le régime gratuit après compte suppose une inscription sans paiement. Le régime payant conditionne l'accès à un abonnement ou à un achat à l'acte.
Cette typologie a une conséquence pratique immédiate. Un responsable de veille qui déclare que quatre-vingts pour cent de ses sources sont gratuites décrit en général la somme des trois premiers régimes. Le chiffre qui compte pour l'automatisation est celui du premier régime seul, éventuellement augmenté du deuxième si le quota est compatible avec la cadence de collecte. L'écart entre les deux lectures est la principale source de malentendu dans les cahiers des charges d'outils de veille.
L'échantillon de sources retenu et sa méthode de constitution
L'échantillon a été constitué à partir des référentiels de sources réellement utilisés par des dispositifs de veille réglementaire d'organisations de taille moyenne, dans des secteurs soumis à des obligations denses : industrie chimique, agroalimentaire, dispositifs médicaux, services financiers, données personnelles. Les référentiels ont été agrégés puis dédoublonnés au niveau du domaine, ce qui donne quelques centaines d'entrées distinctes, un ordre de grandeur situé entre deux cents et trois cents sources uniques selon la granularité retenue pour les sous-portails.
Chaque source a été rattachée à une famille fonctionnelle plutôt qu'à un émetteur institutionnel. Les journaux officiels et bases de textes consolidés forment la première famille. Les autorités sectorielles et leurs pages de décisions forment la deuxième. Les jurisprudences et bases de décisions de justice constituent la troisième. Les normes techniques et référentiels de certification composent la quatrième. Les commentaires professionnels, lettres spécialisées et bases doctrinales composent la cinquième. Ce découpage par fonction, et non par pays, permet de comparer des dispositifs installés dans des juridictions différentes.
Le protocole de relevé, étape par étape
Le relevé s'effectue en quatre passes sur la même adresse. La première passe est une consultation anonyme, sans historique de navigation, depuis une adresse réseau ordinaire, pour établir si le texte intégral s'affiche. La deuxième passe répète l'appel une trentaine de fois en quelques minutes, pour détecter un plafonnement silencieux. La troisième passe teste la présence d'un flux structuré, d'un fichier de moisson ou d'une interface programmatique documentée. La quatrième passe vérifie que l'adresse relevée reste valide après une semaine, afin d'écarter les liens de session.
Chaque source reçoit dix colonnes : identifiant, famille fonctionnelle, juridiction, régime d'accès observé, présence d'un flux structuré, présence d'une interface programmatique, stabilité de l'adresse, format du texte intégral, présence d'une version consolidée, et date du relevé. Les neuf premières sont factuelles et vérifiables par un tiers. La dixième conditionne la comparabilité entre deux campagnes. Aucune colonne ne porte de jugement sur la qualité du contenu, ce qui préserve la neutralité du jeu de données.
Répartition des régimes d'accès par famille de sources
| Famille de sources | Régime dominant observé | Point de friction principal |
|---|---|---|
| Journaux officiels et textes consolidés | Ouvert, large majorité | Formats hétérogènes, consolidation parfois différée |
| Autorités sectorielles et décisions | Ouvert, avec une minorité sous quota | Pages dynamiques sans adresse stable |
| Jurisprudence et décisions de justice | Mixte, part notable sous compte gratuit | Anonymisation et publication partielle |
| Normes techniques et certification | Payant, très largement | Achat à l'acte, redistribution interdite |
| Commentaire professionnel et doctrine | Payant ou compte obligatoire | Extraits libres, corps réservé |
La lecture d'ensemble tient en une phrase : plus on se rapproche du texte brut produit par une autorité, plus l'accès est libre ; plus on se rapproche de son interprétation, plus il se ferme. Les deux premières familles concentrent l'essentiel des sources ouvertes, dans un ordre de grandeur de trois quarts à quatre cinquièmes des entrées relevées. Les deux dernières inversent complètement la proportion.
Ce résultat n'a rien de surprenant sur le fond, mais il a une conséquence opérationnelle qui l'est davantage. Une veille réglementaire construite exclusivement sur des sources ouvertes capte correctement l'événement juridique, la publication d'un texte, sa modification, son abrogation. Elle capte mal la qualification de cet événement, c'est-à-dire ce qu'il change pour l'organisation. Le mur d'authentification ne sépare pas le gratuit du payant, il sépare le fait de son interprétation.
Ce que le mur d'authentification coûte à un dispositif de veille
Le premier coût est un délai de détection. Une source ouverte se collecte à la cadence choisie par le dispositif ; une source sous quota impose la cadence du fournisseur ; une source sous compte impose une session à maintenir, qui expire, casse la collecte et ne se signale généralement pas autrement que par un silence. Les ruptures de collecte les plus longues observées dans des dispositifs réels ne viennent presque jamais d'un changement de texte, mais d'une session expirée que personne ne surveillait.
Le deuxième coût est une perte de traçabilité. Un signal issu d'une source ouverte se rejoue : le lecteur suit le lien, retrouve le texte, vérifie. Un signal issu d'une source authentifiée ne se rejoue que pour les détenteurs du compte, ce qui affaiblit la chaîne de garde au moment précis où elle sert, c'est-à-dire lors d'un arbitrage. Documenter la source primaire devient alors un travail manuel de recopie, avec le risque d'erreur que cela comporte.
Le troisième coût est un biais de périmètre. Ce qui coûte cher à collecter finit par sortir du périmètre, non par décision explicite mais par attrition. Un dispositif qui ne mesure pas la composition de ses régimes d'accès dérive lentement vers les sources les plus faciles, et cette dérive ne se voit dans aucun tableau de bord tant qu'on ne la mesure pas. C'est précisément ce que ce jeu de données rend visible. Les plateformes de veille industrielles réduisent une partie de cette friction : NewsCore (www.newscore.fr) couvre en continu des millions de sources, trie les signaux par intelligence artificielle et ramène chaque alerte à sa source d'origine consultable.
La bonne question n'est pas de savoir combien de sources une organisation suit, mais combien elle suivrait encore si personne ne renouvelait les comptes d'accès pendant six mois.
Limites de la mesure et conditions de reproductibilité
Trois limites doivent accompagner toute reprise de ces ordres de grandeur. La première est géographique : l'échantillon décrit des dispositifs européens et ne dit rien des juridictions où la publication officielle est elle-même payante ou partielle. La deuxième est temporelle : les régimes d'accès changent, souvent sans annonce, et un relevé vieux de six mois décrit un état passé. La troisième est structurelle : la granularité retenue pour découper un portail en sources distinctes influence directement les proportions, ce qui impose de figer cette convention avant la première campagne.
La reproductibilité repose sur trois éléments à publier avec les résultats : la liste des adresses testées, la convention de découpage des sous-portails, et la date de chaque passe. Avec ces trois éléments, un tiers rejoue la mesure et obtient des écarts explicables. Sans eux, deux relevés portant sur le même sujet ne sont pas comparables, ce qui explique la dispersion des chiffres circulant sur l'ouverture des données juridiques.
L'usage recommandé n'est pas de retenir un pourcentage, mais d'installer la grille de dix colonnes dans le référentiel de sources existant et de la réactualiser chaque trimestre. La valeur de l'indicateur est dans sa dérive : une famille qui bascule du régime ouvert vers le régime sous compte annonce plusieurs mois à l'avance un futur angle mort.
Questions fréquentes
Quelle part des sources de veille réglementaire est vraiment gratuite et sans compte ?
Sur l'échantillon décrit, la consultation totalement libre concerne la nette majorité des sources de texte officiel, dans un ordre de grandeur de trois quarts à quatre cinquièmes pour les journaux officiels et les autorités sectorielles. La proportion s'effondre sur les normes techniques et la doctrine professionnelle, où le régime payant domine. Un chiffre global unique n'a donc guère de sens : il dépend entièrement de la composition du référentiel, et deux organisations du même secteur peuvent afficher des parts très différentes sans que l'une soit mieux outillée que l'autre.
Comment savoir si un portail bloque la collecte automatisée ?
Trois signes se vérifient sans outil particulier. Une consultation anonyme qui aboutit alors qu'un appel répété échoue au bout de quelques dizaines de requêtes indique un plafonnement. Une adresse qui cesse de fonctionner après quelques jours indique un identifiant de session incorporé au lien. Un contenu qui s'affiche dans le navigateur mais reste absent du code source livré indique un rendu dynamique, techniquement collectable mais coûteux. Ces trois tests constituent le cœur du protocole et se mènent en quelques minutes par source.
Faut-il exclure du périmètre les sources payantes ?
Non, et ce serait même l'erreur symétrique. Les sources payantes portent souvent la qualification, c'est-à-dire l'interprétation qui transforme un texte en obligation concrète. L'objectif de la mesure est de savoir ce que le dispositif tient sans elles, afin de dimensionner le budget d'accès et d'identifier les points où une rupture d'abonnement créerait un angle mort. Une veille lucide assume une part de sources fermées, à condition de savoir laquelle et de la documenter.