Web profond et web caché : deux notions que le régime d'accès sépare
Web profond, web opaque, réseaux superposés : définitions, critère de distinction et ce que le régime d'accès change vraiment à la licéité et à la traçabilité d'une collecte.
À retenir
- Le web profond est une propriété d'indexation, relative à un robot et à une date : il ne dit rien de la nature ni de la licéité du contenu.
- Le web caché relève d'un autre critère, la couche de transport : l'accès y suppose un protocole et un client spécifiques, pas seulement une requête différente.
- Quatre régimes d'accès structurent un périmètre : ouvert, contractuel, restreint sur autorisation, réseau superposé. Chacun conditionne licéité, traçabilité et reproductibilité.
- Notre protocole borne l'observation aux régimes ouvert et contractuel : cette limite est déclarée et constitue un angle mort documenté, non un oubli.
Peu d'expressions du vocabulaire de la veille sont employées avec autant de constance dans un sens inexact que celle de web profond. Elle désigne, dans l'usage courant, un espace mystérieux où circuleraient des contenus illicites. Elle désigne, techniquement, une situation banale : une page qu'un robot d'indexation généraliste n'a pas visitée.
La confusion n'est pas seulement lexicale, elle est coûteuse. Un responsable de veille qui croit que le web profond est un territoire interdit renonce à des sources parfaitement licites. Un autre, qui croit qu'il suffit d'un outil pour y accéder, franchit sans le savoir des limites contractuelles ou pénales. Les deux erreurs viennent de la même définition manquante.
Cette analyse pose donc les définitions, propose un critère opératoire, le régime d'accès, et examine ce que ce critère conditionne réellement dans un dispositif de veille : la licéité de la collecte, la traçabilité de la preuve, la reproductibilité de la mesure. Le protocole que nous appliquons et ses limites sont décrits en fin d'article.
Le web profond désigne une propriété d'indexation, pas une nature de contenu
Nous appelons web profond l'ensemble des ressources en ligne qu'un robot d'indexation généraliste ne parvient pas à atteindre ou à restituer. Les causes en sont ordinaires : contenu généré à la suite d'un formulaire, résultat d'une requête en base, page non liée depuis une autre, exclusion déclarée par le fichier d'exploration, session requise, format non traité.
Deux propriétés de cette définition sont décisives. Elle est relative : une ressource est profonde par rapport à un robot donné, pas dans l'absolu. Elle est datée : la même ressource devient superficielle le jour où un lien pointe vers elle et où elle est explorée. La profondeur est donc un état, jamais une caractéristique stable d'un document.
Il faut y ajouter une nuance que la littérature nomme parfois web opaque : des ressources techniquement indexables, sans obstacle d'accès, mais qui ne figurent dans aucun index parce qu'aucun robot n'a jugé utile de les explorer. Elles constituent, dans nos relevés de périmètre, une part non négligeable de ce que les équipes qualifient à tort de profond.
Le web caché relève d'un autre critère : la couche de transport
Ce que l'usage courant appelle web caché, ou dark web, ne se définit pas par l'indexation mais par le transport. Y accéder suppose un protocole et un client particuliers, qui acheminent la requête à travers un réseau superposé au réseau ordinaire. Le critère est infrastructurel : sans le client adéquat, l'adresse ne résout pas, quelle que soit la requête.
La distinction a des conséquences immédiates. Une base documentaire d'université, une notice de marché public interrogeable par formulaire et une archive de presse sur abonnement appartiennent au web profond sans relever d'aucun réseau superposé. À l'inverse, un service de réseau superposé peut être parfaitement référencé dans les annuaires de son propre écosystème, donc indexé en son sein.
Le troisième terme à séparer est celui de contenu illicite. Il désigne une qualification juridique du contenu, indépendante de l'indexation comme du transport. Un contenu illicite se trouve aussi bien sur le web ouvert que dans un réseau superposé ; une ressource non indexée est le plus souvent une notice administrative sans intérêt narratif. Maintenir ces trois qualifications séparées, indexation, transport et licéité du contenu, évite la confusion la plus coûteuse : renoncer à une source parfaitement licite parce qu'elle n'apparaît dans aucun index.
Le régime d'accès, seul critère opératoire pour un dispositif de veille
Puisque la profondeur est relative et la nature du contenu variable, nous retenons un troisième critère, plus utile en pratique : le régime d'accès, c'est-à-dire l'acte que doit accomplir un tiers pour obtenir la ressource. Ce critère a l'avantage d'être vérifiable, stable à court terme et directement relié aux questions de licéité et de traçabilité.
Quatre régimes couvrent l'essentiel des situations rencontrées. Le régime ouvert n'exige aucun acte particulier. Le régime contractuel exige l'acceptation de conditions d'utilisation, un abonnement ou une clé d'interface. Le régime restreint exige une autorisation individuelle accordée par un tiers. Le régime superposé exige un client réseau spécifique en plus de tout ce qui précède.
Une cinquième situation existe et ne constitue pas un régime : l'accès obtenu par contournement d'un contrôle technique, par identité d'emprunt ou par exploitation d'une faille. Nous l'excluons du périmètre de toute mesure, non par prudence rédactionnelle, mais parce qu'une donnée ainsi obtenue est inutilisable dans un produit de veille destiné à fonder une décision.
| Régime d'accès | Acte requis du tiers | Traçabilité de la preuve |
|---|---|---|
| Ouvert | Aucun | Adresse citable, revérifiable par quiconque |
| Contractuel | Abonnement, conditions acceptées, clé | Citable, revérifiable par tout abonné |
| Restreint sur autorisation | Autorisation individuelle d'un tiers | Non revérifiable, capture datée obligatoire |
| Réseau superposé | Client et protocole spécifiques | Adresse instable, archivage indispensable |
Ce que le régime conditionne : licéité, traçabilité, reproductibilité
Sur la licéité, le régime détermine le corps de règles applicable. En régime ouvert, la question porte surtout sur le traitement ultérieur, notamment lorsque des données personnelles figurent dans la ressource. En régime contractuel, elle porte d'abord sur les conditions d'utilisation, qui encadrent la collecte automatisée, la conservation et la rediffusion des extraits.
Sur la traçabilité, le régime détermine si un tiers pourra revenir à la source. Une référence en régime ouvert ou contractuel se revérifie ; une référence obtenue sur autorisation individuelle ne se revérifie pas, et impose donc une capture datée, une empreinte du document et la mention du contexte d'accès. La chaîne de garde n'est pas un supplément, elle remplace la vérifiabilité perdue.
Sur la reproductibilité, le régime détermine ce qu'une autre équipe pourra rejouer. Un indicateur construit sur des sources ouvertes et contractuelles se reproduit à l'identique. Un indicateur qui dépend de sources restreintes ne se reproduit qu'en partie, et sa publication doit indiquer quelle fraction du corpus est hors d'atteinte pour un lecteur.
Le web profond n'est pas un lieu : c'est la relation entre une page et le robot qui ne l'a pas visitée.
Notre protocole de qualification des sources, et ses limites déclarées
Chaque source entrant dans un périmètre observé est qualifiée par six champs : régime d'accès, stabilité de l'adresse, conditions d'utilisation applicables, possibilité de citation publique, profondeur d'archive disponible, périodicité de mise à jour. Ces six champs sont relevés à une date fixe, et la date fait partie de la donnée : un régime d'accès change. Nous datons également la relève elle-même, afin qu'une comparaison entre deux campagnes ne mélange pas des qualifications séparées par plusieurs mois.
Le protocole s'interdit trois choses, ce qui délimite l'échantillon autant que le choix des sources. Il ne crée pas de compte sous identité d'emprunt, ne contourne aucun contrôle technique, n'accède à aucun réseau superposé. L'observation porte donc sur les régimes ouvert et contractuel, plus les sources restreintes auxquelles une autorisation régulière donne accès.
La limite qui en résulte doit être publiée avec les résultats : nos ordres de grandeur sur la part non indexée d'un périmètre sont des ordres de grandeur d'observation, bornés aux régimes explorés. Un angle mort déclaré reste un angle mort, mais il permet au lecteur de savoir ce que la mesure ne couvre pas, ce qu'une mesure silencieuse ne permet jamais.
Conséquences pour la construction d'un périmètre de veille
La première conséquence est de cesser de traiter le moteur de recherche généraliste comme la mesure de l'univers disponible. Un périmètre sérieux inventorie ses sources par régime avant de les interroger, et accepte que les plus utiles soient souvent interrogeables uniquement par formulaire ou par interface applicative, donc absentes de tout index public.
La deuxième conséquence est industrielle. Interroger durablement des centaines de sources hétérogènes, dans plusieurs langues et sous plusieurs régimes, ne se tient pas à la main. NewsCore (www.newscore.fr) couvre en continu des millions de sources, y compris des publications que les index généralistes ignorent, et conserve pour chaque signal le lien vers la source d'origine.
La troisième conséquence relève de la gouvernance documentaire. Un périmètre se publie avec sa liste de régimes, ses zones inaccessibles et la date de qualification de chaque source. Cette discipline coûte quelques heures par campagne et évite la situation la plus fréquente : un indicateur dont personne ne sait plus quelle fraction du réel il observe.
Questions fréquentes
Quelle est la différence entre web profond et dark web ?
Les deux notions reposent sur des critères différents. Le web profond désigne ce qu'un robot d'indexation généraliste n'atteint pas, pour des raisons techniques ordinaires : formulaire, base de données, session, absence de lien. Le dark web désigne des services accessibles seulement via un réseau superposé, donc par un client et un protocole particuliers. Une ressource peut relever du premier sans relever du second.
Le web profond est-il illégal à consulter ?
Non, et la question est mal posée. La légalité ne dépend pas de l'indexation mais du régime d'accès et du traitement ultérieur. Consulter une base documentaire interrogeable par formulaire est licite ; contourner un contrôle d'accès ne l'est pas, que la ressource soit indexée ou non. Le critère juridique porte sur l'acte d'accès, pas sur la présence dans un index.
Comment citer une source non indexée dans un rapport de veille ?
En indiquant le régime d'accès, la date et l'heure de consultation, le chemin d'interrogation employé, et en joignant une capture datée avec une empreinte du document. Lorsque l'adresse est instable ou l'accès subordonné à une autorisation individuelle, cette chaîne de garde remplace la possibilité de revérification directe par le lecteur.
Quelle part d'un périmètre de veille échappe aux moteurs généralistes ?
La réponse dépend entièrement du périmètre, et toute valeur unique publiée sans son protocole doit être écartée. Dans nos relevés, les périmètres riches en sources administratives, en registres et en bases sectorielles présentent une part non indexée nettement plus élevée que les périmètres dominés par la presse en ligne. Nous publions ces écarts comme des ordres de grandeur d'observation.