Le web profond comme périmètre de veille, ce qui est réellement accessible
Définition du web profond, distinction avec les darknets, quatre familles de contenus non indexés et le seul critère qui compte en veille : l'accès sans contournement.
À retenir
- Le web profond désigne ce que les index généralistes n'atteignent pas, ce qui n'a aucun rapport avec les darknets ni avec le caractère licite des contenus.
- La frontière utile en veille n'est pas indexé contre non indexé, mais accessible sans contournement d'un contrôle d'accès contre inaccessible sans contournement.
- L'essentiel de la matière profonde exploitable en intelligence économique tient dans des bases interrogeables par formulaire, publiques et licites, mais absentes des moteurs.
- Aucune mesure de taille du web profond n'est vérifiable : on ne compte pas un ensemble que l'on ne peut pas énumérer.
Le web profond est l'une des notions les plus mal délimitées du vocabulaire de la veille. Elle sert tour à tour à désigner des bases documentaires publiques, des espaces d'échange clandestins, des contenus payants et des pages simplement mal référencées. Cette confusion a un coût opérationnel : elle conduit à surestimer l'inaccessibilité de sources parfaitement consultables, et à sous-estimer les contraintes juridiques attachées à d'autres.
Nous posons ici une définition étroite, nous la distinguons de ses voisines, puis nous décrivons quatre familles de contenus non indexés avec, pour chacune, ce qu'il faut pour l'atteindre. La question directrice n'est pas de savoir ce que le web profond contient en théorie, mais ce qu'un dispositif de veille peut en tirer de façon licite, reproductible et opposable.
La conclusion méthodologique vient tôt : le critère utile n'est pas technique mais juridique et documentaire. Ce qui sépare une source exploitable d'une source inexploitable, c'est la possibilité d'y accéder sans contourner un contrôle d'accès, et la possibilité d'en conserver une trace datée.
Définir le web profond : ce que la notion désigne et ce qu'elle ne désigne pas
Nous appelons web profond l'ensemble des ressources disponibles sur le web qui ne figurent pas dans les index des moteurs de recherche généralistes. La définition est relative et non substantielle : une même page appartient au web profond ou n'y appartient pas selon l'état d'un index à un instant donné. Une ressource peut y entrer parce qu'elle vient d'être publiée, en sortir parce qu'un moteur l'a découverte, y revenir parce qu'un en-tête a changé.
Trois confusions doivent être écartées. Le web profond n'est pas le darknet : les darknets sont des réseaux superposés qui exigent un logiciel de routage particulier et un adressage propre, ils forment une catégorie technique distincte, minuscule en volume. Le web profond ne qualifie aucunement la licéité des contenus : un bulletin officiel et une base de brevets en font partie. Enfin, non indexé ne veut pas dire inaccessible : la majorité de la matière profonde utile s'atteint avec un navigateur ordinaire, à condition de connaître l'adresse du point d'interrogation.
La notion voisine qu'il faut également séparer est celle de contenu payant. Un article derrière abonnement est parfois indexé et donc hors web profond, tout en restant inaccessible sans droit d'accès. Inversement, une base publique gratuite peut être totalement absente des index. Accessibilité économique, accessibilité juridique et présence dans un index sont trois dimensions indépendantes, et les mélanger est la source d'erreur la plus fréquente dans les cadrages de périmètre.
Quatre familles de contenus non indexés et leur accessibilité réelle
La première famille, la plus importante en intelligence économique, rassemble les contenus générés à la requête : bases interrogeables uniquement par un formulaire, dont les pages de résultats n'existent pas avant l'interrogation. Registres d'entreprises, bases de brevets et de marques, portails de marchés publics, bases jurisprudentielles, bases d'autorisations et de rappels de produits, portails statistiques territoriaux relèvent de cette catégorie. Rien n'y est confidentiel, tout y est licite, et pourtant un moteur généraliste n'en restitue qu'une fraction.
La deuxième famille regroupe les contenus derrière authentification : espaces clients, extranets, forums à inscription, réseaux sociaux fermés. Ils sont hors périmètre d'une veille défendable dès lors que l'accès suppose l'usage de justificatifs qui ne sont pas ceux de l'organisation, ou l'acceptation de conditions incompatibles avec un usage professionnel. La troisième famille couvre les contenus volontairement désindexés, par consigne d'exclusion des robots ou par en-tête de non-indexation : ils restent publics au sens juridique, mais l'éditeur a exprimé une volonté de non-référencement dont il faut tenir compte.
La quatrième famille tient à des obstacles purement techniques : documents dont le texte n'est pas extractible, interfaces à défilement continu, adressages instables qui empêchent toute citation stable, limitations de débit. Cette famille est la plus traître, parce que l'accès y est licite mais la reproductibilité mauvaise : une observation qui ne peut pas être citée par une adresse stable perd l'essentiel de sa valeur probante.
| Famille | Exemple de contenu | Accès sans contournement | Condition pour l'exploiter |
|---|---|---|---|
| Contenu généré à la requête | registres, brevets, marchés publics | oui | connaître le point d'interrogation et conserver les paramètres |
| Derrière authentification | extranets, forums fermés | non | hors périmètre sauf droit d'accès propre à l'organisation |
| Désindexé volontairement | pages exclues des robots | oui | tenir compte de la volonté de non-référencement de l'éditeur |
| Obstacle technique | documents non extractibles, adressage instable | oui | capture datée et citation par une référence stable de substitution |
Le seul critère qui tranche : accès sans contournement d'un contrôle d'accès
Une veille défendable se construit sur une frontière unique et écrite : la ressource est-elle atteignable sans franchir un dispositif destiné à en restreindre l'accès ? Un formulaire de recherche public n'est pas un contrôle d'accès, c'est une interface. Un identifiant et un mot de passe en sont un. Une limitation de débit est une mesure de protection technique dont le contournement systématique change la nature de l'acte. Cette distinction est plus opérante que toute typologie technique, parce qu'elle se documente et se justifie devant un tiers.
En découle une conséquence sur la chaîne de garde. Pour une ressource issue d'une base interrogeable, il ne suffit pas de conserver l'adresse : il faut consigner les paramètres de l'interrogation, la date et l'heure de consultation, la version de la base si elle est affichée, et un export ou une capture du résultat. Sans ces éléments, l'observation n'est pas rejouable, et un résultat non rejouable ne vaut rien dans un dossier.
Le second effet porte sur l'outillage. Atteindre cette matière suppose de surveiller en continu un grand nombre de points d'interrogation hétérogènes, dans plusieurs langues, plutôt que d'attendre qu'un flux d'actualité les rapporte. NewsCore (www.newscore.fr) couvre en continu des millions de sources dans de nombreuses langues, trie les signaux par pertinence et remonte chaque résultat avec le lien vers la publication d'origine, ce qui raccourcit le délai entre la parution d'un document et sa qualification. Le cadrage du périmètre, lui, reste un travail d'organisation : décider quelles bases sont pertinentes, à quelle fréquence les interroger, et ce que l'on refuse de suivre.
Protocole d'observation : inventaire, échantillon, unité de comptage
Notre méthode consiste à partir d'un besoin d'information précis, puis à inventorier les points d'interrogation qui y répondent, sans jamais chercher à cartographier le web profond en général. Pour un échantillon de sujets d'intelligence économique, de l'ordre de quelques dizaines, nous recensons les bases publiques pertinentes, leur autorité de publication, leur périodicité de mise à jour, la stabilité de leur adressage et la possibilité d'en extraire un résultat citable.
L'unité de comptage est le point d'interrogation, non le document. Compter des documents dans un ensemble non énumérable produit un chiffre arbitraire ; compter des points d'interrogation identifiés, documentés et testés produit un inventaire vérifiable. Sur nos échantillons, le nombre de points d'interrogation utiles par sujet reste modeste, de l'ordre de quelques unités à quelques dizaines, et la difficulté n'est pas leur nombre mais leur découverte initiale.
Trois règles d'exclusion complètent le protocole : toute ressource exigeant des justificatifs d'accès qui ne sont pas ceux de l'organisation est écartée, toute ressource dont l'adressage ne permet aucune citation stable est signalée comme non probante, et toute ressource dont l'éditeur a exprimé un refus d'indexation est traitée comme consultable mais non redistribuable. Ces trois règles écrites suffisent à rendre l'inventaire reproductible par un autre opérateur.
On ne mesure pas la taille du web profond : on inventorie les points d'interrogation qui répondent à une question donnée, et on vérifie que chaque résultat est rejouable.
Limites de la notion et conditions de reproductibilité
La première limite est logique. Aucune mesure de volume du web profond n'est vérifiable, puisque l'ensemble en question se définit précisément par le fait de n'être pas énuméré. Les ratios de taille qui circulent depuis des années ne reposent sur aucun protocole reproductible et ne devraient pas figurer dans un rapport de veille. La seule grandeur honnête est locale : le nombre de sources pertinentes identifiées pour un sujet donné, à une date donnée.
La deuxième limite est temporelle : l'appartenance d'une ressource au web profond change sans avertissement, au rythme des index. Un inventaire doit donc porter une date de relevé et être révisé, faute de quoi il décrit un état qui n'existe plus. La troisième limite est humaine : la découverte des points d'interrogation reste largement artisanale, elle dépend de la connaissance qu'un analyste a des institutions qui publient dans son domaine, et c'est ce savoir, plus que l'outillage, qui distingue un périmètre profond utile d'une collection de liens.
Questions fréquentes
Quelle est la différence entre web profond et dark web ?
Le web profond désigne tout ce que les moteurs généralistes n'indexent pas, ce qui inclut des registres officiels, des bases de brevets et des portails statistiques parfaitement licites. Le dark web désigne des réseaux superposés accessibles seulement avec un logiciel de routage spécifique et un adressage propre. Le second est un sous-ensemble technique très minoritaire du premier, et l'assimilation des deux conduit à écarter par prudence des sources publiques dont la veille économique a besoin.
Le web profond est-il accessible légalement en veille ?
Une large part l'est, à condition de s'en tenir aux ressources atteignables sans franchir un dispositif restreignant l'accès. Interroger un formulaire public, consulter une base institutionnelle ou télécharger un jeu de données ouvert relève de la recherche documentaire ordinaire. En revanche, l'usage de justificatifs d'accès qui ne sont pas ceux de l'organisation, le contournement délibéré d'une protection technique ou la collecte massive au mépris des conditions d'usage font sortir la démarche du cadre défendable.
Comment intégrer des sources du web profond dans un corpus de veille ?
En partant du besoin d'information et non de l'outil. On formule la question, on identifie les autorités qui publient sur le sujet, on recense leurs points d'interrogation, on teste la stabilité de l'adressage et on écrit la procédure d'interrogation avec ses paramètres. Chaque résultat retenu est conservé avec sa date de consultation et un export. Cet inventaire, daté et révisé, est ce qui transforme une intuition sur les sources cachées en périmètre de veille opposable.