mercredi 7 octobre 2026
Analyses

Ce que recouvre exactement la notion de web profond dans une veille professionnelle

Le web profond n'est ni le web sombre ni une zone grise : définition opératoire, critères de bascule, gisements réellement exploitables et limites d'accès en veille professionnelle.

L'Observatoire2 septembre 20269 min de lecture

À retenir

  • Le web profond se définit par un seul critère, l'absence d'indexation par les moteurs généralistes, jamais par la licéité ou l'intention.
  • Le web sombre se définit par son protocole d'accès, un réseau superposé exigeant un client dédié : c'est un sous-ensemble étroit, pas un synonyme.
  • Les gisements profonds les plus utiles en veille sont banals et publics : registres, brevets, marchés publics, jurisprudence, bases réglementaires.
  • Quatre critères font basculer une ressource hors du web de surface : lien stable, autorisation d'indexation, authentification, génération à la requête.

Peu de notions du vocabulaire de la veille sont aussi mal employées que celle de web profond. Le terme circule dans les offres de service, dans les catalogues de formation et dans les articles de vulgarisation avec au moins trois sens distincts : tantôt il désigne tout ce que les moteurs généralistes n'affichent pas, tantôt il sert de synonyme commode à web sombre, tantôt il évoque un espace supposé clandestin où se trouverait l'information que les autres n'ont pas. Ces trois usages ne recouvrent ni la même réalité technique, ni les mêmes conditions d'accès, ni les mêmes risques juridiques.

La définition importe parce qu'elle commande des choix concrets : quels gisements intégrer à un dispositif, quelles compétences réunir, quelles précautions poser sur la traçabilité des sources. Un responsable de veille qui confond les notions surestime la difficulté de l'exercice ou sous-estime le cadre juridique qui s'y applique. Cette analyse pose une définition opératoire, sépare les notions voisines, énonce les critères qui font basculer une ressource d'une catégorie à l'autre, puis décrit ce que l'accès à ces gisements change réellement pour un dispositif professionnel.

Une définition opératoire : ce qui n'est pas indexé n'est pas nécessairement caché

Le web profond désigne l'ensemble des ressources accessibles par les protocoles ordinaires du web mais absentes de l'index des moteurs généralistes. Le critère est technique et unique : l'indexabilité. Il ne dit rien de la licéité du contenu, rien de l'intention de son éditeur, rien de la difficulté d'y accéder. La notion est née à la fin des années 1990 pour nommer un phénomène précis, le contenu des bases de données interrogeables par formulaire, que les robots d'indexation de l'époque ne savaient pas atteindre parce qu'aucun lien ne pointait vers les pages de résultats.

Les causes de non-indexation sont nombreuses et pour la plupart banales : contenu généré à la volée en réponse à une requête, page protégée par authentification, article derrière un abonnement, exclusion volontaire déclarée par le fichier robots.txt, absence de lien entrant, pagination trop profonde pour être parcourue, format de fichier que le robot ne sait pas analyser, contenu produit par du code exécuté dans le navigateur. À cela s'ajoutent les intranets, extranets et espaces clients, qui représentent une masse considérable de documents parfaitement légitimes.

Il en découle une propriété que l'on oublie souvent : le web profond n'est pas un lieu, c'est un résidu défini par la négative, et ce résidu dépend de l'observateur. Une ressource profonde pour un moteur généraliste est de surface pour un moteur spécialisé qui sait interroger le formulaire correspondant. Parler du web profond au singulier, comme d'un territoire homogène doté de ses propres codes, entretient une confusion dont aucun dispositif de veille ne tire bénéfice.

Web profond, web sombre, web invisible : trois notions à ne pas confondre

Le web sombre désigne les services qui ne sont accessibles qu'au travers d'un réseau superposé, Tor ou I2P principalement, exigeant un client dédié et une résolution de noms propre à ce réseau. Le critère de définition est ici le protocole d'accès, pas l'indexation. C'est un sous-ensemble étroit du web profond, connu pour ses places de marché illicites, ses forums de revente de données et ses espaces de publication de fuites, mais il abrite aussi des usages licites, en particulier la protection des sources journalistiques et l'accès à l'information dans des contextes de censure.

Le web invisible est le terme historique, largement synonyme de web profond dans la littérature des années 2000. Il a vieilli pour une raison simple : les moteurs ont appris à indexer une partie de ce qui leur échappait, notamment les documents bureautiques et certains contenus produits dynamiquement. La frontière s'est déplacée, ce qui confirme qu'elle relève de la capacité technique des robots à un moment donné et non d'une propriété stable des ressources.

La règle de lecture tient en une phrase : profond renvoie à l'indexation, sombre renvoie au protocole, invisible est un terme daté. Une page hébergée sur un service Tor est à la fois profonde et sombre. Une base d'appels d'offres publics est profonde et parfaitement publique. Un article de presse derrière abonnement est profond et commercial. Ces trois cas n'appellent ni les mêmes outils, ni les mêmes précautions, ni les mêmes compétences.

Le web profond se définit par un défaut d'indexation, le web sombre par un protocole d'accès : confondre les deux revient à confondre une porte fermée et une porte dérobée.

Les gisements du web profond réellement utiles en veille professionnelle

L'inventaire des gisements profonds à valeur professionnelle est décevant pour qui attend du spectaculaire, et précieux pour qui cherche de la matière première. On y trouve les registres d'entreprises et les publications de comptes, les bases de brevets, de marques et de dessins, les décisions de justice, les portails d'appels d'offres et de marchés publics, les bases réglementaires et normatives, les bases bibliographiques scientifiques, les registres d'installations classées, les données environnementales et sanitaires, les autorisations et décisions administratives publiées par les autorités sectorielles.

Ces gisements partagent des caractéristiques qui expliquent leur absence des index : l'accès passe par un formulaire, la requête doit être structurée, les résultats ne portent pas d'adresse stable, l'export est bridé. Leur valeur tient à trois qualités que la presse n'offre pas : la donnée est primaire, elle est datée de façon fiable, elle est souvent opposable. Un dépôt de brevet, une décision d'autorisation ou un avis de marché constituent des faits vérifiables, antérieurs de plusieurs semaines à leur éventuelle reprise médiatique.

L'accès industriel à ces sources change de nature dès lors que la collecte, la traduction et le tri sont automatisés. NewsCore (www.newscore.fr) couvre en continu des millions de sources en plusieurs langues, y compris des gisements que les moteurs généralistes n'exposent pas, et relie chaque signal remonté à sa source d'origine. La définition du périmètre pertinent et la lecture des résultats restent un travail d'analyste, car aucun outil ne décide à la place d'une organisation ce qui compte pour elle.

Les critères qui font basculer une ressource du web de surface au web profond

Quatre critères suffisent à classer une ressource, et un seul d'entre eux suffit à la faire basculer hors du web de surface. Premier critère, l'existence d'une adresse stable et atteignable par un lien : sans elle, le robot ne trouve pas la page. Deuxième critère, l'autorisation d'indexation déclarée par l'éditeur au moyen du fichier robots.txt ou de balises dédiées. Troisième critère, l'exigence d'une authentification ou d'un paiement. Quatrième critère, la génération du contenu en réponse à une requête, qui rend le nombre de pages potentielles pratiquement infini.

Les cas limites sont fréquents et méritent d'être tranchés explicitement dans une cartographie de sources. Un article sous abonnement dont les premiers paragraphes sont indexés est partiellement profond. Un document accessible à qui connaît son adresse mais absent de tout index relève de l'obscurité par l'adresse, une protection illusoire. Un fichier volumineux indexé par son titre mais dont le contenu n'est pas analysé est indexé sans être exploitable. Une plateforme sociale exigeant un compte pour afficher les publications est profonde du point de vue du moteur.

En pratique, la bonne question à se poser devant une source n'est pas de savoir si elle appartient à une zone réputée difficile, mais pourquoi elle n'apparaît pas dans un moteur. La réponse oriente directement le mode de collecte : interface de programmation lorsqu'elle existe, formulaire à automatiser dans le respect des conditions d'utilisation, abonnement à souscrire, ou renoncement assumé quand le coût dépasse la valeur attendue.

Ce que l'accès au web profond change, et ne change pas, pour un dispositif de veille

Ce que cela change tient en trois points. La veille cesse de dépendre de la reprise médiatique, puisqu'elle s'alimente à la source primaire. La datation devient fiable, car les registres publient des dates d'acte et non des dates de publication éditoriale. Le délai de détection se raccourcit sur toute une classe d'événements, dépôts, autorisations, procédures, contentieux, qui laissent une trace administrative avant de laisser une trace publique.

Ce que cela ne change pas mérite d'être rappelé avec la même netteté. Le cadre juridique s'applique intégralement : conditions générales d'utilisation, protection des données personnelles, secret des affaires, droit de la propriété intellectuelle. L'accès frauduleux à un système d'information reste une infraction, et le fait qu'une page ne soit pas indexée ne vaut pas autorisation d'y entrer. La qualification humaine reste indispensable, car un registre ne dit pas ce qu'un fait signifie pour une organisation.

Reste la conséquence organisationnelle, la plus souvent négligée. Exploiter des gisements profonds impose de documenter le mode d'accès de chaque source, de journaliser les collectes et de conserver une capture horodatée des pages consultées. Cette chaîne de garde n'a rien d'une formalité : elle conditionne la valeur probante du corpus le jour où une décision, un contentieux ou une communication de crise s'appuie dessus.

Questions fréquentes

Le web profond est-il illégal ?

Non, et la question repose sur une confusion de critères. Le web profond se définit par l'absence d'indexation, ce qui est un fait technique sans portée juridique. La messagerie d'une entreprise, l'espace client d'un opérateur, une base de brevets, un intranet et un catalogue de bibliothèque en font tous partie. L'illicéité ne tient jamais à la profondeur d'une ressource, mais à la nature du contenu et au mode d'accès employé : consulter une base publique par son formulaire est licite, contourner une authentification ne l'est pas, quelle que soit la zone du web concernée.

Quelle différence entre web profond et web sombre en OSINT ?

En recherche en sources ouvertes, la distinction est opératoire. Le web profond fournit l'essentiel de la matière primaire exploitable, registres, brevets, marchés, décisions, et se travaille avec des compétences documentaires classiques : construction de requêtes, connaissance des référentiels, dédoublonnage. Le web sombre relève d'une pratique spécialisée, avec ses propres exigences de sécurité, d'anonymisation et de cadrage juridique, et il concerne surtout la surveillance de fuites de données et de la revente d'accès. Rapporté au volume d'information utile pour une direction, le premier pèse infiniment plus que le second.

Faut-il des outils spécifiques pour surveiller le web profond ?

Cela dépend du gisement, et la réponse se décide source par source. Beaucoup de bases publiques exposent une interface de programmation ou un flux de mise à jour, qui rend la surveillance triviale une fois le raccordement fait. D'autres n'offrent qu'un formulaire, et l'automatisation doit alors respecter les conditions d'utilisation du service. Un dispositif efficace combine trois briques : une plateforme de collecte large pour le flux continu, des raccordements dédiés pour les registres critiques, et une routine de vérification humaine pour les sources dont la mise à jour est irrégulière.

Repris dans le réseau

Pour approfondir