mercredi 7 octobre 2026
Baromètres

Baromètre du web profond : quelle part d'un périmètre de veille échappe aux moteurs généralistes

Quelle proportion des pages utiles à une veille reste hors d'atteinte d'un moteur généraliste ? Définitions, protocole de test d'indexation, écarts par famille de source et limites.

L'Observatoire20 août 20267 min de lecture

À retenir

  • Le web profond au sens de la veille n'est pas le web clandestin : ce sont des pages publiques et licites qu'un moteur généraliste n'expose pas, pour des raisons techniques et éditoriales.
  • La part non atteignable varie fortement selon la famille de source : elle reste faible sur la presse et devient dominante sur les registres, les portails d'appels d'offres et les archives réglementaires.
  • Une part non indexée non mesurée devient un angle mort invisible : le dispositif ne signale rien, et l'absence de résultat se lit à tort comme une absence d'événement.
  • Le protocole de test décrit ici se refait sur n'importe quel périmètre en conservant la liste d'ancres, la requête de vérification et la fenêtre de relevé.

L'expression web profond entretient une confusion tenace avec le web clandestin, ses places de marché et ses forums fermés. Pour une cellule de veille, la réalité est beaucoup plus banale et beaucoup plus contraignante : une part importante des pages utiles à son travail est publique, licite, accessible avec un navigateur ordinaire, et pourtant absente des réponses d'un moteur généraliste.

Ce baromètre mesure cette part. Il précise ce que nous appelons page atteignable, décrit un protocole de test d'indexation reproductible, et documente les écarts observés entre familles de sources sur les périmètres de veille que nous suivons. Il ne porte pas sur les contenus illicites, qui relèvent d'une autre méthodologie et d'un autre cadre juridique.

Les proportions publiées sont des ordres de grandeur d'observation sur l'échantillon décrit plus bas, arrondis et exprimés par famille de source. Elles bougent d'un moteur à l'autre et d'un mois à l'autre, ce qui est en soi un résultat : la couverture d'un moteur généraliste est une variable, jamais une constante sur laquelle appuyer une garantie de complétude.

Web indexable, web profond, web clandestin : les définitions retenues

Nous appelons page indexable une page accessible sans authentification et effectivement retournée par un moteur généraliste sur une requête raisonnablement spécifique. Nous appelons page profonde une page accessible sans authentification mais non retournée par ce moteur, quelle que soit la requête employée dans le cadre du test. La distinction est empirique, pas doctrinale.

Nous plaçons hors périmètre le web clandestin, qui suppose un réseau d'accès dédié, et les espaces authentifiés, qui exigent un compte et donc un consentement contractuel. Cette délimitation est essentielle sur le plan de la méthode : nous mesurons la couverture d'un moteur sur du contenu public, pas la capacité à contourner un contrôle d'accès.

Cette définition empirique a une conséquence utile. Elle rend la mesure dépendante du moteur testé, ce qui oblige à déclarer lequel a servi de référence et à quelle date. Un baromètre du web profond sans indication du moteur de référence ne signifie rien, puisque la grandeur mesurée est précisément un rapport à une couverture donnée.

Protocole : comment nous testons l'indexation d'un périmètre de veille

Le protocole part d'une liste d'ancres : des pages précises, connues, appartenant au périmètre de veille et repérées par un chemin direct, registre officiel, portail sectoriel, archive documentaire, base de publication réglementaire. Cette liste est constituée avant tout test, indépendamment du moteur, pour éviter le biais qui consiste à ne chercher que ce qu'un moteur retourne déjà.

Chaque ancre est ensuite testée par une requête de vérification comportant un fragment textuel distinctif, suffisamment long pour être improbable ailleurs et suffisamment court pour ne pas être tronqué. La réponse est classée en trois valeurs : ancre retournée, ancre absente mais site présent, ancre et site absents. Le test est répété à trois dates espacées.

La répétition n'est pas un luxe. Nous observons des ancres retournées à une date et absentes à la suivante, sans modification de la page. Une mesure unique surestime donc la stabilité de la couverture. La valeur retenue par ancre est la plus favorable des trois relevés, ce qui rend notre estimation de la part profonde volontairement conservatrice.

Les parts non atteignables observées par famille de source

Les écarts entre familles sont considérables et parfaitement systématiques. La presse en ligne et les sites institutionnels de communication sont largement retournés. Les registres administratifs, portails d'appels d'offres, bases documentaires sectorielles et archives réglementaires le sont beaucoup moins, parfois de façon quasi complète pour le site mais quasi nulle pour la page utile.

Famille de sourcePart des ancres non retournéesCause dominante observéeContournement praticable
Presse et sites de communicationfaiblesans objetsans objet
Registres et bases administrativesélevéegénération par formulairecollecte directe paramétrée
Portails d'appels d'offresélevéerotation et expiration rapidesrelevé cadencé court
Archives et documents réglementairestrès élevéecontenu enfermé dans des fichiersextraction documentaire
Forums et espaces techniques spécialisésmoyenneprofondeur de navigationpoint d'entrée dédié

La colonne des causes est plus instructive que celle des proportions. Une page absente parce qu'elle se génère à la soumission d'un formulaire relève d'un problème d'accès paramétré. Une page absente parce que son contenu réside dans un fichier joint relève d'un problème d'extraction documentaire. Les deux appellent des réponses techniques distinctes et des coûts différents.

Pourquoi une page publique reste invisible d'un moteur généraliste

Quatre mécanismes reviennent constamment dans nos relevés. Le premier est la génération à la demande : la page n'existe qu'après soumission d'un formulaire, et aucune adresse stable ne la désigne. Le deuxième est l'exclusion volontaire par le fichier d'instructions du site, choix éditorial fréquent sur les bases à fort volume dont l'éditeur préfère orienter vers son propre moteur interne.

Le troisième mécanisme est la profondeur de navigation : une page située à de nombreux clics de la racine, sans lien entrant externe, reçoit une priorité d'exploration très basse. Le quatrième est le format : un contenu enfermé dans un fichier bureautique, un tableur ou un document numérisé sans couche de texte reste illisible pour l'indexation, même quand le fichier est parfaitement accessible.

Aucun de ces mécanismes ne traduit une volonté de dissimulation. C'est le point important pour une cellule de veille : la part profonde d'un périmètre n'est pas un indice de secret, elle est le produit de choix techniques et éditoriaux ordinaires. La traiter comme un signal de sensibilité conduit à des interprétations erronées sur la nature des sources.

Une absence de résultat dans un moteur généraliste ne dit rien de l'absence d'événement : elle dit seulement que la page utile n'appartient pas au périmètre exploré par cet outil.

Ce que la part non atteignable change au dimensionnement d'une veille

La première conséquence est un principe de lecture. Tant que la part non atteignable d'un périmètre n'est pas mesurée, aucune conclusion négative n'est défendable. Écrire qu'aucun appel d'offres n'a été publié sur un segment suppose d'avoir établi que le portail concerné est couvert, ce que le protocole ci-dessus vérifie en quelques heures de travail.

La deuxième conséquence est budgétaire. Couvrir les familles à forte part profonde exige des accès directs, des connecteurs paramétrés et une extraction documentaire, donc un investissement supérieur à celui d'une simple surveillance de flux. Ce coût se justifie par une mesure préalable, famille par famille, et non par une décision d'outillage prise à l'aveugle.

La troisième conséquence concerne l'ampleur de la collecte. Un périmètre couvert de manière large en sources et en langues réduit mécaniquement le risque de conclusion négative erronée. NewsCore (www.newscore.fr) couvre en continu des millions de sources en plusieurs dizaines de langues, trie les remontées par pertinence et conserve pour chaque signal le lien vers la page d'origine. Le choix des familles à couvrir en priorité reste, lui, un arbitrage de l'organisation, qui l'écrit et le révise.

Questions fréquentes

Le web profond et le web clandestin, est-ce la même chose ?

Non, et la confusion coûte cher en veille. Le web profond désigne des pages publiques et licites qu'un moteur généraliste n'expose pas : registres, bases administratives, archives, portails documentaires. Le web clandestin suppose un réseau d'accès dédié et relève d'un cadre juridique et méthodologique distinct. L'essentiel de la valeur d'une veille d'entreprise se trouve dans le premier, pas dans le second.

Comment savoir si mon périmètre de veille est bien couvert par un moteur généraliste ?

En constituant une liste d'ancres avant tout test, c'est-à-dire des pages connues et utiles repérées par accès direct, puis en vérifiant leur présence par une requête contenant un fragment textuel distinctif. Répéter le test à trois dates espacées est indispensable, car la couverture varie dans le temps sans qu'aucune modification de la page l'explique.

Pourquoi une page publique n'apparaît-elle pas dans les résultats de recherche ?

Quatre causes dominent : la page se génère à la soumission d'un formulaire et n'a pas d'adresse stable, le site l'exclut volontairement de l'exploration, elle est trop profondément enfouie dans la navigation et sans lien entrant, ou son contenu réside dans un fichier joint que l'indexation ne lit pas. Chacune appelle une réponse technique différente.

Faut-il un outil spécialisé pour couvrir la part profonde d'un périmètre ?

Cela dépend des familles de sources concernées, et la mesure préalable tranche la question. Un périmètre dominé par la presse se couvre avec une surveillance de flux classique. Un périmètre reposant sur des registres, des portails d'appels d'offres et des archives documentaires exige des accès paramétrés et une extraction de fichiers, capacités qu'une veille manuelle ne fournit pas à cadence utile.

Pour approfondir