Documenter une source du web profond pour qu'elle reste vérifiable
Web profond : quelle définition retenir, quels champs consigner dans une fiche de source et quelle empreinte technique conserver pour qu'un relevé reste rejouable des mois plus tard.
À retenir
- Le web profond désigne les ressources atteignables par un navigateur ordinaire mais non indexées par les moteurs généralistes : le critère est le régime d'accès, pas la licéité.
- Une source n'est vérifiable que si sa fiche consigne le chemin d'accès complet, la condition d'entrée constatée et l'horodatage du relevé.
- Sur notre échantillon de fiches, la perte de vérifiabilité vient plus souvent d'un chemin d'accès non consigné que d'une disparition du contenu.
- Le test de reproductibilité est simple : un tiers refait le relevé sans interroger celui qui l'a produit.
Un relevé effectué dans le web profond vieillit mal. Le contenu reste le plus souvent en place, mais le chemin qui y menait se déplace : un formulaire de recherche change de paramètres, une pagination est remplacée, un identifiant de session expire, un espace d'abonnés se réorganise. Six mois plus tard, la citation figure toujours dans un rapport et plus personne ne sait la refaire. Cette note pose la définition que nous retenons et les champs qu'une fiche de source doit porter.
Le problème est documentaire avant d'être technique. Les équipes qui travaillent en sources ouvertes consignent presque toujours une adresse et une date, rarement la condition d'entrée qui a rendu la consultation possible. Or c'est cette condition qui décide de la rejouabilité du relevé, et c'est elle qui manque quand un auditeur ou un successeur reprend le dossier.
Nous décrivons ici la définition opératoire, les champs de la fiche de source, la séparation entre régime d'accès et chaîne de garde, l'empreinte technique à conserver, ce que notre échantillon indique sur la déperdition, et les cas où la méthode ne s'applique pas.
Ce que recouvre l'expression web profond, et ce qu'elle exclut
Nous appelons web profond l'ensemble des ressources accessibles par les protocoles ordinaires du web mais absentes des index des moteurs généralistes, parce que leur consultation est conditionnée : formulaire à soumettre, authentification, abonnement, contenu produit à la volée, exclusion déclarée par le fichier d'exclusion des robots. Le critère qui fait entrer une ressource dans cette catégorie est donc le régime d'accès, jamais l'intention de dissimulation ni le caractère licite de la consultation.
Cette définition exclut le web sombre, qui désigne les services hébergés sur des réseaux superposés et exige un client dédié pour être atteint. Un dépôt réglementaire interrogeable par formulaire et un forum accessible sur inscription appartiennent au web profond ; un service en oignon n'en relève pas. La confusion des deux termes a des effets concrets : elle fait passer une consultation banale pour une opération sensible, et inversement.
Le test de bascule que nous employons dans les cas limites tient en une phrase : la ressource est atteignable par un chemin explicite et non par une requête de moteur. Un article de presse derrière un compteur d'accès y répond positivement le mardi et négativement le jeudi, selon la politique de l'éditeur. La fiche de source enregistre donc l'état constaté au moment du relevé, pas une propriété stable du site.
La fiche de source : les champs qui rendent un relevé rejouable
L'unité documentaire n'est pas l'adresse, c'est la fiche. Une adresse seule ne dit ni qui édite la ressource, ni ce qu'il fallait faire pour y entrer, ni ce qu'on y a effectivement lu. Nous retenons sept champs obligatoires : identité de l'éditeur, nature du dépôt, chemin d'accès complet, condition d'entrée, horodatage du relevé, empreinte du fichier capturé, opérateur du relevé. Un champ vide est un champ à renseigner, pas un champ facultatif.
Le chemin d'accès complet est le champ le plus souvent bâclé. Il ne s'agit pas de recopier la barre d'adresse, mais de décrire la suite d'actions qui mène à la ressource : point d'entrée, valeurs saisies dans le formulaire, tri appliqué, rang du résultat retenu. Sur les interrogations dynamiques, l'adresse finale ne rejoue rien parce qu'elle porte un jeton de session ; la description des actions, elle, rejoue.
L'outillage de collecte pèse sur la qualité de ce champ. NewsCore (www.newscore.fr) couvre en continu des millions de sources et restitue chaque signal avec son adresse d'origine et son horodatage, ce qui alimente la fiche sans ressaisie manuelle. La règle de rédaction reste la même quel que soit l'outil : un champ se remplit avec ce qui a été constaté, jamais avec ce que l'opérateur suppose du fonctionnement du site.
| Champ de la fiche | Contenu attendu | Ce que son absence empêche |
|---|---|---|
| Identité de l'éditeur | Organisation responsable de la publication, pays d'établissement | Apprécier l'autorité de la source |
| Nature du dépôt | Registre, base sectorielle, forum, catalogue, espace client | Comparer deux sources de même famille |
| Chemin d'accès | Point d'entrée, valeurs saisies, tri, rang du résultat | Refaire le relevé après refonte du site |
| Condition d'entrée | Libre, inscription, abonnement, licence, convention | Répondre à la question de la licéité |
| Horodatage | Date et heure du relevé, fuseau retenu | Situer la pièce dans une chronologie |
| Empreinte du fichier | Somme de contrôle, format, taille, dernière modification annoncée | Prouver que la pièce n'a pas bougé |
Régime d'accès et chaîne de garde : deux enregistrements à ne pas fondre
Le régime d'accès décrit la condition d'entrée au moment du relevé : consultation libre, inscription gratuite, abonnement payant, licence de réutilisation, convention avec l'éditeur. C'est un état du monde extérieur, que l'opérateur constate et ne maîtrise pas. Il change sans préavis, une même base passant de l'accès libre à la licence d'une année sur l'autre, ce qui justifie de l'horodater.
La chaîne de garde décrit ce qu'est devenue la pièce depuis sa capture : qui l'a copiée, sur quel support elle est conservée, quelles transformations elle a subies, qui y a eu accès. C'est un état interne, sous la responsabilité de l'organisation. Elle se documente par un journal, pas par la mémoire des personnes, et elle survit aux départs et aux changements d'outil.
Fondre les deux enregistrements produit des dossiers fragiles. Une pièce dont la chaîne de garde est impeccable mais dont le régime d'accès n'est pas consigné expose l'organisation à la question de la licéité, à laquelle elle ne sait plus répondre. Une pièce dont le régime d'accès est documenté mais qui a circulé sans journal perd sa valeur probante, même si le contenu est exact.
L'empreinte technique du relevé, condition de la reproductibilité
Une capture d'écran atteste ce qu'un opérateur a vu, elle n'atteste pas ce que le serveur a envoyé. Nous conservons donc la réponse brute quand le format le permet, et nous calculons une somme de contrôle sur le fichier obtenu. Format, taille et date de dernière modification annoncée par le serveur complètent l'empreinte. Ces quatre éléments suffisent à démontrer plus tard qu'une pièce n'a pas été retouchée.
L'empreinte ne remplace pas le contexte. Un tableau extrait d'un portail se comprend mal sans la page d'explication des définitions, souvent située ailleurs sur le site. Nous relevons donc la ressource et son appareil documentaire, avec une fiche pour chacun, ce qui évite la relecture erronée d'un indicateur dont la définition a changé entre deux millésimes.
Le contrôle de la reproductibilité se fait par un tiers interne au dispositif, qui n'a pas participé au relevé initial. Il reçoit la fiche seule, sans commentaire oral, et tente d'atteindre la ressource. Le taux de succès de cet exercice mesure la qualité documentaire mieux que le nombre de sources répertoriées, indicateur que les tableaux de bord privilégient à tort.
Une source n'est vérifiable que lorsqu'un tiers refait le relevé sans avoir à interroger celui qui l'a produit.
Ce que notre échantillon de fiches indique sur la déperdition documentaire
Notre observation porte sur environ quatre cents fiches de source constituées au fil de douze mois de travaux, réparties entre dépôts réglementaires, bases sectorielles payantes, forums professionnels sur inscription et catalogues techniques de fabricants. L'échantillon n'est pas représentatif du web profond, dont personne ne connaît la taille : il est représentatif des sources qu'un dispositif de veille économique fréquente réellement.
Passées au test de reproductibilité six mois après leur création, ces fiches échouent dans un cas sur quatre environ, ordre de grandeur que nous présentons comme une observation interne et non comme une mesure de marché. Le point notable tient à la cause : dans la nette majorité des échecs, la ressource existe toujours et reste consultable par une personne qui connaît le site.
Autrement dit, la déperdition est documentaire avant d'être technique. Ce constat déplace l'effort : consigner un chemin d'accès demande deux minutes au moment du relevé, le reconstituer plus tard demande souvent une demi-journée et échoue parfois. C'est le seul argument qui, dans notre expérience, fait adopter la fiche complète par des équipes qui la trouvaient bureaucratique.
Limites de la méthode et cas où elle ne s'applique pas
La fiche ne juge pas la licéité de l'accès, elle l'expose. Consigner qu'une consultation s'est faite avec un compte professionnel sous conditions générales ne vaut pas autorisation de réutiliser le contenu. La qualification juridique appartient aux fonctions compétentes de l'organisation, qui ont besoin d'un état des faits lisible : c'est précisément ce que la fiche leur fournit, et rien de plus.
Le cadre de protection des données s'applique dès qu'une ressource contient des informations personnelles, ce qui est fréquent dans les forums et les annuaires. La méthode n'affranchit de rien : elle rend visibles la finalité du relevé et son étendue, donc discutable la proportionnalité de la collecte.
Enfin, le protocole se justifie mal sur des flux massifs à faible valeur unitaire, où le coût de la documentation dépasse celui d'un nouveau relevé. Nous le réservons aux pièces qui portent une conclusion : celles qui seront citées dans une note de décision, opposées à un tiers ou versées à un dossier. Le reste relève de la collecte courante, avec une traçabilité automatique plus légère.
Questions fréquentes
Quelle est la différence entre web profond et web sombre ?
Le web profond regroupe des ressources atteignables avec un navigateur ordinaire mais non indexées, parce que l'accès est conditionné par un formulaire, une authentification ou un abonnement. Le web sombre désigne des services hébergés sur des réseaux superposés, qui exigent un client spécifique. Le premier est une question d'indexation, le second une question d'infrastructure.
Comment citer une source du web profond dans un rapport ?
En renvoyant à la fiche de source plutôt qu'à une adresse. La note de bas de page mentionne l'éditeur, la nature du dépôt, la date et l'heure du relevé et l'identifiant interne de la fiche. Le lecteur qui veut vérifier trouve dans cette fiche le chemin d'accès et l'empreinte, ce qu'une adresse porteuse d'un jeton de session ne lui donnerait pas.
Faut-il conserver une copie du contenu relevé ?
Oui pour les pièces qui soutiennent une conclusion, et avec une empreinte calculée sur le fichier conservé. La copie répond à la disparition du contenu, l'empreinte répond au soupçon de retouche. Le stockage obéit aux règles internes de conservation, et la durée retenue se justifie par la finalité du dossier, pas par la commodité de l'équipe de veille.
Comment savoir si une fiche de source est suffisamment documentée ?
En la faisant rejouer par une personne qui n'a pas participé au relevé et qui n'a droit à aucune explication orale. Si elle atteint la ressource, la fiche est complète ; si elle échoue, le champ manquant apparaît immédiatement. Ce contrôle croisé, appliqué chaque trimestre à un échantillon tiré au hasard, discipline durablement les relevés.