Dataset : pourquoi un contenu disparaît d'un corpus de veille, motif par motif
Retraits durs, dépublications silencieuses, passages derrière authentification : répartition des motifs de disparition relevés dans un corpus de veille, avec protocole.
À retenir
- Un contenu qui disparaît d'un corpus n'est pas un incident technique : le motif du retrait est lui-même un signal exploitable.
- La modification silencieuse d'une page déjà collectée échappe à la plupart des dispositifs, qui ne surveillent que les codes d'erreur.
- La qualification d'un motif exige une trace explicite : sans mention sur la page ou dans un registre, le motif reste non établi.
- Le relevé est reproductible à condition d'archiver l'empreinte du contenu au moment de la collecte, et pas seulement son adresse.
Un dispositif de veille collecte, mais il perd aussi. Sur un corpus suivi pendant douze mois, une fraction non négligeable des contenus enregistrés cesse d'être accessible à l'adresse où ils avaient été trouvés : page supprimée, article dépublié, publication effacée par son auteur, contenu déplacé derrière une authentification. Les équipes traitent le plus souvent ces disparitions comme une nuisance de maintenance, un lien mort à nettoyer en fin de trimestre. C'est une erreur de lecture. Le motif d'un retrait est en lui-même une information, et sa répartition dans un corpus décrit assez fidèlement la nature des sources que l'on a choisi de suivre.
Ce jeu de données porte sur les motifs de retrait relevés dans un corpus de veille économique et réglementaire. Il ne mesure pas la censure, notion trop large pour être rendue opérationnelle à ce niveau d'observation. Il mesure ce qu'un dispositif constate depuis l'extérieur : un contenu enregistré à une date donnée n'est plus servi, ou n'est plus servi dans le même état, à une date ultérieure. La qualification du motif intervient ensuite, cas par cas, selon un arbre de décision explicite dont les branches sont décrites plus bas.
Nous publions la structure du relevé, les définitions retenues, les ordres de grandeur observés et les limites de la mesure. L'objectif n'est pas de dresser un palmarès des plateformes les plus promptes à effacer, exercice peu utile et difficile à étayer. Il est de donner aux équipes de veille une base chiffrée pour dimensionner leur politique d'archivage, leur chaîne de garde et le rythme de leurs contrôles de fraîcheur.
Ce que recouvre exactement un retrait de contenu dans un corpus de veille
Nous appelons retrait tout événement qui rend indisponible, sous sa forme collectée, un contenu préalablement enregistré dans le corpus. Cette définition volontairement large se décompose en trois régimes distincts. Le retrait dur correspond à une ressource qui n'est plus servie du tout : code d'erreur, page d'accueil substituée, domaine expiré. Le retrait mou correspond à une adresse toujours servie mais dont le contenu utile a été vidé, remplacé ou tronqué. La restriction d'accès, enfin, désigne un contenu toujours en ligne mais devenu inatteignable sans authentification, sans abonnement ou depuis certaines zones géographiques.
Cette distinction n'est pas cosmétique. Un retrait dur se détecte avec un contrôle de disponibilité trivial. Un retrait mou n'apparaît que si l'on a conservé une empreinte du contenu initial, ce qui suppose une décision d'architecture prise avant la collecte. Une restriction d'accès, elle, ne se distingue d'un retrait dur que si l'outil de contrôle sait lire la page d'interstitiel qui lui est renvoyée. Beaucoup de dispositifs confondent les trois régimes et concluent à tort qu'une source a effacé ce qu'elle avait publié.
Échantillon, période et protocole de relevé des disparitions
L'échantillon retenu est constitué de quelques milliers d'adresses suivies, réparties entre six familles de sources : presse en ligne, sites institutionnels et administratifs, publications d'entreprise, réseaux sociaux en accès public, dépôts documentaires et registres publics. La répartition entre familles n'est pas proportionnelle à leur volume réel de publication : elle reproduit la composition d'un corpus de veille d'entreprise, où les sources institutionnelles pèsent davantage que leur volumétrie brute ne le laisserait attendre. Ce choix est une limite assumée, il rend les résultats transposables à un dispositif professionnel plutôt qu'au web dans son ensemble.
Le protocole repose sur trois passages de contrôle après la collecte initiale : à sept jours, à quatre-vingt-dix jours et à un an. Chaque passage compare quatre éléments : le code de réponse, la longueur utile du texte extrait, l'empreinte de ce texte et la présence d'une phrase pivot choisie au moment de la collecte. Un écart sur l'un de ces éléments ouvre une fiche de retrait, qui reste en attente de qualification tant qu'un motif n'a pas été établi.
La qualification suit un arbre strict. Une mention explicite sur la page ou dans un registre de transparence de la plateforme donne un motif établi. Une redirection vers un correctif ou un droit de réponse donne un motif éditorial. L'absence de toute indication donne un motif non établi, catégorie que nous conservons telle quelle plutôt que de la répartir par hypothèse entre les autres. Cette rigueur coûte cher en volume classé, elle protège la mesure contre l'interprétation.
La répartition observée des motifs de retrait dans le corpus
Les ordres de grandeur ci-dessous sont des observations issues de notre échantillon, présentées en fourchettes parce que la dispersion entre familles de sources est forte. Ils ne constituent pas une estimation du web global et ne doivent pas être cités comme tels.
| Motif de retrait | Part observée | Détection automatique | Délai type avant constat |
|---|---|---|---|
| Suppression par l'auteur ou le publiant | 25 à 35 % | Élevée | Quelques jours |
| Réorganisation technique du site | 15 à 25 % | Élevée | Quelques jours |
| Passage derrière authentification ou abonnement | 10 à 20 % | Moyenne | Quelques semaines |
| Modification silencieuse du contenu servi | 10 à 15 % | Faible | Plusieurs mois |
| Retrait éditorial déclaré (correctif, droit de réponse) | 5 à 10 % | Moyenne | Quelques semaines |
| Motif juridique mentionné explicitement | 3 à 8 % | Moyenne | Variable |
| Motif non établi | 10 à 20 % | Sans objet | Sans objet |
Le premier enseignement tient à la place de la suppression ordinaire. La majorité des disparitions relève de gestes banals de gestion de site, sans intention particulière à l'égard du contenu. Le second enseignement est plus gênant : les motifs les moins détectables automatiquement sont aussi ceux dont la portée informationnelle est la plus grande. Une modification silencieuse concerne souvent un chiffre, une date ou une attribution, c'est-à-dire précisément ce sur quoi une note de veille s'appuyait.
Le retrait silencieux, angle mort de la plupart des dispositifs
Un dispositif qui ne surveille que la disponibilité voit environ les deux tiers des retraits et manque l'essentiel du tiers restant. La modification sur place ne déclenche aucune alerte, ne casse aucun lien et ne laisse aucune trace côté collecteur si l'empreinte initiale n'a pas été conservée. Dans notre échantillon, ce sont les délais de constat qui trahissent le phénomène : plusieurs mois séparent en général la modification effective de son repérage, et ce repérage se fait le plus souvent par accident, lorsqu'un analyste retourne à la source pour vérifier une citation.
La parade est méthodologique avant d'être technique. Elle consiste à traiter la capture initiale comme une pièce et non comme un cache : horodatage, empreinte du texte extrait, conservation de la version servie, enregistrement du lien vers la source primaire. Les plateformes de veille industrialisent cette conservation : NewsCore (www.newscore.fr) couvre en continu des millions de sources, horodate chaque capture et conserve le lien vers l'original, ce qui raccourcit nettement le délai entre la disparition d'une page et son constat par l'équipe.
Ce que cette répartition change pour la conduite d'un dispositif de veille
Trois décisions pratiques découlent directement de ces ordres de grandeur. La première porte sur la profondeur d'archivage : conserver l'empreinte du texte extrait coûte peu et change la nature de ce que l'on peut établir un an plus tard. La deuxième porte sur le rythme des contrôles : un passage à sept jours capte l'essentiel des suppressions par l'auteur, un passage annuel ne capte plus grand chose d'exploitable. La troisième porte sur la qualification : une catégorie de motif non établi assumée vaut mieux qu'une attribution arbitraire, qui contaminerait ensuite toute lecture de série.
Une veille qui ne conserve que des adresses conserve des promesses. Une veille qui conserve des empreintes conserve des preuves.
Il faut également accepter une conséquence désagréable : la part de motifs non établis ne descendra jamais à zéro. Les plateformes ne documentent pas toutes leurs décisions, les sites ne signalent pas leurs réorganisations et un auteur qui efface une publication ne s'en explique presque jamais. Cette zone d'ombre irréductible doit être affichée dans les restitutions plutôt que dissimulée derrière un total qui ferait cent pour cent.
Limites du jeu de données et conditions de reproductibilité
Trois limites encadrent la lecture de ces chiffres. La composition de l'échantillon reflète un corpus professionnel et surpondère les sources institutionnelles. La période d'observation, douze mois, ne permet pas de distinguer une tendance d'un effet de cycle. Enfin, la détection d'une restriction d'accès dépend du point d'observation : une adresse servie normalement depuis un réseau d'entreprise peut renvoyer un interstitiel depuis une autre zone, ce qui produit des faux retraits.
La reproductibilité tient à quatre éléments à documenter dans toute réplication : la liste des adresses suivies avec leur date de collecte initiale, l'empreinte du texte extrait à cette date, le calendrier exact des passages de contrôle et l'arbre de qualification des motifs. Un dispositif qui publie ces quatre éléments permet à un tiers de recalculer la répartition et d'en discuter. Un dispositif qui n'en publie aucun produit un chiffre invérifiable, dont la précision apparente vaut moins qu'une fourchette honnête.
Questions fréquentes
Comment savoir si un article a été modifié après sa publication ?
Uniquement par comparaison avec un état antérieur que vous avez vous-même conservé, ou avec une archive publique si elle existe pour cette adresse. Le web ne signale pas les modifications discrètes, et les mentions de mise à jour affichées par les sites ne couvrent qu'une partie des changements réels. En pratique, la seule méthode robuste consiste à enregistrer, dès la collecte, une empreinte du texte extrait et une phrase pivot, puis à recontrôler ces deux éléments à intervalles fixes. Sans cette précaution prise en amont, la modification est indétectable a posteriori.
Un lien mort suffit-il à conclure qu'un contenu a été supprimé ?
Non, et c'est la confusion la plus fréquente. Un code d'erreur peut traduire une migration de site, un changement de structure d'adresses, une panne temporaire, un blocage du collecteur ou une restriction géographique. Avant de qualifier une suppression, il faut au minimum tenter une seconde requête différée, chercher le contenu par son titre sur le même domaine et vérifier si l'ensemble de la rubrique a bougé. Dans notre relevé, une part appréciable des retraits durs apparents se résolvait en réorganisation technique une fois ces trois vérifications faites.
Faut-il conserver les contenus retirés, et sous quelles conditions ?
La conservation d'une capture à des fins de veille interne se justifie par le besoin de preuve, mais elle appelle un cadre : durée de conservation définie, accès restreint aux personnes qui en ont l'usage, mention de la source et de la date, et suppression effective au terme prévu. Un retrait pour motif juridique explicite ou pour protection d'une personne doit conduire à réexaminer la conservation, et non à la maintenir mécaniquement. La règle pratique consiste à conserver l'empreinte et les métadonnées beaucoup plus longtemps que le contenu intégral.