Taux de disparition des contenus référencés à douze mois : jeu de données et protocole de relevé
Jeu de données sur la survie des contenus cités en veille : quelle part reste atteignable douze mois après la référence, et sous quelle forme.
À retenir
- La disparition d’un contenu référencé se mesure sur une cohorte figée, suivie à échéances fixes, jamais par un contrôle de liens ponctuel.
- Une redirection vers une page d’accueil ou une rubrique générique équivaut à une disparition : le document cité n’est plus atteignable.
- Les écarts entre types de contenus sont massifs : moins d’un sur vingt pour les documents institutionnels, près d’un sur trois pour les publications de plateformes.
- Le seul remède mesurable est la capture au moment de la citation : ce qui n’a pas été conservé alors se perd dans une proportion connue d’avance.
Une note de veille ne vaut que par ce qu’elle cite. Chaque affirmation y renvoie à un contenu extérieur : article, communiqué, fiche de registre, rapport en format PDF, publication de plateforme. Tant que ces renvois aboutissent, le raisonnement reste vérifiable par un tiers. Le jour où ils n’aboutissent plus, la note garde sa forme et perd sa valeur probante.
Ce jeu de données porte sur ce délitement. Nous avons constitué une cohorte de contenus référencés dans des produits de veille, puis vérifié leur accessibilité à quatre échéances : un mois, trois mois, six mois et douze mois après la citation. Au bout d’un an, quelle part de ce qui avait été cité reste atteignable à l’adresse indiquée ?
Nous publions les définitions retenues, la construction de la cohorte, le protocole de relevé, les taux par type de contenu, la typologie des modes de disparition et les limites de la mesure. L’objectif est de donner un ordre de grandeur utilisable pour décider quoi archiver, à quel moment et à quel coût.
Ce que ce jeu de données mesure : la survie d’une référence, pas celle d’une source
La distinction est décisive et souvent escamotée. La mortalité d’une source décrit un éditeur qui cesse de publier ou dont le domaine expire. La disparition d’un contenu référencé décrit autre chose : un document précis, cité une fois, n’est plus atteignable alors que son éditeur continue de publier normalement. Le second phénomène est le plus fréquent, et il frappe des corpus réputés stables.
L’unité d’observation est le contenu référencé, identifié par le couple adresse et empreinte du document au moment de la citation. Il est codé disparu lorsqu’il n’est plus obtenable à cette adresse, constat confirmé par deux tentatives séparées d’au moins soixante-douze heures, depuis deux chemins réseau distincts.
Trois choses ne sont pas mesurées ici. La mesure n’établit pas qu’aucune copie ne subsiste ailleurs, archive publique ou capture privée. Elle ne dit rien de la véracité du contenu perdu. Elle ne traite pas la modification silencieuse, ce cas où le document reste à son adresse mais que son texte a changé : autre protocole, autre jeu de données.
Constitution de la cohorte : périmètre, date d’entrée et stratification
La cohorte réunit les contenus effectivement cités dans les livrables d’un périmètre d’observation sur un mois donné, et non un échantillon de pages tirées du web. Les contenus référencés ne sont pas des pages ordinaires : sélectionnés par des analystes, ils sont en moyenne plus institutionnels et plus stables que la population générale.
La date d’entrée est celle de la première référence, pas celle de la publication. Un rapport paru trois ans plus tôt et cité en janvier entre dans la cohorte en janvier. Cette convention évite de mélanger deux horloges dont les effets sont opposés : un document ancien encore en ligne a déjà démontré sa résistance.
L’échantillon est stratifié par type de contenu, avec un effectif minimal par strate. Sept strates sont retenues : article de presse, document institutionnel en format PDF, fiche de registre public, page de site d’entreprise, publication de plateforme sociale, billet de blog ou de communauté technique, prépublication ou article de recherche. La cohorte est figée à l’entrée, sans ajout en cours de suivi.
Protocole de relevé : quatre passages et une règle de confirmation
Chaque contenu est relevé à un mois, trois mois, six mois et douze mois, dans une fenêtre de sept jours autour de l’échéance, horodatée en temps universel coordonné. Le relevé combine une requête automatisée et une vérification humaine de tout constat négatif : un automate seul confond indisponibilité passagère et disparition.
Quatre états sont codés à chaque passage. Accessible à l’identique : le contenu répond et son empreinte correspond. Accessible modifié : il répond, mais le texte a changé. Déplacé : la requête aboutit ailleurs, sur un emplacement qui sert le même contenu. Disparu : aucun accès au document cité. Une redirection vers une page d’accueil ou un formulaire d’abonnement est codée disparue.
Ce dernier point est la principale source de sous-estimation des contrôles de liens usuels : un serveur qui répond normalement en servant autre chose que le document demandé passe pour un lien valide. La frontière entre déplacé et disparu a donc été codée à la main sur tous les cas ambigus, en double lecture indépendante.
Résultats : ce qui reste accessible douze mois après la citation
| Type de contenu référencé | Accessible à l’identique | Déplacé ou modifié | Disparu à douze mois |
|---|---|---|---|
| Fiche de registre public | large majorité | faible | moins d’un sur vingt |
| Document institutionnel en format PDF | large majorité | faible | environ un sur vingt |
| Prépublication ou article de recherche | majorité nette | faible | environ un sur douze |
| Article de presse | un peu moins des trois quarts | notable | environ un sur huit |
| Billet de blog ou de communauté technique | un peu plus de la moitié | modéré | environ un sur cinq |
| Page de site d’entreprise | environ la moitié | élevé | environ un sur quatre |
| Publication de plateforme sociale | minoritaire | faible | près d’un sur trois |
Les valeurs sont données en ordres de grandeur, l’effectif par strate autorisant une lecture comparative, pas une précision au point de pourcentage. Trois régimes se dégagent. Les registres et les documents institutionnels tiennent : leur adresse engage l’émetteur. La presse et la recherche occupent une position intermédiaire, où la perte se joue sur les refontes et les passages derrière authentification. Les pages d’entreprise et les publications de plateformes forment la strate fragile.
La forme de la courbe compte autant que le taux final. Sur les plateformes, l’essentiel de la perte survient dans les trois premiers mois, puis le rythme ralentit : ce qui survit au premier trimestre survit souvent à l’année. Sur les documents institutionnels, la perte est plus tardive et plus régulière, calée sur les cycles de refonte.
Modes de disparition : retrait, refonte, fermeture, restriction d’accès
Un taux global ne dit pas quoi faire. Nous avons donc codé, sur les seuls cas de disparition confirmée, le mécanisme par lequel le contenu est devenu inatteignable, à partir des traces observables au relevé. C’est la partie la plus directement transposable du jeu de données.
| Mode de disparition | Signe observable au relevé | Récupérable autrement ? |
|---|---|---|
| Retrait délibéré du document | erreur explicite, absence du plan de site | parfois, via une archive publique |
| Refonte de site avec rupture des adresses | redirection en masse vers une rubrique ou l’accueil | souvent, en recherchant le titre sur le nouveau site |
| Fermeture du compte ou de l’espace d’hébergement | profil ou domaine entier indisponible | rarement, hors capture antérieure |
| Passage derrière authentification | page de connexion servie à la place du document | oui, avec un accès légitime |
| Restriction de visibilité | document servi à certains chemins seulement | variable, à documenter cas par cas |
La répartition entre ces modes déplace la conclusion opérationnelle. Une perte dominée par les refontes appelle une citation par identifiant stable et un contrôle périodique. Une perte dominée par les fermetures de comptes appelle une capture immédiate : aucune procédure postérieure ne rattrapera le document. Les deux mécanismes coexistent sans frapper les mêmes strates.
Limites connues, biais de sélection et conditions de reproductibilité
Le premier biais est un biais de sélection, et il tire tous les taux dans le même sens. Les contenus de cette cohorte ont été jugés dignes d’être cités : ils sont plus institutionnels et mieux hébergés qu’un tirage aléatoire de pages. Les taux publiés constituent donc un plancher.
La deuxième limite tient au périmètre : la cohorte est francophone à dominante européenne. Les conventions d’adressage, les obligations de conservation et les pratiques de refonte varient d’une aire à l’autre, et ces ordres de grandeur ne se transposent pas sans nouvelle mesure.
La troisième limite tient à l’instrument. Un document codé disparu depuis nos points de collecte reste parfois accessible depuis un autre réseau ou un compte doté de droits particuliers. La double tentative réduit ce risque sans l’annuler. La reproductibilité repose sur trois éléments publiés avec les données : convention de codage des quatre états, définition écrite des strates, calendrier exact des relevés.
Ce que ces taux changent dans la conduite d’un dispositif de veille
La première conséquence est une règle de séquence : la capture se fait au moment de la citation, pas quand on constate le problème. Passé un an, la fraction perdue est connue d’avance et ne se rattrape qu’à la marge. Conserver une copie coûte peu sur l’instant et devient impossible ensuite.
La deuxième conséquence porte sur l’architecture du dispositif. Un signal remonté sans le document qui le fonde devient invérifiable dès la première refonte de site. Sur ce point, NewsCore (www.newscore.fr) conserve le document collecté et le relie au signal qu’il a produit, de sorte que la chaîne reste vérifiable quand la page d’origine change d’adresse.
La troisième conséquence est déclarative. Un produit de veille gagne à porter, pour chaque référence, la date de consultation et l’indication qu’une copie a été conservée. Le lecteur sait alors si l’absence de réponse invalide la source ou seulement son adresse. Sans cette mention, une note bien fondée devient indéfendable au premier contrôle.
Une référence qui n’aboutit plus ne rend pas une note fausse : elle la rend indéfendable, ce qui produit le même effet devant un tiers.
Questions fréquentes
Quelle part des contenus cités en veille disparaît au bout d’un an ?
Sur la cohorte observée, la disparition à douze mois va de moins d’un contenu sur vingt pour les registres et les documents institutionnels à près d’un sur trois pour les publications de plateformes sociales. La moyenne globale a peu d’usage : c’est la composition du corpus par type de contenu qui détermine le taux réellement subi par une équipe.
Un lien qui répond encore signifie-t-il que le contenu est toujours en ligne ?
Non, et c’est l’erreur la plus fréquente. Un serveur renvoie souvent une réponse normale en servant une page d’accueil ou un formulaire de connexion à la place du document demandé. Un contrôle fondé sur le seul code de réponse déclare ces cas valides et sous-estime la perte. La vérification doit porter sur le contenu servi, comparé à une empreinte.
Comment mesurer ce taux sur son propre dispositif de veille ?
En figeant une cohorte de références issues d’un mois de production, en la stratifiant par type de contenu, puis en relevant l’accessibilité à échéances fixes selon une convention écrite. Quelques centaines de références suffisent pour un ordre de grandeur stable par strate. L’essentiel est de n’ajouter aucune référence en cours de suivi et de refaire l’exercice chaque année.