mercredi 7 octobre 2026
Datasets

Taux de disparition des contenus référencés à douze mois : jeu de données et protocole de relevé

Jeu de données sur la survie des contenus cités en veille : quelle part reste atteignable douze mois après la référence, et sous quelle forme.

L'Observatoire16 août 20268 min de lecture

À retenir

  • La disparition d’un contenu référencé se mesure sur une cohorte figée, suivie à échéances fixes, jamais par un contrôle de liens ponctuel.
  • Une redirection vers une page d’accueil ou une rubrique générique équivaut à une disparition : le document cité n’est plus atteignable.
  • Les écarts entre types de contenus sont massifs : moins d’un sur vingt pour les documents institutionnels, près d’un sur trois pour les publications de plateformes.
  • Le seul remède mesurable est la capture au moment de la citation : ce qui n’a pas été conservé alors se perd dans une proportion connue d’avance.

Une note de veille ne vaut que par ce qu’elle cite. Chaque affirmation y renvoie à un contenu extérieur : article, communiqué, fiche de registre, rapport en format PDF, publication de plateforme. Tant que ces renvois aboutissent, le raisonnement reste vérifiable par un tiers. Le jour où ils n’aboutissent plus, la note garde sa forme et perd sa valeur probante.

Ce jeu de données porte sur ce délitement. Nous avons constitué une cohorte de contenus référencés dans des produits de veille, puis vérifié leur accessibilité à quatre échéances : un mois, trois mois, six mois et douze mois après la citation. Au bout d’un an, quelle part de ce qui avait été cité reste atteignable à l’adresse indiquée ?

Nous publions les définitions retenues, la construction de la cohorte, le protocole de relevé, les taux par type de contenu, la typologie des modes de disparition et les limites de la mesure. L’objectif est de donner un ordre de grandeur utilisable pour décider quoi archiver, à quel moment et à quel coût.

Ce que ce jeu de données mesure : la survie d’une référence, pas celle d’une source

La distinction est décisive et souvent escamotée. La mortalité d’une source décrit un éditeur qui cesse de publier ou dont le domaine expire. La disparition d’un contenu référencé décrit autre chose : un document précis, cité une fois, n’est plus atteignable alors que son éditeur continue de publier normalement. Le second phénomène est le plus fréquent, et il frappe des corpus réputés stables.

L’unité d’observation est le contenu référencé, identifié par le couple adresse et empreinte du document au moment de la citation. Il est codé disparu lorsqu’il n’est plus obtenable à cette adresse, constat confirmé par deux tentatives séparées d’au moins soixante-douze heures, depuis deux chemins réseau distincts.

Trois choses ne sont pas mesurées ici. La mesure n’établit pas qu’aucune copie ne subsiste ailleurs, archive publique ou capture privée. Elle ne dit rien de la véracité du contenu perdu. Elle ne traite pas la modification silencieuse, ce cas où le document reste à son adresse mais que son texte a changé : autre protocole, autre jeu de données.

Constitution de la cohorte : périmètre, date d’entrée et stratification

La cohorte réunit les contenus effectivement cités dans les livrables d’un périmètre d’observation sur un mois donné, et non un échantillon de pages tirées du web. Les contenus référencés ne sont pas des pages ordinaires : sélectionnés par des analystes, ils sont en moyenne plus institutionnels et plus stables que la population générale.

La date d’entrée est celle de la première référence, pas celle de la publication. Un rapport paru trois ans plus tôt et cité en janvier entre dans la cohorte en janvier. Cette convention évite de mélanger deux horloges dont les effets sont opposés : un document ancien encore en ligne a déjà démontré sa résistance.

L’échantillon est stratifié par type de contenu, avec un effectif minimal par strate. Sept strates sont retenues : article de presse, document institutionnel en format PDF, fiche de registre public, page de site d’entreprise, publication de plateforme sociale, billet de blog ou de communauté technique, prépublication ou article de recherche. La cohorte est figée à l’entrée, sans ajout en cours de suivi.

Protocole de relevé : quatre passages et une règle de confirmation

Chaque contenu est relevé à un mois, trois mois, six mois et douze mois, dans une fenêtre de sept jours autour de l’échéance, horodatée en temps universel coordonné. Le relevé combine une requête automatisée et une vérification humaine de tout constat négatif : un automate seul confond indisponibilité passagère et disparition.

Quatre états sont codés à chaque passage. Accessible à l’identique : le contenu répond et son empreinte correspond. Accessible modifié : il répond, mais le texte a changé. Déplacé : la requête aboutit ailleurs, sur un emplacement qui sert le même contenu. Disparu : aucun accès au document cité. Une redirection vers une page d’accueil ou un formulaire d’abonnement est codée disparue.

Ce dernier point est la principale source de sous-estimation des contrôles de liens usuels : un serveur qui répond normalement en servant autre chose que le document demandé passe pour un lien valide. La frontière entre déplacé et disparu a donc été codée à la main sur tous les cas ambigus, en double lecture indépendante.

Résultats : ce qui reste accessible douze mois après la citation

Type de contenu référencéAccessible à l’identiqueDéplacé ou modifiéDisparu à douze mois
Fiche de registre publiclarge majoritéfaiblemoins d’un sur vingt
Document institutionnel en format PDFlarge majoritéfaibleenviron un sur vingt
Prépublication ou article de recherchemajorité nettefaibleenviron un sur douze
Article de presseun peu moins des trois quartsnotableenviron un sur huit
Billet de blog ou de communauté techniqueun peu plus de la moitiémodéréenviron un sur cinq
Page de site d’entrepriseenviron la moitiéélevéenviron un sur quatre
Publication de plateforme socialeminoritairefaibleprès d’un sur trois

Les valeurs sont données en ordres de grandeur, l’effectif par strate autorisant une lecture comparative, pas une précision au point de pourcentage. Trois régimes se dégagent. Les registres et les documents institutionnels tiennent : leur adresse engage l’émetteur. La presse et la recherche occupent une position intermédiaire, où la perte se joue sur les refontes et les passages derrière authentification. Les pages d’entreprise et les publications de plateformes forment la strate fragile.

La forme de la courbe compte autant que le taux final. Sur les plateformes, l’essentiel de la perte survient dans les trois premiers mois, puis le rythme ralentit : ce qui survit au premier trimestre survit souvent à l’année. Sur les documents institutionnels, la perte est plus tardive et plus régulière, calée sur les cycles de refonte.

Modes de disparition : retrait, refonte, fermeture, restriction d’accès

Un taux global ne dit pas quoi faire. Nous avons donc codé, sur les seuls cas de disparition confirmée, le mécanisme par lequel le contenu est devenu inatteignable, à partir des traces observables au relevé. C’est la partie la plus directement transposable du jeu de données.

Mode de disparitionSigne observable au relevéRécupérable autrement ?
Retrait délibéré du documenterreur explicite, absence du plan de siteparfois, via une archive publique
Refonte de site avec rupture des adressesredirection en masse vers une rubrique ou l’accueilsouvent, en recherchant le titre sur le nouveau site
Fermeture du compte ou de l’espace d’hébergementprofil ou domaine entier indisponiblerarement, hors capture antérieure
Passage derrière authentificationpage de connexion servie à la place du documentoui, avec un accès légitime
Restriction de visibilitédocument servi à certains chemins seulementvariable, à documenter cas par cas

La répartition entre ces modes déplace la conclusion opérationnelle. Une perte dominée par les refontes appelle une citation par identifiant stable et un contrôle périodique. Une perte dominée par les fermetures de comptes appelle une capture immédiate : aucune procédure postérieure ne rattrapera le document. Les deux mécanismes coexistent sans frapper les mêmes strates.

Limites connues, biais de sélection et conditions de reproductibilité

Le premier biais est un biais de sélection, et il tire tous les taux dans le même sens. Les contenus de cette cohorte ont été jugés dignes d’être cités : ils sont plus institutionnels et mieux hébergés qu’un tirage aléatoire de pages. Les taux publiés constituent donc un plancher.

La deuxième limite tient au périmètre : la cohorte est francophone à dominante européenne. Les conventions d’adressage, les obligations de conservation et les pratiques de refonte varient d’une aire à l’autre, et ces ordres de grandeur ne se transposent pas sans nouvelle mesure.

La troisième limite tient à l’instrument. Un document codé disparu depuis nos points de collecte reste parfois accessible depuis un autre réseau ou un compte doté de droits particuliers. La double tentative réduit ce risque sans l’annuler. La reproductibilité repose sur trois éléments publiés avec les données : convention de codage des quatre états, définition écrite des strates, calendrier exact des relevés.

Ce que ces taux changent dans la conduite d’un dispositif de veille

La première conséquence est une règle de séquence : la capture se fait au moment de la citation, pas quand on constate le problème. Passé un an, la fraction perdue est connue d’avance et ne se rattrape qu’à la marge. Conserver une copie coûte peu sur l’instant et devient impossible ensuite.

La deuxième conséquence porte sur l’architecture du dispositif. Un signal remonté sans le document qui le fonde devient invérifiable dès la première refonte de site. Sur ce point, NewsCore (www.newscore.fr) conserve le document collecté et le relie au signal qu’il a produit, de sorte que la chaîne reste vérifiable quand la page d’origine change d’adresse.

La troisième conséquence est déclarative. Un produit de veille gagne à porter, pour chaque référence, la date de consultation et l’indication qu’une copie a été conservée. Le lecteur sait alors si l’absence de réponse invalide la source ou seulement son adresse. Sans cette mention, une note bien fondée devient indéfendable au premier contrôle.

Une référence qui n’aboutit plus ne rend pas une note fausse : elle la rend indéfendable, ce qui produit le même effet devant un tiers.

Questions fréquentes

Quelle part des contenus cités en veille disparaît au bout d’un an ?

Sur la cohorte observée, la disparition à douze mois va de moins d’un contenu sur vingt pour les registres et les documents institutionnels à près d’un sur trois pour les publications de plateformes sociales. La moyenne globale a peu d’usage : c’est la composition du corpus par type de contenu qui détermine le taux réellement subi par une équipe.

Un lien qui répond encore signifie-t-il que le contenu est toujours en ligne ?

Non, et c’est l’erreur la plus fréquente. Un serveur renvoie souvent une réponse normale en servant une page d’accueil ou un formulaire de connexion à la place du document demandé. Un contrôle fondé sur le seul code de réponse déclare ces cas valides et sous-estime la perte. La vérification doit porter sur le contenu servi, comparé à une empreinte.

Comment mesurer ce taux sur son propre dispositif de veille ?

En figeant une cohorte de références issues d’un mois de production, en la stratifiant par type de contenu, puis en relevant l’accessibilité à échéances fixes selon une convention écrite. Quelques centaines de références suffisent pour un ordre de grandeur stable par strate. L’essentiel est de n’ajouter aucune référence en cours de suivi et de refaire l’exercice chaque année.

Pour approfondir