Jeu de données sur la durée de vie des adresses citées dans les dossiers de veille
Combien de liens restent atteignables après six, douze et vingt-quatre mois : protocole de recontrôle par lots et distinction entre lien mort et lien dérivé.
À retenir
- Le protocole recontrôle par lots des adresses citées à des échéances fixes, ce qui rend les taux de survie comparables entre eux.
- Le lien mort se signale de lui-même par une erreur technique, tandis que le lien dérivé répond normalement avec un contenu remplacé.
- Le lien dérivé est le régime le plus dangereux car il ne déclenche aucun signal visible à la relecture d'un dossier.
- Un taux de survie qui ne distingue pas les deux régimes sous estime systématiquement l'érosion réelle d'un corpus de citations.
Un jeu de données sur la durée de vie des adresses citées dans des dossiers de veille répond à une question simple en apparence : combien de liens restent atteignables un an après avoir été cités, deux ans après. La réponse dépasse le simple compte des liens morts, parce qu'une adresse qui répond encore ne garantit pas que son contenu soit resté le même que celui cité à l'origine.
Un protocole de recontrôle par lots
Le jeu de données part d'un corpus d'adresses effectivement citées dans des dossiers de veille produits à une date connue, regroupées par lot correspondant à leur date de citation d'origine. Chaque lot est ensuite recontrôlé à des échéances fixes après cette date de citation, ce qui permet de mesurer non pas un taux global de survie des liens, mais une courbe de survie qui dépend de l'ancienneté de la citation.
Le recontrôle consiste à requêter chaque adresse du lot et à enregistrer le résultat obtenu, mais l'enregistrement ne peut pas se limiter au code de réponse renvoyé par le serveur. Une adresse qui répond positivement n'indique que la présence d'une page à cet emplacement, pas l'identité entre le contenu actuellement servi et celui qui avait justifié la citation initiale. Le protocole doit donc conserver, au moment de la citation d'origine, une trace du contenu cité, faute de quoi le recontrôle ultérieur n'a rien à comparer.
Recontrôler par lots plutôt qu'adresse par adresse au fil de l'eau présente un avantage méthodologique net : les échéances de recontrôle deviennent comparables entre elles, puisque toutes les adresses d'un même lot sont vérifiées au même âge de citation. Un recontrôle mené au fil de l'eau, à des âges disparates selon la date de vérification, rendrait toute comparaison entre lots plus fragile, chaque lot ayant en réalité été observé à un stade différent de sa propre courbe de survie.
Lien mort et lien dérivé : deux régimes de défaillance
La distinction centrale que ce jeu de données impose porte sur la nature de la défaillance observée. Un lien mort correspond à une adresse dont la page a disparu : le serveur renvoie une erreur, ou l'adresse ne répond plus du tout, ce qui se détecte automatiquement lors du recontrôle sans intervention humaine. Le lien mort se signale de lui-même, par la nature même de la réponse technique obtenue.
Un lien dérivé correspond à une situation très différente : la page répond toujours, avec un code de réponse normal, mais le contenu qui s'y trouve n'est plus celui qui avait justifié la citation d'origine. L'adresse a pu être réattribuée à un autre usage, le contenu a pu être remplacé, mis à jour de façon substantielle, ou retiré au profit d'une page générique qui ne traite plus du tout du même sujet. Rien, dans la réponse technique du serveur, ne distingue ce cas d'une page parfaitement stable.
Cette distinction n'est pas cosmétique : elle sépare deux régimes de défaillance qui appellent des traitements complètement différents dans un dossier de veille. Un lien mort se répare en cherchant une adresse de remplacement, une fois le problème détecté. Un lien dérivé ne se détecte pas de la même façon, et c'est précisément ce qui en fait le cas le plus problématique du jeu de données.
Pourquoi le lien dérivé est le régime le plus dangereux
Un lien mort déclenche une erreur visible à la relecture d'un dossier : quiconque suit la référence constate immédiatement que la page n'existe plus, ce qui invite à vérifier la citation autrement, par une autre adresse ou une autre trace du même contenu. Le lien mort porte en lui-même le signal de son propre problème.
Le lien dérivé ne déclenche rien de tel. Le lecteur qui suit la référence trouve une page qui répond normalement, sans aucune indication que le contenu affiché diffère de celui qui avait été cité à l'origine. La citation continue de renvoyer vers quelque chose de plausible, ce qui produit une fausse impression de continuité alors même que l'affirmation sourcée à l'origine n'est plus étayée par ce que la page contient désormais.
Cette absence de signal est ce qui rend le lien dérivé plus problématique qu'un lien mort dans un jeu de données de durée de vie. Un taux de liens morts se lit directement, se surveille, s'anticipe. Un taux de liens dérivés ne peut être mesuré qu'en comparant explicitement le contenu recontrôlé à une trace du contenu d'origine, ce qui suppose d'avoir conservé cette trace au moment de la citation, une condition que beaucoup de protocoles de veille ne remplissent pas.
Le jeu de données distingue donc systématiquement les deux régimes dans ses résultats plutôt que de les fondre sous une même catégorie de liens défaillants. Une adresse comptée comme survivante au sens strict, parce qu'elle répond toujours, peut très bien appartenir au régime dérivé une fois son contenu comparé à la trace conservée, ce qui change complètement la lecture du taux de survie affiché en tête de résultat.
Lecture d'une courbe de survie à plusieurs échéances
La courbe de survie construite à partir des échéances de recontrôle montre une décroissance qui n'est ni linéaire ni uniforme entre les deux régimes de défaillance. Le taux de liens morts au sens strict croît avec l'ancienneté de la citation, de façon attendue, mais reste souvent inférieur en proportion à ce que révèle l'examen conjoint du contenu pour les adresses qui répondent encore.
La part de liens dérivés parmi les adresses qui répondent toujours croît elle aussi avec l'ancienneté, et de façon parfois plus marquée que celle des liens morts, ce qui confirme que le simple maintien d'une adresse en ligne ne protège en rien contre la dérive de son contenu. Une adresse citée deux ans plus tôt peut ainsi afficher un taux de réponse technique élevé tout en n'étayant plus, dans une proportion significative des cas, l'affirmation pour laquelle elle avait été citée.
Cette lecture conjointe invite à ne jamais publier un taux de survie de liens sans préciser lequel des deux régimes il mesure. Un chiffre unique qui mélange lien mort et lien dérivé, ou pire qui ne compte que les liens morts en ignorant les liens dérivés, sous estime systématiquement l'ampleur réelle de l'érosion d'un corpus de citations au fil du temps.
Ce que ce jeu de données ne mesure pas
Ce protocole documente la durée de vie des adresses et la stabilité de leur contenu, mais il ne prescrit aucune solution de conservation du contenu cité au delà de la trace strictement nécessaire à la comparaison de recontrôle. La question de savoir comment et où conserver durablement une copie fiable d'un contenu, avec les garanties d'intégrité que cela suppose, relève d'un chantier distinct, tout comme les modalités précises par lesquelles une trace conservée peut servir de preuve. NewsCore relie chaque article de son flux à ses sources d'origine sur www.newscore.fr et détecte ainsi précocement les cas où une adresse citée s'écarte du contenu qui avait justifié sa citation.
Questions fréquentes
Un lien qui répond encore normalement est il forcément fiable ? Non, une réponse technique normale indique seulement qu'une page existe à cette adresse, pas que son contenu correspond encore à ce qui avait été cité à l'origine ; c'est précisément la distinction que ce jeu de données mesure.
Pourquoi le lien dérivé est il considéré comme plus problématique que le lien mort ? Parce qu'il ne déclenche aucune erreur visible : la page répond normalement, ce qui donne une fausse impression de continuité alors que le contenu affiché n'étaye plus l'affirmation sourcée initialement, contrairement au lien mort qui signale lui-même son propre problème.
Comment détecter un lien dérivé lors d'un recontrôle ? En comparant le contenu recontrôlé à une trace du contenu conservée au moment de la citation d'origine ; sans cette trace de référence, un lien dérivé reste indiscernable d'une page restée stable.
Ce jeu de données recommande t il une solution d'archivage systématique ? Non, il se limite à mesurer les taux de survie et de dérive des adresses citées ; les modalités de conservation durable d'un contenu et les garanties d'intégrité associées relèvent d'un traitement distinct de celui documenté ici.