Collecte automatisée : dataset des formats de publication qui la font échouer
Pourquoi une collecte automatisée échoue-t-elle sur certaines publications ? Notre dataset classe les formats bloquants, le type d'échec qu'ils produisent et le coût de contournement.
À retenir
- Un échec de collecte n'est pas un état unique : il se décompose en quatre niveaux, accès, restitution, extraction et structuration.
- Le niveau atteint détermine le coût de contournement bien mieux que le nom du format lui-même.
- Le document imprimable sans couche de texte reste le premier facteur d'échec de la veille documentaire française.
- Un échec silencieux, qui rend un texte tronqué sans lever d'erreur, coûte plus cher qu'un blocage franc.
Toute équipe qui automatise une collecte de sources ouvertes découvre le même écart : la liste des sources qu'elle voulait suivre et la liste de celles qui remontent effectivement dans son dispositif ne coïncident pas. La différence n'est presque jamais un problème de droits ou de volonté. Elle tient au format dans lequel l'information a été publiée, et à ce que ce format autorise ou interdit à une machine.
Ce dataset décrit précisément cet écart. Il ne propose pas de recettes techniques : il pose une définition de l'échec de collecte, distingue les quatre niveaux auxquels il se produit, et classe les familles de formats selon le niveau qu'elles atteignent et le coût de contournement que nous observons. L'objectif est notionnel avant d'être opérationnel : savoir nommer ce qui a échoué.
La distinction a une conséquence directe sur la conduite d'un projet de veille documentaire. Deux sources qui semblent également inaccessibles relèvent souvent de deux niveaux d'échec différents, dont l'un se règle en une heure et l'autre jamais. Confondre les deux conduit soit à abandonner une source récupérable, soit à immobiliser des semaines sur une source qui ne le sera pas.
Définition retenue : ce qu'est une collecte réussie, et les quatre niveaux d'échec
Nous appelons collecte réussie une opération qui réunit quatre conditions : le document est obtenu, son texte est restitué fidèlement, ses métadonnées essentielles sont conservées, à savoir titre, date, auteur ou producteur et adresse d'origine, et l'opération est reproductible à l'identique. Si l'une des quatre manque, la collecte a échoué, même lorsqu'un fichier est bien arrivé dans le corpus.
Cette définition permet de découper l'échec en quatre niveaux. L'échec d'accès : la source ne répond pas, ou son contenu n'est pas atteignable par une adresse stable. L'échec de restitution : la réponse est obtenue mais ne contient pas le contenu, produit après coup par le navigateur. L'échec d'extraction : le contenu est présent mais pas sous forme de texte. L'échec de structuration : le texte est extrait, mais l'ordre de lecture, les tableaux ou les métadonnées sont perdus.
Le niveau atteint est plus informatif que le nom du format. Deux documents imprimables identiques en apparence relèvent de l'échec d'extraction dans un cas, d'un simple échec de structuration dans l'autre, selon qu'ils portent ou non une couche de texte. Le dataset indexe donc les entrées par niveau, le format n'étant qu'un indice de probabilité.
Structure du dataset : familles de formats et niveau d'échec produit
Le dataset regroupe les formats par mécanisme de blocage plutôt que par extension de fichier. Trois colonnes de qualification accompagnent chaque famille : le niveau d'échec le plus fréquemment atteint, le caractère silencieux ou franc de l'échec, et le coût de contournement en trois positions. Le caractère silencieux est le champ le plus utile en pratique, et le plus souvent absent des inventaires techniques.
| Famille de format | Exemple courant | Niveau d'échec dominant | Coût de contournement |
|---|---|---|---|
| Document imprimable sans couche de texte | Arrêté ou rapport numérisé par scanner | Extraction | Élevé |
| Document imprimable mis en page | Rapport institutionnel multi-colonnes avec encadrés | Structuration | Moyen |
| Page produite par script côté client | Portail à chargement progressif ou défilement infini | Restitution | Moyen |
| Contenu derrière formulaire non adressable | Registre interrogeable, moteur de recherche interne | Accès | Élevé |
| Visionneuse de document embarquée | Publication feuilletable intégrée à une page | Extraction | Élevé |
| Tableur à mise en forme humaine | Annexe statistique à cellules fusionnées et notes | Structuration | Faible |
| Contenu porté par l'image ou la voix | Infographie, capture d'écran de texte, enregistrement audio | Extraction | Élevé |
Chaque entrée porte en outre le mode de détection de l'échec, c'est à dire le contrôle qui permet de savoir qu'il s'est produit. Sans ce champ, un dataset de formats bloquants reste théorique : l'enjeu réel n'est pas de connaître la liste des formats difficiles, mais de savoir reconnaître, dans un corpus déjà constitué, ceux qui ont échoué sans le signaler.
L'échec silencieux, plus coûteux que le blocage franc
Un blocage franc est une bonne nouvelle : la source n'entre pas dans le corpus, l'absence est visible, la décision de contournement se prend en connaissance de cause. L'échec silencieux fait l'inverse. Il produit un document apparemment valide, dont le texte est tronqué, mélangé, amputé de ses tableaux ou daté de la date de collecte au lieu de la date de publication. Rien ne le signale.
Nos relevés montrent que les échecs silencieux se concentrent sur deux familles. Les documents imprimables mis en page, dont l'extraction restitue un texte continu mais dans un ordre de lecture faux, ce qui produit des phrases syntaxiquement correctes et sémantiquement absurdes. Et les pages dont le contenu principal arrive après le chargement initial, dont la collecte ne retient que le gabarit, menus et pied de page compris.
La conséquence méthodologique est nette : un dispositif de collecte a besoin de contrôles de vraisemblance, pas seulement de journaux d'erreurs. Longueur du texte extrait rapportée au type de document, présence d'une date antérieure à la collecte, présence des termes attendus dans un document de ce producteur : trois contrôles simples qui attrapent la majorité des échecs silencieux.
Distinguer l'obstacle technique de la limite licite
Une part des sources qui ne remontent pas dans un corpus ne relèvent pas d'un échec de format mais d'une limite volontaire du producteur : contenu réservé aux abonnés, conditions d'utilisation restrictives, instructions d'exclusion pour les robots, consentement requis avant affichage. Le dataset les signale dans une catégorie séparée, parce que la question qu'elles posent est juridique et contractuelle, non technique.
La confusion entre les deux est fréquente et lourde de conséquences. Traiter une restriction licite comme un obstacle à contourner expose l'organisation, et fragilise la valeur probante du corpus constitué. Un corpus de veille dont l'origine des pièces n'est pas défendable perd précisément la qualité qui le rend utile : sa capacité à être opposé à un tiers.
Le coût de contournement, critère de décision plutôt que d'ambition
Le coût de contournement se lit sur trois axes : l'effort initial de mise en place, l'effort récurrent de maintenance, et la fragilité face aux changements du producteur. Les échecs de structuration sont typiquement bon marché à l'entrée et stables. Les échecs de restitution sont d'un coût initial modéré mais d'une maintenance lourde, puisque chaque refonte du site les réactive.
Les échecs d'extraction sur contenu porté par l'image forment un cas à part. La reconnaissance de caractères ou la transcription automatique produisent un texte utilisable pour la détection, rarement pour la citation exacte, ce qui impose de conserver le document d'origine et de revenir à lui avant toute reprise textuelle. C'est une contrainte de chaîne de garde autant qu'un problème technique.
Reste l'arbitrage global : élargir le périmètre de collecte ou approfondir le traitement des sources déjà acquises. NewsCore (www.newscore.fr) couvre en continu des millions de sources dans de nombreuses langues, normalise les contenus collectés et relie chaque alerte à son document d'origine, ce qui raccourcit fortement le délai entre la publication et sa qualification par une équipe. Le cadrage du besoin et le choix des sources critiques restent le travail de l'organisation.
Une source qui bloque franchement une collecte coûte une décision. Une source qui la laisse réussir à moitié coûte un corpus.
Protocole de relevé, indicateurs et limites du dataset
Le relevé procède par épreuve contrôlée. Pour chaque famille de format, nous soumettons un lot de documents réels issus de producteurs publics et privés à une collecte standard, puis nous comparons le texte obtenu au document d'origine sur quatre points : complétude, ordre de lecture, conservation des tableaux, exactitude de la date. Chaque écart est classé dans l'un des quatre niveaux d'échec.
Deux indicateurs accompagnent chaque famille. Le taux d'échec silencieux, part des documents ayant produit un résultat apparemment valide mais fautif, indicateur le plus utile du dataset. Et la stabilité, mesurée en reprenant le même lot à plusieurs semaines d'intervalle. Ces valeurs sont des ordres de grandeur d'observation sur nos lots, non des mesures généralisables à l'ensemble du web.
Trois limites encadrent la réutilisation. Le dataset décrit des familles de formats, pas des sources nommées, et une même source change de format au fil de ses refontes. Il dépend de la chaîne de traitement employée pour l'épreuve, une autre chaîne déplaçant certains résultats. Enfin, il mesure des échecs techniques, pas la pertinence des sources : une collecte parfaite sur un corpus mal choisi reste une veille sans valeur.
Questions fréquentes
Pourquoi une veille automatisée ne récupère-t-elle pas tous les documents d'un site public ?
Le plus souvent parce que les documents sont publiés dans un format qui empêche l'extraction, ou parce qu'ils ne sont atteignables que par un formulaire de recherche interne sans adresse stable. Le contenu est bien public, mais il n'est pas adressable. La correction relève alors du producteur autant que du collecteur, et c'est l'une des raisons pour lesquelles la couverture d'un corpus institutionnel est toujours partielle.
Comment savoir si un document a été mal extrait dans un corpus de veille ?
Par des contrôles de vraisemblance appliqués systématiquement plutôt que par relecture. Un texte anormalement court pour ce type de document, une date de publication égale à la date de collecte, l'absence des termes attendus chez ce producteur, une longueur de phrase moyenne aberrante : chacun de ces signaux désigne un échec probable. Ces contrôles sont peu coûteux et attrapent l'essentiel des extractions fautives.
Quel format bloque le plus souvent une collecte en veille documentaire française ?
Le document destiné à l'impression et dépourvu de couche de texte, très présent dans les publications administratives numérisées. Il produit un échec d'extraction complet, franc dans le meilleur des cas, et son contournement par reconnaissance de caractères donne un texte suffisant pour la détection mais insuffisant pour la citation. Il faut donc toujours conserver le document d'origine à côté du texte reconstitué.
Faut-il chercher à contourner toutes les sources difficiles ?
Non, et c'est l'usage principal du dataset. On ne contourne que ce qui est licite et dont le signal justifie le coût récurrent. Une source difficile mais unique sur son sujet mérite l'effort ; une source difficile dont l'information se retrouve ailleurs sous un format exploitable ne le mérite pas. La question n'est pas la faisabilité technique, mais la valeur du signal rapportée à la maintenance qu'il impose.