mercredi 7 octobre 2026
Datasets

Dataset : la distribution des formats d'un corpus de veille et ce qu'ils laissent extraire

La distribution des formats techniques d'un corpus de veille et leur taux d'extraction textuelle montre que les documents les plus décisifs restent souvent les moins extractibles.

L'Observatoire15 août 20268 min de lecture

À retenir

  • Un corpus de veille mêle des formats très inégalement extractibles, de la page structurée au document numérisé sans couche texte.
  • Le taux d'extraction textuelle exploitable varie fortement d'un format à l'autre et conditionne directement ce qui devient réellement analysable.
  • Les formats les moins extractibles ne sont pas les moins fréquents dans les corpus les plus sensibles, ce qui crée un angle mort structurel.
  • Documenter cette distribution avant toute analyse permet de savoir quelle part d'un corpus reste hors de portée d'un traitement automatisé du texte.

Un corpus de veille n'est jamais homogène dans sa matérialité technique. Il rassemble des pages structurées, des documents bureautiques, des documents numérisés sans couche texte, des images et des contenus audiovisuels, chacun de ces formats offrant un niveau très différent d'accessibité au traitement automatisé du texte. L'Observatoire a construit un dataset qui publie la distribution de ces formats sur un ensemble de corpus de veille observés, ainsi que le taux d'extraction textuelle exploitable propre à chacun.

Cette distinction entre formats est trop souvent absente des discours sur la veille, qui parlent de volume de documents collectés sans préciser ce que ce volume recouvre réellement en matière d'accessibilité du contenu. Deux corpus de même taille peuvent ainsi offrir une matière analysable radicalement différente selon la part que chacun consacre aux formats les plus extractibles.

Le taux d'extraction textuelle exploitable, tel que retenu par ce dataset, mesure la proportion de documents d'un format donné dont le contenu textuel peut être récupéré directement, sans étape intermédiaire de reconnaissance ou de transcription, et sans perte significative de structure. Ce taux ne juge pas de la pertinence du contenu, seulement de sa disponibilité technique pour un traitement ultérieur.

Cette approche par la matérialité technique du corpus se distingue volontairement d'une approche par le contenu ou par la source : elle ne cherche pas à qualifier ce que dit un document, seulement ce que sa forme permet ou empêche de récupérer automatiquement, ce qui en fait un préalable technique à toute analyse de contenu plutôt qu'un jugement sur ce contenu lui-même.

Cinq familles de formats pour un même corpus

Le dataset retient cinq familles de formats représentatives d'un corpus de veille courant. La page structurée regroupe les contenus nativement en ligne, dont le texte est directement accessible dans le code de la page. Le document bureautique regroupe les fichiers produits par des logiciels de traitement de texte ou de présentation, dont le texte reste généralement récupérable, avec parfois une perte de mise en forme.

Le document numérisé sans couche texte regroupe les fichiers issus d'une numérisation d'un support papier, sans traitement de reconnaissance de caractères appliqué en amont : leur contenu se présente comme une image du texte, non comme du texte lui-même. L'image regroupe les contenus visuels sans texte numérique associé, et le contenu audiovisuel regroupe les enregistrements sonores et vidéo, dont le contenu parlé n'est pas disponible sous forme de texte sans une étape de transcription.

Ce découpage en cinq familles ne prétend pas couvrir tous les formats rencontrés dans un corpus de veille réel, il correspond aux catégories les plus fréquentes et les plus contrastées en matière d'extractibilité, ce qui en fait un cadre utile pour documenter la matérialité technique d'un corpus sans se perdre dans une taxonomie trop fine pour être exploitable.

Chaque famille a été définie de façon à rester reconnaissable indépendamment du système de collecte employé, sans référence à un format de fichier technique précis, qui varie d'un environnement à l'autre. Cette abstraction volontaire permet de comparer des corpus rassemblés par des dispositifs différents sans que la comparaison ne se heurte à des différences purement techniques d'enregistrement des fichiers.

La distribution observée et le taux d'extraction par format

L'Observatoire a mesuré, sur un ensemble de corpus de veille couvrant des périmètres variés, la part que chaque famille de formats représente en volume de documents, ainsi que le taux d'extraction textuelle exploitable propre à chacune. Le tableau ci-dessous restitue ces deux dimensions côte à côte, ce qui permet de voir immédiatement où se situent les écarts les plus marqués entre fréquence et extractibilité.

Famille de formatPart dans le corpusTaux d'extraction textuelle exploitable
Page structuréeMajoritaireÉlevé
Document bureautiqueFréquenteÉlevé, avec pertes de mise en forme
Document numérisé sans couche texteMinoritaire mais significativeFaible sans étape intermédiaire
ImageMinoritaireTrès faible
Contenu audiovisuelMarginale à significative selon le périmètreTrès faible sans transcription

Cette distribution fait apparaître un contraste net : les formats les plus extractibles, la page structurée et le document bureautique, dominent en volume dans la plupart des corpus observés, tandis que les formats les moins extractibles restent minoritaires mais loin d'être négligeables, en particulier dans les périmètres où l'information décisive circule davantage sous forme de documents numérisés ou de contenus audiovisuels que sous forme de pages en ligne.

L'écart de taux d'extraction entre la page structurée et le document numérisé sans couche texte est le plus marqué du tableau, ce qui en fait la frontière la plus nette du dataset : c'est à ce point de bascule que se joue la part la plus significative de contenu qui échappe, sans traitement complémentaire, à toute exploitation automatisée du texte.

Les documents les plus décisifs sont souvent les moins extractibles

Le constat le plus significatif de ce dataset ne tient pas à la distribution globale des formats, mais à sa répartition selon la sensibilité du contenu. Dans les corpus observés où les documents portent sur des sujets à forte valeur informationnelle, comptes rendus internes, pièces techniques, enregistrements de réunions, la part de formats faiblement extractibles augmente sensiblement par rapport à des corpus composés majoritairement de communication publique courante.

Cette corrélation s'explique simplement : les documents à forte valeur informationnelle sont plus rarement produits et diffusés nativement comme des pages structurées, et plus souvent transmis sous forme de documents numérisés, d'images de documents ou d'enregistrements. Un dispositif de veille qui ne traite efficacement que les formats les plus extractibles laisse ainsi passer, de façon disproportionnée, une partie des contenus les plus décisifs de son propre corpus.

Cet écart n'est pas anecdotique pour l'évaluation d'un dispositif de veille : un taux de couverture apparent élevé, mesuré en nombre de documents traités, peut masquer un taux de couverture réel plus faible si l'on pondère ce chiffre par la valeur informationnelle des documents laissés hors de portée du traitement textuel automatisé.

Ce que cela implique pour l'évaluation d'un corpus

Documenter la distribution des formats et leur taux d'extraction avant toute analyse permet de savoir, dès le départ, quelle part d'un corpus reste hors de portée d'un traitement automatisé du texte, et donc quelle part de l'analyse produite en aval repose sur une couverture partielle plutôt qu'exhaustive du corpus initialement collecté.

Cette documentation préalable ne résout pas le problème d'extractibilité, elle le rend visible et mesurable, ce qui est la condition nécessaire pour décider, en connaissance de cause, s'il faut investir dans un traitement complémentaire des formats les moins extractibles ou accepter, en le signalant explicitement, qu'une part du corpus reste non couverte par l'analyse textuelle automatisée.

NewsCore couvre sur www.newscore.fr l'ensemble de ces familles de formats et relie les documents faiblement extractibles à leur traitement adapté, ce qui documente la part réelle d'un corpus effectivement rendue analysable plutôt que sa seule part la plus facilement accessible.

Les limites du dataset

Le taux d'extraction mesuré ici décrit une accessibilité technique brute, pas une qualité d'extraction : un document classé comme extractible peut néanmoins produire un texte incomplet ou mal structuré selon la complexité de sa mise en page d'origine. Le dataset ne distingue pas ces degrés fins de qualité, qui relèveraient d'une mesure complémentaire distincte.

La composition d'un corpus de veille varie fortement selon le périmètre surveillé et les sources retenues, ce qui signifie que la distribution publiée ici ne se généralise pas telle quelle à tout corpus : elle sert de repère comparatif, chaque dispositif devant mesurer sa propre distribution pour évaluer sa situation réelle face à ce constat général.

Le dataset ne mesure pas non plus l'évolution de cette distribution dans le temps : un corpus de veille se renouvelle en continu, et la part relative de chaque famille de formats peut varier d'une période à l'autre selon la nature des événements suivis, ce qui appelle une actualisation régulière plutôt qu'une lecture figée de la photographie publiée ici.

Enfin, la frontière entre les cinq familles retenues n'est pas toujours nette dans la pratique : certains documents mêlent plusieurs formats en leur sein, par exemple une page structurée intégrant une image numérisée. Ces cas mixtes ont été classés selon leur composante dominante, un choix de méthode qui simplifie la lecture du dataset au prix d'une perte de nuance sur ces documents composites.

Questions fréquentes

Pourquoi les documents numérisés sans couche texte posent-ils un problème particulier ? Parce que leur contenu se présente comme une image du texte plutôt que comme du texte numérique directement accessible, ce qui empêche toute extraction directe sans une étape intermédiaire dédiée à la reconnaissance du texte contenu dans l'image.

Un corpus majoritairement composé de pages structurées est-il suffisamment couvert par un traitement textuel automatisé ? Pas nécessairement en valeur informationnelle : le dataset montre que les documents les plus décisifs sont souvent surreprésentés dans les formats les moins extractibles, même quand ces formats restent minoritaires en volume dans le corpus global.

Le taux d'extraction mesure-t-il la qualité du texte obtenu ? Non, il mesure seulement l'accessibilité technique brute du contenu textuel, pas sa qualité ni sa fidélité à la mise en page d'origine, qui relèveraient d'une mesure complémentaire distincte de celle publiée dans ce dataset.

Cette distribution de formats s'applique-t-elle à tout corpus de veille ? Non, elle varie selon le périmètre surveillé et les sources retenues. Le dataset sert de repère comparatif général, chaque dispositif devant mesurer sa propre distribution pour situer sa couverture réelle par rapport à ce constat.

Pour approfondir