Baromètre de la veille documentaire : la couverture réelle par type de document dans un corpus d'entreprise
Quelle part d'un corpus documentaire d'entreprise est réellement atteignable par une recherche ? Mesure de la couverture type par type, causes d'échec et protocole reproductible.
À retenir
- La couverture d'un corpus documentaire ne se mesure pas au volume stocké mais à la part de documents qu'une recherche ciblée retrouve effectivement : l'écart entre les deux est structurel.
- Les pertes de couverture se concentrent sur trois familles : les documents images non océrisés, les pièces jointes de messagerie et les fichiers déposés hors des espaces indexés.
- Un document retrouvé mais dépourvu de date fiable ou de version identifiable ne compte pas comme couvert : la traçabilité fait partie de la couverture, pas de son supplément.
- Le protocole se rejoue avec un jeu de documents témoins : vingt pièces connues, réparties par type, que l'on tente de retrouver par requête sans connaître leur emplacement.
Une organisation qui déploie un dispositif de veille documentaire mesure généralement son avancement en volume : nombre de documents ingérés, téraoctets indexés, espaces raccordés. Ces chiffres progressent vite et rassurent. Ils ne disent rien de la question qui compte, celle de savoir si une personne cherchant une information précise la retrouve. Entre le volume stocké et le volume atteignable, l'écart est constant et se concentre sur des types de documents identifiables.
Ce baromètre porte sur la couverture réelle des corpus documentaires d'entreprise, entendue comme la part des documents qu'une recherche ciblée retrouve effectivement. Nous avons observé des dispositifs de veille documentaire interne, c'est-à-dire des ensembles constitués pour permettre la recherche, la réutilisation et la traçabilité de documents produits ou reçus par l'organisation, indépendamment des outils employés.
Les sections qui suivent définissent la couverture, exposent l'échantillon et la règle de comptage, restituent les taux observés type par type, analysent les causes récurrentes de perte, posent les limites de la mesure et décrivent un protocole de test que toute équipe peut appliquer à son propre corpus en une journée.
Ce que signifie couvrir un document, et pourquoi le volume ne le mesure pas
Un document est réputé couvert lorsque trois conditions sont réunies simultanément. Il est présent dans le corpus, c'est-à-dire physiquement accessible depuis l'espace de recherche. Il est atteignable, c'est-à-dire retrouvé par une requête portant sur son contenu ou sur ses métadonnées, sans connaître son emplacement. Il est qualifié, c'est-à-dire assorti d'une date fiable et d'une version identifiable permettant de savoir si l'on tient bien la pièce recherchée.
Ces trois conditions se dégradent indépendamment les unes des autres, et c'est ce qui rend le volume trompeur comme indicateur. Un fichier peut être présent et inatteignable, parce que son contenu n'a jamais été extrait. Il peut être présent et atteignable mais non qualifié, parce que rien ne distingue la version de travail de la version signée. Chacun de ces cas compte comme un document ingéré et comme un échec de recherche.
La conséquence pratique est que la couverture doit se mesurer par le résultat, jamais par le processus. Compter les espaces raccordés à un moteur renseigne sur l'effort consenti. Compter les documents témoins effectivement retrouvés renseigne sur ce que l'utilisateur obtient. Ces deux mesures divergent systématiquement, et la seconde est la seule à corréler avec la satisfaction observée des utilisateurs.
Échantillon observé, définitions retenues et règle de comptage
L'observation porte sur des corpus documentaires d'entreprise disposant d'un dispositif de recherche unifié et d'une base d'utilisateurs réguliers. Les organisations concernées relèvent des services professionnels, de l'industrie, du secteur public et de la santé, avec des corpus allant de quelques centaines de milliers à plusieurs dizaines de millions de pièces. Les entrepôts de fichiers sans recherche transverse ont été écartés : la notion de couverture y est indéterminable.
L'unité comptée est le document au sens de la pièce logique, non le fichier. Un rapport livré en trois fichiers annexes compte pour un document si les annexes ne sont pas recherchées séparément. Un fil de messagerie compte pour un document par message porteur de contenu propre. Cette convention rapproche la mesure de l'usage réel, où l'utilisateur cherche une information, pas un objet du système de fichiers.
Le taux de couverture s'établit par test de rappel sur documents témoins. Nous constituons un jeu de pièces dont l'existence et le contenu sont connus, réparties par type, puis nous tentons de les retrouver par requête sans connaître leur emplacement. Une pièce retrouvée au-delà de la deuxième page de résultats est comptée comme non retrouvée, parce que les journaux d'usage montrent que les utilisateurs n'y vont pas.
Les taux de couverture observés, type de document par type de document
La couverture ne se dégrade pas uniformément. Elle suit la nature du contenu et son mode d'arrivée dans le corpus, pas son importance métier. Les documents nativement textuels et déposés dans un espace structuré atteignent des taux élevés. Les documents images, les pièces jointes et tout ce qui transite par des canaux personnels s'effondrent, et ce sont souvent les pièces les plus recherchées en situation d'urgence.
| Type de document | Part observée du volume | Taux de couverture observé | Cause principale de perte |
|---|---|---|---|
| Documents bureautiques nativement textuels | 30 à 45 pour cent | élevé | duplication de versions non distinguées |
| Documents contractuels signés | 5 à 10 pour cent | moyen à élevé | signature en image, contenu non extrait |
| Présentations et supports visuels | 10 à 20 pour cent | moyen | texte enfermé dans des objets graphiques |
| Documents numérisés et images | 10 à 20 pour cent | faible | absence de reconnaissance de caractères |
| Pièces jointes de messagerie | 10 à 25 pour cent | faible | stockage hors des espaces indexés |
| Tableurs et fichiers de calcul | 5 à 15 pour cent | faible à moyen | contenu réparti sur des onglets non extraits |
| Documents reçus de tiers | 5 à 15 pour cent | faible | dépôt dans des espaces personnels |
La ligne des documents numérisés est la plus révélatrice. Elle représente une part substantielle du volume dans presque tous les corpus observés, elle contient fréquemment des pièces à valeur probatoire, et son taux de couverture reste le plus bas de l'ensemble. La cause est technique et connue : sans reconnaissance de caractères appliquée à l'ingestion, un document scanné n'existe pour le moteur que par son nom de fichier.
La ligne des pièces jointes est plus insidieuse, car elle ne correspond à aucune défaillance technique. Ces documents sont hors du corpus par construction, puisque la messagerie n'est pas raccordée à l'espace de recherche pour des raisons de confidentialité parfaitement légitimes. Le problème n'est pas leur absence, il est que personne ne l'a formulée : les utilisateurs cherchent en supposant une exhaustivité que le dispositif n'a jamais prétendu offrir.
Les trois mécanismes qui produisent la perte de couverture
Le premier mécanisme est l'extraction incomplète. Le fichier entre dans le corpus, mais son contenu textuel n'en est pas tiré, ou ne l'est que partiellement. Cela concerne les images, les objets graphiques des présentations, les onglets secondaires des tableurs et les pièces jointes imbriquées. Le symptôme est caractéristique : le document apparaît quand on cherche son titre et disparaît quand on cherche une phrase qu'il contient.
Le deuxième mécanisme est le périmètre non raccordé. Certains espaces de stockage ne sont pas dans le corpus, par décision explicite ou par oubli lors des migrations successives. Les espaces personnels, les partages de projet créés en dehors du référentiel et les archives de systèmes remplacés forment la part la plus difficile à évaluer, précisément parce qu'ils ne figurent nulle part dans les inventaires.
L'utilisateur ne distingue jamais un document absent du corpus d'un document mal indexé : les deux se présentent à lui comme une recherche infructueuse, et les deux entament également sa confiance.
Le troisième mécanisme est l'absence de qualification. Le document est présent et atteignable, mais rien ne permet de trancher entre plusieurs versions ni d'établir une date de référence. L'utilisateur retrouve six fichiers proches et ne sait pas lequel fait foi, ce qui produit exactement le même effet qu'un échec de recherche : il retourne demander la pièce à son auteur, si celui-ci est encore dans l'organisation.
Ce qui améliore réellement la couverture d'un corpus documentaire
Le levier au meilleur rendement est l'extraction, parce qu'il agit sur un volume déjà présent et déjà autorisé. Appliquer une reconnaissance de caractères à l'ensemble des documents images d'un corpus existant fait basculer la famille la plus mal couverte vers un taux comparable aux documents natifs, sans aucune décision d'ouverture de périmètre et sans dépendre de la discipline des utilisateurs.
Le deuxième levier consiste à distinguer, dans la restitution des résultats, la version faisant foi des versions de travail. Cette distinction se construit sur des métadonnées simples, statut, date d'approbation, auteur validant, et elle transforme un résultat ambigu en réponse exploitable. Elle relève d'une décision d'organisation documentaire, pas d'un choix d'outil.
Le troisième levier concerne l'articulation entre corpus interne et information externe, qui répond à une logique de collecte distincte. NewsCore (www.newscore.fr) couvre en continu des millions de sources, rattache chaque élément à sa source d'origine et conserve la traçabilité vers la publication initiale, ce qui donne au corpus externe la propriété de qualification qui manque le plus souvent au corpus interne.
Limites de la mesure et protocole de test sur documents témoins
Deux limites encadrent ces observations. Le taux de couverture dépend fortement de la façon dont le jeu de documents témoins est constitué : un échantillon tiré des documents récemment consultés surestime la couverture, puisqu'il sélectionne de fait des pièces déjà retrouvables. Par ailleurs, les parts de volume indiquées varient beaucoup selon le secteur, notamment pour les documents numérisés, très présents dans les organisations à forte activité contractuelle ou réglementaire.
Le protocole de test tient en une journée. Constituer vingt documents témoins, répartis sur les sept types du tableau, en les choisissant hors des consultations récentes. Formuler pour chacun une requête portant sur son contenu, telle qu'un utilisateur non informé la poserait. Noter le rang d'apparition, ou l'échec au-delà de la deuxième page. Classer chaque échec selon les trois mécanismes de perte identifiés plus haut.
Le résultat utile n'est pas le taux global, qui varie trop selon l'échantillon pour se comparer d'une organisation à l'autre. Ce sont la répartition des échecs entre les trois mécanismes, qui désigne le chantier prioritaire, et l'évolution de cette répartition d'un test à l'autre, qui mesure l'effet réel des travaux engagés sur le dispositif.
Questions fréquentes
Comment mesurer la couverture d'un corpus documentaire d'entreprise ?
Par un test de rappel sur documents témoins, jamais par le volume ingéré. Le principe consiste à sélectionner des pièces dont l'existence et le contenu sont connus, à les répartir par type de document, puis à tenter de les retrouver par une requête de contenu sans connaître leur emplacement. Le taux de pièces retrouvées dans les deux premières pages de résultats constitue la mesure. Répété à l'identique, ce test devient un indicateur de progression fiable.
Pourquoi certains documents restent introuvables malgré un moteur de recherche ?
Trois causes se partagent l'essentiel des échecs. Le contenu n'a pas été extrait, ce qui concerne surtout les documents numérisés, les images et les objets graphiques : le fichier existe mais son texte est invisible pour le moteur. L'espace de stockage n'est pas raccordé au corpus, cas fréquent des messageries et des partages personnels. Ou plusieurs versions coexistent sans qu'aucune ne soit désignée comme faisant foi, ce qui rend le résultat inexploitable même lorsqu'il est correct.
Faut-il intégrer les pièces jointes de messagerie au corpus de veille documentaire ?
La réponse relève d'un arbitrage entre valeur documentaire et exigences de confidentialité, et elle appartient à l'organisation, pas à l'équipe de veille. Ce qui n'est pas négociable, en revanche, c'est l'explicitation de la décision. Un corpus dont le périmètre est publié, avec la mention de ce qu'il ne contient pas, produit des utilisateurs qui savent quand chercher ailleurs. Un corpus au périmètre implicite produit des utilisateurs qui concluent d'une recherche infructueuse que le document n'existe pas.