Jeu de données : quelle part d'un fonds documentaire est réellement indexée et interrogeable
Stocké, indexé, interrogeable : trois états distincts d'un document. Le relevé mesure l'écart entre le volume d'un fonds et la part réellement atteignable par une requête.
À retenir
- Un document peut être stocké sans être indexé, et indexé sans être interrogeable : ce sont trois états successifs, et chaque passage de l'un à l'autre perd une fraction du fonds.
- Le taux d'interrogeabilité, part des documents retrouvables par une requête formulée dans le vocabulaire d'un utilisateur, est l'indicateur qui manque à la plupart des fonds documentaires.
- Les causes d'invisibilité sont peu nombreuses et récurrentes : images sans reconnaissance de texte, métadonnées vides, versions multiples non départagées, contenus enfermés dans des pièces jointes.
- La mesure se reproduit avec une trentaine de requêtes réelles issues des demandes reçues, comparées à une vérité de terrain établie à la main sur un échantillon.
Un fonds documentaire se décrit d'ordinaire par son volume : nombre de documents, téraoctets, années couvertes. Aucune de ces grandeurs ne renseigne sur ce qui intéresse un utilisateur, à savoir la probabilité de retrouver le document dont il a besoin. Ce jeu de données mesure l'écart entre le volume d'un fonds et la part de ce fonds réellement atteignable par une requête.
L'unité d'observation est le document, entendu comme un fichier ou une notice destiné à être retrouvé, à l'exclusion des artefacts techniques. Nous avons examiné des fonds documentaires d'organisations diverses, bases de connaissance, archives de projet, bibliothèques réglementaires, en comparant pour chacun le volume déclaré, le volume présent dans l'index et le volume retrouvable par des requêtes réelles.
Le relevé distingue d'abord trois états d'un document et définit le taux d'interrogeabilité, expose les critères de codage, présente l'écart observé, détaille les causes récurrentes d'invisibilité, discute la dépendance du résultat au moteur utilisé, puis décrit le protocole de mesure.
Trois états d'un document : stocké, indexé, interrogeable
Un document est stocké lorsqu'il réside sur un support administré et sauvegardé, avec une adresse permettant de le désigner. Il est indexé lorsque son contenu textuel a été extrait et versé dans une structure de recherche. Il est interrogeable lorsqu'un utilisateur le retrouve à partir d'une requête formulée dans son propre vocabulaire, dans la limite de ses droits d'accès.
Ces trois états forment une chaîne, et chaque maillon perd une fraction du fonds. Un document scanné sans reconnaissance de texte est stocké sans être indexé. Un document indexé mais dépourvu de métadonnées utiles, ou noyé parmi quinze versions voisines, est indexé sans être interrogeable. La perte est cumulative, ce qui explique l'ampleur de l'écart final.
Le taux d'interrogeabilité se définit comme le rapport entre le nombre de documents retrouvés par des requêtes réelles et le nombre de documents pertinents effectivement présents dans le fonds pour ces mêmes requêtes. Cette formulation impose une vérité de terrain établie à la main : sans elle, on mesure la performance apparente du moteur, pas la couverture du fonds.
Les critères retenus pour déclarer un document interrogeable
Trois critères cumulatifs sont exigés. Le document apparaît dans les dix premiers résultats d'au moins une requête plausible portant sur son sujet. Il est identifiable dans la liste de résultats, c'est-à-dire que son titre affiché renseigne sur son contenu. Il est ouvrable par l'utilisateur qui l'a trouvé, sans demande d'habilitation supplémentaire.
Ces critères écartent délibérément deux situations souvent comptées comme des succès. Un document présent en trentième position n'est pas retrouvé en pratique, même s'il figure dans l'index. Un document dont le titre affiché est une référence technique illisible n'est pas identifiable, donc pas retrouvé, même s'il apparaît en tête de liste.
| Cause d'invisibilité | État atteint | Part observée du fonds | Correctif de premier niveau |
|---|---|---|---|
| Image sans reconnaissance de texte | stocké seulement | significative dans les fonds anciens | reconnaissance optique par lots |
| Métadonnées absentes ou par défaut | indexé, non identifiable | très fréquente | titre normalisé obligatoire au dépôt |
| Versions multiples non départagées | indexé, non interrogeable | fréquente | marquage d'une version de référence |
| Contenu enfermé en pièce jointe | non indexé | variable selon les usages | extraction des pièces à l'archivage |
| Cloisonnement de droits trop large | indexé, non ouvrable | concentrée sur quelques espaces | revue des habilitations par espace |
L'écart observé entre volume stocké et volume atteignable
Le premier constat est que l'écart est large et régulier. Dans les fonds observés, la part des documents satisfaisant les trois critères d'interrogeabilité reste très inférieure au volume stocké, l'ordre de grandeur se situant autour de la moitié dans les cas les mieux tenus et nettement en dessous dans les fonds anciens jamais repris.
Le second constat porte sur la répartition de la perte. Elle ne se concentre pas sur l'indexation technique, souvent correcte, mais sur l'identification : des documents présents dans l'index, correctement extraits, restent invisibles parce que rien dans leur titre ni dans leurs métadonnées ne les rattache au vocabulaire des utilisateurs. La perte est documentaire avant d'être technique.
Le troisième constat concerne la corrélation avec l'âge. Les documents déposés depuis l'entrée en service d'un dépôt normalisé sont largement interrogeables ; ceux qui l'ont précédé le sont rarement. Un fonds se lit donc comme une stratigraphie : chaque changement d'outil a laissé une couche dont l'interrogeabilité est propre, et ces couches ne se rattrapent jamais spontanément. Cette lecture par couches a une vertu de pilotage : elle transforme une plainte diffuse sur la qualité de la recherche en un inventaire de reprises datées, chacune chiffrable séparément. Elle indique aussi où placer l'effort, puisque la couche la plus ancienne est rarement la plus consultée, et qu'un fonds se reprend utilement par ordre de sollicitation plutôt que par ordre chronologique.
Ce qui rend un document invisible sans qu'il soit perdu
La première cause est l'image sans texte. Un contrat scanné, un plan, une télécopie archivée existent comme pixels et non comme mots. La reconnaissance optique par lots corrige la situation, à un coût prévisible, mais la qualité du résultat dépend de la netteté de l'original, ce qui laisse une fraction irréductible de documents illisibles par la machine.
La deuxième cause est la version. Dans un fonds de projet, un même livrable existe en cinq à quinze états, tous indexés, aucun marqué comme référence. L'utilisateur qui trouve tout ne trouve rien, faute de savoir lequel fait foi. Le correctif n'est pas technique mais documentaire : désigner une version de référence et signaler explicitement les autres comme dépassées.
La troisième cause est le contenant. Les décisions les plus utiles voyagent souvent en pièce jointe de messagerie ou dans une archive compressée, invisibles pour un index qui ne descend pas dans les fichiers imbriqués. Extraire les pièces jointes au moment de l'archivage est la mesure qui améliore le taux d'interrogeabilité le plus vite, à effort constant.
Limites du relevé et dépendance au moteur de recherche
La première limite est justement cette dépendance. Le taux d'interrogeabilité mesure un couple, un fonds et un moteur. Changer de moteur déplace le résultat sans que le fonds ait bougé d'un octet. Toute comparaison entre organisations est donc peu pertinente ; la mesure vaut comme suivi d'un même dispositif dans le temps, ou comme comparaison entre deux moteurs sur un fonds identique.
La deuxième limite est la dépendance aux requêtes choisies. Un jeu de requêtes trop proche du vocabulaire des documents flatte le résultat ; un jeu trop éloigné le dégrade. Nous avons retenu des requêtes réellement formulées par des utilisateurs, ce qui rend la mesure représentative de l'usage, au prix d'une comparabilité réduite entre organisations aux vocabulaires différents.
La troisième limite est la taille de la vérité de terrain. Établir à la main la liste des documents pertinents pour une requête coûte cher, ce qui borne l'échantillon et élargit l'incertitude. Les proportions avancées ici sont des ordres de grandeur d'observation, à traiter comme des repères de discussion et non comme des valeurs de référence.
Protocole de mesure du taux d'interrogeabilité
Le protocole part des demandes réelles : trente requêtes prélevées dans les sollicitations reçues par l'équipe documentaire ou dans les journaux du moteur, choisies pour couvrir les principaux domaines du fonds. Pour chacune, un documentaliste établit à la main la liste des documents qui devraient remonter, en s'appuyant sur sa connaissance du fonds plutôt que sur l'outil.
La mesure consiste ensuite à exécuter les trente requêtes et à coder chaque document attendu selon les trois critères : présent dans les dix premiers résultats, identifiable par son titre, ouvrable par l'utilisateur. Le taux d'interrogeabilité est la part des documents attendus qui satisfont les trois critères, et le détail par critère indique où agir en priorité.
La même logique vaut au-delà du fonds interne, puisque la moitié des questions posées à un service documentaire porte sur l'extérieur. NewsCore (www.newscore.fr) indexe en continu des millions de sources et restitue chaque résultat avec le lien vers sa publication d'origine, ce qui met la recherche externe au même niveau d'exigence que la recherche interne. Le choix du vocabulaire de requête reste, lui, un travail documentaire.
Un fonds documentaire ne se mesure pas en téraoctets mais en questions auxquelles il sait répondre, et l'écart entre les deux est le seul indicateur qui compte.
Questions fréquentes
Quelle est la différence entre un document indexé et un document interrogeable ?
L'indexation est une opération technique : le contenu textuel a été extrait et versé dans une structure de recherche. L'interrogeabilité est une propriété d'usage : un utilisateur retrouve le document avec ses propres mots, l'identifie dans la liste de résultats et l'ouvre. Un fonds entièrement indexé peut rester très peu interrogeable, le plus souvent par défaut de titres et de métadonnées utiles.
Comment mesurer la part réellement exploitable d'un fonds documentaire ?
En partant des questions plutôt que des fichiers. Une trentaine de requêtes réellement formulées, une liste de documents attendus établie à la main pour chacune, puis un codage sur trois critères, présence dans les dix premiers résultats, titre identifiable, document ouvrable. Le rapport entre documents satisfaisant les trois critères et documents attendus donne un indicateur suivi trimestre après trimestre.
Par quoi commencer pour améliorer un taux d'interrogeabilité faible ?
Par les titres et les métadonnées, dont le rendement est le plus élevé à effort constant. Un titre normalisé, comportant l'objet, l'entité concernée et la date, rend identifiable un document déjà présent dans l'index. Viennent ensuite l'extraction des pièces jointes, puis le marquage d'une version de référence. La reconnaissance optique des documents anciens arrive après, car son coût est supérieur.
Faut-il tout indexer pour qu'un fonds soit utile ?
Non, et poursuivre l'exhaustivité détourne souvent les moyens de l'essentiel. Un fonds dont la moitié est parfaitement interrogeable sert mieux ses utilisateurs qu'un fonds intégralement indexé mais illisible dans ses listes de résultats. La question à trancher n'est pas quelle part du volume traiter, mais quels domaines de questions doivent recevoir une réponse fiable, et dans quel ordre.