Un corpus de veille scientifique reproductible à partir de préprints : périmètre, règles d'inclusion et versionnage
Protocole pour bâtir un corpus de veille scientifique reproductible à partir de préprints : périmètre écrit, règles d'inclusion, gestion des versions, biais connus et conditions de rejeu.
À retenir
- Un préprint est un objet mouvant : il change de version, d'identifiant et parfois de conclusions, ce qui interdit de le traiter comme une référence figée.
- Les règles d'inclusion et d'exclusion s'écrivent avant la collecte, sinon le corpus enregistre les intuitions successives du veilleur plutôt qu'un périmètre.
- Le manifeste de corpus, qui consigne requêtes, entrepôts, dates et versions, est la seule pièce qui rend un résultat rejouable par un tiers.
- Les biais de langue, d'entrepôt et de discipline sont structurels : on les documente et on les borne, on ne les corrige pas après coup.
La veille technologique s'est déplacée en amont de la publication. Sur plusieurs disciplines, l'essentiel de ce qui se dit de neuf apparaît d'abord sous forme de préprint, c'est-à-dire d'un texte déposé publiquement par ses auteurs avant toute validation par les pairs. Attendre la publication revient à accepter un retard de plusieurs mois sur des sujets où ce retard coûte cher.
Cette avance a un prix méthodologique. Un préprint n'a pas franchi les filtres qui garantissent, imparfaitement mais réellement, la solidité d'un résultat publié. Il change de version, il est parfois retiré, il porte des identifiants qui évoluent, et une part significative des dépôts ne donnera jamais lieu à une publication. Un corpus qui ignore ces propriétés produit des indicateurs instables.
Cette note décrit le protocole que nous appliquons pour constituer un corpus de veille scientifique reproductible à partir de préprints. Elle traite du périmètre et de ses définitions, des règles d'inclusion écrites avant la collecte, du traitement des versions, des biais structurels que le corpus embarque et du manifeste qui permet à un tiers de rejouer la constitution à l'identique.
Ce qu'un préprint est, et ce qu'il n'est pas, dans un corpus de veille
Un préprint est un dépôt public daté, attribué à des auteurs identifiés, portant un identifiant stable au niveau de l'entrepôt et une version. Cette définition suffit pour la veille : elle ne dit rien de la qualité du travail, seulement de son statut documentaire. Confondre les deux plans est l'erreur qui rend la plupart des corpus inexploitables.
Ce qu'un préprint n'est pas, c'est une référence figée. Le même travail existe fréquemment en plusieurs versions successives, dont les résultats diffèrent, et il peut aboutir à un article publié sous un autre titre, avec une liste d'auteurs modifiée. Un corpus de veille qui traite chaque dépôt comme une entrée indépendante compte plusieurs fois le même objet et surestime l'activité d'un domaine.
Nous retenons donc une unité d'observation explicite : le travail, et non le dépôt. Un travail regroupe toutes les versions rattachées à un même identifiant d'entrepôt, plus la publication ultérieure lorsqu'elle est identifiée. Les indicateurs de volume portent sur les travaux, les indicateurs de dynamique portent sur les versions, et les deux séries sont publiées séparément.
Définir le périmètre avant de collecter : question, entrepôts et fenêtre
Le périmètre s'écrit en trois lignes avant la première requête. La première formule la question de veille dans les termes du domaine, pas dans ceux de l'entreprise : un besoin exprimé comme un enjeu commercial ne se traduit pas directement en requête documentaire, et l'étape de traduction est le principal lieu de perte de pertinence.
La deuxième ligne fixe les entrepôts interrogés et les raisons de ce choix. Les entrepôts n'ont ni les mêmes disciplines dominantes, ni les mêmes règles de dépôt, ni les mêmes formats de métadonnées. Interroger un entrepôt supplémentaire élargit le corpus mais rompt la comparabilité avec les campagnes précédentes, et cette rupture se signale au lieu de se dissimuler.
La troisième ligne fixe la fenêtre temporelle et sa nature : fenêtre glissante pour un suivi de dynamique, fenêtre fixe pour un état des lieux. Une fenêtre glissante mal documentée produit des comparaisons trompeuses d'un mois sur l'autre, parce que le dénominateur change en silence pendant que la courbe donne l'impression d'un phénomène réel.
Les règles d'inclusion et d'exclusion, écrites avant la collecte
Une règle d'inclusion est utile si elle est applicable par une personne qui ne connaît pas le sujet. Nous les formulons donc sous forme de tests binaires portant sur des éléments observables : présence d'un terme dans le titre ou le résumé, appartenance à une catégorie déclarée de l'entrepôt, langue du dépôt, existence d'une affiliation renseignée. Les critères d'appréciation subjective sont bannis à ce stade.
Les règles d'exclusion demandent plus d'attention que les règles d'inclusion, parce qu'elles décident silencieusement de ce que le corpus ne verra jamais. Exclure les dépôts sans résumé, par exemple, écarte des travaux légitimes dans certaines disciplines. Chaque exclusion est donc accompagnée d'un décompte des entrées écartées, publié avec le corpus.
| État du dépôt | Traitement dans le corpus | Indicateur affecté | Trace conservée |
|---|---|---|---|
| Version initiale seule | Inclus, marqué version unique | Volume de travaux | Identifiant et date de dépôt |
| Versions multiples | Une entrée, historique des versions | Dynamique de révision | Date de chaque version |
| Dépôt retiré par les auteurs | Conservé, marqué retiré | Aucun, sorti des volumes | Motif si publié, date de retrait |
| Publication ultérieure identifiée | Rattaché au même travail | Taux de passage en publication | Référence de la publication |
| Doublon inter-entrepôts | Fusionné sous un identifiant maître | Volume de travaux | Liste des identifiants fusionnés |
Ce tableau fixe des conventions, pas des vérités. Une autre équipe choisira légitimement de sortir du corpus les dépôts retirés plutôt que de les conserver marqués. Ce qui importe n'est pas le choix retenu mais son inscription écrite avant la collecte, et sa stabilité d'une campagne à l'autre, faute de quoi les séries publiées ne se comparent pas.
Le versionnage, ou comment suivre un objet qui change d'identité
Le suivi des versions est la partie la plus laborieuse du protocole et celle qui distingue un corpus de veille d'une simple liste de liens. Nous relevons pour chaque travail la date de première version, la date de dernière version connue et le nombre de versions, ce dernier étant relevé à date et non recalculé rétrospectivement.
La difficulté réelle apparaît quand une révision modifie les conclusions. Un signal détecté sur une première version et repris dans une note interne devient faux si la version suivante corrige le résultat. Nous rattachons donc chaque note interne à la version précise qui l'a déclenchée, et une alerte de révision est émise vers les destinataires de la note initiale.
Détecter ces révisions suppose de surveiller en continu des dépôts dispersés sur plusieurs entrepôts et plusieurs langues, ce qu'une consultation manuelle périodique ne couvre pas. NewsCore (www.newscore.fr) couvre en continu des millions de sources multilingues, fait remonter les publications nouvelles dès leur parution et relie chaque signal à sa référence d'origine, ce qui raccourcit le délai entre une révision et sa prise en compte.
Un corpus de préprints ne se juge pas au nombre d'entrées qu'il contient, mais à la capacité d'un tiers à reconstituer, requête par requête et version par version, comment ces entrées y sont arrivées.
Biais structurels du corpus : langue, entrepôt, discipline et notoriété
Le premier biais est linguistique. Les entrepôts internationaux sont massivement anglophones, et une veille conduite en anglais seul ignore des travaux déposés dans des entrepôts nationaux. Nous documentons systématiquement la répartition linguistique du corpus, non pour la corriger, ce qui n'aurait pas de sens, mais pour borner les conclusions tirées d'une comparaison entre zones géographiques.
Le deuxième biais tient aux entrepôts eux-mêmes. Leurs pratiques de dépôt diffèrent selon les disciplines : là où déposer avant publication est une norme installée, le corpus reflète correctement l'activité ; ailleurs, il ne capte qu'une fraction non aléatoire des travaux. Comparer deux disciplines sur un même corpus de préprints suppose donc de connaître ces différences de culture de dépôt.
Le troisième biais est celui de la notoriété. Les travaux issus d'équipes visibles sont repris, commentés et retrouvés plus facilement, ce qui les surreprésente dans toute collecte fondée en partie sur des signaux de reprise. Nous séparons donc strictement la collecte, fondée sur les entrepôts, de la priorisation, fondée sur la reprise, et nous ne mélangeons jamais les deux dans un même indicateur.
Rendre le corpus reproductible : manifeste, archivage et rejeu à distance
Le manifeste de corpus est la pièce centrale du dispositif. Il consigne la question de veille, la liste des entrepôts, les requêtes dans leur formulation exacte, la fenêtre temporelle, les règles d'inclusion et d'exclusion, la date d'exécution de la collecte et le décompte des entrées écartées par chaque règle. Il tient sur une page et se publie avec les résultats.
L'archivage porte sur les métadonnées, pas nécessairement sur les documents. Nous conservons pour chaque entrée l'identifiant d'entrepôt, la version relevée, le titre, la date de dépôt, l'adresse consultée et la date de consultation. Ce jeu minimal suffit à reconstituer le corpus même si un dépôt est retiré, à condition d'avoir été enregistré au moment du relevé.
Le rejeu se conduit à distance, par une personne extérieure à la collecte initiale, qui applique le manifeste sans autre indication. Nous considérons le corpus comme reproductible lorsque l'écart entre les deux collectes reste marginal et intégralement explicable par les dépôts intervenus entre les deux dates. Tout autre écart signale une requête ambiguë ou une règle sous-spécifiée.
Questions fréquentes
Peut-on fonder une veille technologique sur des préprints non validés par les pairs ?
Oui, à condition de séparer nettement le signal de la conclusion. Un préprint indique qu'une équipe travaille sur un sujet, avec une approche donnée, à une date donnée : cette information est solide et exploitable pour anticiper. Le résultat annoncé, lui, reste provisoire. Les notes internes issues d'un préprint mentionnent donc explicitement son statut et la version examinée.
Comment éviter de compter plusieurs fois le même travail dans un corpus de préprints ?
En prenant le travail comme unité d'observation plutôt que le dépôt. Toutes les versions rattachées à un même identifiant d'entrepôt forment une seule entrée, les doublons entre entrepôts sont fusionnés sous un identifiant maître avec la liste des identifiants absorbés, et la publication ultérieure est rattachée au même travail. Les indicateurs de volume et de dynamique se calculent alors sur deux séries distinctes.
Que faire quand une nouvelle version d'un préprint contredit une note déjà diffusée ?
Il faut avoir prévu le cas avant qu'il ne survienne. Chaque note interne est rattachée à la version précise qui l'a déclenchée, et la liste des destinataires est conservée. Lorsqu'une révision modifie les conclusions, une alerte est envoyée à cette liste, avec la version d'origine, la nouvelle version et la nature de l'écart. Une note non rattachée à une version ne peut pas être corrigée proprement.
À quelle fréquence faut-il rejouer la collecte d'un corpus de veille scientifique ?
La fréquence dépend de la vitesse de dépôt du domaine, mais la règle utile porte ailleurs : une collecte se rejoue intégralement à chaque fois que le manifeste change, entrepôt ajouté, requête reformulée ou règle d'exclusion modifiée. Sans ce rejeu complet, la série publiée mélange deux périmètres, et la rupture apparaît comme une évolution du domaine alors qu'elle vient de la méthode.