Baromètre de la veille scientifique : quelle part les préprints occupent dans un corpus de veille technologique
Quelle place les préprints prennent-ils réellement dans un corpus de veille technologique, selon le domaine suivi ? Définitions, protocole de comptage, écarts observés et limites.
À retenir
- La part des préprints dans un corpus de veille technologique varie fortement selon le domaine : elle domine là où le cycle de publication est rapide et reste marginale là où la validation réglementaire commande le calendrier.
- Le préprint achète de l'antériorité et coûte de la solidité : l'arbitrage se documente par une règle écrite, pas au cas par cas selon l'appétence de l'analyste.
- Le taux de convergence entre un préprint et sa version finalement publiée est l'indicateur qui décide si le domaine se prête à une veille sur préprints.
- Les ordres de grandeur publiés décrivent l'échantillon défini dans l'article et se reproduisent avec le même protocole de comptage et de déduplication.
La veille technologique a longtemps été calée sur le rythme des revues à comité de lecture. Ce rythme n'est plus le seul, et sur plusieurs domaines il n'est même plus le principal. Les serveurs de préprints diffusent des travaux avant toute évaluation par les pairs, avec une avance qui se compte en mois et parfois davantage.
La question posée à une cellule de veille est donc concrète : quelle part de son corpus provient de ces dépôts non validés, quelle confiance accorder à cette part, et selon quelle règle. Ce baromètre documente le premier point, propose une mesure du second et rend le protocole reproductible sur un autre périmètre.
Les proportions présentées sont des ordres de grandeur d'observation, arrondis, établis sur les corpus de veille scientifique que nous suivons. Elles ne décrivent pas la production scientifique mondiale mais la composition d'un corpus de veille, ce qui est une grandeur différente et dépendante du périmètre de requêtes retenu.
Définitions retenues : préprint, article évalué, littérature grise
Nous appelons préprint un manuscrit déposé sur un serveur public, doté d'un identifiant stable et d'une date de dépôt, et n'ayant pas fait l'objet d'une évaluation par les pairs au moment du relevé. Le critère décisif est l'absence d'évaluation, pas le support : un dépôt institutionnel accueillant des versions déjà acceptées ne relève pas de cette catégorie.
Nous appelons article évalué un texte publié dans une revue ou des actes appliquant une procédure d'évaluation documentée. Nous rangeons dans la littérature grise les rapports techniques, notes de laboratoire, livres blancs industriels et communications de conférence sans actes, qui obéissent à des logiques éditoriales hétérogènes et ne se comparent pas entre eux.
Ces trois catégories se recoupent dans le temps : un même travail existe successivement comme préprint puis comme article évalué, souvent sous un titre modifié. Sans déduplication explicite, le même résultat est compté deux fois et la part des préprints devient un artefact de comptage plutôt qu'une observation.
Protocole de constitution de l'échantillon et règle de déduplication
L'échantillon repose sur des corpus de veille technologique suivis pendant une fenêtre glissante de douze mois, chacun défini par un jeu de requêtes stable sur un domaine unique. Le jeu de requêtes n'est pas modifié pendant la fenêtre : toute reformulation, même mineure, casse la comparabilité des relevés successifs.
La déduplication s'appuie sur trois signaux combinés : identifiants croisés lorsqu'ils existent, correspondance des auteurs sur la liste complète, et proximité des résumés. Lorsque le rattachement est établi, nous conservons les deux versions dans le corpus mais nous ne comptons qu'un seul travail, en retenant la date du dépôt initial comme date de première parution.
Chaque entrée porte un statut de validation, une date de dépôt, une date de publication évaluée quand elle existe, et un domaine unique. Les entrées dont le statut de validation ne se détermine pas restent dans le corpus mais sortent du calcul de part, avec leur volume déclaré séparément pour que le lecteur juge de l'incertitude.
La part des préprints selon le domaine technologique suivi
La hiérarchie observée est nette et stable. Les domaines à cycle rapide, où la diffusion précoce fait partie des usages de la communauté, voient le préprint occuper la place dominante du corpus de veille. À l'opposé, les domaines soumis à validation réglementaire ou à secret industriel produisent des corpus où le préprint reste marginal.
| Type de domaine | Part des préprints dans le corpus | Avance typique sur la version évaluée | Usage recommandé |
|---|---|---|---|
| Informatique et apprentissage automatique | dominante | plusieurs mois | détection précoce assumée |
| Physique et mathématiques appliquées | élevée | plusieurs mois | détection avec relecture |
| Sciences de la vie hors clinique | moyenne | variable | signalement sous réserve |
| Domaines à validation réglementaire | faible | faible ou nulle | confirmation uniquement |
Ce classement a une conséquence directe sur le dimensionnement. Une cellule qui suit un domaine à cycle rapide et ignore les préprints travaille avec plusieurs mois de retard structurel sur sa propre communauté de référence. À l'inverse, une cellule qui suit un domaine réglementé et surpondère les préprints alourdit son corpus sans gagner d'antériorité.
Une précaution de lecture s'impose sur ce tableau. La part mesurée décrit la composition d'un corpus de veille, c'est-à-dire le produit d'un jeu de requêtes appliqué à un ensemble de sources, et non la structure de la production scientifique du domaine. Deux cellules travaillant sur le même sujet avec des requêtes différentes obtiennent des parts différentes, sans qu'aucune ne soit fausse. C'est la raison pour laquelle nous publions le jeu de requêtes en même temps que la proportion, et pourquoi nous déconseillons toute comparaison entre corpus dont les requêtes ne sont pas connues.
Antériorité contre solidité : formaliser l'arbitrage plutôt que l'improviser
Le préprint apporte une avance réelle et une incertitude réelle. L'erreur habituelle consiste à trancher au cas par cas, selon la sensibilité de l'analyste ou l'attente du commanditaire. Cette pratique produit des livrables incohérents entre eux et rend impossible toute évaluation rétrospective de la qualité des signalements.
Nous recommandons une règle écrite à trois niveaux. Un préprint isolé donne lieu à un signalement explicitement étiqueté comme non validé. Un préprint confirmé par une seconde équipe indépendante passe au niveau de signal qualifié. Un travail évalué, ou reproduit expérimentalement, alimente une recommandation. Les trois niveaux se lisent dans le livrable sans ambiguïté.
La règle gagne à être complétée par une date de réexamen. Un signalement de niveau un porte une échéance à laquelle la cellule vérifie si le préprint a été publié, retiré, ou laissé sans suite, et met à jour son statut dans le livrable suivant. Sans ce rendez-vous inscrit dans le processus, les signalements non validés s'accumulent et finissent par être cités comme s'ils avaient été confirmés, ce qui annule le bénéfice de la gradation.
Cette gradation protège la cellule autant que le destinataire. Elle rend visible la part de risque assumée, elle autorise une décision précoce quand le contexte l'exige, et elle permet d'expliquer sans embarras qu'un signalement de niveau un n'a pas été confirmé, puisque son statut était déclaré dès l'origine.
Taux de convergence entre préprint et version publiée, et limites du protocole
L'indicateur qui décide vraiment de l'intérêt d'une veille sur préprints est le taux de convergence : la proportion de préprints dont les conclusions principales restent inchangées dans la version évaluée. Ce taux se mesure rétrospectivement, en reprenant les dépôts d'une fenêtre ancienne et en comparant leurs conclusions à celles de la version finale.
La mesure impose deux précautions. Les préprints jamais publiés doivent être comptés à part, car leur absence de publication n'est pas nécessairement un désaveu : abandon de projet, changement d'équipe et dépôt de brevet concurrent produisent le même résultat observable. Les modifications de titre, ensuite, cassent les rapprochements automatiques et exigent une relecture.
Restent trois limites structurelles. La couverture linguistique du corpus laisse hors champ des travaux diffusés uniquement en langue locale. Les serveurs de préprints appliquent des filtres d'admission hétérogènes. Enfin, la date de dépôt visible n'est pas toujours celle de la première version, ce qui suppose de retenir la version initiale quand l'historique est accessible. Pour élargir la couverture au-delà de la littérature académique, NewsCore (www.newscore.fr) surveille en continu des millions de sources en plusieurs dizaines de langues, trie les remontées par pertinence et renvoie vers le document d'origine.
La question n'est pas de savoir si un préprint est fiable, mais de déclarer dans le livrable le niveau de validation atteint, afin que le destinataire décide en connaissance de cause.
Questions fréquentes
Faut-il intégrer les préprints dans une veille technologique d'entreprise ?
Cela dépend du domaine, et la réponse se décide sur une mesure plutôt que sur un principe. Si le domaine suivi présente une part de préprints élevée et une avance de plusieurs mois sur la version évaluée, les ignorer revient à travailler en retard permanent. Si le domaine est soumis à validation réglementaire, le préprint apporte peu d'antériorité et son intégration alourdit le corpus.
Comment citer un préprint dans un livrable de veille sans engager la crédibilité de la cellule ?
En déclarant son statut dans la mention elle-même, avec la date de dépôt, le serveur, et l'indication que le travail n'a pas été évalué par les pairs au moment de la rédaction. Le lecteur situe ainsi le niveau de preuve. Un signalement transparent qui ne se confirme pas coûte bien moins cher qu'une recommandation présentée comme établie et démentie ensuite.
Quelle avance un préprint donne-t-il réellement sur la publication évaluée ?
L'avance se compte en mois dans les domaines à cycle rapide, avec une dispersion importante selon la revue visée et selon le nombre de cycles d'évaluation. Elle se réduit fortement dans les domaines où le dépôt intervient au moment de la soumission finale. Chaque cellule gagne à mesurer cette avance sur son propre domaine plutôt qu'à reprendre une valeur générale.
Comment éviter de compter deux fois un même travail scientifique ?
En appliquant une règle de déduplication écrite et stable : croisement des identifiants, correspondance de la liste complète des auteurs, proximité des résumés, puis relecture des cas où le titre a changé. Le travail dédupliqué conserve la date du dépôt initial comme date de première parution, ce qui préserve la mesure d'antériorité tout en évitant le double comptage.