mercredi 7 octobre 2026
Notes de méthode

Note de méthode : constituer un corpus de veille scientifique reproductible

Comment constituer un corpus de veille scientifique qu'une autre équipe peut reconstituer à l'identique ? Gisements, identifiants pérennes, calendrier de la recherche et limites.

L'Observatoire6 septembre 20268 min de lecture

À retenir

  • Un corpus est reproductible quand une équipe extérieure, avec le protocole seul, obtient le même ensemble de références à la même date d'arrêt.
  • La couche des identifiants pérennes, DOI, ORCID et ROR, fait toute la différence : sans elle, le dédoublonnage repose sur les titres et échoue silencieusement.
  • Les gisements du champ scientifique sont hétérogènes en droits et en fraîcheur : préprints, bases bibliographiques, registres d'essais, brevets, financements et rétractations.
  • Le calendrier de la filière, appels à projets, embargos, conférences et cycles d'évaluation, détermine quand un signal apparaît et où il apparaît en premier.

Une veille scientifique se juge rarement sur ses conclusions et presque toujours sur son corpus. Deux équipes qui suivent le même domaine avec des ensembles de références différents produisent des analyses incomparables, sans que personne ne sache dire où se situe l'écart. Le corpus est donc le premier livrable, avant toute synthèse, et le seul dont la qualité se vérifie de l'extérieur.

La reproductibilité, dans ce contexte, a une définition étroite et exigeante : une équipe qui ne dispose que du protocole écrit doit obtenir le même ensemble de références, à la même date d'arrêt, à la marge près des sources dont l'accès a changé. Ce critère est plus dur qu'il n'y paraît, car la plupart des corpus reposent sur des choix implicites faits au fil de l'eau et jamais consignés.

Cette note décrit le protocole que nous appliquons dans le champ de la recherche : ce qui se définit avant de collecter, quels gisements existent réellement dans ce secteur, quelle couche technique rend le dédoublonnage fiable, quel calendrier commande l'apparition des signaux, et ce qu'un corpus de ce type ne mesure pas.

Définir le corpus avant de collecter : objet, périmètre, fenêtre, arrêt

Quatre éléments s'écrivent avant la première requête. L'objet d'abord, formulé comme une question de décision et non comme un mot-clé : suivre une technologie, une équipe, un financeur ou une controverse ne conduit pas aux mêmes sources. Le périmètre ensuite, qui énumère les types de documents retenus et surtout ceux qui sont exclus, les préprints étant le cas le plus discuté.

La fenêtre temporelle vient en troisième, avec une précision décisive : elle porte sur la date de dépôt ou sur la date de publication, jamais sur les deux indistinctement. Un même travail existe comme préprint, comme communication de conférence puis comme article de revue, à des dates parfois séparées de deux ans. Choisir la mauvaise date déplace la moitié d'un corpus d'une année sur l'autre.

La date d'arrêt enfin, qui fige l'état de la collecte. Un corpus scientifique n'est jamais stable : des articles sont ajoutés rétrospectivement dans les bases, d'autres sont corrigés, quelques-uns sont rétractés. Sans date d'arrêt écrite, deux extractions faites à quinze jours d'intervalle diffèrent, et l'on attribue à une évolution du domaine ce qui n'est qu'un effet d'indexation.

Les gisements réellement disponibles dans le champ scientifique

Les serveurs de préprints donnent l'accès le plus précoce : arXiv pour la physique, les mathématiques et l'informatique, bioRxiv et medRxiv pour les sciences de la vie, HAL pour la production française toutes disciplines confondues, SSRN pour les sciences sociales. Leur avantage est le délai, souvent plusieurs mois avant la revue. Leur contrepartie est l'absence d'évaluation par les pairs au moment du dépôt, qui doit rester visible dans la fiche.

Les bases bibliographiques constituent la deuxième couche. Certaines sont ouvertes et interrogeables sans licence, comme Crossref, OpenAlex ou PubMed dans le domaine biomédical ; d'autres sont sous abonnement, comme Scopus ou Web of Science, avec des périmètres de revues différents. Le choix entre elles n'est pas neutre : deux bases ne couvrent pas les mêmes éditeurs ni les mêmes langues, et un corpus construit sur l'une n'est pas comparable à un corpus construit sur l'autre.

Viennent ensuite les gisements non bibliographiques, souvent les plus informatifs pour une veille d'intelligence économique. Les registres d'essais cliniques annoncent des travaux avant toute publication. Les bases de brevets, consultables via Espacenet ou les offices nationaux, révèlent des orientations industrielles que les articles ne mentionnent pas. Les bases de financement, appels de l'Agence nationale de la recherche, programmes européens, subventions publiées par les agences, indiquent qui travaillera sur quoi dans les deux à cinq ans.

Une dernière catégorie mérite une place explicite : les signalements d'intégrité. Les avis de rétractation, les corrections d'erratum et les bases spécialisées qui les recensent qualifient la fiabilité d'une référence après sa publication. Un corpus qui ne les intègre pas continue de compter comme acquis des résultats retirés, ce que nous observons régulièrement dans les revues de littérature internes.

GisementCe qu'il apporte en premierPrécaution de méthode
Serveurs de préprintsLe délai le plus court avant diffusionMarquer l'absence d'évaluation par les pairs
Bases bibliographiquesLa couverture et les métadonnées structuréesDocumenter la base retenue, les périmètres diffèrent
Registres d'essais et brevetsL'intention avant le résultat publiéVocabulaire distinct de celui des articles
Bases de financementL'orientation des travaux à venirDécalage de plusieurs années avec la publication
Avis de rétractationLa qualification a posteriori des référencesÀ rejouer sur tout le corpus, pas seulement sur les nouveautés

Identifiants pérennes et dédoublonnage : la condition technique de la reproductibilité

Le dédoublonnage par titre est la principale cause d'écart entre deux corpus censément identiques. Un même travail apparaît sous un titre légèrement modifié entre le préprint et la version publiée, avec une ponctuation différente, une capitalisation différente ou un sous-titre ajouté. Les rapprochements approximatifs fusionnent alors des documents distincts et en séparent d'identiques, sans qu'aucune alerte ne le signale.

Trois familles d'identifiants résolvent l'essentiel du problème. Le DOI identifie le document et se conserve tel quel dans la fiche. L'ORCID identifie l'auteur, ce qui règle les homonymies et les changements de nom que les listes d'auteurs ne permettent pas de traiter. Le ROR identifie l'établissement, indispensable dès qu'une analyse porte sur des laboratoires ou des tutelles, car les affiliations en texte libre s'écrivent de dizaines de manières.

La règle pratique est de conserver la chaîne complète : identifiant, source d'où provient la référence, date d'extraction, et lien vers la version consultée. Cette chaîne de garde permet de rejouer une extraction et d'expliquer un écart plutôt que de le découvrir. Une plateforme telle que NewsCore (www.newscore.fr) couvre en continu des millions de sources multilingues, conserve le lien vers la publication d'origine et remonte les reprises d'un même travail, ce qui relie la couche scientifique à sa réception médiatique et industrielle.

Le calendrier propre à la filière recherche

Le champ scientifique a des rythmes stables qu'une veille efficace anticipe. Les grandes conférences concentrent l'annonce des résultats sur quelques jours, souvent précédés de dépôts de préprints groupés à la date limite de soumission, plusieurs mois plus tôt. Une veille calée uniquement sur les revues rate cette fenêtre et découvre les travaux au moment où ils sont déjà connus des équipes concurrentes.

Les appels à projets forment un second rythme. Les programmes nationaux et européens publient leurs calendriers à l'avance, et la liste des projets retenus paraît généralement plusieurs mois après la clôture. Suivre ces listes revient à disposer d'une carte des travaux qui commencent, information sans équivalent dans la littérature publiée puisqu'elle la précède de plusieurs années.

Un troisième rythme, moins visible, tient aux embargos éditoriaux et aux communications d'établissement. Un résultat sort simultanément dans une revue et dans un communiqué de l'organisme de recherche, souvent accompagné d'éléments de contexte absents de l'article. Suivre les salles de presse des organismes et des universités donne accès à cette matière et fournit le vocabulaire employé par les équipes elles-mêmes, utile pour affiner les requêtes.

Limites connues d'un corpus scientifique en sources ouvertes

La première limite est le biais linguistique. Les bases indexent inégalement les publications non anglophones, et un corpus constitué en anglais seul sous-représente des travaux réels, notamment dans les disciplines à ancrage national. Nous consignons donc systématiquement les langues interrogées, non comme une garantie de couverture mais comme un élément permettant d'interpréter une absence.

La deuxième limite est la confusion entre visibilité et activité. Un corpus mesure ce qui est publié, indexé et accessible, ce qui laisse hors champ la recherche sous contrat, les travaux protégés avant dépôt de brevet et les programmes non publiés. Présenter un décompte de publications comme une mesure d'effort de recherche est une erreur d'interprétation courante, et la précaution consiste à croiser au moins un gisement bibliographique avec un gisement de financement ou de brevet.

La reproductibilité, enfin, tient à un fichier de protocole tenu à jour et versionné : requêtes exactes, bases interrogées avec leur date d'accès, critères d'inclusion et d'exclusion, règles de dédoublonnage, date d'arrêt. Deux équipes partageant ce fichier obtiennent des corpus comparables, et lorsqu'elles divergent, elles localisent le point de divergence en quelques minutes au lieu de discuter des impressions générales que laisse la lecture.

Questions fréquentes

Faut-il inclure les préprints dans un corpus de veille scientifique ?

Oui dans la plupart des veilles d'intelligence économique, parce qu'ils portent l'avance temporelle qui fait tout l'intérêt de l'exercice, mais avec un marquage explicite du statut d'évaluation. La règle utile est de les inclure et de les distinguer, jamais de les mélanger silencieusement avec des articles évalués. Il faut également prévoir la réconciliation ultérieure entre le préprint et la version publiée, sans quoi le même travail est compté deux fois.

Quelles bases interroger quand on n'a pas d'abonnement à une base commerciale ?

Crossref et OpenAlex donnent une couverture très large à partir des métadonnées déposées par les éditeurs, PubMed couvre le domaine biomédical, HAL la production des établissements français, et les serveurs de préprints se consultent directement. Cette combinaison ouverte suffit à constituer un corpus défendable, à condition d'écrire quelles bases ont été interrogées, car l'absence d'une base explique la plupart des écarts constatés ensuite.

Comment savoir si un corpus est complet ?

Il ne l'est jamais, et l'objectif réaliste est de connaître sa couverture plutôt que de la maximiser. Le test usuel consiste à constituer une courte liste de références que l'on sait pertinentes, obtenue par une autre voie que la requête principale, et à vérifier combien d'entre elles le corpus retrouve. Le résultat ne donne pas une exhaustivité mais un ordre de grandeur du taux de rappel, et il indique surtout quel gisement manque.

Pour approfondir