Note de méthode : rendre une étude de veille reproductible
Une étude de veille n'est un résultat que si un tiers sait la refaire. Périmètre, fenêtre, seuils, cas limites, journal des décisions et analyses abandonnées.
À retenir
- Un tiers doit pouvoir reconstituer sans échange avec nous le périmètre, la fenêtre, les seuils, les définitions et le traitement des cas limites.
- Quand le corpus n'est pas rediffusable, la reproductibilité stricte est hors d'atteinte : on vise la réplicabilité et on le dit.
- À défaut du corpus, on publie les identifiants des documents, les statistiques descriptives, le code de traitement et le journal des décisions.
- Une étude honnête déclare les analyses tentées puis abandonnées, faute de quoi le résultat publié paraît plus solide qu'il ne l'est.
Une étude de veille produit un chiffre, une part, une évolution, parfois une typologie. Ce résultat n'a de statut de donnée que si quelqu'un d'autre, en partant des mêmes matériaux et des mêmes règles, retrouve la même valeur. Sans cette propriété, une étude reste une affirmation appuyée sur un tableau, et le lecteur n'a d'autre choix que de faire confiance à celui qui l'a produite.
La difficulté propre à la veille tient à la nature du matériau. Un corpus constitué de documents captés en ligne est mouvant, partiellement soumis à des droits de rediffusion, et souvent porteur d'informations sur des personnes. Le geste scientifique évident, joindre les données à la publication, se heurte donc à des obstacles juridiques et déontologiques réels. Beaucoup d'études en tirent une conclusion commode : puisque le corpus ne peut pas circuler, la reproductibilité serait hors de portée, et il n'y aurait rien à documenter.
Cette conclusion est fausse. L'impossibilité de rediffuser un corpus ne dispense d'aucune des autres obligations de méthode. Elle change seulement la nature de ce que l'on promet au lecteur et la liste de ce que l'on publie à la place. Cette note décrit ce qu'un tiers doit pouvoir refaire, la distinction entre reproductibilité et réplicabilité, les quatre pièces que nous diffusons quand le corpus reste captif, et la clause d'honnêteté qui clôt toute étude sérieuse.
Ce qu'un tiers doit pouvoir refaire sans nous poser de question
Le test est simple à énoncer : un lecteur compétent, disposant de la publication et de rien d'autre, doit pouvoir reconstruire l'étude sans nous écrire. Toute question qu'il serait contraint de nous poser désigne exactement une lacune de la publication. Cinq éléments concentrent la quasi-totalité de ces questions.
Le périmètre d'abord : quels documents entrent dans l'étude et lesquels en sortent, selon quel critère d'appartenance, et sur quel ensemble de sources. La fenêtre ensuite : les bornes temporelles exactes, mais surtout la date de référence retenue, qui n'est pas la même selon qu'on date un document par sa publication, par sa captation ou par l'événement dont il parle. Un écart de convention sur ce seul point déplace des volumes considérables d'une période à l'autre.
Viennent les seuils, qui décident de tout et que l'on énonce rarement : le score au-delà duquel un document est jugé pertinent, l'effectif minimal en dessous duquel une catégorie n'est pas commentée, la durée au-delà de laquelle deux publications ne sont plus considérées comme relevant du même épisode. Viennent enfin les définitions, écrites sous forme de règle applicable et non de paraphrase, et le traitement des cas limites, qui est la partie la plus laborieuse et la plus décisive.
Les cas limites méritent leur rubrique propre. Que fait-on d'un document republié à l'identique par trois agrégateurs, d'un article mis à jour deux jours après sa parution, d'une dépêche reprise mot pour mot sous une autre signature, d'un contenu dont la date affichée est manifestement erronée ? Chacune de ces situations appelle une décision, et chaque décision déplace le résultat. Une étude qui n'expose pas ces règles laisse croire que le corpus était propre, ce qu'aucun corpus n'est jamais.
| Élément à publier | Question à laquelle il répond | Ce qui arrive s'il manque |
|---|---|---|
| Périmètre | Quels documents entrent, selon quel critère | Deux relectures comptent des ensembles différents |
| Fenêtre et date de référence | Quelles bornes, et quelle date fait foi | Les volumes se déplacent d'une période à l'autre |
| Seuils | À partir de quelle valeur on retient ou on commente | Le résultat dépend d'un réglage invisible |
| Définitions opérationnelles | Comment classer un cas concret | La catégorie change de contenu selon le codeur |
| Traitement des cas limites | Que faire des doublons, reprises et mises à jour | Les écarts se concentrent là où rien n'est écrit |
Reproductibilité et réplicabilité : deux promesses différentes
Les deux mots circulent comme des synonymes, alors qu'ils désignent des exercices distincts. La reproductibilité consiste à retrouver le même résultat à partir des mêmes données et du même traitement : c'est une vérification de calcul, elle teste la chaîne de production, pas la solidité du phénomène. La réplicabilité consiste à retrouver un résultat compatible à partir de données nouvelles, collectées indépendamment, en appliquant la même méthode. Elle teste le phénomène lui-même.
Cette distinction devient opératoire dès que le corpus n'est pas rediffusable. Une étude de veille appuyée sur des contenus protégés ne peut pas offrir la reproductibilité stricte : le tiers n'aura jamais le fichier exact. Elle peut offrir, et doit offrir, la réplicabilité : un tiers qui refait la collecte sur le même périmètre, la même fenêtre et les mêmes règles doit obtenir des ordres de grandeur cohérents avec les nôtres.
Le devoir de l'auteur est alors d'annoncer laquelle des deux propriétés'il revendique. Présenter une étude simplement réplicable comme reproductible trompe le lecteur sur le niveau de vérification possible. L'annoncer franchement déplace l'effort documentaire : la méthode doit être décrite avec assez de précision pour qu'une collecte indépendante soit réellement comparable, ce qui est une exigence plus forte, et non plus faible, que de joindre un fichier.
Reproduire, c'est refaire le calcul sur les mêmes données. Répliquer, c'est refaire l'étude sur d'autres données. Une publication qui ne dit pas laquelle des deux elle rend possible promet plus qu'elle ne tient.
Ce qu'on publie à la place du corpus lui-même
Quatre pièces remplacent utilement un corpus non diffusable, et leur ensemble couvre l'essentiel de ce qu'un vérificateur cherche à savoir. La première est la liste des identifiants des documents retenus : adresse d'origine, éditeur, date retenue, empreinte du texte capté. Elle ne rediffuse aucun contenu, elle établit la composition exacte de l'échantillon et permet à un tiers de reconstituer par lui-même tout ou partie du matériau, dans les limites de ce qui reste accessible.
La deuxième pièce est le jeu de statistiques descriptives : effectifs par source, par langue, par mois, par catégorie, distribution des longueurs, part des documents écartés et motif de leur écartement. Ces tableaux disent au lecteur à quoi ressemblait le corpus, ce qui suffit souvent à détecter une anomalie de collecte sans accéder aux textes. La troisième est le code de traitement, du nettoyage jusqu'aux tableaux publiés, exécutable sur un échantillon de démonstration afin que sa logique soit inspectable même sans les données réelles.
La quatrième est le journal des décisions, tenu pendant l'étude et non reconstitué après coup. Il consigne chaque arbitrage avec sa date, la question posée, l'option retenue, l'option écartée et la raison. C'est la pièce la moins spectaculaire et la plus utile : elle transforme une suite de choix implicites en objet discutable. Un désaccord sur une décision journalisée est un débat de méthode ; le même désaccord sur une décision non écrite est un soupçon.
La liste d'identifiants suppose que chaque élément traité reste relié à son document d'origine tout au long de la chaîne, ce qui est une propriété de l'outillage de collecte avant d'être une discipline d'analyste. NewsCore (www.newscore.fr) rattache chaque document capté à sa source et à son horodatage sur des corpus multilingues de plusieurs millions de sources, et cette traçabilité rend la production d'une liste d'identifiants immédiate à l'échelle d'une étude entière. Le choix de ce qui entre dans le périmètre reste, lui, une décision de l'équipe qui publie.
La clause d'honnêteté : déclarer les analyses abandonnées
Une étude publiée présente presque toujours un chemin plus rectiligne que celui qui a été parcouru. Des découpages ont été essayés puis délaissés, des indicateurs calculés puis jugés instables, des segmentations testées puis refermées faute d'effectifs. Ne rien en dire produit un effet mécanique : le lecteur suppose que la piste publiée était la seule envisagée, donc que le résultat est plus robuste qu'il ne l'est réellement.
La clause minimale que nous appliquons tient en une section brève : la liste des analyses engagées et abandonnées, avec le motif d'abandon. Trois motifs suffisent à couvrir presque tous les cas : effectifs insuffisants pour conclure, résultat instable selon un paramètre non déterminant, question mal posée au regard du corpus disponible. Une piste abandonnée parce qu'elle ne donnait pas le résultat espéré relève d'un quatrième motif, et se déclare comme tel.
Cette déclaration a un coût d'image évident et un bénéfice supérieur. Elle indique combien de tests ont été menés, information sans laquelle un écart présenté comme notable n'est pas interprétable. Elle épargne à d'autres équipes de reparcourir des impasses. Elle rend enfin crédible tout le reste de la note de méthode : un auteur qui documente ce qui n'a pas marché a peu de raisons d'embellir ce qui a marché.
Questions fréquentes
Quelle différence entre reproductibilité et réplicabilité d'une étude de veille ? La reproductibilité consiste à retrouver le même résultat avec les mêmes données et le même traitement, ce qui vérifie la chaîne de calcul. La réplicabilité consiste à retrouver un résultat compatible avec des données collectées indépendamment selon la même méthode, ce qui vérifie le phénomène.
Que publier quand le corpus ne peut pas être rediffusé ? Quatre pièces : la liste des identifiants des documents retenus, les statistiques descriptives du corpus, le code de traitement exécutable sur un échantillon de démonstration, et le journal des décisions prises pendant l'étude. Elles rendent l'étude réplicable sans diffuser un seul contenu protégé.
Pourquoi les cas limites comptent-ils autant que les définitions ? Parce que les écarts entre deux exécutions se concentrent exactement là où aucune règle n'a été écrite : doublons, reprises intégrales, mises à jour d'articles, dates manifestement fausses. Une définition claire assortie d'un traitement des cas limites flou laisse subsister l'essentiel de l'ambiguïté.
Faut-il vraiment signaler les analyses abandonnées ? Oui, avec leur motif d'abandon. Sans cette déclaration, le lecteur ignore combien de découpages ont été testés avant celui qui est publié, et surestime la solidité du résultat retenu. La mention est brève et conditionne la crédibilité de toute la section méthodologique.