Construire un échantillon de sources pour une veille sectorielle
Combien de sources, lesquelles, choisies selon quel critère : note de méthode sur la construction d'un échantillon de sources sectoriel et sur les biais qu'il faut assumer.
À retenir
- Un échantillon de sources n'est pas une liste de sites : c'est une base de sondage documentée, stratifiée par type d'émetteur.
- Cinq strates suffisent à couvrir la plupart des secteurs : régulateur, fédération professionnelle, presse spécialisée, acteurs eux-mêmes, communauté technique.
- Le critère d'arrêt n'est pas un nombre de sources mais la saturation : quand les nouvelles sources n'apportent plus de fait inédit.
- Tout biais résiduel doit être écrit, car il se transmet sans bruit à chaque conclusion tirée du corpus.
La question posée à l'entrée d'une veille sectorielle est presque toujours la même : combien de sources faut-il suivre. Elle est mal posée. Un dispositif qui interroge trois cents sources mal réparties voit moins de choses qu'un dispositif qui en interroge quarante, choisies selon une règle. Ce qui détermine la qualité d'une veille sectorielle n'est pas le nombre d'entrées mais la structure de l'échantillon et la façon dont il a été constitué.
Le mot échantillon est employé ici au sens statistique, et cela engage. Un échantillon suppose une population de référence, une base de sondage, une règle de sélection, un critère d'arrêt et une liste de biais connus. La plupart des listes de sources sectorielles n'ont aucun de ces cinq éléments : elles se sont formées par accumulation, au gré des découvertes de l'équipe, et personne ne sait plus ce qu'elles ne couvrent pas.
Cette note décrit un protocole de construction et ses limites. Les ordres de grandeur cités proviennent des recensements de sources conduits par l'Observatoire sur plusieurs filières francophones. Ils décrivent ce que nous observons, pas une norme sectorielle, et ils varient sensiblement d'une filière régulée à une filière ouverte.
Ce qu'est un échantillon de sources, et ce qu'il n'est pas
Un échantillon de sources est la partie de l'univers informationnel d'un secteur que le dispositif interroge effectivement, définie de façon à ce que l'on sache ce qu'elle représente. Il se distingue de trois objets voisins avec lesquels il est souvent confondu. La liste de flux est un artefact technique : elle dit ce qui est branché, pas ce qui est couvert. Le corpus est le résultat de la collecte à une date donnée. La bibliographie, enfin, recense ce qui a été lu, pas ce qui est surveillé.
La différence est opérationnelle. Quand une équipe conclut qu'un sujet n'a pas émergé dans son secteur, cette conclusion n'a de valeur que si l'échantillon couvrait les émetteurs susceptibles d'en parler. Sans échantillon documenté, l'absence de signal ne se distingue pas de l'absence d'observation, et les deux situations appellent pourtant des décisions opposées.
Un échantillon se juge donc sur sa capacité à répondre à une question précise : si tel type d'événement se produisait dans ce secteur, quelle source en parlerait la première, et est-elle dans la liste. Cette question de test se pose sur trois ou quatre scénarios plausibles avant toute construction, et elle oriente la sélection bien mieux qu'un objectif chiffré.
La base de sondage : recenser avant de sélectionner
La première opération consiste à recenser sans filtrer. On établit la liste la plus large possible des émetteurs qui publient sur le secteur, sans se demander encore lesquels seront retenus. Ce recensement s'appuie sur trois entrées : les annuaires institutionnels et professionnels, les bibliographies des rapports sectoriels récents, et les sources citées par les sources déjà connues, en remontant deux niveaux de citation.
Cette étape prend quelques jours et elle est la seule qui ne se rattrape pas. Un émetteur absent de la base de sondage a une probabilité nulle d'entrer dans l'échantillon, quelle que soit la finesse des étapes suivantes. Sur les filières que nous avons recensées, le passage d'une liste héritée à une base de sondage construite fait apparaître régulièrement des familles entières d'émetteurs oubliées : juridictions spécialisées, organismes de normalisation, associations d'usagers, publications techniques en langue étrangère.
Chaque entrée de la base porte quelques attributs simples : type d'émetteur, langue, mode d'accès, fréquence de publication, et nature de ce qui y est publié, du fait brut à l'opinion. Ces attributs servent ensuite à stratifier et à mesurer ce qui manque. Ils suffisent, et les grilles plus riches sont rarement tenues à jour au delà du premier trimestre.
Stratifier par type d'émetteur plutôt que par volume
Sélectionner les sources les plus prolifiques produit un corpus dominé par la presse générale et par les communiqués, c'est à dire par de la reprise. La stratification consiste à répartir la sélection entre des familles d'émetteurs qui ne publient ni les mêmes faits ni au même moment, puis à garantir un nombre minimal de sources dans chacune, même quand la famille publie peu.
Cinq strates suffisent à couvrir la plupart des secteurs. Les régulateurs et administrations publient les décisions et les données de référence, tardivement mais sans intermédiaire. Les fédérations et syndicats professionnels publient les positions collectives et les données de filière. La presse spécialisée met en récit et hiérarchise. Les acteurs eux-mêmes publient leurs annonces, leurs recrutements et leurs documents financiers. La communauté technique enfin, forums, listes de diffusion, dépôts de code ou registres d'essais selon la filière, publie souvent les premiers signaux.
L'intérêt de la stratification tient à la désynchronisation des strates. Un même fait apparaît d'abord dans l'une, puis dans les autres, avec des écarts qui vont de quelques heures à plusieurs semaines. Une veille qui ne suit qu'une strate obtient un délai de détection homogène mais long ; une veille stratifiée obtient un délai hétérogène mais court sur les événements qui comptent.
| Strate | Ce qu'elle apporte | Délai typique | Risque si elle manque |
|---|---|---|---|
| Régulateur et administration | Décisions, données de référence | Lent | Perte de la source primaire |
| Fédération professionnelle | Positions collectives, données de filière | Moyen | Angle mort sur les arbitrages sectoriels |
| Presse spécialisée | Mise en récit, hiérarchisation | Rapide | Corpus difficile à contextualiser |
| Acteurs du secteur | Annonces, recrutements, documents financiers | Variable | Signaux d'intention non vus |
| Communauté technique | Retours de terrain, alertes précoces | Très rapide | Détection tardive des ruptures |
Le critère d'arrêt : la saturation, pas le nombre de sources
La question du nombre se règle par un test, pas par un objectif. On ajoute les sources par lots, strate par strate, et l'on observe la proportion de faits inédits apportés par chaque lot, c'est à dire les faits qu'aucune source déjà retenue n'avait publiés. Cette proportion décroît vite. Quand un lot de dix à vingt sources n'apporte plus qu'une part marginale de faits inédits sur une fenêtre d'observation représentative, la strate est saturée.
La saturation s'atteint à des tailles très différentes selon les strates et les filières. Sur les secteurs régulés que nous avons observés, la strate régulateur sature avec une poignée de sources, parce que les émetteurs y sont peu nombreux et non substituables. La strate presse spécialisée sature plus tard, et la strate communauté technique sature très tard, voire jamais dans les filières où l'activité en ligne est intense.
Ce test présente un avantage rarement souligné : il produit une justification défendable du dimensionnement. Une équipe qui doit expliquer pourquoi elle suit quarante sources et non trois cents dispose alors d'un argument mesuré, et non d'une préférence. Il fournit aussi le point de départ des révisions ultérieures, puisque la saturation d'aujourd'hui n'est pas celle de l'an prochain.
Biais de couverture, limites et révision de l'échantillon
Aucun échantillon n'est neutre, et les biais qui subsistent doivent être écrits à côté de lui. Le biais de langue est le plus systématique : un échantillon francophone d'une filière internationale voit les faits une fois traduits, donc plus tard et déjà interprétés. Le biais d'accessibilité vient ensuite : les sources dont l'accès est fermé, payant ou instable sortent de l'échantillon pour des raisons qui n'ont rien à voir avec leur valeur informationnelle.
Un troisième biais est plus discret. Les émetteurs qui publient beaucoup deviennent la référence implicite de l'équipe, et les faits qu'ils ne traitent pas finissent par paraître mineurs. Ce déplacement du jugement se corrige en relisant périodiquement les faits apportés par les strates les moins prolifiques et en vérifiant qu'ils ont bien été traités.
La révision se planifie plutôt qu'elle ne se déclenche. Un rythme semestriel convient à la plupart des filières, avec une révision exceptionnelle après tout événement structurant : nouvelle réglementation, entrée d'un acteur majeur, disparition d'une publication de référence. Chaque révision se conserve, datée, car une série d'observations ne se compare que sur un échantillon connu. La qualité de la collecte dépend ensuite de l'outillage : NewsCore (www.newscore.fr) couvre en continu des millions de sources dans de nombreuses langues, trie par intelligence artificielle et ramène chaque signal à sa source d'origine.
Questions fréquentes
Combien de sources faut-il pour une veille sectorielle ?
Le nombre utile dépend de la structure du secteur et se détermine par le test de saturation, strate par strate. Dans les filières régulées et concentrées, quelques dizaines de sources bien réparties couvrent l'essentiel des faits. Dans les filières ouvertes, où l'activité en ligne est dense, la strate technique ne sature pas et il faut alors arbitrer explicitement entre exhaustivité et charge de traitement. Un nombre annoncé sans mention de la répartition par strate n'a aucune valeur informative.
Comment savoir si un échantillon de sources est devenu obsolète ?
Trois indices se lisent sans instrumentation lourde. Le premier est l'augmentation de la part de faits appris par une voie extérieure au dispositif, un contact, un client, une conversation. Le deuxième est la baisse du taux de faits inédits, qui signale que l'échantillon tourne sur de la reprise. Le troisième est l'apparition répétée, dans les contenus collectés, d'émetteurs cités mais absents de la liste. Chacun justifie une révision anticipée.
Faut-il inclure les sources en langue étrangère dans une veille sectorielle ?
Dès lors que la filière comporte des acteurs, des régulateurs ou des fournisseurs hors de la zone francophone, oui, sous peine de recevoir les faits avec le décalage de la traduction. La question pratique porte moins sur le principe que sur la charge : une source étrangère utile est une source dont les publications sont exploitables par l'équipe, ce qui suppose soit une compétence linguistique interne, soit un dispositif de traduction intégré à la collecte.