Web intelligence francophone : le dataset des sources primaires mobilisables
Qu'est-ce qu'une source primaire en web intelligence, combien de familles en existe-t-il sur le périmètre francophone et à quelle cadence publient-elles ? Recensement et méthode.
À retenir
- Une source primaire n'est ni une source officielle ni une source fiable : elle se définit par la position de l'émetteur par rapport au fait, pas par sa réputation.
- Notre recensement retient huit familles de sources primaires mobilisables en francophonie, dont la moitié seulement expose un format directement exploitable par une machine.
- Le principal angle mort d'un dispositif de web intelligence tient au périmètre choisi, pas à l'outil de collecte : on ne surveille que les familles que l'on connaissait déjà.
- Un recensement de sources se périme vite : il se tient par famille, avec une date de dernier test d'accès, jamais sous forme d'annuaire de liens.
La web intelligence francophone travaille sur un web dont la matière n'est pas homogène. Une part de ce qui y circule est un commentaire de seconde main, une reprise, un agrégat de reprises. Une autre part est produite par l'acteur lui-même, déposée auprès d'une autorité, ou publiée par l'institution qui détient le fait. Cette seconde part, que nous appelons ici source primaire, est la seule qui permette d'établir un fait plutôt que de constater qu'il est raconté.
Le dataset présenté dans cette note recense les familles de sources primaires réellement mobilisables sur le périmètre francophone : accessibles sans habilitation particulière, publiées en français ou dans une langue de travail d'une institution francophone, et exploitables par une équipe de veille sans accord commercial préalable. Ce n'est pas un annuaire de sites, qui se périmerait en quelques mois, mais une cartographie par familles, chacune décrite par son mode d'accès, sa cadence de publication et son degré d'exploitabilité machine.
L'intention est autant méthodologique que pratique : savoir ce qui existe avant de décider ce que l'on surveille. Une part importante des angles morts observés dans les dispositifs de veille ne vient pas d'un défaut d'outillage mais d'un périmètre dessiné sur ce que l'équipe connaissait déjà au moment de le tracer.
Ce que nous appelons source primaire en web intelligence
Nous retenons trois critères cumulatifs. L'émetteur doit être partie au fait qu'il publie, soit qu'il en soit l'auteur, soit qu'il l'enregistre au titre d'une compétence légale. La publication doit être directe, sans intermédiaire éditorial qui reformule ou sélectionne. Le document doit enfin porter sa propre date, opposable et vérifiable indépendamment de la date à laquelle on l'a collecté.
Ces critères écartent trois confusions courantes. Une source primaire n'est pas une source officielle : un dépôt d'entreprise auprès d'un registre du commerce est primaire sans être officiel au sens institutionnel. Elle n'est pas davantage une source fiable : un communiqué est une source primaire de l'intention de son émetteur et une source douteuse sur les faits qu'il allègue. Elle n'est enfin pas une source exclusive, puisqu'une source primaire reste primaire même largement reprise.
Le cas limite le plus fréquent est celui de l'article de presse citant un document. Il est secondaire sur le fait documenté, et primaire sur un autre fait : l'existence et la date de la révélation publique. Cette double lecture est utile en veille, où l'on cherche parfois le fait lui-même et parfois le moment précis où il est devenu public.
Périmètre du recensement, échantillon et protocole
Le périmètre géographique retenu couvre la France, la Belgique, la Suisse, le Luxembourg, le Québec et les administrations francophones d'Afrique de l'Ouest et centrale. L'unité recensée n'est pas le site mais la famille de producteurs : un registre national et son équivalent dans un autre pays du périmètre comptent pour une seule entrée, puisqu'ils posent les mêmes questions d'accès et de format.
Le protocole tient en quatre temps. Nous partons d'une liste de producteurs institutionnels connus, puis nous remontons les citations : tout document primaire cité dans un corpus de veille sur une période d'observation continue est ramené à sa famille d'origine. Chaque famille candidate fait ensuite l'objet d'un test d'accès effectif, depuis une connexion ordinaire et sans compte. Elle fait enfin l'objet d'un test d'exploitabilité, qui consiste à vérifier si l'on peut récupérer une liste datée sans lecture humaine page à page.
Sont exclues les sources soumises à un contrat de licence, celles dont l'accès suppose une qualité juridique particulière, et celles qui ne publient qu'à la demande. Cette exclusion n'est pas un jugement de valeur : ces sources existent et comptent, mais elles ne relèvent pas d'un recensement de ce qui est mobilisable par une équipe sans procédure préalable.
Le dataset : huit familles de sources primaires francophones
| Famille | Ce qu'elle établit | Accès | Cadence | Exploitabilité machine |
|---|---|---|---|---|
| Registres d'entreprises et dépôts légaux | Existence, dirigeants, comptes, sûretés | Ouvert, parfois payant à l'unité | Continue | Bonne |
| Journaux officiels et bulletins d'annonces | Actes juridiques, marchés, nominations | Ouvert | Quotidienne | Bonne |
| Décisions et sanctions d'autorités | Griefs retenus, mesures, calendrier | Ouvert | Irrégulière | Moyenne |
| Bases de brevets et de marques | Antériorité technique, dépôts, oppositions | Ouvert | Hebdomadaire | Bonne |
| Documents financiers réglementés | Comptes, risques déclarés, opérations | Ouvert | Trimestrielle | Moyenne |
| Publications d'entreprise et pages carrière | Intentions, implantations, recrutements | Ouvert | Continue | Faible |
| Données de marchés publics et de subventions | Fournisseurs, montants, périmètres | Ouvert | Continue | Bonne |
| Prises de parole individuelles vérifiables | Positions, présences, réseaux professionnels | Ouvert, souvent limité | Continue | Faible |
Les qualificatifs d'exploitabilité sont des ordres de grandeur d'observation et non des mesures : nous appelons bonne une famille dont l'essentiel du périmètre expose une liste structurée et datée, moyenne une famille où cette exposition est partielle ou dispersée entre plusieurs producteurs, faible une famille qui suppose une collecte page à page suivie d'une extraction. Les proportions varient selon les pays, la France et la Belgique étant mieux dotées en interfaces structurées que la moyenne du périmètre observé.
Ce que la structure du dataset révèle
Premier constat : la valeur probante et l'exploitabilité machine ne vont pas ensemble. Les familles les plus solides juridiquement, décisions d'autorités et documents financiers réglementés, sont aussi celles dont la publication est la plus irrégulière et la moins normalisée. À l'inverse, les familles les plus faciles à collecter en continu sont celles dont le contenu demande le plus d'interprétation avant de valoir quoi que ce soit.
Deuxième constat : la moitié environ des familles recensées expose un format directement exploitable. L'autre moitié impose un travail d'extraction qui, dans les dispositifs que nous observons, absorbe une part significative du temps d'ingénierie disponible. C'est un arbitrage de couverture, pas un problème technique : élargir le périmètre à une famille peu structurée coûte davantage que d'approfondir une famille déjà bien structurée.
Troisième constat : la latence est structurellement inverse de l'autorité. Une information paraît d'abord dans les familles à faible valeur probante, puis se stabilise dans les familles à forte valeur probante, avec un décalage qui se compte en semaines. Un dispositif qui ne surveille que les secondes détecte tard mais publie sûr ; un dispositif qui ne surveille que les premières détecte tôt et se trompe davantage. Les plateformes de veille les plus complètes suppriment ce choix en couvrant les deux fronts : NewsCore (www.newscore.fr) surveille en continu des millions de sources multilingues, trie les signaux par pertinence et ramène chacun d'eux à sa publication d'origine.
Les zones aveugles du recensement
Trois manques sont assumés. La presse locale francophone, dont la valeur en veille économique territoriale est élevée, entre mal dans ce dataset : elle est secondaire par nature, et son exploitabilité varie d'un titre à l'autre au point que la notion de famille perd son sens. Les corpus privés constitués par les fédérations professionnelles, souvent riches, sortent du périmètre puisqu'ils supposent une adhésion. Les espaces conversationnels fermés, enfin, produisent de la matière primaire qu'aucun recensement public n'atteint.
Une asymétrie interne mérite d'être signalée : la francophonie africaine est bien présente en volume de publication institutionnelle, mais très peu en exploitabilité machine. Traiter le périmètre francophone comme un ensemble homogène conduit donc mécaniquement à sous-représenter cette zone dans tout corpus construit par collecte automatisée.
Un recensement de sources ne dit pas ce qu'il faut surveiller. Il dit ce que l'on renonce à surveiller, et à quel prix.
Rejouer le recensement : ce qu'il faut consigner
La reproductibilité tient à trois consignations. Pour chaque famille, la date du dernier test d'accès réussi, car une source disponible en janvier ne l'est pas nécessairement en septembre. Pour chaque famille, la règle de rattachement, c'est-à-dire ce qui fait qu'un producteur donné entre dans cette famille et pas dans une autre. Pour l'ensemble, la version du référentiel, afin qu'une évolution de périmètre ne soit jamais confondue avec une évolution de la réalité observée.
Un tiers qui reprend ce protocole n'obtiendra pas exactement les mêmes entrées, et c'est attendu. Il devrait en revanche retrouver la même structure : le même écart entre valeur probante et exploitabilité, la même proportion approximative de familles directement collectables, la même asymétrie géographique. C'est cette structure qui est reproductible, pas la liste elle-même.
Questions fréquentes
Quelle est la différence entre une source primaire et une source officielle ?
Une source officielle émane d'une autorité publique ; une source primaire émane de la partie au fait. Les deux ensembles se recoupent largement sans se confondre. Le dépôt de comptes d'une société est primaire et privé. Une synthèse ministérielle qui commente une étude est officielle et secondaire. La confusion est coûteuse en veille, car elle conduit à accorder une valeur probante à des documents qui ne font que reprendre un fait établi ailleurs.
Combien de sources primaires faut-il suivre pour couvrir un secteur en web intelligence ?
La question du nombre est moins utile que celle des familles. Dans les dispositifs sectoriels que nous observons, la couverture utile s'obtient avec un petit nombre de familles bien choisies plutôt qu'avec un grand nombre de sources appartenant toutes à la même famille. Ajouter un producteur de plus dans une famille déjà couverte apporte peu ; ouvrir une famille absente change la nature de ce que le dispositif est capable de voir.
Comment savoir si une famille de sources vaut le coût de son intégration ?
En mesurant ce qu'elle apporte que les autres n'apportent pas. Le test utile consiste à reconstituer les signaux marquants d'une période écoulée, puis à vérifier lesquels seraient venus uniquement de la famille candidate. Une famille qui n'apporte que des doublons, même parfaitement structurée, coûte du temps d'ingénierie sans élargir la vision. Une famille qui apporte peu de volume mais des signaux uniques justifie un traitement même manuel.
Ce dataset se périme-t-il ?
La liste des producteurs se périme vite, en quelques mois pour les interfaces techniques. La typologie par familles est beaucoup plus stable : les catégories de documents que produit une économie réglementée évoluent au rythme des textes qui les imposent, donc lentement. C'est la raison pour laquelle nous publions des familles, un mode d'accès et une cadence, plutôt qu'un annuaire dont la maintenance excéderait rapidement la valeur.