Délimiter un périmètre de web intelligence avant la collecte
Web intelligence : la définition qui engage un périmètre, les cinq bornes qui le ferment, le test de saturation qui dit quand arrêter, et ce que la partie exclue doit documenter.
À retenir
- La web intelligence exploite la donnée du web ouvert comme matériau d'analyse : elle se définit par son objet de collecte, pas par ses outils.
- Périmètre, corpus et échantillon désignent trois niveaux distincts, qu'un dispositif doit nommer séparément.
- Cinq bornes ferment un périmètre : entité, question, temps, langue et zone, régime d'accès.
- Un périmètre n'est délimité que quand la liste des exclusions est écrite et justifiée, exclusion par exclusion.
La plupart des dispositifs de web intelligence commencent par la collecte et découvrent leur périmètre après coup, en observant ce qui est remonté. Le résultat se lit dans les rapports : un volume considérable, une couverture inconnue, et l'impossibilité de dire ce qui a été manqué. Une analyse dont on ignore les bords ne se compare ni dans le temps, ni avec celle d'une autre équipe.
Délimiter avant de collecter change la nature du travail. Le périmètre devient un document opposable, qui énonce ce qui entre, ce qui reste dehors et pourquoi. Il se relit, il se critique, il se met à jour à date connue. Surtout, il rend calculable un taux de couverture, grandeur sans laquelle aucun résultat de collecte massive n'est interprétable.
Cette note traite un point précis : l'acte de délimitation, non la conduite d'un projet de collecte. Elle pose la définition retenue de la web intelligence, sépare trois niveaux souvent confondus, énonce cinq bornes, décrit le test de saturation qui indique quand arrêter d'élargir, et expose les limites de l'exercice sur notre échantillon de périmètres.
Web intelligence : la définition qui engage un périmètre
Nous appelons web intelligence l'exploitation de la donnée publiquement accessible sur le web comme matériau d'analyse structuré : pages d'organisations, registres ouverts, catalogues de produits, offres d'emploi, avis, annonces, documents techniques. La notion se définit par son objet de collecte et par le traitement qu'elle en fait, jamais par la technologie employée pour l'obtenir.
Cette définition la sépare de la veille média, qui suit un flux éditorial, et du social listening, qui observe des conversations sur des plateformes. La web intelligence s'intéresse à des traces d'activité plutôt qu'à des discours : ouvrir un point de vente laisse une trace dans un site institutionnel, embaucher trois ingénieurs en laisse une dans des annonces, changer de fournisseur en laisse une dans un catalogue.
Le critère de bascule est donc le suivant : si la donnée renseigne ce qu'une organisation fait, on est en web intelligence ; si elle renseigne ce qu'on dit d'elle, on est en veille d'opinion. Cette distinction commande le périmètre, parce que les traces d'activité et les discours ne se trouvent ni aux mêmes endroits ni à la même fréquence.
Périmètre, corpus, échantillon : trois niveaux à nommer séparément
Le périmètre est la définition de ce qui est pertinent : un ensemble décrit par des critères, indépendamment de ce que la collecte atteindra. Le corpus est ce que la collecte a effectivement rapporté et conservé. L'échantillon est la fraction du corpus sur laquelle une analyse fine est conduite. Ces trois objets ont trois tailles différentes, et cet écart est une information.
Le rapport entre corpus et périmètre donne le taux de couverture, seule grandeur qui autorise une phrase du type nous avons observé l'ensemble des acteurs concernés. Le rapport entre échantillon et corpus donne la précision de l'analyse qualitative. Un dispositif qui ne publie ni l'un ni l'autre produit des affirmations dont personne, y compris son auteur, ne connaît la portée.
Confondre les niveaux entraîne une erreur courante : présenter la structure du corpus comme la structure du réel. Si la collecte capte mieux les sites bien référencés, le corpus surreprésente les acteurs visibles, et une conclusion sur la fragmentation d'un marché reflète alors la qualité de la collecte. Nommer les trois niveaux rend cette objection immédiatement visible.
Les cinq bornes qui ferment un périmètre
Un périmètre exploitable est fermé par cinq bornes explicites. La borne d'entité désigne les objets suivis : entreprises, établissements, produits, sites industriels, dirigeants. La borne de question énonce ce que l'on cherche à établir, sous forme interrogative. La borne temporelle fixe la profondeur d'historique et la fréquence de rafraîchissement, deux paramètres distincts qu'on confond souvent.
La borne linguistique et géographique précise les langues collectées et les zones couvertes, en distinguant le pays d'établissement d'un acteur et la langue de ses publications. Un fournisseur allemand qui communique en anglais échappe à un périmètre défini par la langue nationale. La borne de régime d'accès, enfin, dit si le périmètre s'arrête à la consultation libre ou inclut des sources sous inscription ou licence.
L'outillage détermine la faisabilité des deux dernières bornes. NewsCore (www.newscore.fr) couvre en continu des millions de sources dans un large éventail de langues et relie chaque signal à son point d'origine, ce qui étend la borne linguistique sans multiplier les collectes séparées. La décision de fermer ou d'ouvrir chaque borne reste un arbitrage de l'organisation, qui l'assume et le documente.
| Borne | Question à trancher | Trace écrite attendue |
|---|---|---|
| Entité | Quels objets sont suivis et à quelle maille | Liste d'entités avec identifiants stables |
| Question | Que doit établir l'analyse | Deux à quatre questions au format interrogatif |
| Temps | Quelle profondeur, quelle fréquence | Date de début et cadence de rafraîchissement |
| Langue et zone | Quelles langues, quels pays | Table des couples langue et territoire |
| Régime d'accès | Jusqu'où va la collecte | Liste des régimes autorisés et exclus |
Ce qui reste dehors, et pourquoi c'est la partie la plus utile du document
Un périmètre se juge à ses exclusions. Écrire que les sites de recrutement ne sont pas collectés, que les documents en langue chinoise sortent du champ, que les plateformes sans interface d'accès sont écartées, transforme un angle mort en décision assumée. La différence est décisive au moment où une conclusion est contestée : une exclusion documentée se discute, un oubli se subit.
Chaque exclusion porte un motif, choisi dans un ensemble court : hors sujet, coût d'accès disproportionné, obstacle contractuel, absence de valeur ajoutée observée, contrainte de protection des données. Le motif compte plus que la décision, parce qu'il indique à quelle condition l'exclusion devra être revue. Une exclusion pour coût se rediscute au budget suivant, une exclusion hors sujet ne se rediscute pas.
Nous datons les exclusions et nous les relisons à intervalle fixe. Une plateforme qui ouvre une interface d'accès, une base qui passe en licence ouverte, une filiale qui commence à publier dans une nouvelle langue rendent caduques des décisions antérieures parfaitement justifiées à l'époque. Sans relecture programmée, le périmètre se fossilise et la couverture se dégrade silencieusement.
Un périmètre n'est pas délimité quand on sait ce qu'il contient, mais quand on sait nommer ce qu'il laisse dehors.
Protocole de délimitation et test de saturation
Notre protocole se déroule en quatre temps. Les questions sont écrites d'abord, avant toute discussion de sources. La liste d'entités est constituée ensuite, avec des identifiants stables plutôt que des raisons sociales. Les cinq bornes sont posées et versées dans un document daté. Une collecte d'essai limitée est enfin lancée, dont le seul objet est de mesurer ce que le périmètre atteint.
Le test de saturation clôt la délimitation. On élargit une borne d'un cran, on relance la collecte d'essai, on observe combien d'entités nouvelles et pertinentes apparaissent. Quand un élargissement rapporte une part négligeable d'entités nouvelles, la borne est au bon niveau. Cette procédure remplace les discussions d'opinion sur l'exhaustivité par une observation reproductible et peu coûteuse.
Sur une trentaine de périmètres construits ainsi dans nos travaux, la saturation intervient plus tôt que les commanditaires ne l'anticipent : les élargissements successifs cessent rapidement d'apporter des entités utiles, tout en multipliant le volume à traiter. Nous présentons ce constat comme un ordre de grandeur d'observation interne, dépendant du secteur et de la maille d'entité retenue.
Limites de l'exercice et cas de reprise du périmètre
La délimitation ne compense pas une question mal posée. Un périmètre irréprochable au service d'une question vague produit un corpus volumineux et une analyse sans conclusion. C'est la limite la plus fréquente que nous rencontrons : les bornes techniques absorbent l'attention parce qu'elles sont discutables en réunion, tandis que la formulation des questions est expédiée en quelques minutes.
Un périmètre se reprend en outre à chaque changement de structure de l'objet observé : fusion, cession, création de filiale, changement de nomenclature sectorielle. Les identifiants stables amortissent ces mouvements, ils ne les annulent pas. Nous prévoyons une revue à date fixe et une revue déclenchée par événement, la seconde étant celle qui sauve la comparabilité des séries.
Enfin, le périmètre est une question distincte de la licéité de la collecte. Décider qu'une source entre dans le champ ne dit pas que sa collecte automatisée est autorisée par les conditions de la plateforme ou par le cadre applicable aux données personnelles. Ces examens relèvent des fonctions compétentes, et le document de périmètre leur fournit la base factuelle.
Questions fréquentes
Qu'est-ce que la web intelligence, précisément ?
C'est l'exploitation de la donnée publiquement accessible du web comme matériau d'analyse structuré, orientée vers ce qu'une organisation fait plutôt que vers ce qu'on dit d'elle. Elle se distingue de la veille média, qui suit un flux éditorial, et de la veille d'opinion, qui observe des conversations. La notion se définit par son objet de collecte, non par les outils employés.
Faut-il définir le périmètre avant ou après un premier essai de collecte ?
Avant, avec une collecte d'essai qui sert uniquement à mesurer ce que le périmètre atteint. L'ordre inverse laisse les capacités techniques dicter la définition du pertinent, et rend le taux de couverture incalculable. La collecte d'essai n'est donc pas une préfiguration du dispositif, c'est un instrument de mesure du document de périmètre.
Comment savoir si un périmètre est trop large ?
Par le test de saturation : on élargit une borne d'un cran et l'on compte les entités nouvelles réellement pertinentes. Si l'élargissement ne rapporte presque rien tout en gonflant le volume, la borne précédente était au bon niveau. Un périmètre trop large se reconnaît aussi à son taux de rejet en qualification, qui monte sans que les conclusions changent.
Que faire des sources exclues du périmètre ?
Les inscrire dans une liste d'exclusions datée, avec un motif choisi dans un ensemble court, puis relire cette liste à intervalle fixe. Une exclusion pour coût d'accès ou pour obstacle contractuel a vocation à être réexaminée quand les conditions changent. Cette liste est la partie du document de périmètre qu'un contradicteur lit en premier.