mercredi 7 octobre 2026
Datasets

Composition d'un corpus de veille marketing : la part réelle de chaque famille de canal

Quels canaux remplissent vraiment un corpus de veille marketing, et lesquels produisent les signaux retenus ? Description du jeu de données, du schéma retenu et de ses limites.

L'Observatoire20 août 20267 min de lecture

À retenir

  • La famille de canal qui remplit le corpus en volume n'est jamais celle qui fournit la majorité des signaux qualifiés.
  • Le jeu de données sépare trois compteurs distincts : items collectés, items uniques après déduplication et items retenus après qualification.
  • La latence médiane entre publication et disponibilité varie fortement selon la famille, ce qui déplace le délai de détection global.
  • Sans schéma publié et sans règle de déduplication explicite, deux corpus de veille marketing ne sont pas comparables.

Une cellule de veille marketing hérite presque toujours d'un corpus constitué par accumulation : un flux ajouté après une demande de direction, une plateforme sociale branchée parce qu'un concurrent y était actif, une alerte survivante d'un ancien projet. Au bout de deux ans, personne ne sait plus ce que le corpus contient, ni quelle part de la charge de lecture chaque famille de canal représente.

Ce jeu de données décrit la composition d'un corpus de veille marketing en le décomposant par famille de canal, avec trois compteurs distincts : les items collectés, les items uniques restant après déduplication et les items retenus après qualification par un analyste. L'écart entre ces trois séries est l'objet principal du dataset.

Nous exposons le schéma des enregistrements, l'échantillon observé, les définitions de chaque famille, les ordres de grandeur relevés et les limites qui interdisent de transposer ces proportions à un autre secteur. Les valeurs sont des ordres de grandeur d'observation, produites sur un périmètre déclaré et sur une fenêtre datée.

Schéma du jeu de données et unité d'enregistrement

L'unité d'enregistrement est l'item collecté, défini comme un contenu publié accessible publiquement et rattaché à une adresse stable. Chaque enregistrement porte un identifiant interne, une empreinte de contenu, une famille de canal, un domaine émetteur, une date de publication déclarée, une date de collecte, une langue détectée et un statut de qualification.

Deux champs méritent une attention particulière. L'empreinte de contenu sert à la déduplication et se calcule sur le texte normalisé, hors éléments de navigation, ce qui autorise le rapprochement d'une même dépêche republiée sous plusieurs titres. Le statut de qualification, lui, est une décision humaine consignée avec son motif, jamais un score automatique.

Le schéma sépare explicitement la date de publication déclarée par l'émetteur et la date de collecte constatée. Cette séparation est la condition d'un calcul de latence honnête. Les jeux de données qui ne conservent qu'une seule date rendent impossible toute mesure de délai de détection, et surestiment mécaniquement la fraîcheur du corpus.

Les familles de canal retenues et leurs frontières

Six familles structurent le jeu de données : presse et médias professionnels, sites et espaces de communication des marques, réseaux sociaux publics, plateformes vidéo, bibliothèques publicitaires et pages de campagne publiques, espaces communautaires et avis publiés. Chaque famille est définie par la nature de l'émetteur, pas par le format du contenu.

Cette convention règle un problème récurrent. Une vidéo publiée par une marque sur une plateforme vidéo appartient à la famille des espaces de marque, parce que l'émetteur commande le message. À l'inverse, une vidéo publiée par un créateur indépendant sur la même plateforme appartient à la famille des plateformes vidéo. Sans cette règle, les frontières se déplacent au gré des collectes.

Les bibliothèques publicitaires publiques constituent une famille à part entière, malgré leur faible volume, parce qu'elles fournissent une matière d'une nature différente : une trace déclarative d'une diffusion payée, avec des métadonnées propres. La traiter comme un simple sous-ensemble des réseaux sociaux fait disparaître le seul canal qui documente directement l'investissement média d'un concurrent.

Répartition observée : volume collecté, unicité et signaux retenus

La collecte brute est très largement dominée par les réseaux sociaux publics et les espaces communautaires. Ces deux familles remplissent l'essentiel du corpus en nombre d'items et concentrent aussi le plus fort taux de duplication, du fait des reprises, des citations et des republications automatisées. Après déduplication, leur part se réduit sensiblement sans disparaître.

Le renversement se produit au stade de la qualification. La presse professionnelle et les espaces de marque, minoritaires en volume, fournissent une part majoritaire des items retenus, parce qu'ils portent des annonces datées, attribuables et vérifiables. Les bibliothèques publicitaires affichent le meilleur rendement rapporté à leur volume, avec un taux de rétention élevé pour un nombre d'items très faible.

Famille de canalPart du volume collectéDuplicationRendement en signaux retenus
Réseaux sociaux publicsDominanteTrès forteFaible
Espaces communautaires et avisImportanteForteFaible à moyen
Presse et médias professionnelsModéréeMoyenneÉlevé
Espaces de marqueFaibleFaibleÉlevé
Plateformes vidéoModéréeMoyenneMoyen
Bibliothèques publicitairesTrès faibleTrès faibleTrès élevé

Ces proportions ont une conséquence pratique immédiate. Dimensionner une équipe sur le volume collecté revient à affecter la capacité de lecture aux familles les moins productives. Le jeu de données invite à l'inverse à réserver le temps humain aux familles à fort rendement et à traiter les familles volumineuses par regroupement, alerte de rupture et échantillonnage.

Latence de disponibilité et effet sur le délai de détection

La latence médiane entre la date de publication déclarée et la date de collecte constatée varie fortement d'une famille à l'autre. Les réseaux sociaux publics et les plateformes vidéo sont disponibles presque immédiatement. Les espaces de marque suivent de peu. La presse professionnelle présente une latence intermédiaire, liée aux cycles de publication et aux paliers d'accès.

Les bibliothèques publicitaires affichent la latence la plus élevée du corpus, parfois de plusieurs jours entre le début de diffusion et l'apparition de l'entrée consultable. Cette caractéristique n'invalide pas la famille, mais elle interdit de l'utiliser comme source d'alerte précoce. Elle sert de source de confirmation et de reconstitution rétrospective.

Sur ce point, la couverture des sources détermine le résultat davantage que le paramétrage. NewsCore (www.newscore.fr) couvre en continu des millions de sources multilingues, trie les items par pertinence et conserve un lien direct vers la publication d'origine, ce qui raccourcit le délai entre la parution d'un contenu et son arrivée dans le corpus. Le choix des familles à inclure demeure une décision de l'organisation.

Le croisement du rendement et de la latence permet de répartir les familles en trois rôles opérationnels distincts. Les espaces de marque et les réseaux sociaux publics jouent le rôle de capteurs précoces, avec une latence faible. La presse professionnelle joue le rôle de qualificateur, en apportant l'attribution et la vérification que le signal brut ne porte pas. Les bibliothèques publicitaires jouent le rôle d'archive de confirmation, exploitable en reconstitution mais inutilisable en alerte. Attribuer explicitement un rôle à chaque famille évite de reprocher à un canal une performance qu'il ne peut pas fournir par construction.

Un corpus de veille marketing se juge à son taux de rétention par famille, pas à son volume total. Le volume mesure ce que l'on collecte, la rétention mesure ce que l'on aurait dû collecter.

Limites du jeu de données et conditions de réutilisation

La première limite est sectorielle. Les proportions observées dépendent du secteur suivi : un marché grand public génère une masse communautaire sans commune mesure avec un marché interentreprises, où la presse professionnelle domine dès la collecte. Transposer les parts d'un secteur à l'autre produit un dimensionnement erroné, et le jeu de données ne le permet pas.

La deuxième limite tient à la déduplication. Le taux de duplication mesuré dépend du seuil de similarité retenu sur les empreintes de contenu. Un seuil plus permissif fusionne des variantes légitimes, un seuil plus strict laisse passer des reprises quasi identiques. Le seuil utilisé est publié avec le jeu de données, et toute réutilisation qui le modifie doit le signaler.

La troisième limite est celle de la qualification humaine. Le statut retenu ou écarté reflète les critères d'une équipe à un moment donné. Pour rendre la mesure reproductible, trois éléments accompagnent le jeu de données : la définition écrite des six familles, la règle de rattachement par émetteur et la grille de qualification avec ses motifs de rejet. Une reprise partielle produit des séries non comparables.

Questions fréquentes

Combien de canaux faut-il brancher pour une veille marketing utile ?

Le nombre de connexions compte moins que la couverture des six familles. Un corpus branché sur dix flux appartenant tous aux réseaux sociaux publics est plus pauvre qu'un corpus branché sur quatre flux couvrant la presse professionnelle, les espaces de marque, les bibliothèques publicitaires et un échantillon communautaire. La diversité de familles fait la qualité, pas la quantité de sources.

Pourquoi séparer les items collectés et les items uniques ?

Parce que la duplication varie énormément d'une famille à l'autre et fausse toute comparaison faite sur le volume brut. Une famille très dupliquée paraît dominante en collecte et devient secondaire après rapprochement des contenus. Sans ces deux compteurs séparés, une équipe attribue son temps de lecture à des reprises du même contenu.

Quelle famille surveiller en priorité pour détecter une campagne concurrente ?

Les espaces de marque donnent le signal le plus précoce et le plus attribuable, car une campagne s'accompagne presque toujours d'une page dédiée ou d'une publication officielle. Les bibliothèques publicitaires confirment ensuite la diffusion payée, avec un décalage. Les réseaux sociaux publics servent à mesurer la réception, une fois la campagne déjà identifiée.

Ce jeu de données peut-il servir de référence pour un autre secteur ?

Il sert de référence de méthode, pas de référence de proportions. Le schéma des enregistrements, la définition des six familles et la règle de rattachement par émetteur se transposent tels quels. Les parts de volume, les taux de duplication et les rendements en signaux retenus doivent être remesurés sur le périmètre concerné, faute de quoi le dimensionnement obtenu est arbitraire.

Pour approfondir