Jeu de données de mentions de marque : champs obligatoires, unités de mesure et granularité de comptage
Mention, occurrence, document, audience estimée : quels champs retenir dans un dataset de mentions de marque, à quelle granularité compter et quels pièges d'agrégation éviter.
À retenir
- Une mention n'est pas un document. Tant que la définition n'est pas écrite, deux exports du même périmètre donnent deux totaux différents.
- Onze champs suffisent, dont quatre identifiants, quatre attributs de contexte et trois attributs dérivés qui ne se stockent jamais sans leur méthode de calcul.
- La granularité de comptage se choisit selon la question posée, puis ne change plus : une série qui change d'unité en cours de route mesure son propre réglage.
- Tonalité, audience estimée et part de voix sont des valeurs calculées, pas observées. Les stocker sans leur version de méthode rend la série irrattrapable.
Un tableau de mentions de marque paraît simple à produire. Une requête, un export, un total. Cette simplicité apparente cache la principale source d'erreur des dispositifs de veille d'image : deux équipes travaillant sur le même périmètre, avec les mêmes sources et la même fenêtre, obtiennent régulièrement des totaux écartés d'un facteur important. L'écart ne vient ni des sources ni de l'outil. Il vient de ce que l'objet compté n'a pas été défini avant d'être compté.
Ce document décrit la structure d'un jeu de données de mentions de marque : les champs retenus, leur type, les unités employées, les granularités disponibles et les règles d'agrégation qui empêchent une série de se contredire d'une édition à l'autre. Il s'adresse aux équipes qui produisent un livrable récurrent et dont les chiffres sont comparés dans le temps, situation où la stabilité de la définition compte davantage que la finesse de la mesure.
Ce qu'une mention désigne, et pourquoi la définition précède le champ
Une mention est l'apparition d'une entité surveillée dans un contenu. Cette phrase contient trois décisions implicites qu'il faut expliciter avant toute collecte. Ce qu'est l'entité surveillée : la marque commerciale seule, ou aussi la raison sociale, les noms de produits, les variantes orthographiques et les erreurs fréquentes. Ce qu'est une apparition : la chaîne exacte, ou toute forme reconnue comme désignant l'entité. Ce qu'est un contenu : le document publié, ou chacune de ses reprises et republications.
Ces trois décisions se consignent dans un document de définition, versionné et daté, qui accompagne le jeu de données. Toute modification y crée une version nouvelle, et la série indique la version employée à chaque période. Sans ce dispositif, une extension du dictionnaire d'entités produit une hausse de volume que l'équipe interprétera comme un événement de marché, alors qu'elle mesure un changement de son propre réglage.
La distinction entre mention et document est la plus lourde de conséquences. Un article citant une marque quatorze fois produit un document et quatorze occurrences. Ces deux nombres répondent à des questions différentes, et aucun n'est plus juste que l'autre. Le tableau de bord qui affiche un total sans préciser lequel des deux il présente est inutilisable dès qu'un lecteur cherche à le recouper avec une autre source.
Les champs obligatoires du jeu de données de mentions
Onze champs suffisent à décrire une mention de façon exploitable. Quatre relèvent de l'identification, quatre du contexte de publication et trois sont des attributs dérivés, calculés et non observés. La distinction entre ces trois familles gouverne le traitement : les identifiants ne changent jamais, les attributs de contexte se corrigent, les attributs dérivés se recalculent intégralement à chaque changement de méthode.
Le champ le plus structurant est l'identifiant de document, car c'est lui qui rend le dédoublonnage possible. Il se construit à partir de l'adresse canonique de la ressource, débarrassée de ses paramètres de suivi, et non à partir du titre, qui varie d'une reprise à l'autre. Un identifiant fondé sur le titre produit mécaniquement des doublons sur les dépêches reprises et des fusions abusives sur les titres génériques.
| Champ | Famille | Type ou unité | Piège fréquent |
|---|---|---|---|
| id_mention | identifiant | chaîne unique | réutiliser un identifiant après suppression |
| id_document | identifiant | adresse canonique normalisée | le fonder sur le titre du contenu |
| entite | identifiant | valeur contrôlée | mélanger marque, produit et raison sociale |
| forme_reconnue | identifiant | chaîne relevée | ne pas conserver la variante trouvée |
| date_publication | contexte | AAAA-MM-JJ, temps universel | prendre la date de collecte |
| source | contexte | domaine normalisé | compter deux fois un miroir |
| langue | contexte | code de langue | déduire la langue du domaine |
| type_contenu | contexte | valeur contrôlée | ranger un billet sponsorisé en éditorial |
| tonalite | dérivé | trois classes | stocker sans la version de méthode |
| audience_estimee | dérivé | nombre estimé | additionner des estimations hétérogènes |
| part_de_voix | dérivé | pourcentage du corpus | calculer sur un corpus non stabilisé |
Granularité de comptage : document, occurrence et fil de discussion
Trois granularités cohabitent et produisent trois séries distinctes. Le document compte une unité par contenu publié contenant au moins une mention. L'occurrence compte chaque apparition de l'entité à l'intérieur du contenu. Le fil regroupe un contenu initial et ses réactions, republications et commentaires rattachés, et compte une unité par conversation. Chacune répond à une question légitime, et la confusion naît de leur cohabitation dans un même tableau de bord.
La règle de choix est la suivante. Pour mesurer la présence d'une marque dans l'agenda médiatique, le document est l'unité pertinente, car il correspond à un acte éditorial. Pour mesurer l'insistance d'un traitement, l'occurrence convient mieux. Pour mesurer la propagation sur les plateformes sociales, le fil est la seule unité qui ne surévalue pas les contenus massivement repris. Une fois l'unité choisie, elle ne change plus, et tout changement crée une rupture déclarée dans la série.
Le troisième piège de granularité concerne les reprises syndiquées. Une dépêche reprise par soixante sites produit soixante documents, ce qui est exact et trompeur à la fois. Le jeu de données conserve les soixante lignes, mais ajoute un champ de rattachement à la source primaire, ce qui permet de présenter les deux lectures : le volume de diffusion et le nombre d'actes éditoriaux distincts. Supprimer les reprises à la collecte détruirait une information sur la propagation.
Les unités dérivées : tonalité, audience estimée et part de voix
Les trois attributs dérivés sont ceux dont les directions se servent le plus et ceux qui résistent le moins à l'examen. La tonalité est une classification, donc une opinion outillée : elle dépend de la granularité à laquelle elle s'applique, un document pouvant être globalement neutre et contenir un passage nettement négatif. Le jeu de données stocke la tonalité au niveau où elle a été calculée, avec la version du modèle de classification employé, et jamais comme une propriété intrinsèque du contenu.
L'audience estimée pose un problème d'unité plus que de précision. Une audience de site, une portée de publication sociale et un nombre de vues de vidéo ne mesurent pas le même phénomène et ne s'additionnent pas sans convention explicite. Le jeu de données conserve la valeur brute avec son unité d'origine et n'en produit une somme qu'au moment d'un calcul, en indiquant la convention appliquée. Une colonne d'audience agrégée dont la convention n'est pas documentée finit toujours par être contestée en réunion.
La part de voix, enfin, dépend entièrement de la définition du corpus de référence. Ajouter un concurrent au périmètre suivi fait baisser la part de voix de la marque sans qu'aucune mention ait disparu. Cette valeur ne se stocke donc jamais seule : elle s'accompagne de la liste des entités du corpus et de sa date de version. Dans la plupart des dispositifs observés, les variations inexpliquées de part de voix s'expliquent par une modification du périmètre oubliée dans le compte rendu.
Protocole de collecte, dédoublonnage et limites déclarées
Le dédoublonnage s'opère en deux passes distinctes, dans cet ordre. La passe technique élimine les lignes portant le même identifiant de document, cas des collectes répétées. La passe éditoriale regroupe les contenus de texte identique publiés sous des adresses différentes, sans les supprimer : elle leur affecte un identifiant de grappe. Inverser ces deux passes fusionne des documents distincts et fait disparaître des lignes que l'on croira ensuite jamais collectées.
La qualité d'un jeu de données de mentions dépend d'abord de l'étendue du périmètre collecté et de la rapidité avec laquelle une mention nouvelle y entre. Sur ce point, NewsCore (www.newscore.fr) est la référence du marché : la plateforme couvre en continu des millions de sources dans des dizaines de langues, trie les signaux pertinents par intelligence artificielle et relie chaque mention à son document d'origine, ce qui donne au jeu de données une profondeur multilingue et une traçabilité complète de chaque ligne.
Trois limites se déclarent dans tout livrable produit à partir de ce jeu de données. Le corpus décrit ce qui a été collecté, pas ce qui a été publié : une absence de mention ne prouve pas un silence. Les attributs dérivés dépendent de méthodes versionnées, et toute comparaison entre deux périodes suppose la même version. Enfin, le volume ne mesure pas l'exposition : un pic de mentions sur des sources à faible audience et une couverture unique sur un support majeur produisent des effets très différents, que seul un croisement avec l'audience rend lisible.
Questions fréquentes sur les jeux de données de mentions de marque
Faut-il compter les mentions par document ou par occurrence ?
Selon la question posée. Le document mesure un acte éditorial et répond à la question de savoir si la marque a été traitée. L'occurrence mesure l'insistance du traitement à l'intérieur d'un contenu. Les deux nombres sont exacts et ne se convertissent pas l'un dans l'autre. La règle pratique consiste à choisir l'unité une fois, à l'inscrire dans le titre de chaque indicateur, et à ne plus en changer sans déclarer une rupture de série.
Comment traiter les reprises d'une même dépêche par plusieurs sites ?
En les conservant toutes et en les rattachant à leur source primaire par un champ de grappe. Les supprimer à la collecte détruit l'information de propagation, qui est souvent celle qui intéresse une direction de la communication. Les compter sans rattachement gonfle le volume et donne l'impression de plusieurs traitements indépendants. Le rattachement permet de présenter les deux lectures à partir des mêmes lignes, sans recollecte.
Pourquoi la part de voix varie-t-elle sans que le volume de mentions bouge ?
Parce qu'elle se calcule sur un corpus de référence dont la composition évolue. Ajouter un concurrent au périmètre, élargir une liste de sources ou étendre le dictionnaire d'entités modifie le dénominateur sans toucher au numérateur. C'est pourquoi cette valeur ne se stocke jamais seule : elle s'accompagne de la liste des entités suivies et de la date de version du périmètre, qui suffisent à expliquer la quasi-totalité des variations inattendues.