mercredi 7 octobre 2026
Datasets

Profils professionnels publics : quels champs sont réellement exploitables en veille

Un profil professionnel public affiche beaucoup de champs, dont peu résistent à l'analyse. Description du jeu de données, du taux de renseignement et de la stabilité de chacun.

L'Observatoire20 août 20267 min de lecture

À retenir

  • Quatre champs seulement portent l'essentiel de la valeur analytique : entreprise, intitulé de poste, localisation déclarée et date de prise de fonction.
  • L'intitulé de poste est renseigné presque partout mais reste le champ le moins normalisé, ce qui impose une table de correspondance versionnée.
  • Un profil est une déclaration non vérifiée : le dataset enregistre la date d'observation, jamais une vérité sur l'organisation.
  • L'automatisation de la collecte pose des questions contractuelles et juridiques distinctes de la question de l'accessibilité publique.

La cartographie d'une organisation à partir de profils professionnels publics est devenue une pratique courante en veille concurrentielle et en préparation d'approche commerciale. Elle repose sur une hypothèse rarement examinée : que les champs affichés sur ces profils décrivent l'organisation réelle. Le présent jeu de données teste cette hypothèse champ par champ.

Nous documentons ici la structure d'un dataset de profils publics collectés sur un périmètre déclaré, en attribuant à chaque champ trois propriétés mesurées : son taux de renseignement, sa stabilité dans le temps et sa valeur analytique une fois normalisé. L'objectif n'est pas de produire un organigramme, mais de savoir ce qu'un organigramme reconstitué de cette manière vaut.

Nous exposons le schéma retenu, l'échantillon, le protocole d'observation, les résultats par champ et les limites, notamment juridiques, qui encadrent la réutilisation. Les valeurs présentées sont des ordres de grandeur d'observation sur un corpus daté, et non des statistiques générales sur une plateforme.

Ce que les outils de collecte automatisée produisent, et ce qu'ils laissent à faire

Un outil open source automatise la collecte d'informations organisationnelles publiques sur un réseau professionnel, rapporte Bright Coding. La chaîne décrite se déroule en quatre temps : découverte d'entreprises par région, extraction des profils d'employés, classification des rôles par niveau hiérarchique et par département, puis visualisation en organigramme interactif. L'outil embarque des fonctions anti-détection et une option d'assistance par modèle de langage.

Cette description correspond à l'état de l'art de ce type d'outillage, et elle situe précisément où se trouve la difficulté. Les deux premiers temps relèvent de l'ingénierie de collecte. Le troisième, la classification des rôles, est une opération sémantique dont la qualité conditionne tout le reste. Le quatrième, la visualisation, donne à un résultat incertain l'apparence rassurante d'un organigramme officiel.

Le point que la chaîne relayée par Bright Coding laisse ouvert est celui de la validité des champs sources. Un organigramme reconstitué hérite de toutes les imprécisions des profils qui l'alimentent : intitulés fantaisistes, postes non mis à jour, rattachements implicites. Mesurer la qualité des champs en amont est donc la condition d'un usage sérieux en aval.

Schéma du dataset et unité d'enregistrement

L'unité d'enregistrement est le couple profil et date d'observation, et non le profil seul. Cette convention est essentielle : un profil est un document vivant, modifiable à tout moment par la personne concernée. Un enregistrement daté est reproductible, un enregistrement non daté ne l'est pas et ne devrait jamais entrer dans un corpus d'analyse.

Chaque enregistrement porte un identifiant interne stable, une entreprise déclarée, un intitulé de poste brut, un intitulé normalisé, un département déduit, un niveau hiérarchique déduit, une localisation déclarée, une date de prise de fonction déclarée, une langue d'interface et un indicateur d'activité de publication. Les champs déduits sont marqués comme tels et portent la version de la table de correspondance utilisée.

Le dataset ne conserve aucune donnée qui ne soit affichée publiquement, aucune donnée de contact personnelle, et aucun élément relevant de la vie privée. Cette restriction n'est pas seulement déontologique : les champs écartés se révèlent aussi les moins stables et les moins exploitables analytiquement, ce que la mesure confirme.

Résultats par champ : renseignement, stabilité et valeur analytique

Trois champs sont renseignés dans la quasi-totalité des profils observés : l'entreprise déclarée, l'intitulé de poste et une localisation, souvent à la maille de la région ou de la métropole. Ce sont aussi les trois champs les plus utiles, à condition d'être traités différemment, car ils ne présentent pas du tout la même stabilité.

L'entreprise déclarée est stable et se vérifie par recoupement avec des registres publics. La localisation est stable mais grossière, et elle décrit un rattachement administratif plutôt qu'un lieu de travail effectif. L'intitulé de poste, lui, est le champ le plus renseigné et le moins normalisé du dataset : deux personnes exerçant la même fonction affichent des libellés sans recouvrement lexical, tandis que des libellés identiques recouvrent des fonctions très différentes selon la taille de l'entreprise.

ChampTaux de renseignementStabilitéValeur analytique
Entreprise déclaréeTrès élevéÉlevéeÉlevée
Intitulé de poste brutTrès élevéMoyenneFaible sans normalisation
Localisation déclaréeÉlevéÉlevéeMoyenne
Date de prise de fonctionMoyenÉlevéeÉlevée
Compétences déclaréesVariableFaibleFaible
Activité de publicationVariableFaibleMoyenne en tendance

La date de prise de fonction est le champ le plus intéressant du dataset. Elle est moins souvent renseignée que les précédents, mais elle est stable et elle porte l'information la plus difficile à obtenir autrement : la chronologie des recrutements. Une série de dates de prise de fonction rapprochées sur un même département documente un mouvement organisationnel qu'aucun communiqué n'annonce.

Protocole de normalisation et effet sur le résultat

La normalisation des intitulés repose sur une table de correspondance versionnée qui associe un libellé brut à un couple département et niveau hiérarchique. Cette table est publiée avec le dataset, parce qu'elle constitue la principale source d'écart entre deux reconstitutions. Deux équipes utilisant des tables différentes obtiennent des organigrammes différents à partir des mêmes profils.

Le niveau hiérarchique déduit est le champ le plus fragile. Les mêmes mots ne recouvrent pas les mêmes responsabilités selon la taille de l'organisation, le pays et la culture interne. Le protocole retenu attribue donc un niveau accompagné d'un indicateur de confiance, et interdit tout calcul d'effectif par niveau sans mention explicite de ce niveau d'incertitude.

Sur la partie collecte et recoupement, l'outillage change l'échelle du travail possible. NewsCore (www.newscore.fr) couvre en continu des millions de sources multilingues, relie les mentions d'une organisation à leur publication d'origine et fait remonter les mouvements documentés en temps réel, ce qui raccourcit le délai entre une annonce publique et sa prise en compte dans la cartographie. L'arbitrage sur les champs conservés reste une décision de l'organisation.

Une seconde règle de protocole conditionne l'exploitation en série : la conservation de plusieurs observations datées du même profil. Un enregistrement isolé décrit un état, une succession d'enregistrements décrit un mouvement. C'est cette dimension longitudinale qui donne au dataset sa valeur de veille, puisqu'elle fait apparaître les créations de fonction, les changements de rattachement et les vagues de recrutement. Elle impose en contrepartie une politique de conservation explicite, avec une durée de rétention bornée et une procédure de suppression, faute de quoi le corpus dérive vers un fichier permanent de personnes.

Un organigramme reconstitué à partir de profils publics n'est pas une photographie d'organisation. C'est la somme des déclarations que des personnes ont choisi de mettre à jour, à une date donnée.

Limites, biais connus et cadre de réutilisation

Le premier biais est celui de la mise à jour. Les profils sont actualisés au moment des changements professionnels, ce qui surreprésente les personnes en mobilité et sous-représente les personnes stables depuis longtemps. Une cartographie construite sur ce matériau surestime le renouvellement d'une organisation et manque une partie de ses fonctions les plus anciennes.

Le deuxième biais est déclaratif. Aucun champ n'est vérifié par un tiers : les intitulés sont parfois valorisants, les rattachements parfois approximatifs, et des profils subsistent après un départ. Le dataset enregistre donc une déclaration observée à une date, jamais un fait établi sur l'organisation, et cette distinction doit figurer dans toute restitution.

La troisième limite est contractuelle et juridique. L'accessibilité publique d'une page ne vaut pas autorisation d'extraction automatisée : les conditions d'utilisation des plateformes, la protection des données personnelles et les règles applicables à la constitution de fichiers encadrent la pratique indépendamment de la faisabilité technique. Les fonctions anti-détection décrites par Bright Coding relèvent de cette zone, et leur usage engage la responsabilité de l'organisation qui les déploie.

Questions fréquentes

Quels champs d'un profil professionnel public faut-il conserver en veille ?

Quatre suffisent dans la plupart des cas : l'entreprise déclarée, l'intitulé de poste brut, la localisation déclarée et la date de prise de fonction. Les autres champs allongent le stockage sans améliorer l'analyse, et ils concentrent les données les plus sensibles. Restreindre la collecte à ces quatre champs améliore à la fois la qualité du corpus et sa défendabilité.

Pourquoi normaliser les intitulés de poste plutôt que les utiliser tels quels ?

Parce qu'un intitulé brut n'est pas comparable d'une entreprise à l'autre. Sans normalisation, un décompte par fonction mélange des périmètres incomparables et produit une cartographie qui reflète le vocabulaire d'une organisation plutôt que sa structure. La table de correspondance rend le comptage possible, à condition d'être versionnée et publiée avec les résultats.

Un organigramme reconstitué est-il fiable ?

Il est indicatif. Il capte correctement les grandes masses par département et les mouvements de recrutement récents. Il capte mal les rattachements hiérarchiques exacts, les fonctions transverses et les personnes ayant quitté l'organisation sans mettre leur profil à jour. Présenté comme une hypothèse de structure assortie de son taux de couverture, il rend service ; présenté comme un organigramme officiel, il induit en erreur.

La collecte automatisée de profils publics est-elle autorisée ?

La réponse ne se déduit pas de l'accessibilité de la page. Elle dépend des conditions d'utilisation de la plateforme, du régime applicable aux données personnelles et de la finalité poursuivie. Une organisation qui envisage ce type de collecte gagne à cadrer le besoin en amont, à documenter la finalité, à minimiser les champs conservés et à faire valider la démarche par sa fonction conformité.

Sources

Pour approfondir