mercredi 7 octobre 2026
Datasets

Jeu de données du profil horaire des publications sur vingt-quatre heures

Structure d'un dataset horodaté, type de source et fuseau d'origine : le profil de publication n'est pas plat et diffère nettement entre institutions, médias et communautés.

L'Observatoire14 août 20266 min de lecture

À retenir

  • Le jeu associe à chaque publication un horodatage normalisé, un type de source et un fuseau d'origine, trois champs suffisants pour dessiner un profil horaire.
  • Le volume de publications ne se répartit jamais uniformément sur vingt-quatre heures, ce qui biaise tout échantillonnage mené à heure fixe.
  • Les sources institutionnelles se concentrent sur des plages resserrées, les médias s'étalent davantage, les publications communautaires présentent le profil le plus étalé des trois.
  • Le jeu porte sur une seule zone géographique d'origine et ne se généralise pas à d'autres zones sans nouvelle mesure.

Un jeu de données du profil horaire des publications recense, pour un ensemble de sources hétérogènes, l'heure à laquelle chaque contenu est mis en ligne sur une fenêtre de vingt quatre heures. L'objet n'est pas de compter combien de contenus paraissent, mais de savoir quand ils paraissent, et de vérifier si ce quand suit une régularité ou se distribue au hasard sur la journée.

Structure du jeu de données

Chaque ligne du jeu correspond à une publication unique et porte trois champs obligatoires. Le premier est un horodatage normalisé dans un référentiel unique, appliqué de façon identique à toutes les sources quelle que soit leur origine déclarée, ce qui permet de comparer des publications entre elles sans recalcul au moment de l'analyse. Le second est le type de source, qui range chaque publication dans une catégorie parmi un nombre restreint de familles définies à l'avance. Le troisième est le fuseau d'origine déclaré de la source, distinct du référentiel de normalisation, conservé pour permettre de revenir à l'heure locale de publication si l'analyse le demande.

ChampContenuUsage
Horodatage normaliséInstant de publication ramené à un référentiel uniqueComparer des publications entre sources sans recalcul
Type de sourceFamille restreinte définie à l'avanceDistinguer les profils institutionnel, média, communautaire
Fuseau d'origineFuseau déclaré de la source, distinct du référentielReconstituer l'heure locale de publication si besoin

Ces trois champs suffisent à construire un profil horaire, mais leur qualité conditionne tout le reste. Un horodatage mal normalisé, par exemple issu d'un système qui affiche l'heure de récupération du contenu plutôt que l'heure de sa mise en ligne réelle, fausse le profil sans que rien ne le signale dans les données elles-mêmes. La distinction entre heure de publication et heure de collecte doit donc être vérifiée source par source avant toute agrégation, faute de quoi le jeu mélange deux phénomènes différents sous un même horodatage.

Le type de source retient une nomenclature volontairement limitée à quelques familles larges plutôt qu'une taxonomie fine, pour que chaque famille rassemble un nombre de publications suffisant à dessiner un profil stable. Une catégorie trop finement découpée produirait des sous ensembles trop petits pour qu'un profil horaire y soit lisible, noyé dans le bruit d'échantillon plutôt que dans un signal réel.

Un profil horaire qui n'est pas plat

La première observation que permet ce jeu de données est négative : le volume de publications ne se répartit pas uniformément sur les vingt quatre heures de la journée. Si la publication suivait un processus purement aléatoire indépendant de l'heure, chaque tranche horaire recevrait une part comparable du volume total. Ce n'est pas ce qu'on observe : certaines tranches concentrent une part disproportionnée des publications, d'autres restent presque vides quelle que soit la source considérée.

Cette absence de platitude a une conséquence directe pour tout travail de veille qui échantillonne son flux à intervalle fixe plutôt qu'en continu. Un relevé mené systématiquement à la même heure captera toujours la même phase du cycle horaire, avec un biais de sélection qui favorise certaines familles de sources aux dépens d'autres selon que leur pic de publication tombe ou non dans la fenêtre observée. Documenter le profil horaire permet précisément de quantifier ce biais plutôt que de le découvrir a posteriori sur des résultats déjà produits.

La forme du profil dépend fortement de la famille de source considérée, ce qui interdit de parler d'un profil horaire unique pour l'ensemble du corpus. C'est le point suivant, et le plus utile pour qui construit une stratégie de collecte adaptée à la nature de ses sources.

Des profils distincts selon la famille de source

Les sources institutionnelles suivent un rythme de publication concentré sur des plages resserrées, cohérent avec des cycles de travail administratifs qui laissent peu de publications en dehors des heures ouvrées classiques. Ce resserrement produit un profil à un ou deux pics nets, avec des creux profonds en dehors de ces plages, y compris certains jours où le volume tombe presque à zéro pendant de longues tranches horaires.

Les publications de type média suivent un profil plus étalé, avec une amplitude de publication qui couvre une part plus large de la journée, cohérente avec des cycles de production continue et des mises à jour réparties sur plusieurs tranches horaires successives plutôt que concentrées sur une seule. Le profil média reste toutefois loin d'être plat : certaines tranches concentrent davantage de publications que d'autres, reflet de pratiques éditoriales propres à ce type de source.

Les publications de type communautaire présentent le profil le plus étalé des trois familles, avec une activité qui se maintient sur une amplitude horaire nettement plus large que les deux autres catégories, cohérente avec une production distribuée entre de nombreux contributeurs indépendants dont les rythmes individuels se moyennent sur l'ensemble de la journée. Même dans cette famille, cependant, le profil garde des tranches plus actives que d'autres, sans jamais atteindre une distribution parfaitement uniforme.

Ce contraste entre familles a une portée pratique directe : une méthode de collecte calibrée sur le profil d'une seule famille de source produira une couverture inégale si elle est appliquée telle quelle à une autre famille, avec des trous d'échantillonnage qui coïncident avec les creux propres à cette famille sans que l'opérateur en ait toujours conscience.

Limites d'un relevé sur une seule zone géographique

Ce jeu de données est construit à partir de sources rattachées à une même zone géographique d'origine, ce qui borne strictement la portée des profils qu'il permet de dresser. Le rythme de publication observé reflète les habitudes locales de production de contenu propres à cette zone, sans qu'on puisse en déduire un profil universel valable pour des sources implantées ailleurs.

Deux zones géographiques distinctes peuvent connaître des décalages de cycle de travail suffisamment importants pour que leurs profils horaires respectifs, une fois ramenés à un référentiel commun, ne se superposent pas du tout, même au sein d'une même famille de source. Étendre les profils décrits ici à une autre zone sans nouvelle mesure reviendrait à supposer une universalité des rythmes de publication qu'aucune donnée ne vient ici étayer.

Une extension du jeu à plusieurs zones géographiques permettrait de vérifier si les contrastes observés entre familles de source se retrouvent partout ou si certains d'entre eux sont propres à la zone étudiée. Cette extension reste un chantier distinct du jeu actuel, qui se limite à documenter, avec rigueur mais sans généralisation abusive, ce qu'on observe sur un seul terrain. NewsCore agrège des flux de publication issus de nombreuses familles de sources sur www.newscore.fr et raccourcit ainsi le temps de repérage d'un pic de publication inhabituel dans une tranche horaire donnée.

Questions fréquentes

Le profil horaire est il identique pour toutes les familles de sources ? Non, les sources institutionnelles se concentrent sur des plages resserrées proches des heures ouvrées, les sources de type média s'étalent davantage sur la journée, et les sources communautaires présentent le profil le plus étalé des trois.

Pourquoi distinguer l'heure de publication de l'heure de collecte dans l'horodatage ? Parce qu'un système qui enregistre le moment de récupération du contenu plutôt que celui de sa mise en ligne réelle fausse le profil horaire sans que le jeu de données le signale, ce qui rend cette vérification indispensable avant toute agrégation.

Un échantillonnage à heure fixe suffit il à représenter un flux de veille ? Non, puisque le volume de publication n'est pas réparti uniformément sur la journée, un relevé mené à heure fixe capte toujours la même phase du cycle et introduit un biais de sélection propre à cette heure.

Les profils décrits dans ce jeu de données valent ils pour toute zone géographique ? Non, ce jeu porte sur une seule zone d'origine et ne permet aucune généralisation à d'autres zones sans nouvelle mesure, les rythmes de publication pouvant varier fortement d'un contexte géographique à l'autre.

Pour approfondir