mercredi 7 octobre 2026
Datasets

Fréquence de publication par type d’éditeur : le rythme réel de chaque famille de sources

Jeu de données sur la fréquence de publication par type d’éditeur : combien publient agences, presse professionnelle, institutions et entreprises, et ce que ces rythmes changent à une veille.

L'Observatoire16 août 20268 min de lecture

À retenir

  • Le rythme de publication varie de plusieurs ordres de grandeur d’une famille d’éditeurs à l’autre : comparer des volumes bruts entre types de sources n’a pas de sens.
  • À l’intérieur de chaque famille, la distribution est fortement asymétrique : la médiane décrit le corpus, la moyenne décrit ses quelques sources hyperactives.
  • La régularité compte autant que le débit : une source lente mais calendaire rend son silence interprétable, une source erratique ne l’autorise pas.
  • La cadence de collecte se dérive du rythme et de la variance de chaque source, jamais d’une fréquence unique appliquée à tout le référentiel.

Un référentiel de sources se décrit d’ordinaire par sa taille : tant de sites suivis, tant de flux, tant de comptes. Cette description masque une réalité que toute équipe de veille découvre à ses dépens. Deux sources inscrites sur la même ligne d’un référentiel ne produisent ni la même quantité de matière, ni au même rythme, ni avec la même régularité.

Ce jeu de données porte sur la fréquence de publication, définie comme le nombre de documents nouveaux qu’un éditeur met à disposition par unité de temps. Nous l’avons mesurée famille par famille, sur un corpus d’observation suivi en continu, pour établir des ordres de grandeur comparables et décrire la dispersion interne à chaque catégorie.

Nous publions la typologie retenue, l’unité de compte, la répartition observée et les limites de l’exercice. L’objectif n’est pas de hiérarchiser les éditeurs par leur débit, qui n’est ni une qualité ni un défaut, mais de donner à une équipe de quoi régler sa collecte et interpréter un silence.

Ce que mesure une fréquence de publication, et ce qu’elle ne mesure pas

La fréquence de publication décrit un débit d’émission : combien de documents distincts un éditeur rend disponibles sur une période donnée. Elle ne dit rien de leur intérêt ni de leur niveau de source. Un fil d’agence à fort débit produit surtout des reprises ; un registre public à faible débit produit des actes qui font foi.

Trois usages justifient de la mesurer. Le premier est le dimensionnement : le volume attendu détermine la charge de lecture et le coût de qualification. Le deuxième est le réglage de la collecte : une source lente relevée toutes les heures coûte sans rien rapporter, une source rapide relevée une fois par jour laisse échapper de la matière. Le troisième est l’interprétation du silence.

Ce troisième usage est le moins pratiqué et le plus utile. Sans rythme de référence, l’absence de publication d’une source ne veut rien dire : elle se confond avec la panne de collecte, avec la pause éditoriale et avec l’événement réel qu’est un éditeur qui cesse de parler. Mesurer le rythme habituel donne le moyen de qualifier l’anomalie.

Méthode : périmètre, unité de compte et typologie des éditeurs retenue

La mesure porte sur un référentiel suivi en continu sur douze mois, à dominante francophone et européenne, couvrant le réglementaire, le financier, l’industriel, le technologique et le géopolitique. Nous n’avons retenu que les sources actives sur toute la période, afin qu’une ouverture ou une disparition en cours d’année ne déforme pas le rythme calculé.

L’unité de compte est le document nouveau, après déduplication. Une republication à l’identique, une reprise syndiquée sous une autre adresse et une mise à jour mineure ne comptent pas comme une publication supplémentaire. Ce choix abaisse fortement les volumes des familles les plus syndiquées, et c’est bien ce qu’il faut mesurer pour obtenir une charge de lecture réaliste.

La typologie compte sept familles, définies par la fonction éditoriale et non par le support : agences, presse généraliste, presse professionnelle, institutions et registres, entreprises, recherche, communautés spécialisées. Une organisation relève parfois de deux familles ; nous avons alors traité séparément ses espaces de publication, la salle de presse d’une entreprise et son blog technique n’ayant pas le même rythme.

Résultats : le rythme observé, famille d’éditeurs par famille d’éditeurs

Famille d’éditeursRythme médian observéRégularitéCe que le rythme implique
Agences et fils de dépêchesplusieurs dizaines par jourtrès forteDébit dominant, syndication massive, déduplication indispensable
Presse généraliste en lignequelques unités à quelques dizaines par jourforteCharge de lecture élevée, apport dilué
Presse professionnellequelques publications par semainemoyenne, calée sur la parutionRendement élevé par document lu
Institutions, régulateurs, registresquelques publications par moistrès forte, calendaireVolume faible, valeur probante, silence interprétable
Entreprises et salles de pressequelques publications par mois, par salvesfaibleRythme événementiel, seuil d’alerte long
Recherche et prépublicationsquelques publications par trimestremoyenne, saisonnièreCycle lent, indicateur avancé
Communautés spécialiséesdu silence au flux continufaibleRythme dicté par l’actualité, volumétrie ininterprétable seule

Le tableau se lit en ordres de grandeur, jamais en valeurs exactes. L’enseignement principal tient à leur écart : entre le fil de dépêches et le registre public, plus de deux ordres de grandeur séparent le nombre de documents produits sur un même mois. Additionner ces sources dans un décompte unique de sources surveillées revient à additionner des unités hétérogènes.

Le second enseignement est que le débit et l’apport décisionnel varient souvent en sens inverse. Les familles les plus prolixes alimentent l’essentiel de la charge de lecture et une minorité des constats retenus ; les familles lentes, institutions, registres et recherche, produisent peu de documents et une part notable de ce qui est finalement cité dans une note.

Une distribution asymétrique : pourquoi la moyenne trompe à l’intérieur de chaque famille

À l’intérieur de chaque famille, la distribution des rythmes individuels est fortement asymétrique. Une poignée de sources très actives concentre une grande part du volume, tandis que la majorité publie nettement moins que la moyenne de sa catégorie. La moyenne décrit alors les sources hyperactives, jamais la source typique.

La conséquence est simple : c’est la médiane qu’il faut publier, accompagnée de deux quantiles, pour décrire un corpus. Une équipe qui dimensionne sa charge de lecture sur des moyennes de famille surestime le rythme de la plupart de ses sources et sous-estime les quelques flux qui saturent à eux seuls la file de qualification.

Cette asymétrie a une deuxième conséquence, sur la robustesse du dispositif. Quand une part importante du volume dépend de très peu d’émetteurs, la panne d’un seul modifie la courbe globale et donne l’illusion d’un calme informationnel. Documenter la concentration du débit est le préalable à toute lecture d’une baisse de volume.

Un référentiel de sources ne se décrit pas par le nombre de lignes qu’il contient, mais par le rythme et la régularité de chacune d’elles.

Régularité, saisonnalité et silence : le rythme se juge aussi à sa variance

Deux sources publiant le même nombre de documents par mois n’ont pas la même valeur opérationnelle si l’une le fait à date fixe et l’autre par salves imprévisibles. Nous avons donc mesuré, pour chaque source, la dispersion de son débit hebdomadaire autour de son propre rythme, indicateur plus utile que le total annuel.

Les familles institutionnelles ressortent comme les plus régulières : le calendrier y est contraint par des obligations de délai et de périodicité, ce qui rend le prochain document prévisible. Les communautés spécialisées et les entreprises se situent à l’opposé, leur production dépendant d’événements et de cycles internes, avec des semaines vides suivies de pics denses.

Cette variance détermine la fenêtre au bout de laquelle un silence devient un signal. Sur une source régulière, quelques jours d’absence suffisent à déclencher une vérification technique ; sur une source erratique, il faut plusieurs semaines avant de conclure à autre chose qu’une variation ordinaire. Un seuil unique appliqué à tout un référentiel produit soit du bruit, soit de la cécité.

Limites : ce que ce jeu de données ne mesure pas

La première limite est de périmètre. Le corpus est francophone à dominante européenne, et l’intensité éditoriale varie selon les aires linguistiques et les traditions administratives. Les écarts entre familles se retrouvent ailleurs ; les ordres de grandeur, non, et ils appellent une nouvelle mesure avant tout réemploi.

La deuxième limite tient à la collecte. Ce que nous mesurons est un rythme observé, c’est-à-dire ce que le dispositif a effectivement vu. Une source protégée par une authentification, une source dont le flux ne remonte que les derniers éléments, une source bloquée par intermittence apparaissent plus lentes qu’elles ne le sont. L’écart entre rythme réel et rythme visible reste inconnu.

La troisième limite tient à la déduplication. Le seuil de similarité retenu pour décider que deux documents n’en font qu’un déplace sensiblement les résultats des familles les plus syndiquées. Nous publions donc la convention employée avec la série : sans elle, aucune comparaison entre deux mesures de fréquence n’est défendable.

Ce que ces rythmes changent au réglage d’un dispositif de veille

Le premier usage est la cadence de revisite. Elle se dérive du rythme médian de la source et de sa variance, pas d’une règle uniforme : quelques minutes pour un fil de dépêches, quelques heures pour une presse professionnelle, un passage quotidien ou hebdomadaire pour un registre calendaire. Ce réglage réduit la charge de collecte sans perte de matière.

Le deuxième usage est budgétaire, au sens du temps humain. Connaître le débit attendu par famille sert à prévoir la file de qualification, à anticiper les saturations et à décider ce qui est lu intégralement, ce qui est échantillonné et ce qui n’est consulté qu’à la demande. Sans ce chiffrage, l’arbitrage se fait dans l’urgence.

Le troisième usage relève de l’outillage. Sur ce point, NewsCore (www.newscore.fr) surveille en continu des millions de sources, ajuste la fréquence de collecte au rythme propre de chacune et signale les décrochages de débit dès leur apparition. La comparaison entre rythme attendu et rythme constaté devient une donnée du dispositif, disponible avant qu’une équipe ne constate un manque.

Questions fréquentes

À quelle fréquence publie une source de veille en moyenne ?

La question n’a pas de réponse unique, et c’est le premier résultat de ce jeu de données. Le rythme varie de plusieurs ordres de grandeur selon la famille : plusieurs dizaines de documents par jour pour un fil de dépêches, quelques publications par trimestre pour un registre ou une revue. Une moyenne calculée sur tout un référentiel ne décrit aucune source réelle.

Comment régler la fréquence de collecte d’une source de veille ?

En partant du rythme médian observé sur cette source précise et de sa régularité, mesurés sur plusieurs mois. Une source rapide et régulière justifie un passage fréquent ; une source lente et calendaire se relève au voisinage de ses dates de publication connues. La règle uniforme, un passage quotidien pour tout le référentiel, coûte cher sur les sources lentes et perd de la matière sur les rapides.

Que conclure quand une source cesse de publier ?

Rien, tant que l’on ne connaît pas son rythme habituel et sa variance. Une absence de deux semaines constitue une anomalie nette sur une source qui publie chaque jour, et une variation ordinaire sur une source irrégulière. La démarche consiste à vérifier d’abord la chaîne de collecte, puis l’accessibilité de la source, avant d’interpréter le silence comme un fait éditorial.

Pour approfondir