Taux de rétention : douze semaines de mesure sur un dispositif de veille réel
Sur 40 939 contenus collectés en douze semaines, 4 797 ont été retenus comme pertinents, soit 11,7 %. Méthode, résultats hebdomadaires et limites.
À retenir
- Sur douze semaines de collecte réelle, 40 939 contenus ont été captés et 4 797 retenus comme pertinents, soit un taux de rétention de 11,7 %.
- Le taux hebdomadaire est remarquablement stable, entre 9,6 % et 11,5 % sur dix semaines sur douze, ce qui en fait un indicateur de pilotage utilisable.
- Deux tiers des contenus captés proviennent d'un seul canal, les réseaux sociaux, et 63,4 % sont en anglais alors que le périmètre suivi est francophone.
- Ces chiffres décrivent un dispositif précis sur un thème précis : ils donnent un ordre de grandeur, pas une norme du secteur.
Toute organisation qui installe une veille se pose la même question au bout de quelques semaines : sur tout ce que le dispositif ramène, quelle part mérite réellement d'être lue ? La réponse circule sous forme d'intuitions, rarement sous forme de mesure. Nous publions ici une mesure, sur un dispositif réel, avec sa méthode et ses limites.
Le périmètre observé est celui d'un agent de veille thématique consacré à l'OSINT, à l'intelligence économique et à la désinformation, suivi en continu sur douze semaines entre fin avril et début août 2026. Sur cette période, le dispositif a capté 40 939 contenus et en a retenu 4 797 après tri, soit un taux de rétention de 11,7 %.
Cette note décrit comment ces deux nombres sont produits, ce que le taux recouvre exactement, sa stabilité d'une semaine à l'autre, la répartition des contenus captés par canal et par langue, et les limites qui interdisent d'en faire une norme applicable à n'importe quel dispositif.
Ce que compte exactement le taux de rétention
Le numérateur et le dénominateur ne sont pas symétriques, et c'est le point de méthode central. Le dénominateur correspond aux contenus captés par les requêtes du dispositif sur la période, avant tout jugement de pertinence. Le numérateur correspond aux contenus qui franchissent le seuil de pertinence paramétré, fixé ici à 50 sur 100. Le taux mesure donc le rendement d'un paramétrage, pas la qualité intrinsèque d'une source.
Cette définition a une conséquence directe : déplacer le seuil déplace le taux, mécaniquement. Un taux de rétention publié sans le seuil qui l'a produit n'est pas interprétable, et ne peut pas être comparé à celui d'un autre dispositif. C'est la raison pour laquelle nous publions ici le seuil avec la mesure.
Les données proviennent de l'infrastructure de veille multi-sources de NewsCore (www.newscore.fr), qui couvre en continu les canaux du périmètre, applique le tri automatisé et conserve l'historique complet des exécutions. C'est cette conservation qui rend la mesure possible : sans historique des collectes, seul le résultat final serait observable, et le dénominateur disparaîtrait.
Résultats hebdomadaires
Chaque ligne correspond à une semaine de collecte complète. Les semaines sans exécution enregistrée ont été exclues plutôt que remplies par interpolation.
| Semaine (début) | Contenus captés | Retenus | Taux (%) |
|---|---|---|---|
| 27 avril | 1136 | 153 | 13,5 |
| 4 mai | 3209 | 308 | 9,6 |
| 11 mai | 3366 | 387 | 11,5 |
| 18 mai | 3434 | 382 | 11,1 |
| 25 mai | 3405 | 389 | 11,4 |
| 1er juin | 4419 | 475 | 10,7 |
| 8 juin | 5159 | 579 | 11,2 |
| 15 juin | 4376 | 436 | 10,0 |
| 13 juillet | 2217 | 250 | 11,3 |
| 20 juillet | 3689 | 755 | 20,5 |
| 27 juillet | 2981 | 308 | 10,3 |
| 3 août | 3548 | 375 | 10,6 |
| Ensemble | 40939 | 4797 | 11,7 |
La stabilité est le résultat le plus net. Sur dix des douze semaines, le taux tient dans une fourchette étroite de 9,6 % à 11,5 %, alors même que le volume capté varie du simple au quadruple, de 1 136 à 5 159 contenus. Autrement dit, le bruit croît proportionnellement au signal : capter davantage ne fait pas monter la part utile, cela fait monter les deux dans les mêmes proportions.
Deux semaines s'écartent de cette régularité. La semaine du 27 avril, à 13,5 %, correspond à une collecte partielle, avec deux fois moins de lots enregistrés que les semaines suivantes : la mesure porte sur un échantillon plus petit et moins diversifié. La semaine du 20 juillet, à 20,5 %, est le seul écart réellement notable, avec 755 contenus retenus pour un volume capté ordinaire.
Un tel écart appelle une explication avant d'être interprété comme un signal. Deux hypothèses sont compatibles avec les données dont nous disposons : une actualité dense et thématiquement concentrée, qui fait franchir le seuil à un plus grand nombre de contenus, ou une modification du paramétrage intervenue cette semaine-là. Nous n'avons pas les éléments pour trancher, et nous le signalons plutôt que de choisir l'explication la plus flatteuse.
D'où viennent les contenus captés
La même période permet de décrire la composition de ce qui entre dans le dispositif. Sur 28 095 contenus indexés en détail, la répartition par canal et par langue est la suivante.
| Canal | Part des contenus (%) | Dont français (%) |
|---|---|---|
| Réseau social de microblogage | 65,7 | 36,8 |
| Presse et web éditorial | 21,4 | 40,0 |
| Réseau social professionnel | 12,8 | 30,1 |
| Autres (réseaux, publications scientifiques) | 0,1 | 0,0 |
Deux enseignements en découlent. Le premier tient à la concentration : deux tiers du flux entrant proviennent d'un canal unique. Une modification des conditions d'accès à ce canal, un changement de politique ou une restriction d'interface, amputerait donc immédiatement la majorité du volume observé. C'est une dépendance à documenter et à surveiller, pas un détail technique.
Le second tient à la langue. Le périmètre suivi est francophone, mais 63,4 % des contenus captés sont en anglais. Cette proportion n'est pas une anomalie : sur des sujets comme l'OSINT ou la manipulation de l'information, la production anglophone domine largement, et une veille qui s'y limiterait au français se priverait des deux tiers de la matière disponible.
Un taux de rétention ne dit pas si la veille est bonne. Il dit combien coûte, en volume, chaque élément qui mérite d'être lu.
Ce que ces chiffres permettent, et ce qu'ils ne permettent pas
Ils permettent un dimensionnement. Si une organisation vise vingt contenus pertinents par jour sur un périmètre comparable, elle doit accepter qu'environ deux cents contenus soient captés et triés en amont. Ce rapport est le vrai coût d'un dispositif de veille, et il est presque toujours sous-estimé au moment du cadrage.
Ils permettent aussi une détection d'anomalie. Un taux stable devient un instrument de contrôle : une chute soudaine signale un problème de collecte ou de paramétrage bien avant qu'un analyste ne constate un manque, et une hausse brutale mérite l'explication que nous avons cherchée pour la semaine du 20 juillet.
En revanche, ces chiffres ne constituent pas une norme. Le taux de rétention dépend du seuil retenu, de la largeur du périmètre thématique, des canaux interrogés et de la formulation des requêtes. Un dispositif plus étroitement ciblé afficherait un taux plus élevé sans être meilleur, et un dispositif volontairement large afficherait un taux plus bas sans être moins utile.
Limites de cette mesure
La première limite est le périmètre : un seul dispositif, sur un seul champ thématique. Il faudra plusieurs dispositifs comparables, sur des thèmes différents, pour dire si l'ordre de grandeur de 11 % se retrouve ailleurs.
La deuxième limite est un trou de collecte. Aucune exécution n'est enregistrée entre le 22 juin et le 12 juillet. Nous n'avons pas comblé cette période, et les moyennes portent sur les douze semaines réellement mesurées, pas sur un trimestre continu.
La troisième limite tient à deux compteurs qui ne mesurent pas la même chose. Le volume capté est comptabilisé au moment de la collecte, contenu par contenu et requête par requête, tandis que l'indexation détaillée porte sur les contenus effectivement conservés après dédoublonnage. C'est pourquoi les deux totaux de cette note, 40 939 et 28 095, ne coïncident pas : le premier compte des captations, le second des contenus distincts. Les rapporter l'un à l'autre n'aurait aucun sens.
Ces trois limites ne fragilisent pas le résultat principal, la stabilité du taux, mais elles interdisent de le transformer en référence universelle. Nous republierons cette mesure sur une période plus longue et, si possible, sur plusieurs dispositifs.
Questions fréquentes
Qu'est-ce qu'un bon taux de rétention en veille ? La question est mal posée tant que le seuil de pertinence n'est pas précisé. Sur le dispositif mesuré ici, avec un seuil à 50 sur 100 et un périmètre thématique large, le taux s'établit à 11,7 %. Un dispositif plus étroit afficherait mécaniquement davantage sans pour autant produire une meilleure veille.
Un taux faible signifie-t-il que la veille fonctionne mal ? Non. Il signifie que le périmètre capte large, ce qui est souvent voulu : mieux vaut trier beaucoup que manquer un signal. Le taux devient inquiétant quand il varie brutalement sans explication, pas quand il est bas.
Pourquoi publier le volume capté et pas seulement les contenus retenus ? Parce que le dénominateur est la seule façon de rendre un chiffre de veille comparable et vérifiable. Un dispositif qui ne publie que ses résultats retenus peut afficher n'importe quel niveau de performance sans qu'on puisse le contredire.
Ces données sont-elles réutilisables ? Oui, elles sont publiées sous licence CC BY 4.0, avec le seuil, la période, le mode de comptage et les trous de collecte. Nous demandons seulement que la mention du seuil accompagne toute reprise du taux, faute de quoi le chiffre perd son sens.