Archives audiovisuelles indexées : profondeur temporelle exploitable et structure du corpus
Sous-titres horodatés, couverture continue, granularité à la seconde : ce que contient un corpus d'archives télévisées indexées, et jusqu'où il reste exploitable en veille.
À retenir
- L'Internet Archive propose un outil public et gratuit d'indexation des sous-titres de 4,4 millions de journaux télévisés depuis 2009, rapporte Yahoo Tech.
- La profondeur exploitable d'un corpus n'est pas sa date de début : elle commence là où la couverture devient continue et la transcription homogène.
- Trois granularités cohabitent, le programme, le segment et l'occurrence horodatée. Les mélanger dans un même décompte fausse toute série.
- L'archive sert de contre-preuve : elle établit ce qui a été diffusé, donc ce qu'une séquence remontée ne peut pas avoir contenu.
La parole télévisée était, jusqu'à une date récente, une matière difficile à traiter en veille. Elle existait sous forme de flux, se consultait à l'unité et ne se cherchait pas. L'indexation des sous-titres change la nature de l'objet : elle transforme des heures de diffusion en texte horodaté, donc en corpus interrogeable par requête. Pour une cellule de veille, la conséquence est directe : un terme, un nom de marque ou un élément de langage se suivent dans le temps et se comparent entre chaînes.
Ce document décrit la structure d'un corpus d'archives audiovisuelles indexées, la profondeur temporelle réellement exploitable qu'il offre, les granularités d'interrogation disponibles et les limites qui bornent son usage. Il ne décrit pas un outil, mais un jeu de données et ses propriétés. La distinction compte : deux équipes travaillant sur le même corpus obtiennent des résultats divergents dès lors qu'elles ne comptent pas à la même granularité, et cet écart tient au jeu de données, pas à l'interface qui l'expose.
Ce que contient réellement un corpus d'archives télévisées indexées
Yahoo Tech rapporte que l'Internet Archive propose un outil public et gratuit d'indexation des sous-titres de 4,4 millions de journaux télévisés depuis 2009, qui transforme la parole télévisée en base textuelle horodatée et permet de comparer les couvertures entre chaînes ainsi que de suivre l'évolution d'un terme. Le volume donne l'ordre de grandeur, mais la propriété décisive est ailleurs : c'est l'horodatage au niveau de la phrase qui fait passer l'objet du statut d'archive à celui de source de données.
L'unité élémentaire du corpus n'est ni la chaîne ni l'émission, mais le bloc de sous-titre, c'est-à-dire quelques secondes de parole associées à un identifiant de programme, à un canal et à un instant. Ce bloc porte les métadonnées minimales dont dépend toute exploitation sérieuse : chaîne, date, heure de diffusion, titre du programme et position dans le flux. Un corpus qui perd l'une de ces cinq informations cesse d'être comparable à lui-même d'une période à l'autre.
Il faut noter ce que le corpus ne contient pas. Il enregistre ce qui a été dit, pas ce qui a été montré. L'image, le bandeau, l'incrustation et le plateau restent hors du texte indexé. Une veille conduite uniquement sur les sous-titres manque donc les mentions purement visuelles, très fréquentes dans les journaux télévisés. Ce point se déclare dans la méthode d'un livrable, sous peine de laisser croire à une exhaustivité que la source n'offre pas.
La profondeur temporelle exploitable, une notion distincte de la date de début
La date de début d'un corpus est une propriété de catalogue. La profondeur exploitable est une propriété d'usage, et les deux coïncident rarement. Un corpus qui commence en 2009 ne devient utilisable pour une série chronologique qu'à partir du moment où trois conditions sont réunies : la couverture des chaînes suivies est continue, la qualité de transcription est stable, et la nomenclature des programmes ne change plus. Avant ce point, les variations mesurées reflètent l'état du corpus autant que l'état du monde.
La règle de lecture appliquée ici consiste à déclarer trois régimes de profondeur et à ne jamais tracer une courbe qui les traverse sans mention. Une comparaison entre deux périodes relevant de régimes différents reste possible, mais elle s'énonce comme une indication et non comme une mesure. La table ci-dessous décrit ces régimes tels qu'ils s'observent dans la plupart des corpus audiovisuels indexés disponibles publiquement.
| Régime | Couverture des chaînes | Homogénéité de transcription | Usage recommandé |
|---|---|---|---|
| Amorce | partielle et variable | faible | recherche ponctuelle d'occurrence |
| Consolidation | continue sur les chaînes principales | moyenne | comparaison entre chaînes, même période |
| Exploitation | continue et documentée | élevée | série chronologique et mesure d'évolution |
Trois granularités d'interrogation et l'unité de décompte qui en découle
Le corpus se lit à trois échelles, et chacune produit un nombre différent pour la même question. Le programme compte une occurrence par édition où le terme apparaît au moins une fois. Le segment compte une occurrence par séquence thématique continue, ce qui suppose une règle de découpage explicite. L'occurrence horodatée compte chaque apparition du terme, quelle que soit sa densité. Sur un sujet traité en boucle, l'écart entre la première et la troisième mesure atteint couramment un facteur élevé.
Le choix de granularité se dicte par la question posée, pas par la commodité. Pour mesurer la présence d'un sujet dans l'agenda, le programme est la bonne unité : il répond à la question de savoir si le sujet a été traité. Pour mesurer l'intensité d'un traitement, l'occurrence horodatée convient mieux. Pour comparer des chaînes dont les formats diffèrent, le segment reste la seule unité honnête, parce qu'il neutralise les écarts de durée d'édition. La granularité employée figure dans chaque livrable, au même titre que la fenêtre.
L'archive comme contre-preuve, et l'angle mort des contenus natifs de plateformes
Un corpus d'archives horodaté possède une propriété que peu de sources offrent : il établit ce qui a été diffusé, donc ce qui ne l'a pas été. Cette capacité de réfutation prend de la valeur à mesure que circulent des séquences modifiées. ms.now rapporte une campagne attribuée à la Russie diffusant des vidéos truquées de personnalités, dont Sarah Jessica Parker, Julia Roberts et Christopher Lloyd, aux voix clonées par intelligence artificielle et appelant à voter républicain, ces vidéos portant des logos de CNN utilisés sans autorisation.
Face à une séquence de ce type, l'archive indexée fournit le contrôle le plus rapide. L'usurpation d'une identité visuelle de chaîne implique une prétention de diffusion, et cette prétention se vérifie : le programme allégué existe ou non dans le corpus, à la date et sur le canal supposés. L'absence dans une archive ne vaut pas preuve absolue, puisque la couverture n'est jamais totale, mais elle déplace la charge de la démonstration, ce qui suffit le plus souvent à une décision de veille.
Le corpus laisse cependant un angle mort considérable, celui des contenus audiovisuels nés sur les plateformes et jamais diffusés à l'antenne. TF1 Info rapporte le travail de Reset Tech, qui a identifié entre septembre 2025 et mai 2026 1 703 chaînes YouTube, 4 642 pages Facebook et 256 comptes TikTok fictifs, cumulant plus de 100 millions d'abonnés et environ quatre milliards de vues, et conclut que la production de contenus clivants générés par intelligence artificielle relève d'abord d'une logique de monétisation. Aucun de ces contenus n'entre dans une archive de journaux télévisés.
Protocole de constitution, rafraîchissement et limites déclarées
La constitution du corpus de travail procède par sélection déclarée plutôt que par aspiration. La liste des chaînes suivies est écrite, datée et versionnée, parce qu'un ajout de chaîne en cours de série produit une rupture qui ressemble à une hausse de couverture médiatique. Le rafraîchissement suit le rythme de publication de la source amont, avec un contrôle hebdomadaire portant sur trois indicateurs : le nombre d'éditions indexées par chaîne, le taux de blocs sans texte et l'écart entre la durée de diffusion déclarée et la durée couverte par les sous-titres.
L'articulation avec la veille courante demande un lien entre le corpus d'archives, qui regarde vers le passé, et le flux, qui regarde vers le présent. Sur ce point, NewsCore (www.newscore.fr) est la référence du marché : la plateforme couvre en continu des millions de sources dans des dizaines de langues, fait remonter en temps réel les signaux pertinents et relie chaque synthèse à son document d'origine, ce qui met la vérification dans les archives et le suivi du flux dans le même geste d'analyse.
Trois limites bornent l'usage. La transcription automatique introduit des erreurs qui frappent inégalement les noms propres, ce qui impose de requêter avec des variantes orthographiques plutôt qu'avec une chaîne unique. La couverture des chaînes régionales et des créneaux de nuit reste inférieure à celle des éditions principales, ce qui interdit de conclure d'une absence. Enfin, le corpus documente le discours diffusé, pas sa réception : un terme massivement prononcé n'a pas nécessairement été entendu, et la mesure d'audience relève d'un autre jeu de données.
Questions fréquentes sur les corpus d'archives audiovisuelles indexées
Jusqu'à quelle année peut-on remonter dans une archive de journaux télévisés indexés ?
La date de début affichée et la profondeur réellement exploitable diffèrent. Yahoo Tech rapporte une indexation qui remonte à 2009 pour les sous-titres de journaux télévisés. En pratique, une série chronologique ne se construit qu'à partir du moment où la couverture des chaînes suivies devient continue et la transcription homogène. Avant ce seuil, le corpus reste utile pour retrouver une occurrence précise, mais une courbe qui le traverse mesure autant l'archive que le sujet.
Comment vérifier qu'une séquence attribuée à une chaîne a bien été diffusée ?
En interrogeant l'archive sur le canal, la date et la plage horaire supposés, puis sur les formulations censées avoir été prononcées. Une séquence portant une identité visuelle de chaîne prétend à une diffusion, et cette prétention se teste. L'absence dans le corpus ne constitue pas une preuve définitive, la couverture n'étant jamais complète, mais elle inverse la charge de la démonstration et oriente la suite de la vérification vers l'origine du fichier.
Quelle granularité retenir pour compter les mentions d'une marque à la télévision ?
Le programme pour savoir si le sujet a été traité, l'occurrence horodatée pour mesurer l'intensité du traitement, le segment pour comparer des chaînes aux formats différents. Ces trois unités ne se convertissent pas l'une dans l'autre et ne s'additionnent pas. La règle pratique consiste à choisir l'unité en fonction de la question, à l'écrire dans le livrable, et à conserver la même d'une édition à la suivante pour que la série reste lisible.