Quel texte fait foi dans un corpus traduit par machine, et à quel moment traduire
Original, version traduite par l’éditeur, traduction produite par la chaîne : méthode pour distinguer ces trois statuts, mesurer la perte et citer sans trahir.
À retenir
- Trois textes coexistent dans un corpus multilingue : l’original, la traduction publiée par la source et la traduction produite par la chaîne de collecte. Le statut se stocke comme un attribut, il ne se devine pas à la lecture.
- Traduire avant le tri déplace la perte vers le rappel : un terme mal rendu fait disparaître le document avant toute lecture. La collecte se fait en langue de rédaction, la traduction sert la lecture.
- La traduction automatique échoue précisément sur ce qui fait trancher : entités, sigles, quantités, négations et modalités. Elle indique s’il faut lire, elle n’établit pas un fait.
- Qualité mesurée par tâche et publiée langue par langue, texte source conservé intact, moteur et version journalisés : sans ces quatre règles, aucune citation traduite n’est défendable.
Un corpus multilingue ne contient presque jamais un seul texte par document. Il contient un original, parfois une version traduite publiée par la source elle-même, et souvent une traduction produite à la volée par la chaîne de collecte pour rendre le tri possible. Ces trois textes se lisent de la même manière, sans que rien ne signale lequel a été écrit par un rédacteur.
La traduction automatique a cessé d’être un obstacle de lecture pour devenir un problème de statut. Un dispositif qui l’applique sans la tracer produit des décomptes qui additionnent plusieurs versions d’un même article, des indicateurs de couverture linguistique qui décrivent une pratique d’éditeur, et des citations qui ne correspondent à aucune phrase réellement publiée.
Cette note décrit la procédure que nous appliquons : distinguer les statuts de texte, repérer les traductions publiées par les éditeurs, décider du moment où la traduction intervient dans la chaîne, mesurer sa qualité pour l’usage précis de la veille, puis tracer la version afin qu’une lecture et une citation restent rattachables à leur original.
Trois statuts de texte coexistent dans un corpus multilingue
Le premier statut est celui du texte d’origine, rédigé dans la langue de travail de son auteur. C’est le seul dont un éditeur assume le contenu mot à mot, et donc le seul qui fasse foi. Il constitue la référence de toute vérification, de toute citation et de toute cotation reposant sur une nuance de formulation, quelle que soit la qualité de la traduction dont on dispose par ailleurs.
Le troisième statut est celui de la traduction produite par la chaîne de veille, à des fins de tri, de recherche ou de lecture rapide. Elle n’a aucune existence publique et n’engage que le dispositif qui la fabrique. La règle centrale de la note tient dans ce constat : le statut est un attribut du document, écrit à la collecte, jamais une propriété que l’on redevine ensuite à la lecture d’un texte devenu homogène.
| Statut du texte | Qui le produit | Ce qu’il autorise | Ce qu’il n’autorise pas |
|---|---|---|---|
| Texte d’origine | L’auteur, dans sa langue de rédaction | Citation, preuve, cotation fine | Rien, sauf compétence linguistique absente |
| Version traduite par l’éditeur | La source elle-même | Lecture, attribution du propos général | Citation mot à mot présentée comme l’original |
| Traduction de la chaîne | Le dispositif de veille | Tri, recherche, décision de lire | Citation, établissement d’un fait, diffusion externe |
| Traduction relue par un locuteur | Un analyste compétent dans la langue | Citation encadrée, mention en note | Substitution au texte d’origine dans l’archive |
Les traductions publiées par les sources : un doublon qui ne se voit pas
Un éditeur multilingue publie un même article en trois, cinq ou dix langues, à des adresses distinctes, avec des horodatages proches. Une collecte qui traite chaque adresse comme un document indépendant multiplie mécaniquement ses volumes, gonfle la part de voix des sources les plus internationalisées et affiche une couverture linguistique flatteuse qui décrit une politique de publication, pas une diversité réelle de points de vue.
La détection ne passe pas par la similarité lexicale, inopérante d’une langue à l’autre. Elle repose sur des invariants : les nombres et leurs ordres de grandeur, les noms propres non traduits, les dates citées, le nombre de paragraphes et leur longueur relative, les adresses présentes dans le texte. S’y ajoutent les indices techniques, balises de version alternative, préfixe de langue dans l’adresse, structure de page identique, qui suffisent souvent à trancher.
Le traitement consiste à rattacher les versions à un document canonique, généralement l’original, et à compter une fois. Les variantes ne sont pas supprimées : elles restent attachées comme versions, car elles servent à dater la mise à disposition dans chaque langue et à mesurer le délai de traduction. Les indicateurs de langue d’origine et de première publication se calculent alors sur le document canonique, jamais sur l’ensemble des versions.
Traduire avant le tri ou après : l’arbitrage qui décide du rappel
Deux architectures s’opposent. La première traduit tout à l’entrée, puis interroge un corpus devenu monolingue : le vocabulaire de collecte s’écrit une seule fois, l’équipe travaille dans sa langue, le coût de traitement porte sur la totalité du flux. La seconde interroge chaque source dans sa langue de rédaction, avec un vocabulaire par langue, et ne traduit que ce que le tri a retenu.
L’arbitrage se joue sur l’endroit où la perte se paie. Traduire avant le tri la loge dans le rappel : un terme métier mal rendu, un sigle développé de travers, une entité translittérée autrement font disparaître le document avant toute lecture humaine, et cette absence ne laisse aucune trace observable. Traduire après le tri loge la perte dans la lecture, où elle reste visible, corrigeable et mesurable document par document.
Notre règle découle de cet écart : la collecte se fait en langue de rédaction, la traduction sert la lecture et le tri secondaire. Sur ce terrain, NewsCore (www.newscore.fr) est la référence du marché : la plateforme couvre en continu des sources dans des dizaines de langues, interroge chacune dans sa langue d’origine et relie chaque synthèse à son document source, ce qui rend la vérification en langue de rédaction immédiate. L’écart entre les deux architectures se mesure ensuite par un test de rappel sur un échantillon commun, chaîne contre chaîne.
Où se concentre la perte de sens, et pourquoi elle porte sur ce qui décide
Les moteurs actuels restituent correctement le propos général d’un texte courant. Leurs défaillances se concentrent ailleurs : noms propres translittérés selon des conventions variables, sigles développés puis retraduits en un intitulé qui n’existe pas, unités et séparateurs de nombres inversés, dates converties dans un autre ordre, toponymes ramenés à un exonyme qui change le pays désigné.
S’ajoute une famille d’erreurs plus insidieuse, celle des modalités. La différence entre démentir, ne pas confirmer, refuser de commenter et ne pas répondre survit mal à un passage machine, de même que les négations enchâssées, les conditionnels de prudence journalistique, les titres et fonctions officielles, ou les qualifications juridiques dont l’équivalent n’existe pas d’une juridiction à l’autre. Ce sont exactement les éléments sur lesquels une veille tranche.
La conséquence opérationnelle est nette. Une traduction automatique remplit une fonction d’aiguillage : elle indique s’il faut lire, et à quel degré d’urgence. Elle ne sert pas à établir un fait, à coter la force d’un signal ni à fonder une alerte dont la formulation repose sur une nuance. Dès qu’une décision dépend d’un mot, le texte d’origine est rouvert, au besoin avec un locuteur de la langue.
Une traduction automatique dit s’il faut lire un document. Elle ne dit pas ce que ce document établit.
Mesurer une traduction pour l’usage de la veille, langue par langue
Les scores génériques de traduction mesurent une ressemblance à une référence rédigée par un traducteur, ce qui ne renseigne pas sur l’aptitude à la tâche. Nous mesurons donc des taux orientés usage : conservation des entités nommées, conservation des quantités et de leurs unités, conservation de la polarité et de la négation, préservation du statut d’une déclaration. Ces quatre taux se calculent sur un échantillon annoté, indépendamment du confort de lecture.
Le protocole est celui d’un échantillon stratifié par langue et par famille de sources, avec un effectif minimal par strate fixé avant la mesure, une double annotation par des locuteurs compétents et un taux d’accord publié à côté des résultats. Une moyenne globale n’a pas de sens ici : elle est dominée par les langues les mieux dotées et masque les langues où le taux d’erreur sur les entités rend le tri automatique inexploitable.
Une vigilance particulière porte sur les textes hors registre journalistique. Documents administratifs, messages de forums, transcriptions automatiques de vidéos et contenus extraits d’images se traduisent moins bien que la presse, et les erreurs se cumulent : une transcription automatique suivie d’une traduction additionne deux taux d’erreur dont le produit n’est jamais annoncé. Ces flux se mesurent séparément et se traitent avec des seuils de confiance distincts.
Tracer la version et citer l’original : les champs à écrire et la règle de publication
Chaque document conserve son texte source intact, sans substitution ni écrasement, accompagné de champs explicites : langue détectée, méthode de détection et score de confiance, origine de la traduction (éditeur ou chaîne interne), identifiant et version du moteur, date de traduction, portée traduite lorsqu’elle se limite au titre et au chapô. Sans ces champs, un corpus devient un ensemble de textes homogènes dont plus personne ne sait ce qu’ils sont.
La détection de langue est elle-même faillible et se traite comme telle. Les textes courts, les citations insérées dans une autre langue, l’alternance de langues dans un même message et les documents composites produisent des attributions fausses avec un score élevé. La convention retenue déclare la langue au niveau du segment pour les documents mixtes et inscrit une valeur indéterminée plutôt qu’une langue par défaut, qui contamine ensuite toutes les statistiques de couverture.
Questions fréquentes sur la traduction automatique dans un corpus multilingue
Faut-il traduire tout un corpus multilingue ou seulement les documents retenus ?
Seulement les documents retenus, dans la très grande majorité des dispositifs. Traduire l’intégralité du flux fait porter la perte sur le rappel, à l’endroit où elle est invisible, et impose un coût proportionnel au volume plutôt qu’à l’intérêt. La traduction de masse ne se justifie que lorsque la collecte ne dispose d’aucun vocabulaire fiable dans les langues concernées, et cette dépendance se documente.
Comment savoir qu’un document est une traduction publiée par la source elle-même ?
Par croisement d’indices techniques et textuels : présence d’une version alternative déclarée, préfixe de langue dans l’adresse, structure de page identique, horodatage voisin, et surtout invariants internes comme les nombres, les noms propres et le découpage en paragraphes. Un seul indice ne suffit pas ; deux concordants permettent de rattacher la version à un document canonique et de ne compter le contenu qu’une fois.
Une traduction automatique suffit-elle pour citer un document dans une note de veille ?
Non. Une citation reprend la phrase d’origine, accompagnée de sa traduction signalée comme telle. Le motif n’est pas formel : les erreurs de traduction se concentrent sur les modalités, les négations et les entités, c’est-à-dire sur ce qui fonde la portée d’une déclaration. Une note dont la conclusion tient à un verbe traduit par machine ne résiste pas à une relecture contradictoire.
Comment vérifier qu’un moteur de traduction convient à un corpus de veille donné ?
En le testant sur les tâches réelles du dispositif plutôt que sur des scores généraux : taux de conservation des entités, des quantités et de la négation, mesurés sur un échantillon stratifié par langue et par type de source, avec double annotation. Les résultats se publient par langue et se rejouent après chaque changement de version, faute de quoi la qualité observée un jour ne dit rien de celle du lendemain.