Combien de graphies pour un seul nom : ce que mesure la translittération dans un corpus francophone
Un même nom propre non latin peut s'écrire de plusieurs façons dans un corpus francophone : ce jeu de données chiffre ces variantes et le volume de documents manqués en mono-graphie.
À retenir
- Un même nom propre non latin apparaît en moyenne sous plusieurs graphies distinctes dans un corpus de veille francophone, le nombre variant fortement selon la langue d'origine.
- Interroger une seule graphie fait manquer une part significative des documents pertinents, part qui varie elle aussi selon le système d'écriture d'origine.
- Ce travail porte sur un même nom écrit différemment, un problème distinct des collisions où deux entités partagent une seule graphie.
- La couverture linguistique globale d'un corpus est une question voisine mais séparée : elle ne mesure pas la dispersion des graphies d'un même nom.
Un même nom, plusieurs graphies
Un nom propre écrit à l'origine dans un système autre que l'alphabet latin n'a, par définition, aucune orthographe latine unique. Chaque transposition vers le français résulte d'un choix parmi plusieurs conventions de translittération possibles, choix qui varie selon la source, l'époque de rédaction, la langue intermédiaire de passage et l'habitude propre à chaque rédaction. Le résultat, dans un corpus de veille francophone qui agrège des documents d'origines multiples, est qu'un même individu, une même organisation ou un même lieu peut apparaître sous plusieurs graphies distinctes, sans qu'aucune ne soit à proprement parler fautive.
Cette dispersion des graphies pose un problème directement opérationnel pour la veille : une requête construite sur une seule forme écrite ne retrouve qu'une partie des documents qui mentionnent pourtant le même nom. L'Observatoire a constitué un jeu de données pour chiffrer cette dispersion, plutôt que la supposer, et pour distinguer les langues d'origine où elle est marginale de celles où elle structure l'essentiel du bruit documentaire.
Construction du corpus et méthode
Le corpus retenu rassemble des documents francophones de veille courante, agrégés sur une période continue, dans lesquels un ensemble de noms propres non latins a été identifié puis rattaché à une entité de référence unique, indépendamment de la graphie utilisée dans chaque document. Ce rattachement s'appuie sur le contexte de la mention, la cooccurrence avec d'autres éléments identifiants et, lorsque c'est possible, un identifiant externe stable qui sert de pivot entre les graphies.
Pour chaque entité ainsi constituée, l'Observatoire dénombre les graphies distinctes rencontrées dans le corpus, en excluant les simples fautes de frappe isolées qui ne relèvent pas d'une convention de translittération différente. Les entités sont ensuite regroupées par langue ou système d'écriture d'origine, car la logique de transposition vers le français, et donc le nombre de variantes qu'elle engendre, diffère fortement d'un système à l'autre. Ce travail se distingue de celui consacré aux collisions de noms, qui traite le problème inverse, deux entités distinctes partagées sous une même graphie, et de celui consacré à la couverture linguistique globale d'un corpus, qui mesure la présence de langues sources plutôt que la dispersion des graphies d'un même nom.
Nombre moyen de variantes selon la langue d'origine
Le nombre de graphies distinctes par nom propre n'est pas uniforme : il dépend directement des propriétés du système d'écriture d'origine et des conventions de transposition en usage dans la presse et les bases documentaires francophones. Les systèmes qui notent peu ou pas les voyelles, ou qui autorisent plusieurs romanisations concurrentes reconnues chacune par une institution différente, produisent une dispersion nettement supérieure à celle des systèmes pour lesquels une convention de transposition dominante s'est imposée de longue date.
Le tableau suivant résume, par grande famille de systèmes d'écriture d'origine, le nombre moyen de graphies distinctes observées par nom et le taux de documents manqués lorsque la recherche se limite à la graphie la plus fréquente.
| Système d'écriture d'origine | Variantes moyennes par nom | Documents manqués en mono-graphie | Cause principale de la dispersion |
|---|---|---|---|
| Systèmes à romanisations concurrentes reconnues | Plusieurs graphies fréquentes | Part élevée | Absence de convention dominante unique |
| Systèmes peu ou pas vocalisés à l'écrit | Variantes fréquentes | Part élevée | Restitution incertaine des voyelles |
| Systèmes avec transcription intermédiaire par une autre langue | Variantes modérées | Part intermédiaire | Doubles emprunts successifs |
| Systèmes avec convention de transposition ancienne et stable | Peu de variantes | Part faible | Usage éditorial homogène de longue date |
La lecture par famille montre que la dispersion n'est pas un phénomène uniforme à traiter par une seule règle générale, mais une propriété propre à chaque système d'écriture, qui appelle un traitement différencié selon la langue d'origine des noms surveillés.
Cette lecture par famille a une conséquence pratique directe pour la construction d'un dispositif de veille : le nombre de graphies à anticiper pour un nom donné ne peut pas être fixé une fois pour toutes de façon générique, il doit être ajusté selon la langue d'origine du nom concerné. Un dispositif calibré sur l'hypothèse d'une seule variante par nom, hypothèse raisonnable pour les systèmes à convention de transposition ancienne et stable, sous estime largement le besoin réel de couverture dès qu'il traite des noms issus de systèmes à romanisations concurrentes ou peu vocalisés à l'écrit.
Le taux de documents manqués en mono-graphie
La conséquence directe de cette dispersion, pour une pratique de veille, est le volume de documents pertinents qu'une requête mono-graphie laisse de côté. L'Observatoire mesure ce taux en comparant, pour chaque entité de l'échantillon, le nombre de documents retrouvés par la graphie la plus fréquente au nombre total de documents rattachés à l'entité toutes graphies confondues. L'écart entre les deux constitue un angle mort directement chiffrable, propre à chaque famille de systèmes d'écriture.
Cet angle mort n'est pas réparti au hasard dans le temps ni dans les sources : les graphies minoritaires apparaissent plus souvent dans des publications spécialisées, des documents traduits d'une troisième langue, ou des sources qui reprennent une transcription plus ancienne qu'une convention devenue depuis dominante. Une veille qui n'interroge que la graphie la plus courante tend ainsi à sous représenter précisément les sources les moins alignées sur l'usage dominant, ce qui peut biaiser la lecture d'un sujet au delà du simple volume de documents manqués.
Cette mesure suggère qu'une requête construite sur un nom propre non latin gagne systématiquement à intégrer l'ensemble des graphies attestées d'une même entité plutôt qu'une seule forme, même lorsque cette forme paraît la plus répandue au moment de la construction de la requête. Le classement d'une graphie comme la plus fréquente n'est d'ailleurs pas stable dans le temps : une transposition minoritaire peut devenir dominante à la faveur d'un changement de convention éditoriale, d'une nouvelle génération de sources, ou d'un usage institutionnel qui finit par s'imposer à l'ensemble de la presse francophone. Une requête figée sur la graphie majoritaire d'hier risque ainsi de se dégrader silencieusement, sans qu'aucun signal n'alerte l'utilisateur du glissement en cours.
Limites et reproductibilité
Ce jeu de données comporte des limites propres à toute mesure de dispersion de graphies. Le rattachement de chaque mention à une entité de référence unique repose sur un jugement contextuel qui n'élimine pas totalement le risque de sous compter des graphies rares faute de contexte suffisant pour les rattacher avec confiance. La classification par système d'écriture d'origine simplifie des situations parfois mixtes, notamment pour les noms transmis par plusieurs langues intermédiaires successives avant d'atteindre le français. Enfin, le corpus retenu couvre une période et un ensemble de sources donnés : les usages éditoriaux de transposition évoluent, et une mesure ancienne ne reflète pas nécessairement les conventions en vigueur aujourd'hui.
Une autre limite tient à la taille inégale des sous échantillons par langue d'origine : certaines familles de systèmes d'écriture sont représentées par un nombre d'entités suffisant pour dégager une tendance robuste, d'autres reposent sur un échantillon plus restreint, ce qui appelle une lecture prudente des écarts les plus marqués entre familles. Cette hétérogénéité de taille ne remet pas en cause le constat d'ensemble, elle invite simplement à distinguer un ordre de grandeur solide d'une estimation encore fragile selon la famille considérée.
Le protocole de rattachement des graphies à une entité unique, la nomenclature des familles de systèmes d'écriture et la méthode de calcul du taux de documents manqués sont documentés pour permettre la reproduction de la mesure sur un autre corpus ou son actualisation périodique, notamment lorsqu'une convention de transposition dominante change au sein d'une langue d'origine donnée.
Une dernière limite concerne le corpus francophone lui-même : les résultats présentés ici ne se transposent pas mécaniquement à un corpus rédigé dans une autre langue cible, les conventions de transposition vers l'anglais, l'espagnol ou l'allemand n'étant pas nécessairement les mêmes que celles observées vers le français pour un même système d'écriture d'origine. Toute extension de cette mesure à un corpus dans une autre langue devrait reprendre le protocole depuis le rattachement des graphies, plutôt que supposer une transposition directe des résultats obtenus ici.
NewsCore, sur www.newscore.fr, couvre un même nom propre non latin sous l'ensemble de ses graphies attestées et détecte ainsi les documents qu'une requête mono-graphie laisserait de côté.
Questions fréquentes
Combien de graphies distinctes un même nom propre non latin peut-il raisonnablement prendre dans un corpus francophone ? Le nombre varie fortement selon le système d'écriture d'origine, de quelques variantes marginales pour les systèmes à convention de transposition ancienne et stable, à un nombre nettement plus élevé pour les systèmes à romanisations concurrentes ou peu vocalisés à l'écrit.
Ce jeu de données traite-t-il aussi le cas de deux entités différentes portant le même nom ? Non, ce cas relève d'un problème distinct, déjà traité par ailleurs, celui des collisions de noms, où une seule graphie recouvre plusieurs entités. Le travail présenté ici traite le problème inverse, un même nom sous plusieurs graphies.
Une requête sur plusieurs graphies suffit elle à couvrir l'ensemble des documents pertinents ? Elle réduit fortement l'angle mort mais ne l'élimine pas complètement, certaines graphies rares n'étant identifiées qu'après une première analyse du corpus. La mesure du taux de documents manqués reste donc une estimation par famille de systèmes d'écriture, pas une garantie individuelle par nom.
Comment ce travail se distingue t il d'une mesure de couverture linguistique d'un corpus ? La couverture linguistique évalue la présence de langues sources dans l'ensemble d'un corpus, tandis que ce jeu de données mesure la dispersion des graphies d'un même nom propre au sein d'une langue d'origine donnée : les deux mesures sont complémentaires mais répondent à des questions différentes.