mercredi 7 octobre 2026
Analyses

Taux de citations fabriquées par l'IA : protocole de mesure et grille de codage

Définitions, tirage, grille en six positions et seuils : le protocole de l'Observatoire pour mesurer les citations fabriquées par un modèle de langage.

L'Observatoire16 août 20268 min de lecture

À retenir

  • L'unité comptée est la citation, jamais la réponse : un taux publié sans son dénominateur ni son intervalle de confiance reste ininterprétable.
  • Six positions de codage, dont deux seulement valent fabrication stricte : mêler invention, attribution déplacée et métadonnée fausse produit un chiffre qu'aucun correctif ne cible.
  • Le taux de vérifiabilité se lit avant le taux de fabrication : un corpus dont une part des références reste inaccessible n'est pas auditable.
  • Tout résultat est daté et rattaché à une version de modèle et à un périmètre documentaire, faute de quoi deux campagnes ne se comparent pas.

Un assistant de veille qui cite ses sources donne l'impression d'être vérifiable. L'impression tient tant que personne n'ouvre les références produites. Dans un dispositif de veille, la citation n'est pourtant pas un ornement : c'est la pièce qui permet de remonter au document, de rejouer une décision et d'engager la responsabilité de l'analyste.

Nous appelons citation fabriquée toute référence produite par un modèle de langage qui ne renvoie à aucun document réel, ou qui renvoie à un document réel sans y trouver le propos rapporté. Le mot hallucination décrit le phénomène du côté du modèle. Nous lui préférons un vocabulaire d'audit, qui décrit ce que l'on observe et ce que l'on code.

Cette note décrit notre protocole : unité de mesure, tirage de l'échantillon, grille de codage en six positions, indicateurs publiés, limites connues. Elle n'établit aucun palmarès de modèles. Elle sert à produire une mesure comparable d'une campagne à l'autre et rejouable par un tiers, condition sans laquelle un taux de fabrication ne dit rien.

Ce qu'est une citation fabriquée, et ce qui n'en est pas une

La définition doit être opératoire, c'est-à-dire décidable par deux codeurs indépendants sur la même pièce. Nous retenons deux familles. La fabrication de l'objet : aucun catalogue, aucune archive, aucun moteur ne retrouve le document sous le titre, l'auteur et l'éditeur annoncés. La fabrication du contenu : le document existe, mais le passage qui lui est attribué ne s'y trouve pas, même paraphrasé.

Trois cas voisins sont exclus de la fabrication stricte, car ils appellent d'autres correctifs. L'attribution déplacée : le fait est exact, publié par un autre éditeur que celui indiqué. La métadonnée fausse : le propos est exact et bien localisé, la date, le titre ou la signature ne le sont pas. La source périmée : le document contenait ce propos dans une version antérieure, depuis remplacée.

Cette séparation n'a rien de cosmétique. Une attribution déplacée se répare par un référentiel d'éditeurs propre ; une fabrication d'objet, non. Fondre les deux dans un taux unique produit un chiffre qui monte et descend sans que l'on sache quelle action l'a fait bouger.

Pourquoi la fabrication tient au mécanisme et non à la consigne

Northern Light rappelle que l'hallucination est une propriété du mécanisme des grands modèles de langage : ils produisent les mots statistiquement probables, pas des vérités vérifiées. La conséquence est directe, ce n'est pas un défaut que corrige une consigne de prompt. Un protocole qui suppose l'inverse teste la formulation des instructions, pas la fiabilité du dispositif.

Le même travail note que le phénomène s'aggrave sur les questions typiques de la veille concurrentielle : concurrents de niche, mouvements récents, sources payantes jamais vues par le modèle. Le taux de fabrication n'est donc pas une constante de l'outil, c'est une fonction de la question posée. Un échantillon fait de questions générales sous-estime mécaniquement le risque réel.

Sur l'ordre de grandeur, Northern Light rapporte des études où 18 % (GPT-4) à 55 % (GPT-3.5) des citations générées étaient entièrement inventées, et un audit de la littérature scientifique ayant signalé environ 147 000 fausses citations générées par l'IA pour la seule année 2025. Ces valeurs ne se transposent pas telles quelles à un corpus de veille, mais elles fixent l'échelle : on compte en dizaines de pourcents, pas en cas isolés.

Constituer l'échantillon : la citation comme unité de mesure

L'unité de mesure est la citation, pas la réponse. Une réponse sans aucune référence reste fausse ; une autre en aligne huit dont une seule est inventée. Compter des réponses rend les taux incomparables dès que la verbosité change. Nous comptons donc toutes les références produites, y compris celles qui apparaissent au fil du texte et non dans une liste finale.

Le tirage est stratifié sur trois axes : le type de question (fait daté, valeur chiffrée, propos attribué, description d'organisation), l'ancienneté du fait (moins de trente jours, plus de six mois), la langue de la source attendue. La stratification suit la distribution réelle des requêtes des analystes sur la période, relevée dans le journal d'usage, et non une liste écrite pour le test.

La taille de l'échantillon se décide avant la campagne, à partir de la précision recherchée. Pour un taux voisin de 20 %, cent citations vérifiées donnent un intervalle de confiance à 95 % d'environ huit points, ce qui interdit de commenter une variation de trois points entre deux campagnes. Publier un taux sans son dénominateur ni son intervalle revient à publier une opinion.

La grille de codage en six positions

CodeSituation observéeVérification appliquéeComptage
C0Le document existe et contient le proposOuverture de l'adresse, lecture du passageCitation exacte
C1Rien ne correspond au titre, à l'auteur et à l'éditeur annoncésRecherche croisée par titre, auteur, éditeurFabrication de l'objet
C2Le document existe, le propos ne s'y trouve pasLecture intégrale et recherche plein texteFabrication du contenu
C3Fait exact, publié par un autre éditeurRecherche du fait hors de la source citéeAttribution déplacée
C4Propos exact, date, titre ou signature inexactsComparaison champ à champ avec le documentMétadonnée fausse
C5Accès fermé, page disparue, archive absenteTentative d'archive, second essai à 48 heuresInvérifiable

Le codage est réalisé par deux analystes travaillant sur la même liste, sans accès au codage de l'autre. Les désaccords sont arbitrés par un troisième, et le taux d'accord avant arbitrage est publié avec le résultat. Sans cette mesure d'accord, un taux de fabrication mélange la variabilité du modèle et celle des codeurs.

La position C2 concentre l'essentiel des désaccords, car elle dépend de la tolérance accordée à la paraphrase. Nous fixons la règle avant la campagne : le propos est réputé présent si un lecteur du document le reconnaît sans reformulation supplémentaire, absent si son rétablissement demande une inférence. La règle reste imparfaite ; l'essentiel est qu'elle soit écrite et identique d'une campagne à l'autre.

Les trois taux publiés, et ce qu'ils supposent

Le taux de fabrication stricte rapporte C1 et C2 au total des citations vérifiables, soit C0 à C4. C'est l'indicateur de sécurité : la part de références qui ne renvoient à rien d'utilisable. Le taux d'attribution déplacée isole C3, défaut de référentiel plus qu'invention. Le taux de métadonnée fausse isole C4, qui coûte du temps de vérification sans détruire la preuve.

Le troisième indicateur est le taux de vérifiabilité : la part des citations qui n'ont pas fini en C5. Il est décisif et souvent négligé. Un dispositif dont un tiers des références restent invérifiables n'est pas auditable, quel que soit son taux de fabrication apparent, puisque le doute porte sur une fraction du corpus que personne n'a lue.

Chaque publication porte trois métadonnées obligatoires : la date de la campagne, la version du modèle interrogé, le périmètre documentaire auquel il avait accès. Un taux mesuré sans ces trois éléments n'est comparable à rien, pas même à lui-même trois mois plus tard. Les modèles changent sans préavis, les périmètres aussi, et une série qui ignore ces ruptures raconte une amélioration qui n'a pas eu lieu. La rupture se documente, elle ne se lisse pas.

Référentiels de vérification et ancrage documentaire

Trancher entre C1 et C3 demande un référentiel d'éditeurs stable, tenu hors du modèle testé. Journalism.co.uk recense des sources gratuites de données sur l'industrie des médias qui remplissent cet office. NewsGuard y évalue la fiabilité de plus de 35 000 sources d'information en ligne, représentant plus de 95 % de l'engagement médiatique mesuré : une base d'identités d'éditeurs indépendante du corpus testé.

Le même recensement de Journalism.co.uk mentionne l'Indice de liberté de la presse de Reporters sans frontières, classement interactif par pays, et le Digital News Report annuel du Reuters Institute, fondé sur près de 100 000 répondants dans 48 pays. Ces jeux de données ne jugent pas la véracité d'un propos : ils établissent qu'un éditeur existe et sous quel nom exact, ce qui suffit à qualifier une bonne part des C1.

Reste l'ancrage documentaire, seule réponse structurelle. Northern Light décrit la solution comme architecturale : ancrer le modèle dans des sources fiables, exiger des citations traçables, tenir ces sources à jour et gouvernées. NewsCore (www.newscore.fr) relie chaque signal à son document d'origine et conserve l'adresse de la publication citée, ce qui rend le codage vérifiable ligne à ligne. La mesure décrite ici reste nécessaire : elle contrôle que l'ancrage tient sur les questions récentes et de niche.

Limites, reproductibilité et péremption de la mesure

La première limite est le périmètre de validité. Un taux vaut pour un triplet précis : un modèle, un corpus documentaire, une famille de questions. Il ne dit rien de l'IA en général, ni du même modèle interrogé sur d'autres sujets. Toute généralisation au-delà du triplet est une extrapolation et doit être signalée comme telle.

La deuxième limite est le non-déterminisme. Une même question ne produit pas la même réponse d'une exécution à l'autre. Nous interrogeons donc chaque question à plusieurs reprises, à quelques heures d'intervalle, et nous codons l'ensemble des citations obtenues. Une campagne fondée sur un tirage unique par question mesure surtout la chance du tirage.

La troisième limite est la péremption des preuves. Les adresses meurent, les pages sont réécrites, les archives restent incomplètes. Le protocole impose une fenêtre de vérification courte, une capture datée de chaque page consultée et la conservation du journal des requêtes. Sans ces pièces, un tiers ne rejoue pas la campagne, et le résultat perd la qualité qui le rendait publiable.

Questions fréquentes

Un taux de citations fabriquées de 20 % signifie-t-il qu'une réponse sur cinq est fausse ?

Non. L'unité comptée est la citation, pas la réponse. Une réponse portant cinq références en verse cinq au dénominateur, et une seule invention suffit à rendre le passage concerné inutilisable. La conversion d'un taux par citation en taux par réponse dépend du nombre moyen de références par réponse, publié à côté du taux.

Peut-on faire baisser le taux de fabrication en changeant la consigne donnée au modèle ?

Marginalement, et sans durée. Northern Light décrit la fabrication comme une propriété du mécanisme, pas comme un défaut corrigeable par une consigne. Les gains stables viennent de l'architecture : restreindre la génération à un corpus contrôlé, exiger une adresse vérifiable pour chaque affirmation, accepter l'absence de réponse quand le corpus ne contient rien.

Faut-il exclure les citations invérifiables du calcul du taux ?

Du dénominateur du taux de fabrication, oui ; de la publication, non. Une citation invérifiable n'est ni exacte ni fabriquée : la ranger d'un côté ou de l'autre fausse le résultat dans les deux sens. Elle est comptée à part, dans le taux de vérifiabilité, qui se lit toujours à côté du taux de fabrication.

Sources

Pour approfondir