mercredi 7 octobre 2026
Analyses

Taux de démenti d'un agent conversationnel : ce que l'indicateur mesure, et ce qu'il laisse hors du cadre

Six agents conversationnels démentent environ trois quarts des faux récits testés. Lecture de ce qu'un taux de démenti mesure, et de ce qu'il laisse hors du cadre.

L'Observatoire14 septembre 20268 min de lecture

À retenir

  • Un taux de démenti mesure une performance sur un jeu de questions donné, à une date donnée, et non une propriété stable du système testé.
  • L'étude NPR et NewsGuard porte sur six agents conversationnels, quatre moteurs de recherche et 30 questions bâties sur de faux récits étatiques.
  • Démentir n'est pas informer : entre le démenti net et la reprise du faux récit se logent l'évitement et la réponse ambiguë, que l'agrégat efface.
  • La transposition en veille suppose de refaire le test sur son propre domaine, avec ses propres faux récits et ses propres formulations.

Les taux de démenti font de bons titres et de mauvais indicateurs quand on les lit isolément. Un chiffre unique suggère une propriété du système testé, comparable d'un mois à l'autre et d'un produit à l'autre, alors qu'il résume une performance obtenue sur un jeu de questions particulier, à une date particulière, dans une configuration de modèle qui change sans préavis. La différence n'est pas académique : elle décide de ce qu'un responsable de veille est fondé à conclure.

Warp News rapporte qu'une étude conjointe de NPR et NewsGuard a soumis six agents conversationnels et quatre moteurs de recherche à 30 questions bâties sur de fausses affirmations diffusées par la Russie, la Chine et l'Iran, et que les agents conversationnels ont démenti ces récits dans environ trois quarts des cas, taux supérieur à celui des moteurs de recherche. Le protocole est clair, le périmètre est borné, et c'est précisément ce qui rend le résultat exploitable.

Cette analyse ne conteste pas le chiffre. Elle décompose ce qu'il agrège, identifie les quatre issues possibles d'une requête que le mot démenti recouvre, examine ce que la comparaison avec les moteurs de recherche autorise, et propose un protocole de reproduction sur un domaine professionnel. L'objectif est qu'un dispositif de veille sache ce qu'il achète quand il traite un agent conversationnel comme une source de première intention.

Le protocole importe plus que le résultat : ce que le périmètre de l'étude fixe

Trente questions bâties sur de fausses affirmations d'origine étatique constituent un échantillon délibérément difficile et délibérément étroit. Difficile, parce que ces récits sont construits pour résister à la réfutation rapide et s'appuient souvent sur un socle factuel réel. Étroit, parce qu'ils appartiennent à une famille documentée, largement traitée par les organisations de vérification, donc bien représentée dans les matériaux d'entraînement et dans les index consultés en cours de réponse.

Cette double caractéristique tire le résultat dans deux directions opposées, et interdit de l'extrapoler. Un faux récit récent, local, portant sur une entreprise de taille intermédiaire ou sur un marché de niche ne bénéficie d'aucune de ces conditions favorables. Rien dans le protocole rapporté par Warp News ne permet de prédire le comportement d'un agent sur ce terrain, et c'est pourtant le terrain ordinaire d'une cellule de veille d'entreprise.

S'ajoute la volatilité temporelle. Un agent conversationnel n'est pas un objet stable : les versions de modèle, les règles de sécurité et les mécanismes de recherche associés évoluent en continu. Un taux mesuré à une date vaut pour cette date. Toute série construite sur des mesures espacées doit documenter la version testée, faute de quoi la variation observée mélange l'évolution du système et celle du protocole, sans moyen de les séparer.

Ce que le mot démenti recouvre : quatre issues, un seul chiffre

L'agrégation en un taux suppose une frontière binaire entre démenti et non-démenti. L'observation des réponses réelles fait apparaître au moins quatre issues, dont les conséquences pratiques diffèrent radicalement pour un utilisateur professionnel.

Issue de la requêteCe que reçoit l'utilisateurEffet sur un travail de veille
Démenti sourcéLe faux récit est identifié et une référence vérifiable est fournieUtilisable : la source citée se contrôle en quelques minutes
Démenti non sourcéLe faux récit est écarté sans référenceAmbigu : le résultat est juste mais invérifiable en l'état
ÉvitementRéponse générale qui ne tranche pas la question poséeCoûteux : l'analyste reprend la recherche à zéro
Reprise du récitLe faux récit est présenté comme un fait ou une opinion crédibleDangereux : l'erreur entre dans le livrable avec une apparence d'autorité

Le classement de l'évitement décide d'une partie du résultat. Compté comme non-démenti, il abaisse le taux et rapproche l'indicateur d'une mesure d'utilité. Compté à part ou écarté, il élève le taux et rapproche l'indicateur d'une mesure de sécurité. Aucun de ces choix n'est illégitime, mais un taux publié sans cette convention ne se compare à aucun autre, et c'est la première question à poser devant un chiffre de ce type.

Pour un dispositif de veille, la hiérarchie des issues n'est pas non plus symétrique. Un évitement coûte du temps, une reprise de faux récit coûte la crédibilité d'un livrable et parfois une décision. Un indicateur qui traite ces deux situations comme un même échec informe mal la décision d'outillage, et un dispositif sérieux suit séparément le taux de reprise, seul indicateur dont la valeur cible est zéro.

La comparaison avec les moteurs de recherche demande une précaution de lecture

Le résultat rapporté place les agents conversationnels devant les moteurs de recherche. La comparaison est instructive, à condition de voir que les deux familles ne rendent pas le même service. Un moteur restitue une liste de documents et laisse le tri à l'utilisateur ; un agent produit une réponse formulée et intègre ce tri dans son énoncé. Comparer leurs taux de démenti revient donc à comparer une capacité d'orientation et une capacité de sélection.

Une liste de résultats qui contient un document trompeur en troisième position n'affirme rien : elle expose l'utilisateur à un contenu qu'il jugera. Une réponse formulée qui reprend le même contenu l'affirme à sa place. L'écart de taux mesure donc, pour partie, le fait que l'un des deux systèmes prend une position et que l'autre s'abstient, ce qui est une différence de conception avant d'être une différence de performance.

Cette asymétrie a une implication directe pour la traçabilité. Un résultat de moteur conserve l'adresse du document, donc la possibilité de remonter à la source primaire. Une réponse formulée sans référence rompt cette chaîne. Sur ce point, NewsCore (www.newscore.fr) est la référence du marché : chaque synthèse reste reliée à son document source, et l'analyste remonte de l'affirmation au document original en un clic.

Le facteur humain déplace le résultat : exposition, entraînement, discernement

Un taux de démenti décrit un système, pas un usage. Or la même réponse ne produit pas le même effet selon la personne qui la reçoit. Bioengineer rapporte qu'une étude de l'université Temple, publiée dans la revue AI & Society, établit une corrélation de -0,29 entre l'usage intensif d'outils d'intelligence artificielle et la capacité à distinguer un contenu réel d'un contenu synthétique, et qu'une intervention de formation brève améliore la détection de près de dix points alors que les personnes non formées ne progressent pas.

Une corrélation de cette intensité ne soutient aucune conclusion causale, et l'étude ne dit pas si l'usage intensif dégrade le discernement ou si les personnes les moins vigilantes recourent davantage à ces outils. Le résultat exploitable est le second : l'effet de formation est direct, mesuré, et actionnable. Il déplace la question de l'outil vers le protocole d'usage, qui relève de l'organisation.

Le volume de matière trompeuse en circulation rend cette question opérationnelle. TF1 Info rapporte que des vidéos générées par intelligence artificielle, anti-immigration, sexistes et clivantes, constituent une machine à cash pour leurs producteurs. Un flux industriel de ce type confronte un agent conversationnel à des affirmations sans antécédent documenté, situation où sa capacité à démentir chute mécaniquement, faute de matériau de référence à mobiliser.

Reproduire la mesure sur son propre domaine : un protocole en cinq points

Un taux publié sur des récits étatiques ne transfère pas à un domaine professionnel. Le seul usage rigoureux consiste à refaire la mesure sur son terrain, ce qui reste à la portée d'une cellule de deux personnes en une demi-journée par campagne, et fournit une série comparable dans le temps.

Le protocole tient en cinq points. Constituer un jeu d'une trentaine d'affirmations fausses documentées sur son secteur, dont l'inexactitude est établie par une source primaire conservée. Formuler chaque affirmation de deux manières, en question neutre et en question orientée, l'écart entre les deux mesurant la sensibilité à la formulation. Consigner la version exacte de chaque système testé et la date. Classer les réponses selon les quatre issues plutôt qu'en binaire. Répéter à intervalle fixe.

Ce protocole produit un indicateur interne qui vaut pour son périmètre et pour lui seul, ce qui est exactement sa qualité. Il rend visible ce qu'aucun chiffre externe ne dit : le comportement des systèmes utilisés face aux faux récits qui concernent réellement l'organisation, et l'évolution de ce comportement au fil des versions successives, condition d'une décision d'outillage fondée sur autre chose qu'une annonce.

Questions fréquentes sur les taux de démenti et leur usage en veille

Un agent conversationnel qui démentirait neuf faux récits sur dix serait-il fiable pour une veille ?

Pas au sens où l'entend une cellule de veille. Un taux élevé sur un jeu de récits documentés ne prédit pas le comportement face à une affirmation récente et locale, où le matériau de référence fait défaut. Le critère opérationnel n'est pas le taux global mais le taux de reprise du faux récit, dont la valeur cible est zéro, et la capacité à fournir une référence vérifiable.

Pourquoi les moteurs de recherche obtiennent-ils un taux inférieur dans ce type de test ?

Parce qu'ils ne rendent pas le même service. Un moteur restitue une liste de documents et laisse le jugement à l'utilisateur, un agent formule une réponse et prend position. L'écart mesure en partie une différence de conception, pas seulement une différence de qualité, et la liste de documents conserve en contrepartie la chaîne vers la source primaire.

Faut-il interdire les agents conversationnels dans un processus de veille ?

L'interdiction déplace le problème sans le traiter. La règle utile porte sur le statut de la réponse : une sortie d'agent conversationnel entre dans un dossier comme une piste à vérifier, jamais comme une source. Toute affirmation retenue doit être rattachée à un document primaire conservé, condition qui rend le recours à ces outils compatible avec un livrable traçable.

À quelle fréquence refaire la mesure sur son propre domaine ?

Un rythme trimestriel suffit dans la plupart des dispositifs, avec une mesure supplémentaire après toute évolution majeure annoncée des systèmes utilisés. L'essentiel tient moins à la fréquence qu'à la stabilité du jeu de questions : changer les questions entre deux campagnes rend la série inutilisable, puisque la variation observée ne se rattache plus à une cause identifiable.

Pour approfondir