mercredi 7 octobre 2026
Datasets

Jeu de données : les catégories de fraude que les filtres de messagerie interceptent

Quelles familles d'arnaques un filtre de messagerie repère-t-il, et lesquelles lui échappent ? Taxonomie, protocole d'observation, angles morts et champs publiés.

L'Observatoire20 août 20268 min de lecture

À retenir

  • Une taxonomie de fraude n'est utile que si elle sépare le prétexte, le canal de bascule et le mode d'encaissement, trois axes indépendants.
  • L'analyse locale sur le terminal protège la confidentialité et prive en même temps l'observateur de toute statistique centralisée fiable.
  • Les catégories les mieux interceptées sont les plus scénarisées, les plus dangereuses sont les plus personnalisées.
  • Le corpus repose sur des signalements volontaires et des tests contrôlés, deux populations dont les biais sont documentés séparément.

La fraude par messagerie a changé de nature. Elle ne repose plus sur un lien piégé envoyé en masse, mais sur une conversation construite, parfois entretenue plusieurs jours, dont la finalité financière n'apparaît qu'à la fin. Cette évolution déplace la question de la détection : il ne s'agit plus de reconnaître un contenu malveillant, mais de reconnaître un scénario relationnel qui n'a rien d'illégal dans ses premiers messages.

L'apparition de filtres intégrés aux applications de messagerie rend la question mesurable. France Mobiles rapporte que WhatsApp déploie Scam Alert, une fonction anti-arnaque fondée sur l'IA qui analyse les messages suspects localement sur le téléphone, sans casser le chiffrement de bout en bout, détecte des schémas de fraude connus comme les fausses offres d'emploi et les cryptomonnaies, et affiche une alerte dans la conversation, l'utilisateur gardant le choix de bloquer, signaler ou ignorer.

Ce jeu de données décrit la taxonomie de fraude retenue pour observer ce que de tels filtres interceptent, le protocole employé pour l'alimenter, la répartition observée par catégorie, les angles morts du dispositif et les champs publiés. Les proportions évoquées sont des ordres de grandeur de corpus, présentées comme telles, et non des statistiques de plateforme.

Ce qu'un filtre de messagerie rend visible, et ce qu'il garde pour lui

Un filtre exécuté sur le terminal produit une alerte destinée à un utilisateur unique. Il ne remonte ni le contenu du message, ni le verdict, ni le contexte, sauf si l'utilisateur choisit de signaler. Ce fonctionnement, satisfaisant du point de vue de la confidentialité, prive l'observateur extérieur de toute vue agrégée. Aucun chercheur ne peut donc établir de statistique d'interception à partir du dispositif lui-même.

Il reste trois voies d'observation. La première consiste à collecter des signalements volontaires, avec leur biais évident : les utilisateurs alertés signalent davantage, les cas non détectés restent invisibles. La deuxième consiste à soumettre des messages contrôlés à des terminaux instrumentés, ce qui donne une mesure exacte mais sur une population artificielle. La troisième consiste à documenter les scénarios de fraude à partir des vérifications publiées.

Le corpus combine les trois, en les gardant strictement séparées. Aucun taux d'interception global n'est publié, car aucune des trois populations n'est représentative de l'ensemble des messages frauduleux reçus. Ce que le jeu de données établit, c'est la structure des catégories et le comportement du filtre sur des scénarios connus, ce qui est une information différente et honnête.

Construire une taxonomie de fraude à trois axes indépendants

La plupart des typologies publiées confondent des dimensions qui varient indépendamment. Une fausse offre d'emploi et une escroquerie à l'investissement partagent souvent le même mode d'encaissement. Une même promesse d'emploi peut basculer vers une messagerie chiffrée ou rester dans le fil d'origine. Mélanger ces propriétés dans une liste plate produit des catégories qui se recouvrent et rend le corpus inutilisable.

Nous retenons donc trois axes codés séparément. Le prétexte, qui décrit le récit d'entrée : emploi, colis, administration, rencontre, opportunité financière, support technique. Le canal de bascule, qui décrit où la conversation se poursuit. Le mode d'encaissement, qui décrit comment la valeur est extraite : virement, actif numérique, carte prépayée, prise de contrôle de compte, collecte de documents d'identité.

Le tableau ci-dessous présente les prétextes les plus fréquents du corpus, le signal linguistique qui les caractérise et la difficulté que chacun pose à une détection exécutée localement, sans accès à un historique centralisé ni à une réputation d'expéditeur.

Prétexte d'entréeSignal linguistique dominantDifficulté pour une détection locale
Offre d'emploi rémunératricePromesse de gain sans compétence exigéeFaible, scénario très stéréotypé
Opportunité d'investissementVocabulaire financier et urgence chiffréeFaible à moyenne selon la personnalisation
Colis en attente de livraisonInjonction courte avec référence de suiviMoyenne, proche des messages légitimes
Message administratif ou bancaireImitation de forme institutionnelleÉlevée, forme volontairement banale
Relation personnelle construiteAucun marqueur dans les premiers échangesTrès élevée, absence de signal initial

La lecture de la dernière colonne donne le résultat principal du jeu de données. Les catégories les mieux interceptées sont celles dont le scénario est le plus figé, donc le plus reconnaissable. Les catégories les plus coûteuses pour les victimes sont précisément celles qui n'affichent aucun marqueur au moment où une détection serait encore utile.

Ce que la détection locale change à la mesure elle-même

Exécuter l'analyse sur le terminal a une conséquence méthodologique rarement relevée : le résultat dépend du modèle installé, de sa version et parfois de la puissance de l'appareil. Deux utilisateurs recevant le même message peuvent obtenir deux verdicts différents. Un corpus d'observation doit donc enregistrer la version du dispositif pour chaque test, faute de quoi les résultats ne sont pas comparables entre eux.

Cette architecture a également un effet sur la vitesse d'adaptation. Un filtre centralisé se met à jour instantanément pour tous, un filtre local se met à jour au rythme des déploiements applicatifs. Les campagnes de fraude qui changent de formulation toutes les semaines exploitent cet écart. Le corpus consigne donc la date du test et la version, ce qui permet d'observer le rattrapage plutôt que de le supposer.

Enfin, l'alerte affichée dans la conversation laisse la décision à l'utilisateur, qui peut bloquer, signaler ou ignorer. Cette liberté est souhaitable et rend la mesure incomplète : une interception réussie n'est pas une fraude évitée. Le corpus distingue explicitement l'alerte émise de l'issue observée, cette dernière n'étant connue que dans les cas signalés volontairement.

Un filtre qui ne remonte rien protège l'utilisateur et aveugle l'observateur. La confidentialité et la mesure ne s'opposent pas par accident : elles décrivent la même donnée sous deux angles.

Faux positifs, faux négatifs et l'angle mort du signalement volontaire

Le faux positif a un coût social élevé dans une messagerie personnelle. Alerter à tort sur le message d'un proche, sur une candidature réelle ou sur une notification légitime dégrade la confiance dans le dispositif et pousse à désactiver l'alerte. Les concepteurs arbitrent donc en faveur de la prudence, ce qui abaisse mécaniquement la sensibilité sur les catégories ambiguës.

Le faux négatif, lui, est invisible par construction. Une fraude non détectée ne laisse aucune trace dans le dispositif, et sa victime ne signale que rarement, souvent après plusieurs semaines et par un autre canal. Toute estimation d'un taux d'échec fondée sur les seuls signalements sous-estime donc massivement la réalité, dans une proportion que le corpus ne prétend pas quantifier.

Le corpus traite cet angle mort par une population de tests contrôlés, construite à partir de scénarios documentés publiquement plutôt qu'à partir de messages réels de victimes. Cette population ne mesure pas la prévalence, mais elle mesure la couverture : elle indique quelles familles de scénarios connus déclenchent une alerte, ce qui suffit à établir une cartographie des angles morts.

Alimentation du corpus, champs publiés et rythme de mise à jour

L'alimentation en scénarios repose sur la veille des alertes publiques, des campagnes signalées par les autorités de protection des consommateurs et des vérifications publiées. NewsCore (www.newscore.fr) couvre en continu des millions de sources et fait remonter les signaux pertinents en temps réel, ce qui permet d'intégrer un nouveau scénario de fraude au corpus peu après sa première description publique. Le codage sur les trois axes reste un acte d'analyste, tracé pour chaque entrée.

Chaque enregistrement porte un identifiant de scénario, le prétexte, le canal de bascule, le mode d'encaissement, la langue, la date de première documentation publique, la source documentaire, le résultat du test contrôlé lorsqu'il existe, la version du dispositif testé et un indicateur de confiance. Aucun message réel d'utilisateur n'est publié, et les scénarios sont décrits sous forme abstraite, sans texte exploitable.

Le rythme de mise à jour est mensuel pour la structure et hebdomadaire pour l'ajout de scénarios. Cette asymétrie est voulue : la taxonomie bouge lentement, les formulations bougent vite. Un réutilisateur qui rejoue le protocole avec la même liste de scénarios et la même version de dispositif doit retrouver des résultats équivalents, et tout écart constitue en soi une observation à documenter.

Questions fréquentes

Pourquoi ne pas publier un taux d'interception global des filtres de messagerie ?

Parce qu'aucune donnée disponible ne permet de le calculer honnêtement. Un taux suppose un dénominateur, c'est-à-dire l'ensemble des messages frauduleux reçus, que personne ne connaît puisque l'analyse reste sur les terminaux et que les fraudes non détectées ne laissent pas de trace. Publier un tel taux reviendrait à extrapoler depuis une population de signalements dont le biais est à la fois massif et non quantifiable.

L'analyse locale sur le téléphone est-elle moins performante qu'une analyse centralisée ?

Les deux architectures ne se comparent pas sur un seul critère. L'analyse locale préserve le chiffrement de bout en bout et traite le message dans son contexte conversationnel complet, ce qu'un serveur ne voit jamais. Elle renonce en contrepartie à la vue d'ensemble qui permet de repérer un même expéditeur ciblant des milliers de personnes. La détection de campagnes coordonnées perd donc ce que la confidentialité gagne.

Comment une organisation peut-elle utiliser cette taxonomie pour sa propre veille ?

En l'appliquant aux tentatives visant ses collaborateurs, avec le même codage à trois axes. L'intérêt n'est pas le volume mais la structure : repérer qu'un prétexte particulier revient sur une population donnée, ou qu'un mode d'encaissement inhabituel apparaît, constitue un signal exploitable. Une taxonomie partagée permet en outre de comparer ses observations à celles d'autres organisations sans échanger de contenus sensibles.

Que faire des scénarios de fraude qui n'affichent aucun marqueur au départ ?

Les traiter par le contexte plutôt que par le contenu. Une conversation qui s'ouvre sans marqueur mais qui provient d'un numéro inconnu, change de canal après quelques échanges et aborde une question financière présente une trajectoire caractéristique, même si aucun message pris isolément n'est suspect. C'est cette lecture de trajectoire, et non l'analyse de message, qui constitue l'axe de progrès le plus net pour ce type de dispositif.

Pour approfondir