Un ingénieur a mis en ligne un quiz pour savoir si des lecteurs lambdas pouvaient reconnaître un texte marqué par un filigrane IA parmi d’autres.

Le 11 août dernier, Anthropic annonçait la mise en place d’un système de marquage invisible sur les textes générés par Claude, censé permettre d’identifier un texte totalement ou partiellement généré par IA.

Reposant sur SynthID-Text, une technologie de filigranage développée par Google DeepMind, ce système venait avec une promesse : ne modifier ni le sens, ni la qualité, ni la lisibilité du texte.

Reçu plutôt froidement par une partie de la communauté, il reste aujourd’hui un sujet d’interrogation, alors qu’il doit être généralisé à tous les futurs modèles d’Anthropic. Le filigrane est ainsi venu avec un lot d’outils permettant de le contourner, et est régulièrement accusé de dégrader la qualité des réponses des modèles.

C’est ce dernier point qu’a voulu vérifier Sean Goedecke, ingénieur logiciel australien, en soumettant de vrais lecteurs à un quiz les mettant au défi de repérer, parmi trois réponses à une même question, laquelle avait été discrètement marquée.

Chaque question propose trois textes générés par un seul et même prompt // Source : Capture d'écran Numerama
Chaque question propose trois textes générés par un seul et même prompt // Source : Capture d’écran Numerama

Un protocole simple

Pour mener son expérience, l’auteur a donc mis en ligne un site proposant dix questions. Chacune affichait trois réponses générées par le même modèle, Qwen3-30B-A3B-Instruct-2507. Sur les trois réponses, une seule portait la marque invisible de SynthID-Text. Aux participants de deviner laquelle.

Un premier lot de 278 participants a d’abord semblé indiquer une capacité de détection réelle, avec une moyenne de 3,92 sur 10 contre 3,33 attendus au hasard. Mais l’écart s’expliquait en réalité par un biais du protocole : la réponse filigranée occupait systématiquement la position « A » dans six questions sur dix, ce qui suffisait à faire grimper le score de quiconque cliquait par réflexe sur la première option.

Une fois l’ordre des réponses mélangé, un second lot de 73 participants a livré une moyenne de 3,4 sur 10, quasiment identique au hasard pur, sans aucun pic anormal. Avec l’audience plus large obtenue par la suite (environ 4 700 réponses au total, après relais sur LinkedIn et Hacker News), la moyenne s’est stabilisée à 3,44.

Une expérience informelle

L’auteur le reconnaît lui-même : son test n’a rien d’une « étude scientifique rigoureuse ». Le protocole de suivi des scores serait par exemple facilement falsifiable par un participant malintentionné. À cela s’ajoute le fait que le quiz peut paraître un peu long, et que la lassitude de disséquer trente textes peut pousser certains participants à cliquer rapidement pour venir à bout de l’exercice.

Mais selon lui, le résultat est sans appel : « les lecteurs ne peuvent pas identifier le texte IA filigrané », assure-t-il.

Score reçu au bout des 10 questions // Source : Capture d'écran Numerama
Score reçu au bout des 10 questions // Source : Capture d’écran Numerama

Une conclusion, disons-le, un peu hâtive, mais qui coïncide avec les explications données par Anthropic au lancement du filigrane, et qui repose sur la façon dont un modèle choisit un mot.

En effet, un modèle de langage ne choisit jamais un unique mot optimal mais pioche, à chaque étape, parmi une poignée de jetons candidats de probabilité proche. Le filigrane ne ferait donc que remplacer ce hasard par un biais prévisible et détectable algorithmiquement, mais statistiquement équivalent à un tirage aléatoire du point de vue du lecteur.

« Si les filigranes choisissaient réellement des mots aléatoires que le modèle ne sélectionnerait jamais, on pourrait parfois distinguer, à partir de trois réponses côte à côte, celle qui contient un filigrane, n’est-ce pas ? » conclut Sean Goedecke.

Découvrez les bonus

+ rapide, + pratique, + exclusif

Zéro publicité, fonctions avancées de lecture, articles résumés par l'I.A, contenus exclusifs et plus encore.

Découvrez les nombreux avantages de Numerama+.

S'abonner à Numerama+

Vous avez lu 0 articles sur Numerama ce mois-ci

Il y a une bonne raison de ne pas s'abonner à

Tout le monde n'a pas les moyens de payer pour l'information.
C'est pourquoi nous maintenons notre journalisme ouvert à tous.

Mais si vous le pouvez,
voici trois bonnes raisons de soutenir notre travail :

  • 1 Numerama+ contribue à offrir une expérience gratuite à tous les lecteurs de Numerama.
  • 2 Vous profiterez d'une lecture sans publicité, de nombreuses fonctions avancées de lecture et des contenus exclusifs.
  • 3 Aider Numerama dans sa mission : comprendre le présent pour anticiper l'avenir.

Si vous croyez en un web gratuit et à une information de qualité accessible au plus grand nombre, rejoignez Numerama+.

S'abonner à Numerama+
Toute l'actu tech en un clien d'oeil

Toute l'actu tech en un clin d'œil

Ajoutez Numerama à votre écran d'accueil et restez connectés au futur !


Un édito exclusif, un guide, une reco de lecture et l’agenda de la rédaction : c’est ce que vous trouverez tous les jeudis dans ToujoursPlus, la newsletter tech écrite par Julien Cadot. Inscrivez-vous gratuitement ici !