À son tour, ChatGPT s’apprête à déployer un système de marquage invisible pour les textes générés par IA. La nouveauté devrait débarquer dans l’Union européenne dans les prochaines semaines pour répondre aux nouvelles exigences de l’AI Act.

Il y a d’abord eu Gemini, avec SynthID, puis Claude, avec une version modifiée du système de Google. Dans les prochaines semaines, ChatGPT leur emboîtera le pas avec textGrain. Déjà éprouvé en interne, le dispositif d’OpenAI intégrera aux textes produits par le chatbot et Codex un signal invisible, sorte de signature statistique censée faciliter leur identification a posteriori. Impossible à repérer à la lecture, ce filigrane doit pouvoir répondre aux obligations européennes de traçabilité des contenus générés par IA.
Un filigrane caché dans le choix des mots
Dans le détail, textGrain ne reposera ni sur l’ajout de caractères cachés ni sur des métadonnées glissées dans les réponses de ChatGPT, mais orientera légèrement le choix des mots du modèle au fil de la génération afin de faire émerger un motif statistique détectable. Forcément, plus le passage sera long, plus le détecteur aura de matière pour en établir la présence avec fiabilité.
D’après les tests d’OpenAI, un texte de 200 tokens consacré à la psychologie est ainsi attribué à ses modèles dans environ 80 % des cas, contre près de 95 % pour un texte de 400 tokens, pour un seuil fixé à 1 % de faux positifs. Les performances chutent en revanche sur les contenus soumis à un vocabulaire plus contraint, comme ce peut être le cas en mathématiques.
En théorie, le procédé ne devrait pas trop peser sur la qualité rédactionnelle des réponses, dixit OpenAI. TextGrain devrait commencer son déploiement dans les prochaines semaines sur ChatGPT et Codex dans l’Union européenne, quel que soit le forfait souscrit. Les clients de l’API peuvent déjà l’activer dans le monde entier sur les modèles compatibles.
Quelques retouches peuvent déjà brouiller la piste
Sans grande surprise, parce qu’il repose sur le choix des mots, textGrain résiste assez mal à la réécriture. Toujours d’après OpenAI, remplacer 10 % du vocabulaire par des synonymes dans un texte de 400 tokens fait chuter le taux de détection à 66 %. Un pourcentage qui s’effondre à 17 % si l’on modifie un quart des mots.
Une reformulation plus poussée ou une traduction peuvent donc considérablement dégrader le signal, voire le rendre caduc, ce qui exclut d’emblée le recours à textGrain comme détecteur universel des textes produits par l’IA. Un résultat négatif pourrait en effet aussi bien trahir un filigrane perdu en cours de route qu’un texte antérieur au dispositif ou résultant d’un modèle qui ne l’utilise pas.
À noter enfin que, même lorsqu’il repère le filigrane, le détecteur ne permet ni d’identifier l’utilisateur à l’origine du texte, ni de déterminer le prompt employé, ni de savoir quelle part du contenu relève d’un travail humain. Dans un premier temps, OpenAI préfère donc en réserver l’accès aux chercheurs agréés et aux organismes spécialisés, afin d’en éprouver la fiabilité et les usages.