Dans le premier volet de notre enquête concernant les détecteurs d'IA, Pangram et GPTZero ont plutôt bien reconnu les textes entièrement humains ou générés par ChatGPT. Les choses devenaient beaucoup moins claires avec un usage "hybride". On s'est toutefois posé la question : que se passe-t-il vraiment entre le moment où l’on colle quelques centaines de mots dans un détecteur et celui où apparaît un verdict à 97 ou 100 % IA ? Pour le comprendre, il faut déjà oublier une partie de ce que l’on raconte encore sur ces outils…

Humain, assisté ou généré par IA : derrière ces catégories simples en apparence se cache une mécanique bien plus complexe. © Matthieu Legouge / Clubic
Humain, assisté ou généré par IA : derrière ces catégories simples en apparence se cache une mécanique bien plus complexe. © Matthieu Legouge / Clubic

Un texte entre dans Pangram ou GPTZero, l’interface mouline quelques secondes et le verdict tombe : humain, IA, mixte, le tout accompagné d’un pourcentage qui semble d’une précision redoutable. Pourtant le détecteur ne « sait » pas que ChatGPT a écrit le texte. Voilà toute la nuance est là.

Il ne dispose pas d’un registre recensant les réponses produites par ChatGPT, Claude ou Gemini et ne demande pas secrètement à OpenAI si le passage vient de ses serveurs. Dans le cas de Pangram et GPTZero, il essaie plutôt de répondre à une question statistique : à quelle famille de textes ce que je viens de lire ressemble-t-il le plus ?

Notre enquête sur les détecteurs d’IA

Avant de décortiquer leur fonctionnement, nous avons commencé par confronter Pangram et GPTZero à une série de textes dont nous connaissions précisément l’origine : écriture humaine, génération intégrale par ChatGPT, corrections légères et réécritures profondes.

Et ce n’est pas terminé : les prochains volets pousseront ces détecteurs sur des textes plus longs, des usages hybrides et des cas volontairement plus difficiles à trancher.

Comment un détecteur analyse-t-il réellement un texte ?

Non, un détecteur d’IA n’est pas un logiciel antiplagiat

Une petite distinction s’impose ici, d’autant que Pangram propose aujourd’hui les deux fonctions. Avec son abonnement payant, le service peut également lancer un contrôle antiplagiat, il compare alors le document à des sources existantes et signale les passages similaires, avec leur provenance lorsqu’elle est identifiée. Pangram affirme effectuer cette recherche parmi des milliards de pages web, articles, publications académiques ou livres.

La détection d’un texte généré par IA ne fonctionne pas, du tout, de cette manière. Pangram ne cherche pas une copie du passage quelque part sur le Web pour déterminer qu’il vient de ChatGPT ou autre. Son modèle analyse le texte qui lui est soumis et tente d’en estimer la provenance à partir des caractéristiques qu’il a appris à reconnaître.

Pangram permet de visualiser assez simplement le début du processus. Le texte est d’abord découpé en tokens, des unités qui peuvent correspondre à un mot, une partie de mot ou un signe de ponctuation. Chacun est ensuite converti en une représentation numérique, ou embedding, exploitable par le réseau neuronal.

N'imaginez pas derrière cela quelques règles écrites à la main, pour caricaturer, des choses comme « beaucoup de tirets longs = ChatGPT » ou « phrases trop régulières = IA ». Le réseau apprend à combiner un grand nombre de caractéristiques présentes dans les mots, les phrases, tout autant que dans leur contexte. Autrement dit, pour son volet détection IA, le logiciel ne cherche pas à retrouver votre texte ailleurs, il cherche plutôt à déterminer à quelle forme d’écriture il ressemble.

Derrière Pangram, il y a… un modèle de langage

C’est là que le fonctionnement devient assez intéressant puisque, pour détecter l’écriture d’une intelligence artificielle, Pangram 4 s’appuie lui-même sur un modèle de langage.

Son socle repose sur une architecture dite Mixture-of-Experts (MoE) : plusieurs sous-réseaux spécialisés composent le modèle et seule une partie d’entre eux est sollicitée selon ce qu’il analyse. Pangram ajoute ensuite à cette base plusieurs « têtes de classification », autrement dit, des modules chargés de transformer les représentations du texte en prédictions sur son origine.

En quelque sorte, c'est le même matériau de départ que pour une IA générative, mais avec une toute autre mission. Un LLM, comme le sont ChatGPT ou Claude, utilise ses représentations du langage pour déterminer quel token pourrait venir ensuite. Pangram les exploite pour répondre à d’autres questions : ce passage paraît-il humain ? généré ? assisté ? mélange-t-il plusieurs origines ?

  • Détection IA détaillée
  • Interface simple à utiliser
  • Détection des reformulations

Tous les détecteurs n’utilisent pas exactement la même architecture. GPTZero décrit de son côté son système comme un modèle de deep learning hiérarchique, multitâches et capable de produire des analyses sur plusieurs niveaux du texte. Pour nos essais lors du premier volet, nous avons utilisé GPTZero 4.1m, le modèle disponible dans l’interface au moment de nos tests. Dans les deux cas, l’idée première reste cependant la même, à savoir d'utiliser une IA entraînée à comprendre les régularités du langage pour essayer de reconnaître l’écriture d’autres IA.

Et les filigranes invisibles laissés par les IA ?

Oui, il existe bien une autre manière d’identifier un texte généré. Tout simplement avecun marquage au moment même de sa création. Depuis peu, cette piste ne concerne plus seulement Google ou Claude.

OpenAI vient d’annoncer textGrain, un filigrane invisible destiné aux textes générés par ChatGPT et Codex (pour l’Union européenne). Comme SynthID chez Google, il ne repose pas sur des caractères cachés, ni sur une métadonnée ajoutée au document. Le système agit directement sur la génération en orientant très légèrement les choix de mots effectués par le modèle afin de faire apparaître, à condition d'une longueur suffisante, un motif statistique qu’un détecteur peut ensuite rechercher.

Ce type de marquage est mis en place pour répondre notamment aux nouvelles obligations de l’AI Act européen qui impose aux fournisseurs de rendre les contenus générés ou manipulés par IA détectables. Google utilise déjà SynthID pour plusieurs types de contenus, et OpenAI s’engage désormais dans la même voie pour le texte.

Cette approche ne remplace toutefois pas la raison d'être de services comme Pangram ou GPTZero. Cette méthode suppose que le service qui génère le texte ajoute lui-même le filigrane, et ce dès le départ. De son côté, un détecteur généraliste doit pouvoir analyser un texte dont il ignore totalement l’origine et qui peut avoir été produit par un modèle ne laissant aucune signature.

Et puis, surtout, l'efficacité du filigrane est imparfaite. OpenAI indique notamment que textGrain est bien plus fiable lorsque le texte s’allonge, mais que son signal peut fortement se dégrader après réécriture. Dans ses propres essais, remplacer 10 % des mots par des synonymes faisait déjà nettement chuter la détection et la modification d’un quart du vocabulaire la réduisait drastiquement. Un résultat négatif ne nous permet donc pas d’affirmer qu’un texte n’a jamais été généré par IA.

Non, tout ne repose plus sur la « perplexité »

C’est pourtant l’explication que l’on retrouve encore souvent lorsqu’on recherche comment fonctionnent les détecteurs d’IA. La perplexité permet, pour rester simple, de mesurer à quel point une suite de mots est prévisible pour un modèle de langage. Si les termes employés correspondent souvent aux choix que ce modèle juge les plus probables, la perplexité sera relativement faible.

La burstiness, souvent citée avec cette dernière, s’intéresse davantage aux variations de cette prévisibilité au fil du texte. L’idée est simple : les premières générations de ChatGPT produisaient volontiers des textes réguliers, grammaticalement propres et constitués de choix statistiquement… attendus. Un humain peut davantage casser son rythme, changer brutalement sa construction, son phrasé, ou choisir des mots moins évidents.

Oui, ces métriques ont joué un rôle dans les premières versions de GPTZero. Néanmoins, continuer à expliquer son fonctionnement actuel uniquement de cette manière serait faux. Par exemple, GPTZero indique ne plus utiliser perplexité et burstiness pour sa détection depuis l’automne 2023, après son passage à une architecture fondée sur le deep learning.

Cela ne veut pas dire que toutes les méthodes qui exploitent les probabilités des modèles ont disparu. Une étude Binoculars, présentée en 2024, compare par exemple les scores produits par deux modèles de langage préentraînés dans le but de distinguer les textes rédigés par des humains des textes générés par IA, sans entraîner au préalable un classificateur spécifique sur des productions de ChatGPT. Il y a donc plusieurs familles de techniques, mais réduire Pangram ou le GPTZero actuel à de simples calculs de perplexité revient à expliquer une génération précédente de ces outils.

Pour reconnaître l’IA, il faut d’abord lui montrer beaucoup de textes humains

Pour un classificateur comme Pangram, une bonne partie du travail se joue lors de son entraînement. Le principe paraît simple sur le papier puisqu'il consiste à lui présenter des textes dont on connaît déjà la provenance. Certains sont humains et d’autres artificiels. Le réseau ajuste alors progressivement ses paramètres afin de mieux les distinguer.

Pangram explique avoir commencé ce processus avec environ un million de documents, naturellement des écrits humains ainsi que des productions provenant de plusieurs modèles de langage, avec un corpus couvrant des domaines très différents : essais, littérature, presse, critique, articles scientifiques, etc.

Deux détecteurs peuvent interpréter différemment un même texte : leurs scores et leurs zones de surlignage traduisent une estimation, pas une preuve directe de son origine. © Matthieu Legouge / Clubic

De son côté GPTZero indique aussi entraîner ses modèles sur des millions de documents, avec des sources de provenance assez similaires. Toutefois, accumuler énormément de textes ne suffit pas. Encore faut-il éviter que le modèle apprenne à répondre à la mauvaise question.

Le piège des données d’entraînement

Imaginons que tous les textes humains présentés au détecteur soient des romans, tandis que tous les exemples artificiels soient des dissertations produites par ChatGPT. Il pourrait obtenir d’excellents résultats en apprenant simplement : roman = humain et dissertation = IA. En tout cas, il distinguerait parfaitement les deux corpus, évidemment sans avoir réellement appris ce que l’on attend de lui.

Pangram cherche notamment à réduire ce biais avec ses mirror prompts. Pour un texte humain donné, le détecteur produit un équivalent artificiel aussi proche que possible sur le sujet, avec son style, son ton, ou encore son contexte. Le modèle ne peut alors plus s’appuyer aussi facilement sur ces différences évidentes pour trancher.

La logique est la même avec les hard negatives. Pangram lance un modèle déjà entraîné sur de très grandes quantités de textes humains, récupère ceux qu’il classe à tort comme artificiels, puis utilise ces cas difficiles pour poursuivre son apprentissage. En quelque sorte, il lui montre ses propres erreurs.

Ce processus rappelle surtout une limite fondamentale à bien garder à l'esprit : il n’existe pas une formule universelle de « l’écriture IA » que l’on donnerait au détecteur. Celui-ci apprend à partir des exemples, des modèles et des styles auxquels ses concepteurs l’exposent. Et forcément, la cible ne cesse de changer et d'évoluer.

Une équipe de chercheurs a ainsi comparé deux vagues d’expériences avec au total 960 scores de détection. Leurs résultats, présentés à l’AIME-Con 2026, montrent que les mises à jour successives des IA, des détecteurs et des divers outils d’« humanisation » peuvent légèrement modifier les performances observées. Un détecteur entraîné aujourd’hui doit donc apprendre à reconnaître une cible qui, elle aussi, évolue.

Pangram ne cherche plus seulement à répondre « humain ou IA »

Le problème s’est compliqué à mesure que les usages hybrides se sont généralisés. En effet, un texte corrigé avec ChatGPT est-il pour autant artificiel ? Et si plusieurs paragraphes ont été générés avant d’être repris par l'auteur pour coller précisément à son intention ? Ou alors, si l’IA n’a fait que reformuler ou corriger grammaticalement certaines phrases ?

Pangram 4 cherche à dépasser cette classification purement binaire.
C'est pour cette raison que son architecture possède quatre têtes spécialisées. Une pour estimer le niveau global d’intervention de l’IA. Une autre pour attribuer aux tokens une provenance parmi Human, AI-Assisted ou AI-Generated. Les deux autres cherchent les textes d’origine mixte ou les productions générées passées par la moulinette d'outils d’« humanisation ».

Avant le verdict final, le texte passe par plusieurs étapes : découpage en tokens, représentation numérique, classification, calcul des scores et application de seuils. © Matthieu Legouge / Clubic

Pour les documents longs, le texte est analysé dans plusieurs fenêtres qui se chevauchent. Les prédictions obtenues sont ainsi combinées avant qu'un post-traitement reconstruise des segments cohérents pour les présenter à l’utilisateur. Les zones colorées visibles dans l’interface sont donc déjà le produit de plusieurs étapes de calcul et non une observation directe de la manière dont le document a pu être écrit.

Cela aide à comprendre certains résultats obtenus lors de notre premier test. Un de nos textes avait été entièrement généré avec ChatGPT, tandis qu’un autre partait d’un véritable article écrit par un humain, puis ensuite fortement réécrit par l’IA. Dans les deux cas, Pangram avait trouvé des signaux associés à plusieurs formes d’intervention artificielle, sans pour autant reconstituer parfaitement la genèse réelle du document.

Du score au verdict, il reste encore un choix à faire

Il manque pourtant une étape avant d’obtenir le verdict final « humain », « mixte » ou « IA » affiché dans l’interface. Le réseau produit des prédictions et des scores, faut-il ensuite décider comment les transformer en catégorie… une frontière qui n'a rien d'une loi naturelle.

Pangram 4 documente ses règles en détail. Un document reçoit le verdict global Human lorsqu’au moins 90 % de ses tokens ont été classés humains, AI lorsqu’au moins 80 % ont été classés AI-Generated, tandis que les autres cas sont placés dans la catégorie Mixed.

Ces seuils sont des choix de conception. Abaisser le seuil nécessaire pour déclencher une alerte IA permet potentiellement de retrouver davantage de textes artificiels, mais cela augmente aussi le risque de signaler des textes humains comme étant produits par IA. Logiquement, relever ce seuil donne l’effet inverse. C’est l’arbitrage classique entre faux positifs (un humain pris pour une IA) et faux négatifs (une IA prise pour un humain). Notre propre expérience fournit finalement un assez bon exemple de ce mécanisme.

© Clubic

Mise en abyme oblige, nous avons fait analyser cet article par les deux détecteurs que nous avons décortiqués jusque-là. Chez Pangram ci-dessus, et GPTZero ci-dessous. Le verdict est tombé : 80 % humain pour les deux, et 20 % qui échappent à un verdict aussi net.

© Clubic

Rapellez-vous, lors du premier épisode de cette enquête, T02 avait été entièrement généré avec ChatGPT. Pangram avait pourtant réparti le document entre 67 % AI-Generated et 33 % AI-Assisted, avec un verdict global Mixed / AI Detected. Une fois les seuils connus, ce résultat devient beaucoup plus compréhensible : avec seulement 67 % du document classé AI-Generated, il ne pouvait pas franchir la barre des 80 % nécessaire pour recevoir le verdict global « AI ».

Le contraste avec T08 est encore plus parlant. Celui-ci partait d’un véritable texte humain avant d’être fortement réécrit à l'aide d'une IA. Pangram lui avait pourtant attribué le même verdict global, « Mixed / AI Detected », avec cette fois 38 % de contenu classé IA et 62 % humain. Deux textes dont la genèse n’avait presque rien à voir aboutissaient donc à la même catégorie finale.
C’est une bonne illustration de ce que résume réellement un verdict : il classe le résultat observé mais ne restitue pas nécessairement le processus qui l’a produit.

Un score de « 99 % » ne signifie pas forcément 99 % de certitude

Les pourcentages affichés par les détecteurs peuvent donner une impression de précision trompeuse. Un résultat à « 99 % » ne signifie pas nécessairement qu’il ne reste que 1 % de risque que le verdict soit faux. Tout dépend de ce que mesure réellement ce chiffre et de la manière dont le modèle a été calibré.

Par exemple, chez Pangram, le niveau de confiance indique à quel point le modèle penche vers la catégorie affichée. Il ne correspond pas directement à la probabilité que le verdict soit juste. Enfin, les détecteurs présentent aussi les choses au niveau du document, avec des probabilités différentes selon les passages, sans oublier l'indicateur de confiance global.

Il faut donc se méfier des comparaisons trop rapides car un « 97 % » chez Pangram et un « 97 % » chez GPTZero ou un autre détecteur d'IA, comme Copyleaks, ne signifient donc pas forcément la même chose. GPTZero recommande d’ailleurs lui-même de ne pas utiliser son résultat comme seule preuve, ce qui revêt notamment une certaine importance, par exemple dans le cas d'une procédure disciplinaire.

Même un très faible taux de faux positifs peut poser problème

Le taux de faux positifs est d’ailleurs l’une des métriques les plus importantes pour ces outils. Prenons un exemple fictif, volontairement moins favorable que les chiffres revendiqués aujourd’hui par ces détecteurs d'IA.

Imaginons 10 000 copies, dont seulement 100 ont réellement été produites avec une IA. Notre détecteur en retrouve 90 %, mais affiche également 1 % de faux positifs. Il repère donc correctement 90 copies IA. Mais sur les 9 900 copies honnêtes, 99 seront, elles aussi, signalées. Nous obtenons donc 189 alertes, dont plus de la moitié concernent dans cet exemple des étudiants qui n’ont pourtant pas utilisé d’IA.

C’est ce qu'on pourrait appeler le problème du taux de base. C'est-à-dire que lorsque le phénomène recherché est rare, même un taux de faux positifs qui paraît faible peut peser lourd dans la population des résultats positifs. Pangram revendique actuellement un taux de faux positifs de 0,0041 %, soit environ un texte sur 24 000, sur son corpus FineWeb anglais d’un million de documents. GPTZero communique également sur des taux de faux positifs très faibles dans ses propres évaluations. Il faut toutefois rappeler qu’il s’agit de résultats publiés par les éditeurs eux-mêmes sur leurs protocoles et leurs corpus d’évaluation.

Pourquoi la fiabilité varie-t-elle autant d’un texte à l'autre ?

Même en étant particulièrement bien entraînés, ces modèles restent confrontés à une limite toute simple, à savoir que les caractéristiques qu’ils apprennent ne constituent pas une signature immuable de l’intelligence artificielle.

Une étude publiée en janvier 2026 dans Scientific Reports l’illustre très bien. Deux chercheurs ont entraîné un détecteur spécialisé dans les résumés scientifiques. Sur son jeu de test initial, il repérait 99,8 % de textes IA. Après un passage de paraphrasage réalisé avec GPT-4o, cette proportion tombait à 70,4 %. C'est ce qu'on appelle le "rappel", autrement dit la part des textes IA que le détecteur repère correctement.

Le détecteur n’avait pas cessé de fonctionner. Les paraphrases ont en réalité suffisamment modifié le vocabulaire et la construction des phrases pour brouiller une partie des indices sur lesquels il s’appuyait. C’est précisément ce qui explique pourquoi les performances peuvent fortement varier d’un texte à l’autre, même avec le même outil.

La langue et le profil de l’auteur peuvent peser

De notre côté, nos essais ont été réalisés en français. Les deux services supportent aujourd’hui la langue de Molière en charge.

Cela ne signifie pas que toutes les langues, tous les niveaux de langue et tous les profils d’auteurs se comportent nécessairement de la même manière. L’un des exemples les plus connus remonte à 2023. Un professeur et ses collègues à Stanford avaient soumis à sept détecteurs 91 dissertations TOEFL (un test standardisé d'anglais, destiné aux non-anglophones) réellement écrites par des personnes non anglophones. En moyenne, 61,3 % avaient été classées à tort comme générées par IA, contre environ 5 % pour le groupe de rédactions anglophones utilisé en comparaison. La raison est relativement simple, les auteurs avaient notamment relié ce biais à une écriture plus prévisible et à une diversité lexicale moindre chez les non-anglophones, deux caractéristiques qui étaient alors fortement associées à la génération de textes par les modèles d'IA en vogue à ce moment.

Cette étude ne décrit évidemment pas les détecteurs de 2026… Et tout ça risque bien d'évoluer encore et encore, qu'il s'agisse des architectures comme des corpus. Pangram 4 affirme d’ailleurs obtenir zéro faux positif sur ces 91 textes précis dans son évaluation actuelle.

L’expérience reste néanmoins instructive car un modèle peut apprendre des caractéristiques corrélées à un profil d’écriture plutôt qu’à l’utilisation réelle d’une IA si les données sur lesquelles il s’appuie ne permettent pas de séparer correctement les deux.

Quelques phrases donnent moins d’indices que plusieurs pages

La longueur compte également beaucoup. Pangram exige aujourd’hui au moins 50 mots et explique qu’en dessous, il ne dispose pas de suffisamment d’informations pour produire une analyse qu’il juge fiable. GPTZero indique lui aussi que ses résultats sont généralement plus fiables lorsque le volume de texte analysé augmente.

Sur Pangram, les poèmes de Victor Hugo sont bien détectés comme étant 100 % Humain … Ouf ! © Clubic

Cela éclaire une particularité de notre premier test. Demain, dès l'aube, de Victor Hugo avait bien été reconnu comme humain par Pangram, mais avec une confiance plus limitée que nos articles plus longs. Il n’y a là rien de très mystérieux : moins il y a de texte, moins le détecteur dispose de signal pour stabiliser son jugement.

Il peut montrer où il a réagi, beaucoup moins clairement pourquoi

Enfin, il restera toujours le problème de la "boîte noire". Dire qu’un réseau neuronal combine énormément de caractéristiques ne signifie pas que ses concepteurs puissent ensuite dresser une liste simple du genre : « cette phrase est classée IA à cause de ce mot, de cette longueur et de cette ponctuation ».

Les outils peuvent fournir des éléments d’interprétation et localiser les passages qui pèsent le plus dans la décision, mais cela répond surtout à « où le modèle a-t-il trouvé un signal important ? » et beaucoup moins à « quelle règle explicite et vérifiable lui permet d’affirmer que ce passage vient d’une IA ? ».

Les zones surlignées par un détecteur ne constituent donc pas une démonstration mot par mot de la provenance du texte.

Le texte final n'est qu'une partie de l’histoire

C’est ici même que ce deuxième volet rejoint le premier. Même avec des millions de documents d’entraînement, un modèle de langage spécialisé, plusieurs classificateurs, des seuils optimisés et un travail important sur les faux positifs, Pangram ou GPTZero restent confrontés à ce qu’on leur donne : la version finale du texte. Ils ne disposent pas de son histoire, de sa genèse et ne peuvent pas connaitre le niveau d'implication de l'auteur et son intention derrière la création de ce texte. Le problème est d'ailleurs similaire dans d'autres domaines, notamment dans le monde de la musique.

À découvrir
Musique générée par IA : comment Deezer repère et signale l’« AI slop »
Contenu Sponsorisé
sponsorisé

Or corriger trois fautes avec une IA, lui demander de réécrire chaque phrase ou lui faire générer un chapitre, voire un livre entier sont trois usages très différents.

Une publication déposée sur arXiv en juin 2026 va dans cette direction. L'équipe de scientifiques à son origine a constitué AITDNA, un corpus de textes réellement co-construits entre humains et IA, avec cette fois leur historique détaillé : modifications successives et interactions avec les modèles. Les chercheurs constatent que plusieurs détecteurs fonctionnent bien pour certaines définitions du « texte IA », mais nettement moins lorsqu’on leur demande de couvrir indistinctement toutes les formes de collaboration entre humain et machine.

Avant même de demander si le détecteur a raison, encore faut-il donc savoir ce que nous voulons qu’il détecte. C’est cette frontière que nous allons continuer à explorer dans les prochains volets de cette enquête, avec des textes plus longs, des degrés d’intervention différents et des situations où l’écriture humaine et la génération automatique se mélangent volontairement.

Car derrière la simplicité apparente d’un bouton « vérifier », le chemin est finalement assez long : texte, tokens, représentations numériques, modèle, classification, scores, seuils, post-traitement, et puis enfin, le verdict.

Comprendre cette chaîne permet surtout de mieux cerner la véritable promesse de ces outils. Ils ne découvrent pas qui a écrit un texte : ils estiment à quelle catégorie il ressemble le plus à partir de ce qu’ils ont appris, puis transforment cette estimation en décision. La différence peut sembler technique, pourtant dès qu’un pourcentage devient une accusation, elle ne l’est plus du tout.

Petit lexique des détecteurs d’IA

  • Token : unité de texte manipulée par un modèle de langage. Un token peut correspondre à un mot entier, à une partie de mot, à un nombre ou à un signe de ponctuation.
  • Embedding : représentation numérique d’un mot ou d’un morceau de texte. Elle permet au réseau neuronal de manipuler mathématiquement le sens et le contexte des éléments qu’il analyse.
  • Perplexité : mesure de la « surprise » d’un modèle face à un texte. Plus la suite des mots lui paraît prévisible, plus la perplexité est faible. Cette métrique a beaucoup été utilisée par les premiers détecteurs, mais ne suffit plus à expliquer le fonctionnement des outils modernes.
  • Burstiness : mesure des variations de prévisibilité ou de régularité au sein d’un texte. L’idée est notamment de repérer les changements de rythme que l’écriture humaine peut présenter davantage qu’un texte généré de manière très régulière.
  • Tête de classification : module ajouté à un réseau neuronal pour lui faire prendre une décision précise. Chez Pangram, différentes têtes cherchent par exemple à déterminer si un passage est humain, généré par IA ou assisté par IA.
  • Mixture-of-Experts (MoE) : architecture composée de plusieurs sous-réseaux spécialisés. Tous ne travaillent pas en même temps : le modèle sollicite ceux qu’il juge les plus utiles selon ce qu’il est en train d’analyser.
  • Mirror prompt : technique utilisée par Pangram pour générer un texte IA qui ressemble autant que possible à un texte humain de référence par son sujet, son ton ou son style. Le but est d’éviter que le détecteur apprenne simplement à reconnaître le thème ou le genre du document.
  • Faux positif / faux négatif : un faux positif est un texte humain signalé à tort comme une génération IA. Un faux négatif est l’inverse : un texte généré par IA que le détecteur considère comme humain.
  • Hard negative : exemple humain qu’un détecteur a initialement pris pour de l’IA. Ces erreurs peuvent être réinjectées dans l’entraînement afin d’apprendre au modèle à mieux reconnaître ces cas difficiles.
  • Calibration : manière d’ajuster les scores d’un modèle pour que son niveau de confiance corresponde autant que possible à sa fiabilité réelle. Un score très élevé n’est pas automatiquement synonyme d’une probabilité équivalente d’avoir raison.