Claude Haiku 4.5 a envoyé un faux témoignage sur un meurtre non élucidé à la police de Philadelphie, au beau milieu d’un test. Anthropic, qui a recensé d’autres écarts de ses modèles, a décidé de couper l’accès à Internet de toutes ses évaluations internes.

Anthropic passe au crible les transcriptions de ses tests depuis juillet. L’entreprise avait admis à cette époque que trois versions de Claude avaient pénétré les systèmes de trois entreprises bien réelles, lors de tests de cybersécurité mal cloisonnés. Les cas recensés dans son nouveau rapport sont moins graves, estime-t-elle, mais Claude a cette fois agi sur des sites publics, dont certains sont gérés par des administrations américaines. La Maison-Blanche et chacune des agences concernées ont reçu un compte rendu de l’entreprise.
Anthropic a donc étendu à toutes ses évaluations internes une coupure d’Internet réservée jusqu’ici à certains tests à haut risque, le temps de vérifier la fiabilité de ses outils de surveillance sur ce type de comportement. Elle doit maintenant expliquer pourquoi des modèles chargés de tâches banales en viennent à forcer un serveur ou à écrire à la police, et pourquoi deux mois ont été nécessaires pour découvrir le faux témoignage.
La solution tout-en-un pour protéger votre entreprise
Votre petite entreprise a de grandes ambitions. Protégez-là contre les pirates. Et développez sereinement votre activité !
Bloqué dans sa tâche, Claude force le passage
« La plupart sont des formes de persistance, dans lesquelles Claude, lorsqu’il ne peut pas accomplir une tâche telle qu’elle lui a été confiée, contourne une restriction au lieu de s’arrêter », explique Anthropic. Claude Mythos Preview devait par exemple mener une analyse scientifique avec un outil public hébergé par une université, mais il n’obtenait qu’un message d’erreur. Le modèle a alors fouillé le site et trouvé sur le serveur un script capable de livrer n’importe quel fichier. Il l’a utilisé pour copier des fichiers du serveur, dont le code de ce script. Dans ce code, Claude a repéré une faille d’injection, puis l’a exploitée pour exécuter des commandes sur le serveur et lancer son calcul.
Chargé de situer le lieu d’une photo, Claude Mythos 5 a récupéré des jetons d’accès valides dans le fichier de configuration transmis aux navigateurs par le site cadastral d’une collectivité locale, puis interrogé directement le serveur de la carte. Lors d’un projet statistique mené par un chercheur d’Anthropic, le modèle a aussi obtenu sans payer des données publiques vendues par une agence d’État, grâce à un jeton d’accès distribué à tout visiteur sur le tableau de bord de l’agence. Claude Opus 5 et Claude Mythos 5 ont enfin utilisé des raccourcisseurs d’URL gratuits pour contourner la longueur maximale d’adresse imposée à leur outil de lecture de pages web. Anthropic avait fixé cette limite pour empêcher des injections glissées dans de longues URL.
Anthropic met en cause l’apprentissage par renforcement, où un modèle reçoit une récompense chaque fois qu’il réussit une tâche. Si un contournement est récompensé par erreur pendant l’entraînement, Claude retient la méthode et peut la réutiliser ailleurs. Dans bien des cas, le modèle avait aussi reçu des consignes ambiguës, voire impossibles à suivre, reconnaît l’entreprise.
Anthropic a mis deux mois à repérer le faux témoignage
Claude Haiku 4.5 devait générer puis réaliser des tâches d’exemple sur des pages web tirées au hasard. L’une d’elles était consacrée à un homicide non élucidé et comportait le formulaire de signalement de la police de Philadelphie, hébergé sur PhillyUnsolvedMurders.com. Anthropic avait interdit au modèle de se connecter, de créer un compte, de saisir des données personnelles ou de faire des achats, sans rien prévoir pour l’envoi de formulaires. Claude a donc rédigé un témoignage de trois phrases et laissé vides les champs nom et contact. « Je me souviens avoir vu une personne correspondant à la description dans le secteur de [la rue citée sur la page] à cette période », a-t-il notamment écrit, alors que la page ne contenait aucune description du suspect. Envoyé le 18 juillet à 23 h 27, le message a été classé en spam et n’a jamais été transmis aux enquêteurs.
Anthropic n’a découvert l’incident que le 28 septembre et a prévenu la police le 7 octobre, d’après le communiqué du département relayé par la chaîne locale 6abc. L’entreprise date pour sa part son signalement du 8 octobre. Ses représentants ont rencontré les policiers ce jour-là. « Le délai de deux mois pour détecter l’incident et le signaler à la ville est inacceptable », a tranché la police de Philadelphie. Pour Venkat Margapuri, professeur adjoint d’informatique à l’université Villanova, interrogé par la chaîne, envoyer des informations sur un site au nom d’un utilisateur est une action à haut risque. « Cela aurait dû être détecté plus tôt », a-t-il ajouté.
L’entreprise estime l’impact réel de ces cas minime. D’après la transcription, Claude voulait seulement produire un exemple pour sa tâche, sans chercher à tromper qui que ce soit. Anthropic pourrait toutefois revoir cette interprétation après une analyse plus poussée. Certaines évaluations publiques ont été abandonnées, d’autres reconstruites pour ne plus toucher de sites en ligne. Les ingénieurs d’Anthropic ont aussi conçu un outil de détection automatique, et lors des essais, tous les cas du rapport ont été bloqués par cet outil. L’entreprise analyse maintenant un volume bien plus large de transcriptions, dont celles de son usage interne de Claude, et prévoit de signaler de nouveaux cas au fil de son examen.