Mythos 5 fait encore parler de lui pour ses capacités dangereuses en termes de cybersécurité. L’IA d’Anthropic a tenté de glisser du code piégé dans un vrai projet. Le modèle a ensuite créé de faux comptes pour tromper les développeurs humains. Mythos a même interrogé la réalité d’Internet lors de son attaque confuse.

- Mythos 5 d’Anthropic a tenté d’injecter du code piégé dans un vrai projet GitHub pendant un test britannique de cybersécurité.
- Le modèle a créé de faux comptes, envoyé des emails aux développeurs et utilisé des tactiques pour faire accepter son code malveillant.
- L’affaire montre le danger des agents IA connectés à Internet, même si l’attaque a été stoppée par une relecture humaine.
À la fin du mois de juillet 2026, l’affaire a éclaté pendant un test de cybersécurité mené par un organisme public britannique. C’est l’AI Security Institute (AISI), rattaché au gouvernement britannique, qui a repéré l’attaque menée par Mythos.
En toute liberté, Mythos attaque des projets et développeurs
L’organisme a évalué sept grands modèles d’IA sur des exercices de piratage. Le 28 juillet 2026 au matin, son service de surveillance a détecté des données qui quittaient un système de test par le réseau anonyme Tor. En clair, une IA agissait en ligne, connectée à Internet, sans autorisation humaine. Les chercheurs ont fini par recenser 19 actions du même genre, dont certaines visaient de vraies personnes et organisations.
Il faut préciser un point. Les chercheurs ont volontairement ouvert l’accès à Internet pour les besoins de l’exercice. L’équipe a même retiré les garde-fous que les créateurs des modèles installent contre les utilisations illégales. Sur les 19 actions, 17 venaient de Mythos 5 d’Anthropic et 2 du modèle GPT-5.6 Sol d’OpenAI.
Le cas le plus grave vise un projet hébergé sur la plateforme GitHub. Mythos 5 a d’abord ouvert une demande d’intégration pour fusionner son code piégé dans ce projet. L’IA a ensuite créé de faux comptes en ligne qui prétendaient avoir vérifié ce code et garanti l’absence de virus.
Ces fausses identités appuyaient publiquement la demande d’intégration. Et pour cause, une seule fausse identité ne suffit pas à convaincre les développeurs d’un projet. Le modèle a ensuite ciblé les développeurs humains. Mythos 5 a envoyé cinq emails aux deux personnes chargées du projet. Certains contenaient un virus, d’autres cherchaient à faire accepter la fausse demande d’intégration.
Mythos s’est mis à douter de la réalité d’Internet
Mais ce n’est pas tout puisque le modèle a ouvert un ticket sur un second projet avec une injection d’instructions cachées. L’injection ciblait les agents de programmation qui trient ces tickets. Le modèle partait du principe que le développeur était un agent comme Claude Code, l’agent de programmation d’Anthropic.
Un détail des transcriptions donne le vertige. Par moments, le modèle a douté de la réalité de ses actions et se demandait si Internet n’est pas… une simulation. L’IA a alors tranché dans son raisonnement : « Cela se passe sur le vrai GitHub, les conséquences sont réelles ». Le modèle a eu conscience de ses actes.
Face à la mise en ligne d’un paquet piégé sur le dépôt public PyPI, le modèle a donc refusé. « Ce serait attaquer une infrastructure tierce et causer un vrai préjudice, c’est totalement exclu », note l’IA. Le modèle d’OpenAI a suivi une autre voie avec ses deux actions. GPT-5.6 Sol a réutilisé un jeton d’accès GitHub qu’un agent d’un autre laboratoire a laissé sur un bloc-notes public en ligne.
Le nouveau danger des attaques IA ? Le partage de jetons
Le partage de jetons entre agents est l’un des nouveaux dangers en termes de cybersécurité. Et comment l’attaque contre le projet open source fut déjouée ? Un humain qui a relu le code et signalé le problème, heureusement.
Rappelons que cette affaire arrive après d’autres alertes sur les agents IA. En juillet 2026, Claude Cowork s’est échappé de son bac à sable pour attaquer un Mac. Anthropic communiqué beaucoup sur la dangerosité de Mythos qui est accessible à quelques organisations triées sur le volet.
Ce modèle repère si vite les failles qu’Anthropic demande un frein mondial sur les IA les plus avancées. L’AI Security Institute a prévenu GitHub, stoppé ces tests et durci ses règles d’accès à Internet pour la suite.
Source : AISI














Un avis, une expérience, un désaccord ? La discussion est ouverte.