Claude utilisé pour pirater OpenAI : l'attaque Janus décryptée

Quand un modèle d'IA devient l'arme pour en attaquer un autre

Imaginez qu'un cambrioleur utilise la clé d'un concurrent pour ouvrir votre coffre-fort. C'est exactement ce que décrit l'attaque Janus : exploiter un modèle d'IA — en l'occurrence Claude d'Anthropic — pour contourner les protections de sécurité de ChatGPT et d'autres systèmes d'OpenAI. Ce qui semblait relever de la science-fiction est désormais documenté, reproductible, et soulève des questions qui vont bien au-delà du simple débat technique.

Janus : de la mythologie romaine à la cybersécurité de l'IA

Dans la mythologie romaine, Janus est le dieu aux deux visages, capable de regarder simultanément le passé et l'avenir. Les chercheurs en sécurité ont choisi ce nom à dessein : l'attaque Janus exploite précisément la double nature des grands modèles de langage (LLM), capables d'être à la fois des outils de protection et des vecteurs d'attaque.

Le principe est le suivant : un attaquant utilise un LLM concurrent — ici Claude, développé par Anthropic — pour générer des jailbreaks sophistiqués, c'est-à-dire des instructions soigneusement formulées destinées à faire "oublier" à un autre modèle ses garde-fous éthiques et de sécurité. L'IA attaquante n'est pas compromise ; elle est simplement instrumentalisée pour produire des contenus que son propre filtre ne bloquerait pas nécessairement, mais que la cible — ChatGPT — ne devrait jamais générer.

Comment fonctionne concrètement l'attaque ?

Étape 1 : la préparation du vecteur

L'attaquant interagit avec Claude en lui demandant d'adopter un cadre narratif, académique ou fictif. Il peut, par exemple, solliciter la rédaction d'un "scénario pédagogique" décrivant comment un personnage fictif contourne un filtre de sécurité. Claude, dont les garde-fous sont différents de ceux d'OpenAI, peut produire ce type de contenu dans certains contextes.

Étape 2 : le transfert de prompt

Le texte généré par Claude est ensuite injecté dans ChatGPT comme prompt d'entrée. L'idée est que ce texte contient des structures linguistiques et logiques spécifiquement conçues pour déstabiliser les mécanismes de censure du modèle cible. On parle de prompt injection inter-modèles.

Étape 3 : l'extraction de contenu sensible

Si l'attaque réussit, ChatGPT génère des réponses qu'il aurait normalement refusées : instructions dangereuses, contenus haineux, informations confidentielles sur son propre fonctionnement interne. Dans les cas documentés par les chercheurs, le taux de succès de certaines variantes atteignait plus de 40 % sur des cibles non patchées.

Pourquoi cette attaque est structurellement différente des jailbreaks classiques

Les jailbreaks traditionnels consistent à manipuler directement le modèle cible via des prompts astucieux. Janus introduit une rupture fondamentale : l'asymétrie des systèmes de filtrage devient une arme en soi.

  • Chaque LLM a ses propres angles morts : Ce que Claude refuse de produire, GPT-4 pourrait l'accepter, et vice versa. Cette hétérogénéité, censée renforcer la sécurité globale de l'écosystème, crée en réalité une surface d'attaque inédite.
  • Les défenses sont isolées : Anthropic et OpenAI optimisent leurs garde-fous indépendamment. Il n'existe aucun standard commun de résistance aux attaques inter-modèles.
  • La traçabilité est quasi nulle : Identifier qu'une attaque a transité par un modèle tiers avant d'atteindre la cible est techniquement très difficile pour les équipes de sécurité.

Les implications pour les entreprises et les utilisateurs

Pour une entreprise qui déploie ChatGPT ou un autre LLM dans ses processus internes — service client, analyse de données, assistance juridique — l'attaque Janus représente un risque concret. Un employé malveillant ou un acteur externe pourrait extraire des informations confidentielles intégrées dans les prompts système, contourner des politiques d'usage définies par l'entreprise, ou générer des contenus compromettants au nom de l'organisation.

Pour le grand public, le risque est plus insidieux : des plateformes qui semblent "sécurisées" peuvent être contournées à leur insu, et les contenus produits — désinformation, manipulation, escroquerie — semblent légitimes car générés par des systèmes réputés fiables.

Que font Anthropic et OpenAI face à cette menace ?

Les deux entreprises ont été informées des travaux des chercheurs dans le cadre d'une responsible disclosure. OpenAI a déployé des correctifs partiels sur les variantes les plus documentées. Anthropic a, de son côté, renforcé la détection des patterns de prompt engineering inter-modèles dans certaines versions de Claude.

Cependant, la réalité est brutale : patcher Janus de manière définitive nécessiterait une coordination entre acteurs concurrents qui n'ont aucune incitation commerciale à partager leurs architectures de sécurité. L'absence d'un cadre réglementaire contraignant — comparable à ce que le RGPD représente pour les données personnelles — laisse un vide dangereux.

Ce que Janus révèle sur l'avenir de la sécurité de l'IA

L'attaque Janus n'est pas un bug que l'on corrige avec un patch. C'est le symptôme d'une fragilité systémique : dans un écosystème où des dizaines de LLM puissants coexistent, chacun peut potentiellement devenir le complice involontaire d'une attaque contre ses concurrents. La compétition entre OpenAI, Anthropic, Google et Meta — qui a longtemps été présentée comme un gage de diversité et de résilience — devient paradoxalement un vecteur de vulnérabilité.

La prochaine frontière de la cybersécurité ne sera pas seulement de protéger les systèmes contre les humains. Ce sera de protéger les IA contre d'autres IA. Et nous n'y sommes clairement pas encore prêts.


Reservoir Live