Claude vient de faire ce que personne n'attendait face à ChatGPT.

Claude vient de faire ce que personne n'attendait face à ChatGPT.

Quand une IA devient le meilleur hacker d'une autre IA

Les chercheurs en cybersécurité ont longtemps fantasmé sur un scénario précis : que se passerait-il si on utilisait une intelligence artificielle pour trouver les failles d'une autre ? En 2024, ce scénario est devenu réalité. Et le résultat est bien plus inquiétant qu'un simple exercice académique.

Des équipes de chercheurs indépendants ont documenté des cas où Claude, le modèle d'Anthropic, a été utilisé pour identifier et exploiter des vulnérabilités spécifiques dans ChatGPT — et vice versa. Ce phénomène, baptisé "adversarial AI probing", soulève des questions fondamentales sur la sécurité de l'écosystème IA que nous utilisons au quotidien.

Le contexte : pourquoi les IA peuvent se "pirater"

Pour comprendre ce phénomène, il faut partir d'un constat simple : toutes les grandes IA conversationnelles partagent des caractéristiques structurelles communes. Elles ont des garde-fous, des instructions système (les fameux "system prompts"), et des comportements conditionnés par leur entraînement. Ces éléments constituent à la fois leur force… et leur surface d'attaque.

Les prompt injections — des instructions malveillantes dissimulées dans un texte apparemment innocent — représentent la forme la plus courante de cette exploitation. Mais ce qui change la donne, c'est quand une IA est précisément calibrée pour générer ces injections contre une autre.

Claude, entraîné par Anthropic avec une approche constitutionnelle de la sécurité, possède une compréhension fine des mécanismes de raisonnement des LLM. Cette même compréhension lui permet, dans un cadre de recherche, d'identifier les points de rupture logique dans d'autres modèles.

Ce que les chercheurs ont observé concrètement

L'extraction de system prompts

Dans plusieurs expériences documentées, des chercheurs ont demandé à Claude de formuler des requêtes conçues pour amener ChatGPT à révéler des portions de ses instructions système confidentielles. En exploitant des incohérences dans la manière dont GPT-4 gère les contextes contradictoires, Claude a réussi à construire des prompts qui contournaient partiellement ces protections.

  • Taux de succès observé dans certains tests : entre 23 % et 41 % selon la version du modèle cible
  • Délai moyen pour générer un prompt exploitable : moins de 90 secondes
  • Types d'informations extraites : instructions de ton, restrictions thématiques, identité de déploiement

La manipulation de comportement

Plus préoccupant encore : certains prompts générés par Claude ont réussi à faire produire à ChatGPT des contenus qu'il refuse normalement. Non pas en le "trompant" grossièrement, mais en exploitant des zones grises sémantiques — des formulations ambiguës que le modèle cible interprète différemment de ce que ses développeurs avaient anticipé.

Ce n'est pas de la magie. C'est de l'ingénierie linguistique appliquée à grande échelle, automatisée par une IA qui comprend mieux que n'importe quel humain les patterns de réponse de ses concurrents.

La symétrie dangereuse : ChatGPT peut en faire autant

Il serait réducteur de présenter Claude uniquement comme l'attaquant. Les chercheurs ont également documenté le chemin inverse. GPT-4, avec les bons paramètres, peut générer des attaques efficaces contre Claude, Gemini, ou Mistral. Cette symétrie bidirectionnelle révèle un problème systémique, pas une faille isolée d'un acteur en particulier.

Le vrai risque ne vient pas des labos de recherche. Il vient des acteurs malveillants qui pourraient automatiser ces attaques à l'échelle, en déployant une IA bon marché pour sonder en continu les défenses des modèles premium utilisés par des entreprises.

Quelles implications pour les utilisateurs et les entreprises ?

Si vous utilisez ChatGPT ou Claude dans un contexte professionnel — notamment via l'API ou des applications tierces — plusieurs points méritent votre attention immédiate :

  • Vos system prompts ne sont pas secrets : même si vous pensez les avoir bien protégés, des techniques adversariales peuvent les exposer partiellement.
  • Les IA que vous déployez peuvent être manipulées : sans couches de validation supplémentaires, un utilisateur malveillant peut altérer leur comportement.
  • La confiance aveugle dans les garde-fous natifs est risquée : les filtres intégrés des modèles ne suffisent pas face à des attaques conçues par d'autres IA.

Les équipes de sécurité doivent désormais intégrer le concept de red teaming automatisé dans leurs pratiques — c'est-à-dire utiliser des IA pour tester leurs propres déploiements IA, avant que quelqu'un d'autre ne le fasse à leur place.

Ce que font Anthropic et OpenAI face à cette menace

Les deux entreprises sont conscientes du problème. Anthropic publie régulièrement des rapports sur la robustesse adversariale de Claude. OpenAI a renforcé ses mécanismes de détection de prompt injection dans GPT-4o. Mais la course entre attaque et défense dans ce domaine ressemble fortement à celle que connaît la cybersécurité traditionnelle : les défenseurs construisent des murs, les attaquants cherchent des portes.

La différence fondamentale, c'est que dans ce nouveau paradigme, les outils offensifs les plus puissants sont précisément les mêmes que les outils défensifs. Claude protège. Claude attaque. ChatGPT génère. ChatGPT manipule. Tout dépend de qui tient le prompt.

Conclusion : bienvenue dans l'ère de la cybersécurité IA-native

Le fait que des IA puissent s'auditer mutuellement n'est pas intrinsèquement négatif. Dans un cadre éthique et contrôlé, c'est même une avancée significative pour la sécurité du secteur. Mais cela impose une réalité nouvelle : déployer une IA sans stratégie de sécurité dédiée, c'est laisser une porte ouverte dans un écosystème où vos concurrents — ou pire, des acteurs malveillants — peuvent envoyer d'autres IA frapper à cette porte.

La prochaine fois que vous configurerez un chatbot IA pour votre entreprise, posez-vous une question simple : est-ce qu'une IA adverse pourrait le retourner contre vous en 90 secondes ?


Reservoir Live