Claude vient de faire ce que personne n'attendait.

Claude vient de faire ce que personne n'attendait.

Anthropic ouvre les yeux : voici ce que Claude refuse de faire — et pourquoi ça change tout

Des milliers de requêtes bloquées chaque jour. Des tentatives de manipulation, de contournement, de détournement à des fins dangereuses. Anthropic a décidé de briser le silence et de publier des données concrètes sur les usages que son IA Claude refuse catégoriquement de traiter. Entre exercice de transparence salutaire et révélateur inquiétant sur l'état réel des risques liés à l'IA, cette initiative mérite qu'on s'y attarde sérieusement.

Pourquoi Anthropic publie ce que d'autres taisent

Dans l'industrie de l'IA, la communication sur les échecs, les refus et les incidents de sécurité reste un sujet tabou. Les grandes entreprises technologiques communiquent volontiers sur leurs succès, leurs benchmarks et leurs performances. Elles communiquent beaucoup moins sur ce que leurs modèles refusent de faire — et pourquoi.

Anthropic fait un pari différent. En publiant des informations sur les catégories d'usages bloqués par Claude, la société envoie un message clair : la sécurité n'est pas un argument marketing, c'est un engagement mesurable. Cette démarche s'inscrit dans ce que les experts appellent la "safety transparency", une forme de redevabilité publique encore rare dans le secteur.

Mais cette transparence a aussi un coût : elle oblige à reconnaître que les tentatives d'abus existent, qu'elles sont nombreuses, et qu'elles sont parfois sophistiquées.

Ce que Claude bloque concrètement : les grandes catégories

Les refus de Claude ne sont pas aléatoires. Ils reposent sur une hiérarchie de valeurs intégrée dans le modèle, et les données publiées par Anthropic permettent de dégager plusieurs familles de risques :

  • La création d'armes et de substances dangereuses : instructions pour synthétiser des agents chimiques ou biologiques, fabrication d'explosifs, contournement de dispositifs de sécurité physique.
  • La désinformation coordonnée : génération de fausses identités, rédaction de campagnes de manipulation à grande échelle, usurpation de personnalités publiques.
  • L'exploitation des mineurs : toute forme de contenu sexualisé impliquant des enfants, refusé de manière absolue et non négociable.
  • Les cyberattaques ciblées : aide à la création de malwares, scripts d'intrusion, exploitation de failles zero-day sur des systèmes identifiés.
  • L'aide à des acteurs malveillants identifiés : soutien à des entités sous sanctions internationales ou liées à des organisations terroristes.

Ces catégories ne sont pas théoriques. Elles correspondent à des requêtes réelles, soumises par de vraies personnes, parfois avec des techniques de contournement élaborées.

Le jeu du chat et de la souris : les tentatives de jailbreak

L'une des données les plus frappantes de cette initiative de transparence concerne les jailbreaks — ces tentatives de manipulation visant à faire dire à Claude ce qu'il est programmé pour refuser. Les méthodes évoluent rapidement :

Les scénarios fictifs comme cheval de Troie

Beaucoup d'utilisateurs malveillants habillent leurs requêtes dangereuses dans des contextes fictifs : "Pour mon roman de science-fiction, explique-moi comment un personnage pourrait synthétiser…". Claude est entraîné à reconnaître ces tentatives, même lorsque le cadre narratif est sophistiqué.

La fragmentation des requêtes

Certains acteurs décomposent une demande globalement dangereuse en dizaines de sous-questions apparemment innocentes, espérant que le modèle ne reconstitue pas le puzzle. C'est précisément contre ce type d'attaque que la cohérence contextuelle de Claude est renforcée au fil des versions.

L'autorité simulée

"Je suis chercheur en biosécurité agréé par le gouvernement." Ces affirmations d'autorité, impossibles à vérifier, sont utilisées pour tenter de débloquer des informations sensibles. Claude apprend à ne pas accorder de privilèges sur la base d'assertions non vérifiables.

Transparence ou aveu de vulnérabilité ?

Cette ouverture d'Anthropic suscite des réactions contrastées dans la communauté de la sécurité informatique et de l'éthique de l'IA.

D'un côté, les défenseurs de cette approche soulignent qu'elle permet un débat public éclairé, oblige les concurrents à se positionner, et crée une forme de pression positive sur l'ensemble de l'industrie. Google avec Gemini, OpenAI avec ChatGPT — tous sont désormais implicitement invités à faire de même.

De l'autre, des voix critiques s'interrogent : publier des catégories de refus ne revient-il pas à fournir une feuille de route aux acteurs malveillants ? Si on sait ce que Claude bloque, on sait aussi sur quoi concentrer ses efforts de contournement. C'est le paradoxe fondamental de toute communication en matière de sécurité.

Ce que cela nous dit de l'état réel de l'IA en 2025

Au-delà du cas Anthropic, cette initiative révèle une vérité que l'industrie peine encore à formuler clairement : les grands modèles de langage sont devenus des cibles. Pas seulement des outils. Des cibles pour des acteurs qui cherchent à les détourner à des fins criminelles, géopolitiques ou simplement malveillantes.

La course n'est plus seulement entre entreprises pour la performance. Elle est aussi entre développeurs de garde-fous et ceux qui tentent de les franchir. Et dans cette course-là, la transparence n'est pas une faiblesse — c'est peut-être la seule stratégie durable.

Conclusion : l'honnêteté comme avantage compétitif

En choisissant de montrer ce que Claude refuse, Anthropic ne joue pas la carte de la naïveté. L'entreprise joue celle de la confiance à long terme. Dans un secteur où les promesses sont nombreuses et les preuves rares, documenter ses propres limites est devenu un acte de différenciation.

La vraie question n'est pas de savoir si Claude est parfait — il ne l'est pas. C'est de savoir si les acteurs de l'IA sont prêts à être honnêtes sur leurs imperfections. Pour l'instant, Anthropic est l'un des seuls à avoir répondu oui.


— Reservoir Live