Claude Fable 5.1 et Mythos 5.1 : Anthropic renforce ses modèles… et ses garde-fous
Claude Fable 5.1 et Mythos 5.1 : Anthropic renforce ses modèles… et ses garde-fous
Anthropic a dévoilé le 1er septembre 2026 Claude Fable 5.1 et Claude Mythos 5.1, nouvelles versions de ses modèles de pointe. Une relance trois mois seulement après Fable 5 et Mythos 5, dont la sortie de juin 2026 avait été chaotique — jusqu'à une suspension par ordre de Washington. L'entreprise revendique des gains en codage agentique et en recherche scientifique, avec des coûts d'exploitation réduits par rapport à la génération précédente.
Fable 5.1 peut chercher les failles, mais pas les exploiter
Le curseur cybersécurité évolue nettement avec Fable 5.1 :
- Le modèle peut désormais être utilisé pour identifier des vulnérabilités logicielles, capacité auparavant bloquée par ses propres garde-fous.
- Anthropic annonce 60 % de blocages en moins de la part de ses systèmes de protection sur Claude Code, grâce à une meilleure détection des faux positifs (requêtes légitimes de défenseurs signalées à tort).
- En revanche, pentest, génération d'exploits et scan de vulnérabilités binaires restent redirigés automatiquement vers des modèles Opus, jugés moins performants et donc moins risqués : Fable 5.1 cherche, mais ne livre pas d'arme.
Ces garde-fous ont été éprouvés par deux organisations externes en plus des tests automatisés ; Anthropic affirme n'y avoir trouvé aucun jailbreak critique.
La guerre anti-distillation
Autre chantier majeur : les mécanismes anti-distillation, cette technique qui consiste à extraire les capacités d'un modèle avancé — souvent via des milliers de faux comptes — pour les répliquer sans les garde-fous d'origine. En juin 2026, Anthropic avait accusé Alibaba d'avoir mené la plus grande campagne de distillation de Claude jamais recensée, via près de 29 millions d'échanges (source BBC). Concrètement, les nouveaux comptes API ne peuvent plus modifier rétroactivement les messages d'une conversation en conservant la chaîne de raisonnement interne de Claude — une brèche utilisée pour faire « dérouler » le raisonnement du modèle et récupérer ses chaînes de pensée à des fins d'entraînement.
Mythos 5.1, sous surveillance rapprochée de Washington
La version la plus puissante reste réservée à des organisations pré-vérifiées (« vetted ») via deux programmes : le Cyber Verification Program (cyberdéfense) et le Life Sciences Verification Program, développé en partenariat avec le gouvernement américain. Mythos 5.1 est pour l'instant limité à des organisations américaines ; l'ouverture internationale se fera « en coordination avec le gouvernement américain ». Côté entreprises, le dispositif Enterprise Frontier Safeguards (EFS) stockera les données de trafic sur l'infrastructure cloud du client — disponible fin d'automne — pour concilier détection des abus et confidentialité des secteurs réglementés.
Pourquoi c'est important
- Le precedent de juin pèse toujours : la suspension par Washington des modèles précédents montre que la diffusion des modèles frontière est devenue un enjeu géopolitique, et l'architecture 5.1 en porte la marque (accès filtrés, surveillance gouvernementale).
- Sécurité offensive/defensive : une ligne explicite : Anthropic formalise la distinction entre chercher des failles (autorisé) et les exploiter (interdit) — une grille de lecture que d'autres éditeurs vont probablement reprendre.
- L'anti-distillation devient un produit : protéger les chaînes de raisonnement d'un modèle frontière est désormais un argument commercial autant qu'une mesure technique.