
Tech • IA • Crypto
Anthropic a lancé Claude Fable 5, un modèle d’IA de pointe doté de garde-fous intégrés qui limitent ses capacités dans les domaines à haut risque en raison de préoccupations liées à son utilisation abusive dans les cyberattaques et la biologie avancée.
Claude Fable 5 est accessible publiquement via API et offres entreprise, mais fonctionne avec des protections intégrées qui restreignent les réponses dans des domaines sensibles comme la cybersécurité, la biologie, la chimie et la distillation de modèles. Lorsque des requêtes à haut risque sont détectées, le système rétrograde automatiquement vers Claude Opus 4.8, un modèle moins puissant. Ce basculement se produit dans moins de 5 % des sessions, permettant à la majorité des utilisateurs d’accéder aux capacités complètes tout en limitant les usages dangereux.
Fable 5 partage son architecture avec Claude Mythos 5, une version plus permissive réservée à des organisations validées dans le cadre de programmes comme Project Glasswing, menés avec la collaboration du gouvernement américain. L’accès à Mythos est limité aux entités actives en cybersécurité et en recherche biologique, en raison des risques d’usage dual du modèle.
Anthropic indique que Fable 5 domine les benchmarks en ingénierie logicielle, finance, analytique et raisonnement scientifique. Stripe rapporte que le modèle a réalisé la migration d’une base de code Ruby de 50 millions de lignes en une journée, une tâche estimée à plus de deux mois pour des ingénieurs. En finance et analytique, il atteint des scores élevés sur des tests de raisonnement complexe, dépassant notamment 90 % de précision sur des tâches analytiques longues.
Le modèle montre de solides capacités multimodales, comme l’extraction de données numériques à partir de schémas scientifiques et la reconstruction d’applications web depuis des captures d’écran. Lors d’une démonstration, il a terminé le jeu Pokémon FireRed uniquement à partir d’entrées visuelles, sans outils externes. Il a aussi simulé le mouvement planétaire à partir de principes physiques pour prédire des éclipses solaires, illustrant un raisonnement de haut niveau.
Des évaluations internes et externes indiquent que les modèles de type Mythos peuvent identifier et exploiter des vulnérabilités logicielles et assister à plusieurs étapes d’attaques, y compris la reconnaissance et les déplacements latéraux. Cette capacité, qualifiée de piratage agentique, réduit fortement le coût et la complexité des attaques, justifiant des garde-fous stricts.
Les tests montrent que le modèle peut surpasser des outils spécialisés dans la conception de virus adéno-associés, utilisés en thérapie génique, bien qu’il n’ait pas été entraîné spécifiquement pour cela. Si ces capacités sont prometteuses pour la médecine, elles pourraient aussi servir à concevoir des agents biologiques nocifs, suscitant des inquiétudes.
Anthropic a déployé des classificateurs d’IA distincts pour détecter les tentatives d’abus et bloquer les sorties dangereuses, y compris les jailbreaks. Plus de 1 000 heures de tests externes n’ont révélé aucun jailbreak universel, bien que l’entreprise reconnaisse qu’une prévention totale est improbable. Pour faciliter la surveillance, Anthropic impose désormais une conservation des données de 30 jours pour tous les utilisateurs de Fable 5 et modèles similaires, y compris en entreprise.
Fable 5 est facturé 10 $ par million de tokens en entrée et 50 $ par million de tokens en sortie, soit le double du coût d’Opus 4.8 mais moins de la moitié du tarif initial de Mythos. D’abord inclus dans les abonnements jusqu’au 22 juin, il passera ensuite à un modèle à l’usage en raison de contraintes de capacité.
Ce lancement intervient dans un contexte de préoccupations croissantes sur les risques des IA avancées et coïncide avec des mouvements majeurs vers des introductions en bourse dans le secteur. Les gouvernements réagissent également, notamment aux États-Unis avec une politique autorisant un accès anticipé volontaire aux systèmes avancés. Anthropic appelle à des garde-fous globaux coordonnés à mesure que les modèles approchent des capacités potentielles d’auto-amélioration récursive.
Claude Fable 5 illustre un bond majeur en capacité, accompagné de restrictions inédites, révélant la tension croissante entre innovation et sécurité à mesure que les modèles atteignent des niveaux potentiellement dangereux d’autonomie et d’efficacité.