
Tech • IA • Robotique
Anthropic a lancé Claude Fable 5, un modèle public très performant dérivé de Mythos 5, accompagné de nouveaux garde-fous, dont un mécanisme non divulgué pouvant dégrader silencieusement les performances sur certaines tâches sensibles.
Anthropic a introduit une nouvelle classe de modèles haut de gamme, Mythos, avec deux variantes. Claude Fable 5 est доступible au public, tandis que Claude Mythos 5 est réservé à des partenaires sélectionnés dans le cadre du programme Glasswing, incluant des acteurs de la cybersécurité et des infrastructures. Les deux reposent sur le même système de base, mais diffèrent par les garde-fous appliqués.
Mythos 5 est présenté comme doté de capacités cyber de pointe et n’est pas accessible au grand public pour des raisons de sécurité. Une collaboration avec le gouvernement des États-Unis fait partie de son cadre de déploiement, reflétant une sensibilité accrue aux risques de mauvaise utilisation.
Pour des domaines comme la cybersécurité, la biochimie et la distillation de modèles, Fable 5 bascule vers l’ancien modèle Opus 4.8. Cela se produit dans moins de 5 % des sessions et est explicitement signalé aux utilisateurs lorsqu’il est activé.
Sur des benchmarks de code comme Bench Pro, Fable 5 atteint 80,3 %, contre 69,2 % pour Opus 4.8 et 58,6 % pour GPT 5.5. En pratique, Stripe l’a utilisé pour migrer une base de code Ruby de 50 millions de lignes en une seule journée, une tâche estimée à plus de deux mois manuellement.
Le prix est fixé à 10 $ par million de tokens en entrée et 50 $ par million de tokens en sortie, soit environ le double de Opus 4.8. Toutefois, une meilleure efficacité des tokens pourrait ramener le coût total des projets à environ 1,5× plutôt qu’un doublement complet.
Les performances augmentent avec davantage de calcul, mais plafonnent au niveau le plus élevé. Passer de « très élevé » à « max » apporte peu de gains de précision tout en faisant grimper les coûts d’environ 12 $ à 20 $, ce qui suggère un usage optimal en dessous du maximum.
Grâce à une mémoire persistante, les performances sur des tâches complexes ont été multipliées jusqu’à trois fois par rapport aux modèles précédents. Lors d’évaluations internes, Mythos 5 a généré des hypothèses en biologie moléculaire préférées par les chercheurs 80 % du temps en comparaison à l’aveugle.
Un mécanisme moins visible cible les tentatives de développement de modèles d’IA avancés concurrents. Au lieu de bloquer ou rediriger, le système réduit subtilement la qualité des réponses via des modifications de prompts et des ajustements. Les utilisateurs ne reçoivent aucune indication lorsque ce dispositif est activé.
Cette intervention cachée toucherait seulement 0,03 % des requêtes et moins de 0,1 % des organisations. Malgré cette portée restreinte, certains chercheurs en IA critiquent le manque de transparence, estimant qu’il mine la confiance dans les résultats.
Anthropic conserve désormais toutes les interactions utilisateurs jusqu’à 30 jours à des fins de sécurité, notamment contre les tentatives de jailbreak. L’entreprise affirme que ces données ne sont pas utilisées pour l’entraînement et sont généralement supprimées ensuite, bien que cette politique suscite des inquiétudes en matière de confidentialité.
La dernière version d’Anthropic associe avancées techniques majeures et garde-fous multicouches, mais l’introduction d’une dégradation non divulguée des performances met en lumière les tensions croissantes entre capacité, sécurité et transparence dans les systèmes d’IA avancés.
Explique-moi