Un modèle amélioré pour les tâches longues et le travail de la connaissance
Moins de deux mois après Opus 5, Claude Opus 5.5 s’installe en haut de la gamme Opus et ouvre la génération 5.5. La firme le destine aux tâches longues qu’un modèle mène de bout en bout : migration d’une base de code, audit d’un dépôt, recherche documentaire ou construction d’un modèle financier. Elle lui prête les capacités de Fable 5.1, son modèle le plus avancé jusqu’ici, sur la plupart des travaux.
Le million de tokens passe à 4 $ en entrée et 20 $ en sortie, contre 5 $ et 25 $ auparavant. Avec une consommation de tokens plus sobre, Anthropic chiffre l’économie à 40 % sur les usages courants. Cette baisse ne se fait pourtant pas au détriment des performances : sur Terminal-Bench 4.0, Opus 5.5 obtient 66,4 %, contre 55,8 % pour Fable 5.1. Le modèle arrive en tête sur la plupart des benchmarks publiés par la firme, qui prévient toutefois qu’à ce niveau de capacités, ces tests reflètent mal les différences réelles entre modèles.

Dans son blog post, Anthropic met aussi en avant un travail sur la manière dont le modèle s’exprime, l’un des reproches les plus fréquents adressés à Opus 5. Deux réglages ont changé : le niveau d’effort par défaut est désormais sur « moyen », et le mode réflexion ne peut plus être désactivé.
Disponibilité de Claude Opus 5.5
Le modèle est accessible sur l’ensemble des plateformes, dont Amazon Web Services, Google Cloud et Microsoft Azure, sous l’identifiant claude-opus-5-5. Du côté des abonnés à Claude, les limites d’usage sur cinq heures des offres Pro, Max, Team et Enterprise par siège sont relevées, avec une réinitialisation offerte qu’ils peuvent déclencher quand vous le souhaitez.
Des garde-fous calqués sur ceux de Fable 5.1
Avec Opus 5.5, Anthropic étend à sa gamme Opus les protections qui encadraient jusqu’ici ses modèles les plus puissants. Elles portent notamment sur la cybersécurité et la biologie, deux domaines où le modèle atteint un niveau comparable à Claude Mythos 5.1. En pratique, les requêtes de cybersécurité basculent pour l’essentiel vers Opus 4.8, et les travaux de biologie vers Opus 5. Le même dispositif équipait déjà Fable 5.1, dont les garde-fous cyber avaient été assouplis, début septembre, afin de limiter les faux positifs.
Sur son audit comportemental automatisé, qui couvre près de 2 000 scénarios, Opus 5.5 obtient les meilleurs résultats jamais mesurés par l’entreprise. Une évaluation dédiée au franchissement des limites de confinement fait état d’environ 85 % de tentatives en moins que chez Opus 5 et Mythos 5.1, toutes de faible gravité. Un angle mort demeure : le modèle soupçonne souvent d’être évalué, ce qui complique la lecture de son comportement réel. Il est enfin le premier de la gamme Opus à embarquer le marquage des contenus imposé par l’AI Act.
Une sortie qui suit de près l’appel d’Anthropic à ralentir
Anthropic présente Opus 5.5 comme son premier lancement depuis l’essai dans lequel Dario Amodei appelait les laboratoires à modérer ensemble le rythme de leurs progrès, publié mi-septembre. Avant sa mise à disposition, le modèle a été éprouvé par des organismes externes, dont METR et Frontier Design.
De son côté, OpenAI a dévoilé le même jour GPT-6 Sol et GPT-6 Luna, deux déclinaisons allégées de GPT-6 Astra, facturées 2 $ et 10 $ par million de tokens pour Sol, 0,10 $ et 0,50 $ pour Luna. À noter que Claude Sonnet 5.5 et Claude Haiku 5.5 sont attendus dans les prochaines semaines, avant une possible entrée en bourse de la firme, qui serait reportée en novembre.
