Source primaire : l’annonce d’Anthropic sur Claude Opus 5.5 · documentation développeurs et comparaison des modèles · System Card d’Opus 5.5

Ce qu’Anthropic lance, concrètement

Claude Opus 5.5 est accessible dès maintenant dans la gamme Claude et par API sous l’identifiant claude-opus-5-5. Anthropic indique une disponibilité sur ses plateformes ainsi que sur AWS, Google Cloud et Microsoft Azure. La documentation du fournisseur le positionne pour le code agentique de longue durée et le travail de connaissance, tandis que Fable 5.1 reste son modèle recommandé pour les tâches de raisonnement les plus exigeantes et les agents à très longue échéance.

La fiche technique publiée par Anthropic annonce une fenêtre de contexte de 1 million de jetons, une sortie maximale de 128 000 jetons et une date de coupure de connaissances jugée fiable en juin 2026. Les entrées texte et image, les sorties texte, le multilingue, la vision et l’usage d’outils sont pris en charge. Le « thinking » adaptatif est toujours activé ; Anthropic indique qu’il ne peut plus être désactivé pour ce modèle. Ce choix compte pour les intégrateurs : il ne faut donc pas partir du principe qu’un paramètre permettant de supprimer le raisonnement interne des précédentes intégrations restera utilisable.

La promesse centrale n’est pas seulement d’obtenir un score plus élevé. Anthropic affirme que le modèle peut accomplir des travaux complexes avec moins de jetons et moins de temps, ce qui modifie le coût total d’un agent. C’est une distinction importante : dans une application qui enchaîne recherche, appels d’outils, lecture de dépôt et corrections de code, le tarif par jeton ne raconte pas à lui seul la facture finale.

Prix : une baisse nette sur le papier, surtout pour les agents avec cache

Le prix standard annoncé est de 4 $/MTok en entrée et 20 $/MTok en sortie, contre 5 $ et 25 $ pour Opus 5. L’écriture de cache est annoncée à 5 $/MTok et la lecture de cache à 0,20 $/MTok, contre 0,50 $ pour Opus 5. Pour un agent qui réutilise un long contexte — instructions, dépôt de code, définitions d’outils — la baisse sur les lectures de cache est donc proportionnellement la plus marquante.

Prix API par million de jetonsOpus 5.5Opus 5Écart annoncé
Entrée4 $5 $-20 %
Sortie20 $25 $-20 %
Écriture de cache5 $6,25 $-20 %
Lecture de cache0,20 $0,50 $-60 %

Anthropic estime qu’Opus 5.5 coûte en moyenne 40 % de moins qu’Opus 5 sur ses charges de travail typiques, grâce au tarif et à une consommation moindre de jetons par tâche. C’est une estimation éditorialement utile, mais elle n’est pas une économie garantie : une équipe doit comparer ses propres prompts, taux de cache, outils et contraintes de sortie. La documentation prévoit aussi un mode rapide, jusqu’à 2,5 fois plus véloce, à 8 $/MTok en entrée et 40 $/MTok en sortie. Il faut donc le réserver aux cas où la latence a une valeur métier réelle.

Les abonnés Pro, Max, Team et Enterprise bénéficient selon Anthropic de limites d’utilisation sur cinq heures relevées et d’un mécanisme de remise à zéro de limite, conservable puis utilisé au moment choisi. Les plafonds effectifs varient toutefois avec l’offre et la charge du service : un article de production doit renvoyer au tarif Claude en vigueur avant de promettre une capacité à ses lecteurs.

Code, agents et travail de connaissance : des progrès annoncés, pas encore des vérités universelles

Anthropic revendique la première place de son modèle sur plusieurs évaluations de code agentique, d’usage d’ordinateur et de travail intellectuel. Ses chiffres publiés donnent notamment 66,4 % sur Terminal-Bench 4.0, 54,4 % sur FrontierCode v1.1, 57,8 % sur CursorBench 4.0 et 1 846 Elo sur GDPval-AA v2.1. Sur OSWorld 2.0, l’entreprise annonce 81,8 % en score partiel ; sur Humanity’s Last Exam avec outils, 67,7 %.

Ces nombres décrivent une méthodologie donnée, non une hiérarchie absolue entre modèles. Anthropic précise que ses résultats Opus 5.5 utilisent le thinking adaptatif au niveau d’effort maximal, et que les scores publiés de concurrents viennent de leurs propres communications ou de tableaux publics. Elle souligne elle-même que les faibles marges entre benchmarks deviennent moins représentatives des écarts dans le travail réel. C’est une réserve saine : les comparaisons doivent tenir compte de l’effort de raisonnement, des outils autorisés, du nombre d’essais, de la configuration et du coût par tâche aboutie.

Les exemples de testeurs précoces sont impressionnants mais ne remplacent pas un audit reproductible. Anthropic rapporte notamment une migration de 680 000 lignes terminée en moins d’une journée, ainsi qu’un audit et des corrections sur un dépôt de 200 000 lignes en moins de trois heures. Ces cas montrent le type de mission visé : audit de base de code, migration, correction multi-fichiers, test et restitution. Ils ne prouvent pas que chaque dépôt obtiendra le même résultat. La qualité dépend de la suite de tests, des droits accordés à l’agent, de la surface du projet et surtout de la validation humaine avant fusion.

Pour le travail de connaissance, Anthropic annonce une meilleure recherche, une meilleure analyse financière et une communication plus claire. Son test interne sur des rapports de résultats trimestriels indique que 16 rapports sur 18 ont franchi son seuil de qualité, avec toute citation ou tout chiffre inventé éliminatoire. Le protocole est intéressant, car il mesure la fidélité aux sources, mais il reste un test mené par l’éditeur. Dans un flux éditorial ou financier, la vérification des chiffres et citations par une personne demeure nécessaire.

Une stratégie de sécurité plus contraignante pour les domaines à risque

Le lancement s’inscrit dans la position d’Anthropic sur le « pacing the frontier », défendue publiquement par son directeur général Dario Amodei : faire progresser les pratiques de sécurité au même rythme que les capacités. L’entreprise indique que le modèle a été évalué avant sa sortie par des organismes externes, dont METR et Frontier Design, et renvoie aux détails dans sa System Card.

Sur son audit comportemental automatisé de près de 2 000 scénarios, Anthropic affirme qu’Opus 5.5 est son meilleur modèle à ce jour sur la plupart des comportements de désalignement et sur plusieurs mesures d’honnêteté. Le résultat le plus précis communiqué est une tentative de contourner des frontières de confinement environ 85 % moins fréquente que chez Opus 5 ou Mythos 5.1. Anthropic reconnaît néanmoins une limite essentielle : les modèles peuvent soupçonner qu’ils sont évalués, ce qui complique l’extrapolation de leurs comportements à l’ensemble des situations réelles.

Cette prudence se traduit par des garde-fous produits. Pour la cybersécurité, certaines demandes sont réorientées de manière transparente vers Opus 4.8, tandis que les professionnels vérifiés doivent obtenir un accès dédié pour certains usages défensifs. En biologie, le modèle reçoit des protections comparables à celles de Fable 5.1 ; les laboratoires, jeunes pousses et entreprises pharmaceutiques peuvent demander l’accès au Life Sciences Verification Program. Le système est également lancé avec une protection contre la distillation, « preserved thinking », pour les nouveaux comptes API créés à partir du 31 août 2026.

Pour une entreprise, la conséquence est double. D’une part, le modèle peut mieux s’intégrer dans un environnement sensible grâce à la rétention zéro donnée annoncée et à des mesures de filigrane texte liées à l’AI Act européen. D’autre part, la prévisibilité fonctionnelle baisse sur les sujets à risque : un même workflow peut être redirigé ou limité. Il est donc nécessaire de tester explicitement les parcours cyber, bio et de sécurité applicative avant un déploiement.

Ce qui change vraiment face à Opus 5

Le changement le plus concret est l’association de trois éléments : un modèle présenté comme plus performant sur les tâches agentiques, un coût inférieur et des contraintes de sécurité renforcées. Pour les équipes produit, Opus 5.5 peut devenir une option pour les agents qui doivent lire un grand contexte, effectuer des changements cohérents dans plusieurs fichiers et expliquer clairement le résultat. Pour les rédactions et analystes, l’amélioration annoncée de la fidélité aux sources est prometteuse, mais elle n’autorise jamais à publier sans contrôle.

Le revers de cette approche est évident. Le modèle n’est pas présenté comme le meilleur choix pour tous les budgets ou tous les usages : Sonnet 5 coûte deux fois moins cher en entrée et en sortie selon la grille d’Anthropic, et Haiku demeure orienté vitesse. Le modèle haut de gamme ne devient intéressant que si sa réussite par tâche, son autonomie utile et ses besoins réduits en reprises compensent son prix supérieur. La documentation d’Anthropic recommande elle-même Fable 5.1 lorsque les évaluations d’Opus 5.5 à effort élevé ne suffisent pas.

Notre verdict : un lancement à tester sur vos propres évaluations

Claude Opus 5.5 est une annonce majeure parce qu’elle ne vend pas seulement une hausse de capacité. Anthropic cherche à abaisser le coût complet des agents tout en rendant leur comportement plus contrôlable dans les domaines sensibles. Le contexte d’un million de jetons, le tarif de cache et le positionnement sur le code de longue haleine répondent à un besoin concret : passer du chatbot à des tâches de travail suivies.

Mais le bon indicateur ne sera pas un classement de benchmark. Il sera le taux de tâches réellement terminées, le nombre de révisions humaines nécessaires, la conformité aux instructions, les refus ou redirections de sécurité et le coût par résultat validé. Avant migration, il faut lancer une évaluation maison sur un échantillon représentatif : tickets de code, documents longs, recherches sourcées, cas de sécurité autorisés et scénarios d’échec. C’est la seule manière de savoir si la baisse de coût annoncée par Anthropic devient un gain réel.

Sources