Un petit modèle conçu pour le volume
Dans sa présentation officielle, Anthropic décrit Haiku 5.5 comme son modèle léger le plus rapide et le plus capable à sa sortie. Le mot « léger » ne signifie pas qu’il fonctionnerait nécessairement sur votre ordinateur : il désigne ici sa place dans la gamme, à côté des modèles Sonnet et Opus plus ambitieux. L’objectif est d’obtenir une réponse suffisamment bonne pour une tâche courte, rapidement et à un coût suffisamment bas pour répéter l’opération à grande échelle.
Les exemples avancés par Anthropic sont concrets : résumer un document, condenser l’historique d’une conversation, classer une demande, interroger une base de données ou déléguer une recherche ciblée à un sous-agent. Un assistant plus puissant peut, par exemple, organiser un rapport pendant que Haiku extrait une donnée précise d’un fichier. Cette architecture ne rend pas automatiquement l’ensemble du système fiable : elle déplace une partie du travail vers un modèle moins cher, qu’il faut toujours évaluer.
La rapidité compte aussi lorsque l’utilisateur attend devant une interface. Anthropic cite le support client en temps réel et l’utilisation du navigateur. La société le présente comme son modèle le plus rapide à la vitesse standard propre à chaque modèle ; sa note précise que les modèles Opus en mode Fast peuvent aller plus vite. Il serait donc trompeur de transformer cette formule en « le Claude le plus rapide dans toutes les configurations ».
La grille tarifaire complète, pas seulement le prix d’appel
Le prix dépend de la taille du prompt envoyé pour une requête. Pour les prompts jusqu’à 100 000 tokens, la grille Anthropic affiche, par million de tokens, 0,10 dollar en entrée et 0,50 dollar en sortie. Une lecture dans le cache est facturée 0,01 dollar et une écriture 0,125 dollar. Lorsque le prompt dépasse 100 000 tokens, ces quatre tarifs passent respectivement à 0,50, 2,50, 0,05 et 0,625 dollar.
Le seuil concerne la longueur du prompt d’une requête, pas un volume mensuel global. Une application qui envoie beaucoup de petites requêtes peut rester dans la première tranche même si elle traite des millions de tokens au total. À l’inverse, un agent qui empile consignes, documents et historique dans chaque appel peut franchir le seuil plus vite que prévu. La facture ne se déduit donc pas d’un seul prix affiché en gros caractères.
Anthropic compare Haiku 5.5 à Haiku 4.5, affiché à 1 dollar le million de tokens en entrée et 5 dollars en sortie. Sous le seuil, le tarif unitaire des tokens ordinaires est dix fois plus bas ; au-dessus, il est cinq fois plus bas. La société estime néanmoins une économie moyenne d’environ 75 %, et non de 90 % pour tous, car elle intègre la répartition des requêtes et un nouveau tokenizer susceptible de compter davantage de tokens pour une même tâche. Environ 90 % des requêtes adressées à Haiku 4.5 entraient, selon elle, dans la première tranche.
Une simulation simple permet de vérifier les ordres de grandeur : un million de tokens d’entrée et un million de sortie cumulés sur plusieurs requêtes courtes coûteraient 0,60 dollar aux seuls tarifs d’entrée et de sortie affichés. Les mêmes volumes, s’ils provenaient de requêtes dont les prompts dépassent le seuil, coûteraient 3 dollars. Cet exemple exclut le cache, les outils, les éventuels frais du fournisseur intermédiaire et les différences de tokenisation ; il ne prédit pas une facture réelle.
Ce que disent les benchmarks — et ce qu’ils ne disent pas
Le tableau de performances publié par Anthropic montre une progression marquée sur plusieurs tests. Sur la partie hors ligne d’OSWorld 2.1, consacrée à l’usage d’un ordinateur par un agent, Haiku 5.5 obtient 72,4 %, contre 15,7 % pour Haiku 4.5. Sur Terminal-Bench 4.0, test de codage agentique en ligne de commande, Anthropic affiche 39,2 % contre 0,0 %. Sur Humanity’s Last Exam, le nouveau modèle atteint 45,9 % sans outils et 57,4 % avec outils selon les réglages et le protocole de la société.
Ces chiffres ne signifient pas qu’une application métier réussira sept requêtes sur dix. Les benchmarks mesurent des tâches définies, avec des conditions d’exécution, des outils et des critères de réussite précis. Un score sur une sélection hors ligne d’OSWorld n’est pas interchangeable avec un score sur la version complète du test, ni avec la réussite d’une automatisation sur un poste réel. La fiche système détaillée par Anthropic doit être lue avant de tirer une conclusion comparative.
La comparaison avec les grands modèles rappelle aussi la limite de cette gamme. Dans le tableau d’Anthropic, Sonnet 5.5 dépasse Haiku 5.5 sur les tâches de codage agentique les plus complexes. Le choix rationnel peut donc consister à utiliser Haiku pour filtrer, rechercher ou préparer un travail, puis à escalader vers Sonnet ou Opus quand l’ambiguïté et le coût d’une erreur augmentent. L’économie d’un appel échoue si elle entraîne plusieurs reprises ou une validation humaine plus coûteuse que prévu.
L’effort ajustable change le calcul coût-qualité
Haiku 5.5 est le premier modèle de sa catégorie chez Anthropic à proposer un réglage d’effort ajustable. Le développeur peut choisir un niveau d’effort selon le problème : faible pour une extraction routinière, plus élevé pour une demande nécessitant davantage de raisonnement. Ce levier peut améliorer le résultat, mais il peut également allonger le traitement ou augmenter la consommation. Il faut mesurer le couple coût-qualité à réglage constant avant de comparer deux modèles.
Pour une équipe qui classe des milliers de tickets, le bon test n’est pas seulement la vitesse moyenne. Il faut mesurer le taux d’erreurs graves, les cas où le modèle refuse à tort, la qualité sur les langues réellement utilisées et la performance sur les messages longs. On peut ensuite ajouter le coût d’une vérification humaine et celui d’un appel de rattrapage vers un modèle plus puissant. La promesse d’un « petit modèle » devient intéressante lorsque le système entier, et non un appel isolé, fonctionne mieux.
Une autre économie : le cache de Sonnet 5.5
L’annonce du 7 octobre apporte aussi une baisse du prix de lecture du cache de Sonnet 5.5, qui passe de 0,20 à 0,10 dollar par million de tokens. Anthropic estime que cela réduit d’environ 20 % le coût de la plupart des tâches agentiques qui relisent fréquemment du contexte mis en cache. Ce pourcentage est une moyenne annoncée par le fournisseur, pas une remise automatique sur chaque facture Sonnet.
Pour une application qui renvoie constamment les mêmes consignes ou les mêmes documents, la part des lectures de cache peut être importante. Si elle ne fait presque pas de cache, l’impact sera bien plus faible. Avant de migrer tout un service vers Haiku, certaines équipes auraient intérêt à calculer ce que la nouvelle grille de Sonnet change déjà à qualité constante.
Anthropic annonce enfin des crédits API mensuels pour certains abonnés Claude Max et Team, déployés progressivement pendant la semaine du lancement : 100 dollars pour Max 5x, 200 dollars pour Max 20x et jusqu’à 500 dollars mutualisés pour Team. Ils doivent être réclamés dans les conditions précisées par le fournisseur. Il ne s’agit ni d’un usage illimité ni d’une baisse générale des prix de l’API.
Disponibilité : quelle version utiliser ?
Anthropic indique que Haiku 5.5 est disponible sur ses plateformes, ainsi que chez Amazon Web Services, Google Cloud et Microsoft Azure. Sur la plateforme Claude, l’identifiant communiqué est claude-haiku-5-5. La présence d’un modèle chez plusieurs fournisseurs ne garantit pas la même disponibilité immédiate dans tous les comptes, régions, contrats ou interfaces. Avant une mise en production, il faut vérifier l’identifiant exact, les limites et les tarifs dans l’environnement réellement utilisé.
Une migration depuis Haiku 4.5 ne devrait pas se faire en remplaçant seulement un nom de modèle. Le nouveau tokenizer peut modifier les volumes comptés ; le réglage d’effort, les comportements de sécurité et les réponses aux consignes peuvent aussi changer. Un petit jeu de tests représentatif — y compris les cas difficiles — permet de comparer le coût par tâche réussie plutôt qu’un tarif théorique par token.
Sécurité et confidentialité : les vérifications indispensables
Anthropic affirme que ses évaluations d’alignement sont meilleures que celles de Haiku 4.5 sur la plupart des points examinés. Ses protections en cybersécurité sont, selon la société, plus restrictives que celles de l’ancien Haiku, mais moins que celles de certains modèles récents. Le modèle autorise davantage de demandes défensives que Sonnet 5.5 dans certains cas tout en bloquant des requêtes de test d’intrusion jugées risquées. En biologie, il conserve des restrictions pour les demandes estimées susceptibles de causer un dommage.
Ce sont les évaluations et les arbitrages d’Anthropic. Pour un usage professionnel, il reste nécessaire de contrôler les données envoyées au service, la conservation des informations, les erreurs factuelles, les refus excessifs et les actions qu’un agent peut déclencher. Un modèle rapide peut produire une erreur rapide ; une automatisation à forts enjeux exige une validation humaine et des droits limités aux actions nécessaires.
Le verdict FLUXAI
Claude Haiku 5.5 rend crédible une stratégie où un modèle compact prend en charge les opérations nombreuses et bien délimitées d’un agent. Son prix sous le seuil de 100 000 tokens est particulièrement agressif, et ses scores annoncés montrent un saut par rapport à Haiku 4.5. Mais le bon indicateur reste le coût d’une tâche correcte dans votre propre système : prompt réel, qualité requise, cache, outils, réessais et supervision inclus. La baisse du prix du cache de Sonnet ajoute une autre option à comparer avant de choisir.

