EVOZIA
Modèles d'IA

Claude Haiku 5.5 : ce que le petit modèle à 0,10 $ change pour automatiser une PME

Le petit modèle d'Anthropic coûte 0,10 $ le million de tokens, dix fois moins que Haiku 4.5. Coût réel par tâche, GPT-6 Luna, usages : le point en 2026.

Portrait de Mathis CastigliolaMathis Castigliola10 min de lecture
Un colibri de verre lumineux, en vol stationnaire, range un tourbillon de petites enveloppes bleues en flux parallèles roses, sur fond nuit.

Anthropic a lancé le 7 octobre 2026 Claude Haiku 5.5, le plus petit modèle de sa famille 5.5, après Opus 5.5 le 22 septembre et Sonnet 5.5 le 28. Il est facturé 0,10 dollar par million de tokens envoyés, dix fois moins que Haiku 4.5, et exactement le tarif de GPT-6 Luna, le petit modèle qu'OpenAI a sorti quinze jours plus tôt.

Un modèle de cette taille ne sert pas à rédiger un rapport de cinquante pages. Il sert aux tâches courtes que l'on répète des milliers de fois : classer un courriel, extraire un montant, résumer une demande, aiguiller un client. C'est là que se logent la plupart des automatisations d'une PME, et là que le prix au token décide si une tâche vaut la peine d'être confiée à une IA.

Qu'est-ce que Claude Haiku 5.5 ?

Claude Haiku 5.5 est le petit modèle de langage d'Anthropic, conçu pour les tâches à fort volume et sensibles au délai de réponse : classement, extraction, résumés, aiguillage de demandes. Il remplace Haiku 4.5, sorti en octobre 2025, et devient le modèle le plus rapide de la gamme, du moins aux vitesses standard : le mode Fast d'Opus, facturé le double, reste plus véloce.

Le réglage d'effort est la nouveauté qui compte le plus pour un usage professionnel. C'est le premier Haiku qui en dispose : on choisit, requête par requête, entre une réponse plus réfléchie et une réponse moins chère. Contrairement à Opus 5.5, dont la réflexion reste toujours active, celle de Haiku 5.5 peut aussi être coupée, ce qui convient aux tâches de tri où il n'y a rien à méditer.

Combien coûte Claude Haiku 5.5 ?

Par l'API, Claude Haiku 5.5 coûte 0,10 dollar par million de tokens envoyés et 0,50 dollar par million de tokens produits, tant que la requête ne dépasse pas 100 000 tokens. Au-delà, le tarif est multiplié par cinq, à 0,50 et 2,50 dollars, d'après la grille officielle.

Tarif par million de tokensHaiku 3.5Haiku 4.5Haiku 5.5 (jusqu'à 100 000 tokens)Haiku 5.5 (au-delà)
Entrée0,80 $1 $0,10 $0,50 $
Sortie4 $5 $0,50 $2,50 $
Lecture du cache0,08 $0,10 $0,01 $0,05 $
Traitement par lots (entrée / sortie)0,40 $ / 2 $0,50 $ / 2,50 $0,05 $ / 0,25 $0,25 $ / 1,25 $

La baisse inverse la tendance de la génération précédente : Haiku 4.5 coûtait 25 % de plus que Haiku 3.5 à sa sortie. Elle s'accompagne toutefois de deux réserves que les gros titres ont laissées de côté.

La première est le seuil. Au-dessus de 100 000 tokens, la remise par rapport à Haiku 4.5 tombe à 50 %. Anthropic précise que 90 % des requêtes envoyées à Haiku 4.5 restaient sous ce seuil, ce qui en fait le cas courant, pas la règle.

La seconde tient au découpage du texte. Haiku 5.5 adopte le tokenizer des modèles récents d'Anthropic, l'outil qui découpe un texte en tokens, et ce découpage produit selon la documentation environ 30 % de tokens de plus pour le même texte, l'écart exact variant avec le contenu. Une fois ces deux effets comptés, l'éditeur annonce une facture « environ 75 % plus basse » en moyenne.

0,10 $

par million de tokens envoyés, pour une requête jusqu'à 100 000 tokens

Anthropic

−75 %

de coût moyen à la tâche par rapport à Haiku 4.5, selon l'éditeur

Anthropic, 7 octobre 2026

90 %

des requêtes envoyées à Haiku 4.5 restaient sous le seuil de 100 000 tokens

Anthropic

Dix fois moins cher au token, environ quatre fois moins cher à la tâche : les deux chiffres sont exacts, ils ne mesurent pas la même chose. Le seuil réserve aussi un piège à qui migre une application existante. Un prompt de 80 000 tokens compté avec l'ancien découpage peut, recompté avec le nouveau, dépasser les 100 000 tokens et basculer entièrement sur le tarif haut.

Claude Haiku 5.5 fait-il mieux que GPT-6 Luna ?

Sur le papier, oui, sur chacun des tests où les deux figurent. Mais ces scores viennent du tableau d'Anthropic, obtenu avec ses propres réglages, et aucune mesure indépendante n'était publiée au lendemain de la sortie.

Le prix, lui, est identique au centime : OpenAI facture GPT-6 Luna 0,10 dollar en entrée et 0,50 dollar en sortie, après avoir divisé par deux le tarif de son petit modèle lors de la sortie de GPT-6, le 22 septembre, rapporte VentureBeat. La comparaison se joue donc uniquement sur la qualité.

OSWorld 2.1 (utiliser un ordinateur pour finir une tâche, score partiel)

  • Claude Haiku 5.572,4 %
  • GPT-6 Luna48,9 %
  • Claude Haiku 4.515,7 %

Chartography (lire et raisonner sur des graphiques, sans outil)

  • Claude Haiku 5.546,4 %
  • GPT-6 Luna29,1 %
  • Claude Haiku 4.56,4 %

Terminal-Bench 4.0 (tâches de code en ligne de commande)

  • Claude Sonnet 5.570,6 %
  • Claude Haiku 5.539,2 %
  • GPT-6 Luna16,4 %
  • Claude Haiku 4.50 %

Source : tableau publié par Anthropic, 7 octobre 2026 (OSWorld 2.1 : sous-ensemble hors ligne).

Scores de l'éditeur, réglages choisis par lui ; aucune mesure indépendante n'était disponible au 8 octobre 2026.

Le dernier groupe dit l'essentiel sur le positionnement. Haiku 5.5 progresse nettement sur le code en ligne de commande, et reste loin de Sonnet 5.5. Anthropic l'écrit d'ailleurs dans son annonce :

Haiku 5.5 est plus adapté à des tâches au périmètre plus étroit, qui auraient autrement été trop coûteuses avec les versions précédentes de Claude, comme la compaction, le résumé ou le travail de sous-agent.

Les cas clients cités par l'éditeur vont dans le même sens, avec la prudence qu'imposent des témoignages qu'il choisit lui-même. AlphaSense, une plateforme de recherche financière, envoie environ 8 millions de requêtes par semaine à son outil de questions sur documents ; sur 400 requêtes de test, son score passe de 0,76 avec Haiku 4.5 à 0,84 avec Haiku 5.5.

Combien coûte une tâche automatisée avec Haiku 5.5 ?

Sur une tâche courte, presque rien. Le calcul se fait à partir de la grille officielle, avec des hypothèses posées à plat : mille courriels entrants à trier, chacun envoyé au modèle avec sa consigne (environ 1 500 tokens), et une réponse courte en retour, une catégorie et un résumé de deux lignes (environ 300 tokens), réflexion coupée.

Trier 1 000 e-mails (coût du modèle seul)Tokens envoyésTokens produitsCoût
Claude Haiku 5.51,5 million0,3 millionenviron 0,30 $
Claude Haiku 4.51,2 à 1,5 million0,2 à 0,3 millionenviron 2,30 à 3 $
Claude Sonnet 5.51,5 million0,3 millionenviron 6 $
Claude Opus 5.51,5 million0,3 millionenviron 12 $

La fourchette de Haiku 4.5 traduit son ancien découpage, qui compte moins de tokens pour le même texte. Même en lui laissant cet avantage, l'écart dépasse un facteur sept sur ce type de tâche, plus que les 75 % annoncés en moyenne, parce qu'un courriel reste très loin du seuil des 100 000 tokens.

Trier mille e-mails avec Haiku 5.5 coûte environ trente centimes.

Deux réglages peuvent déplacer ce chiffre. La réflexion d'abord : laissée au niveau d'effort par défaut, elle produit des tokens supplémentaires, facturés comme de la sortie, alors qu'un classement n'en a pas besoin. Le traitement par lots ensuite, qui divise la facture par deux pour tout ce qui n'exige pas de réponse immédiate, un tri nocturne par exemple.

Pour une PME, la conséquence change la façon de chiffrer un projet. À ce niveau de prix, le modèle devient la ligne la plus faible du budget d'une automatisation IA. Ce qui coûte, c'est de la concevoir : décrire le processus, écrire les consignes, prévoir les cas où le modèle hésite, faire valider par un humain ce qui engage l'entreprise. Des tâches que l'on jugeait trop modestes pour justifier un appel à une IA, relire chaque bon de livraison ou étiqueter chaque demande entrante, deviennent rentables dès que ce travail de conception est fait.

À quoi sert un petit modèle d'IA dans une PME ?

À tout ce qui est court, fréquent et bien délimité. Un petit modèle comme Haiku 5.5 traite une tâche dont on peut décrire la bonne réponse en quelques lignes, beaucoup plus vite et beaucoup moins cher qu'un grand modèle, avec une qualité suffisante tant que la tâche reste simple.

TâchePetit modèle (Haiku)Grand modèle (Sonnet, Opus)
Classer un courriel ou une demande entranteOuiSurdimensionné
Extraire une date, un montant, une référenceOuiSurdimensionné
Résumer un échange ou un document courtOuiUtile si le document est long ou technique
Répondre en direct à un client dans un périmètre validéOui, la vitesse compteUtile si la demande est complexe
Rédiger une proposition commerciale argumentéeInsuffisantOui
Analyser un contrat, auditer un dossierInsuffisantOui

La vitesse pèse autant que le prix sur le support client en direct, où chaque seconde d'attente se voit à l'écran. Un chatbot de support qui répond à partir d'une base de connaissances validée relève typiquement de cette catégorie : la difficulté tient à la qualité des réponses fournies au modèle, rarement à sa puissance.

L'autre usage montant est celui de sous-agent. Un grand modèle conduit une tâche longue et confie les petites recherches à un Haiku, plus rapide et moins cher. Anthropic présente explicitement Haiku 5.5 comme le complément d'Opus 5.5 et de Sonnet 5.5 dans ce rôle.

Faut-il passer de Haiku 4.5 à Haiku 5.5 ?

Pour une application qui tourne aujourd'hui sur Haiku 4.5, presque toujours, mais après un test sur des cas réels et non sur la foi du tableau de l'éditeur. Le calendrier laisse le temps de le faire proprement.

Haiku 4.5 passe dans la liste des anciens modèles. D'après la page des retraits de modèles, son maintien n'est garanti que jusqu'au 15 octobre 2026, sans date de retrait fixée, et Anthropic s'engage à prévenir au moins 60 jours avant toute mise à la retraite.

Trois points se vérifient avant de basculer. Le comptage des tokens, pour repérer les requêtes qui franchiraient le seuil des 100 000 avec le nouveau découpage. Les paramètres d'échantillonnage : sur les modèles récents, une valeur de température personnalisée renvoie une erreur, alors que Haiku 4.5 l'acceptait. Et la qualité sur une série de cas réels, comparée à l'ancien modèle tâche par tâche.

C'est la démarche que suit EVOZIA pour ses propres automatisations : chaque nouveau modèle, Claude, Gemini, ChatGPT ou Grok, est rejoué sur des cas réels avant d'entrer en production, et le choix se fait sur le coût par tâche puis sur la qualité constatée, jamais sur un classement. La même méthode, détaillée pour le haut de gamme dans notre analyse de Claude Opus 5.5, vaut pour le petit modèle.

Cet article est publié par EVOZIA, qui conçoit pour les PME des automatisations IA sur mesure, du processus jusqu'au choix du modèle adapté à chaque tâche. Pour savoir lesquelles de vos tâches répétitives coûteraient aujourd'hui quelques centimes à automatiser, le diagnostic IA gratuit est sans engagement.

Questions fréquentes

Quelle différence entre Claude Haiku, Sonnet et Opus ?

Ce sont les trois tailles de modèles d'Anthropic, du plus léger au plus puissant. Haiku est le plus rapide et le moins cher, taillé pour les tâches courtes et répétées comme le tri ou l'extraction. Sonnet offre le meilleur compromis entre vitesse et capacité pour la plupart des usages de production. Opus vise les tâches longues et exigeantes, comme le code complexe ou l'analyse approfondie. Dans la génération 5.5, l'écart de prix va de 0,10 à 4 dollars par million de tokens en entrée, d'où l'intérêt de confier chaque tâche au plus petit modèle qui la réussit.

Un petit modèle d'IA se trompe-t-il plus souvent qu'un grand ?

Sur les tâches complexes, oui : raisonner sur plusieurs étapes, interpréter un document ambigu ou rédiger un argumentaire reste mieux tenu par un grand modèle. Sur une tâche courte et bien décrite, classer une demande ou extraire une référence, l'écart se réduit fortement, et c'est la qualité de la consigne qui fait la différence. La seule façon de le savoir pour une tâche donnée est de la tester sur une série de cas réels, en comparant les résultats des deux tailles de modèle avant de choisir.

Peut-on utiliser Claude Haiku 5.5 avec un traitement des données en Europe ?

Pas par l'API directe d'Anthropic, qui propose un traitement aux États-Unis ou un routage mondial. Un traitement en Europe passe par un fournisseur cloud : Google Cloud propose pour les modèles Claude récents un point d'accès multirégional « eu », avec un supplément de 10 %, et Amazon Web Services des profils régionaux, dont la couverture exacte pour Haiku 5.5 se vérifie dans la console du fournisseur. Pour des données personnelles de clients ou de salariés, ce choix d'architecture se fait avant celui du modèle.

Qu'est-ce que le traitement par lots d'une API d'IA ?

C'est un mode d'envoi où l'on transmet un grand nombre de requêtes d'un coup, traitées en différé plutôt qu'en temps réel. En échange de ce délai, Anthropic facture la moitié du tarif normal : 0,05 dollar par million de tokens en entrée pour Haiku 5.5. Ce mode convient à tout ce qui n'attend pas de réponse immédiate, comme le classement nocturne des courriels de la journée, la mise à jour d'une base documentaire ou l'analyse d'un historique de demandes clients.

On regarde votre cas ?

Le diagnostic IA gratuit est sans engagement : vos volumes d'appels, vos règles, votre chiffrage. Vous repartez avec une vision claire, avec ou sans nous.