Votre facture d’API a grimpé sans que vous changiez d’usage ? Ou vous reportez encore un projet parce que vous ignorez son vrai coût ? Entre un modèle facturé 0,14 dollar le million de tokens et un autre à 50 dollars, l’écart peut atteindre un facteur 60 pour un résultat parfois très proche. Voici un panorama clair des tarifs des grands modèles de langage en 2026, un classement des quinze options les plus intéressantes et trois simulations budgétaires concrètes pour décider sans vous tromper.
L’essentiel à retenir en un clin d’œil
Le modèle le moins cher encore digne d’une mise en production reste DeepSeek V4 Flash : 0,14 dollar en entrée et 0,28 dollar en sortie par million de tokens. Pour le meilleur équilibre global entre performance et prix, MiniMax M3 s’impose à 0,30 / 1,20 dollar avec un million de tokens de contexte. Côté haut de gamme accessible, Kimi K3 propose 3 / 15 dollars, soit environ un quart du tarif de Claude Fable 5 pour des scores publics très proches. Enfin, si la souveraineté européenne compte, Mistral Large 3 à 0,50 / 1,50 dollar hébergé dans l’UE constitue le choix le plus rationnel.
Le piège le plus fréquent ? Le prix de sortie, souvent quatre à six fois supérieur au prix d’entrée, auquel s’ajoutent les tokens de raisonnement invisibles mais facturés au tarif de sortie. Le levier le plus puissant reste la mise en cache du prompt, qui peut faire chuter le coût d’entrée de 75 à 95 % chez les principaux fournisseurs.
Tous les montants cités ici ont été relevés le 25 août 2026 sur les pages officielles des éditeurs. Ils s’expriment en dollars par million de tokens, hors remises négociées, hors API Batch et hors majoration de contexte long.
Comment lire correctement un tarif de LLM en 2026
Un prix de modèle n’est jamais un chiffre unique. Il se décompose en plusieurs lignes qui, combinées, déterminent votre facture réelle. Les tokens d’entrée couvrent tout ce que vous envoyez : prompt système, historique et documents. C’est la ligne qui explose dans les applications de type RAG. Les tokens de sortie correspondent à ce que le modèle génère. Chez OpenAI et Anthropic, comptez généralement un facteur 4 à 6 par rapport à l’entrée. Sur GPT-5.6 Sol comme sur Claude Fable 5, l’écart atteint cinq fois.
Viennent ensuite les tokens d’entrée mis en cache : un préfixe réutilisé est refacturé à un tarif fortement réduit. C’est encore la remise la plus sous-exploitée du marché. Les tokens de raisonnement, eux, n’apparaissent pas dans la réponse finale mais sont facturés au tarif de sortie. Une réponse de 200 mots peut ainsi coûter le prix de 3 000 mots. Enfin, le surcoût de contexte long intervient dès que l’on dépasse certains seuils : 272 000 tokens chez OpenAI (tarif d’entrée doublé et sortie multipliée par 1,5 sur toute la requête) ou 200 000 tokens chez Google sur Gemini 3.1 Pro.
Comparer deux modèles uniquement sur le prix d’entrée n’a donc aucun sens. Un modèle à 0,20 dollar en entrée mais 6 dollars en sortie reviendra plus cher qu’un modèle à 0,50 / 1,50 dollar dès que vous générez du texte long. Pour rendre les comparaisons pertinentes, nous utilisons un indicateur simple : le coût mixte 3:1.
Notre indicateur : le coût mixte 3:1
Nous calculons le coût d’un million de tokens traités avec un ratio de 750 000 tokens d’entrée pour 250 000 tokens de sortie. Ce profil correspond au usage dominant des applications professionnelles : chatbot, assistant documentaire, extraction ou résumé. La formule est claire : (0,75 × prix d’entrée) + (0,25 × prix de sortie).
Le classement des 15 LLM les plus rentables en 2026
Voici le classement du meilleur rapport valeur/prix vers le haut de gamme. Seuls les modèles accessibles directement chez l’éditeur, hors revendeurs, ont été retenus.
1. MiniMax M3 – 0,30 / 1,20 dollar – coût mixte 0,53 dollar – 1 M de contexte
2. Grok 4.6 – 2 / 6 dollars – coût mixte 3 dollars – 500 K
3. Gemini 3.6 Flash – 1,50 / 7,50 dollars – coût mixte 3 dollars – 1 M
4. DeepSeek V4 Flash – 0,14 / 0,28 dollar – coût mixte 0,18 dollar – 1 M
5. GPT-5.6 Luna – 0,20 / 1,20 dollar – coût mixte 0,45 dollar – 1,05 M
6. Mistral Large 3 – 0,50 / 1,50 dollar – coût mixte 0,75 dollar – 256 K
7. GLM-5.1 – 1,40 / 4,40 dollars – coût mixte 2,15 dollars – 200 K
8. Kimi K3 – 3 / 15 dollars – coût mixte 6 dollars – 1,05 M
9. Claude Sonnet 5 – 2 / 10 dollars – coût mixte 4 dollars – 1 M
10. GPT-5.6 Terra – 2 / 12 dollars – coût mixte 4,50 dollars – 1,05 M
11. Mistral Small 4 – 0,15 / 0,60 dollar – coût mixte 0,26 dollar – 256 K
12. Gemini 3.1 Pro – 2 / 12 dollars – coût mixte 4,50 dollars – 1 M
13. GPT-5.6 Sol – 4 / 20 dollars – coût mixte 8 dollars – 1,05 M
14. Claude Opus 5 – 5 / 25 dollars – coût mixte 10 dollars – 1 M
15. Claude Fable 5 – 10 / 50 dollars – coût mixte 20 dollars – 1 M
Ces tarifs officiels datent du 25 août 2026. Le coût mixte 3:1 a été calculé pour permettre une comparaison équitable.
MiniMax M3 : le rapport performance/prix le plus convaincant
À 0,30 dollar en entrée et 1,20 dollar en sortie, MiniMax M3 affiche l’un des meilleurs scores publics par dollar dépensé, avec une fenêtre d’un million de tokens. C’est le premier modèle à tester si vous voulez diviser une facture existante par cinq ou dix sans sacrifier la qualité perçue.
Il convient particulièrement aux applications à fort volume, aux chatbots, à l’extraction de données et à la classification. Sa limite principale reste un écosystème d’outils et une documentation moins denses que chez les acteurs de premier rang, ainsi qu’un hébergement hors Union européenne.
Grok 4.6 : le modèle de production le plus accessible
À 2 / 6 dollars, Grok franchit aujourd’hui la barre des scores considérés comme exploitables en production sur des tâches exigeantes au tarif le plus bas. Point souvent oublié : la version 4.5 reste facturée au même prix tout en obtenant un score public supérieur sur plusieurs agrégats de benchmarks. Tester les deux versions avant de figer un choix s’impose.
Ce modèle convient aux agents, à la recherche web et aux tâches de raisonnement de milieu de gamme. Sa fenêtre de 500 000 tokens reste inférieure au million proposé par la concurrence directe.
Gemini 3.6 Flash : le meilleur compromis chez un grand fournisseur
À 1,50 / 7,50 dollars, Gemini 3.6 Flash obtient un score public comparable à celui de Grok tout en profitant de l’infrastructure Google, d’une fenêtre d’un million de tokens et d’une remise de cache de 90 %. C’est le modèle par défaut des agents managés de l’API Gemini.
Il s’adresse aux équipes déjà présentes sur Google Cloud, aux applications multimodales et au prototypage. Attention : depuis le 1er avril 2026, l’offre gratuite ne couvre plus les modèles de la gamme Pro. Seuls certains modèles Flash et Flash-Lite restent accessibles gratuitement, avec des quotas réduits.
DeepSeek V4 Flash : le tarif plancher du marché
0,14 dollar en entrée, 0,28 dollar en sortie, et une entrée en cache facturée environ 0,007 dollar, soit une remise proche de 95 %. C’est le tarif le plus bas pour un modèle réellement utilisable, avec un million de tokens de contexte. Le prix peut toutefois varier fortement selon l’hébergeur : certains revendeurs facturent jusqu’à trois fois le tarif direct pour le même modèle.
Il convient au traitement de masse, aux pipelines de données et aux tâches répétitives non critiques. L’hébergement en Chine le rend cependant inadapté à toute donnée personnelle ou sensible soumise au RGPD.
GPT-5.6 Luna : l’entrée de gamme OpenAI après une baisse spectaculaire
Luna est passé à 0,20 / 1,20 dollar fin juillet 2026, soit une baisse de 80 % en trois semaines après son lancement. À ce tarif, elle devient l’option la moins chère pour rester dans l’écosystème OpenAI, avec la même fenêtre de 1,05 million de tokens que les modèles supérieurs de la gamme.
Elle convient au routage des étapes simples d’un agent, aux tâches de volume et à la vision légère. Elle reste nettement en retrait sur le raisonnement complexe face à Terra et Sol.
Mistral Large 3 : le choix rationnel sous contrainte RGPD
À 0,50 / 1,50 dollar avec 256 000 tokens de contexte, le modèle phare français combine un tarif d’entrée de gamme, des poids ouverts et un hébergement intégralement européen. Pour une PME ou une ETI qui traite des données clients, l’équation n’est plus seulement technique : elle devient juridique.
Il s’adresse aux secteurs de la santé, de la finance, du secteur public et à toute organisation soumise à une exigence de résidence des données. L’absence de remise de mise en cache publiée pénalise toutefois les usages à prompt système long et répétitif.
GLM-5.1 : un score public solide pour 2,15 dollars le million traité
À 1,40 / 4,40 dollars, GLM-5.1 se place dans le peloton de tête des modèles chinois sur le rapport score/dollar, avec un tarif de cache à 0,26 dollar. C’est une alternative sérieuse à Grok et Gemini Flash pour les équipes qui acceptent un hébergement hors UE.
Kimi K3 : le haut de gamme le moins cher
À 3 / 15 dollars, Kimi K3 atteint un score public de premier plan, très proche de Claude Opus 5 et de GPT-5.6 Sol, pour un tarif trois fois inférieur à celui de Claude Fable 5. Fenêtre de 1,05 million de tokens et cache à 0,30 dollar.
Il convient au raisonnement complexe, aux agents long horizon et à la génération de code exigeante. Sa maturité opérationnelle et ses garanties contractuelles restent cependant inférieures à celles des fournisseurs occidentaux.
Claude Sonnet 5 : un tarif de lancement devenu définitif
Lancé le 30 juin 2026, Sonnet 5 est facturé 2 / 10 dollars. Anthropic a annulé la hausse initialement prévue au 1er septembre 2026 : ce tarif est désormais le prix standard. Avec un million de tokens de contexte, jusqu’à 128 000 tokens de sortie et un cache à 0,20 dollar, c’est le meilleur compromis de la gamme Claude pour la production courante.
Il s’adresse au développement assisté, aux agents fiables et au traitement documentaire long. Anthropic facture toutefois les écritures en cache en plus des lectures, ce qui rend le calcul du gain réel moins direct que chez OpenAI.
GPT-5.6 Terra : le milieu de gamme OpenAI
Baissé de 20 % fin juillet 2026, Terra est passé à 2 / 12 dollars. Il vise les charges de production premium sans le tarif du modèle phare, avec la même fenêtre de 1,05 million de tokens et un cache à 0,20 dollar.
Mistral Small 4 : 0,26 dollar le million de tokens traités
À 0,15 / 0,60 dollar, Small 4 est le modèle de volume le moins cher hébergé en Europe. Mistral en fait un modèle hybride unique couvrant l’instruction, le raisonnement et le code, avec 256 000 tokens de contexte. C’est la porte d’entrée logique pour une équipe française qui veut sortir du prototypage sans exploser son budget.
Gemini 3.1 Pro : le modèle phare de Google
2 / 12 dollars jusqu’à 200 000 tokens de contexte, puis 4 / 18 dollars au-delà. Ce palier est le principal poste de dérapage budgétaire sur les usages documentaires : une seule requête qui franchit le seuil double le coût d’entrée sur l’intégralité de la requête. Le cache à 0,20 dollar compense en partie.
GPT-5.6 Sol : le modèle phare d’OpenAI à tarif promotionnel
Le 21 août 2026, OpenAI a abaissé Sol de 5 / 30 dollars à 4 / 20 dollars, soit une baisse de 20 % sur l’entrée et de 33 % sur la sortie. Ce tarif est qualifié de promotionnel et garanti au moins jusqu’au 21 novembre 2026. Il faut le traiter comme une fenêtre de planification, pas comme un prix acquis.
Il convient au raisonnement difficile, aux agents autonomes, à la vision et à la cybersécurité défensive. Au-delà de 272 000 tokens d’entrée, la requête bascule à 8 / 30 dollars, soit le double sur l’entrée.
Claude Opus 5 : le haut de gamme raisonnable d’Anthropic
5 / 25 dollars, cache à 0,50 dollar, un million de tokens de contexte. Opus 5 a remplacé Opus 4.8 au même tarif standard et reste la moitié du prix de Claude Fable 5. Sur le papier, son score public le place au sommet des modèles largement accessibles. Depuis le tarif promotionnel de Sol, il est toutefois plus cher que le modèle phare d’OpenAI.
Claude Fable 5 : la performance maximale, et le tarif qui va avec
10 / 50 dollars, cache à 1 dollar, un million de tokens de contexte et jusqu’à 128 000 tokens de sortie. Fable 5 se justifie uniquement quand une capacité supérieure change le résultat final, typiquement sur des boucles d’agents où un échec coûte plus cher que les tokens économisés.
L’accès à Fable 5 avait été suspendu du 12 au 30 juin 2026 pour se conformer à des contrôles à l’export du département du Commerce américain, avant d’être rétabli le 1er juillet 2026.
Combien ça coûte vraiment ? Trois scénarios chiffrés
Les tarifs par million de tokens restent abstraits. Voici la facture mensuelle réelle sur trois charges de travail typiques, calculées à partir des tarifs du tableau. Les montants sont arrondis au dollar.
Scénario A – Chatbot de support client : 50 000 conversations par mois, 1 500 tokens d’entrée et 500 tokens de sortie chacune, soit 75 M en entrée et 25 M en sortie. Sans cache.
Scénario B – Production de contenu : 5 M de tokens d’entrée et 2 M de tokens de sortie par mois. Sans cache.
Scénario C – Agent de code : 200 M de tokens d’entrée dont 80 % servis par le cache, et 20 M de tokens de sortie.
DeepSeek V4 Flash : 18 $ / 1 $ / 12 $
GPT-5.6 Luna : 45 $ / 3 $ / 35 $
MiniMax M3 : 53 $ / 4 $ / 46 $
Mistral Large 3 : 75 $ / 6 $ / 130 $
Gemini 3.6 Flash : 300 $ / 23 $ / 234 $
Claude Sonnet 5 : 400 $ / 30 $ / 312 $
GPT-5.6 Sol : 800 $ / 60 $ / 624 $
Claude Opus 5 : 1 000 $ / 75 $ / 780 $
Trois enseignements ressortent clairement. L’écart entre le moins cher et le plus cher atteint un facteur 57 sur le scénario A et un facteur 63 sur le scénario C : le choix de modèle est une décision financière autant que technique. Mistral Large 3 passe devant Gemini Flash sur les scénarios A et B mais recule sur le C, précisément parce qu’il ne publie pas de remise de cache. Enfin, sur le scénario C, GPT-5.6 Sol tombe à 624 dollars avec 80 % de cache contre 1 200 dollars sans cache : la même charge de travail, moitié moins chère.
Quel modèle choisir selon votre budget et votre usage
Pour un budget serré, un volume élevé et des données non sensibles, privilégiez DeepSeek V4 Flash ou GPT-5.6 Luna. Comptez moins de 50 dollars par mois pour un chatbot de 50 000 conversations.
Pour le meilleur équilibre général, MiniMax M3 convient au volume, tandis que Grok 4.6 ou Gemini 3.6 Flash prennent le relais dès que la qualité de raisonnement compte.
Sous contrainte RGPD ou marché public, Mistral Small 4 assure le volume et Mistral Large 3 les tâches exigeantes. C’est aujourd’hui la seule combinaison qui allie tarif d’entrée de gamme et hébergement européen.
Pour le développement et les agents de code, Claude Sonnet 5 en défaut, avec escalade vers Claude Opus 5 ou GPT-5.6 Sol sur les tâches difficiles.
Quand la qualité maximale prime et que le coût devient secondaire, Claude Fable 5 reste la référence, ou Kimi K3 si vous acceptez un fournisseur non occidental pour un tarif divisé par trois.
Six leviers pour diviser votre facture d’API IA par 2 à 10
Activer la mise en cache du prompt reste le levier le plus rentable et le plus rapide à mettre en place. Router les tâches simples vers un petit modèle permet aussi de réaliser d’importantes économies : classification, extraction, reformulation et filtrage n’ont pas besoin d’un modèle phare. Un routage à deux niveaux fait souvent plus d’économies qu’un simple changement de fournisseur.
L’API Batch chez OpenAI et Anthropic divise les tarifs par deux en échange d’un délai de traitement. La majorité des traitements de fond y sont éligibles. Plafonner la sortie agit directement sur la ligne la plus chère, puisque celle-ci coûte quatre à six fois l’entrée. Imposer une longueur maximale et un format structuré est donc très efficace.
Compacter l’historique sur un agent évite que la conversation regonfle l’entrée à chaque tour et limite le risque de franchir les seuils de contexte long à 200 000 ou 272 000 tokens. Enfin, baisser l’effort de raisonnement sur les modèles concernés réduit les tokens invisibles facturés au tarif de sortie, souvent sans effet mesurable sur la qualité des réponses courantes.
Le tarif d’entrée en cache, poste par poste
DeepSeek V4 Flash : 0,14 dollar standard → 0,007 dollar en cache (95 %)
GPT-5.6 Luna : 0,20 → 0,02 dollar (90 %)
MiniMax M3 : 0,30 → 0,06 dollar (80 %)
Gemini 3.6 Flash : 1,50 → 0,15 dollar (90 %)
Claude Sonnet 5 : 2 → 0,20 dollar (90 %)
Gemini 3.1 Pro : 2 → 0,20 dollar (90 %)
Grok 4.6 : 2 → 0,50 dollar (75 %)
Kimi K3 : 3 → 0,30 dollar (90 %)
GPT-5.6 Sol : 4 → 0,40 dollar (90 %)
Claude Opus 5 : 5 → 0,50 dollar (90 %)
Claude Fable 5 : 10 → 1 dollar (90 %)
Attention à une subtilité : Anthropic facture aussi les écritures en cache, à un tarif supérieur au tarif d’entrée standard. Le gain n’est donc réel que si le préfixe mis en cache est réutilisé plusieurs fois. Chez OpenAI, la durée de vie du cache est d’au moins 30 minutes sur la gamme GPT-5.6.
Ce qui a changé sur les prix des LLM en 2026
Le marché est entré dans une guerre des prix ouverte. Les baisses se comptent désormais en semaines plutôt qu’en années. Trois mouvements structurent l’année en cours.
Deux baisses OpenAI en un mois : fin juillet 2026, Terra recule de 20 % et Luna de 80 %. Le 21 août 2026, le modèle phare Sol passe de 5 / 30 dollars à 4 / 20 dollars. Mistral a divisé son tarif phare par quatre : Large 3 est passé de 2 / 6 dollars à 0,50 / 1,50 dollar. De nombreux comparatifs affichent encore l’ancien tarif, avec un écart de quatre fois sur le budget annoncé. Vérifiez toujours la date de mise à jour d’un tableau de prix. Anthropic a quant à elle renoncé à une hausse : le tarif de lancement de Sonnet 5 à 2 / 10 dollars, initialement temporaire, devient le prix standard après annulation de la hausse prévue au 1er septembre 2026.
La conséquence pratique pour une équipe technique est claire : ne construisez pas de modèle financier sur trois ans à partir d’une grille tarifaire du mois en cours, et concevez votre architecture pour pouvoir changer de modèle sans réécrire l’application. La plupart des API sont désormais compatibles avec le format d’OpenAI, ce qui rend le changement de fournisseur trivial sur le plan technique.
FAQ : prix des LLM et API d’intelligence artificielle
Quel est le LLM le moins cher en 2026 ?
Parmi les modèles réellement exploitables en production, DeepSeek V4 Flash reste le moins cher à 0,14 dollar en entrée et 0,28 dollar en sortie par million de tokens. Chez un fournisseur européen, Mistral Small 4 descend à 0,15 / 0,60 dollar. Le tarif le plus bas n’est pas toujours le coût de production le plus bas.
Comment calculer le coût d’une requête ?
Multipliez le nombre de tokens d’entrée par le tarif d’entrée, ajoutez le nombre de tokens de sortie multiplié par le tarif de sortie, puis divisez par un million. Comptez environ 4 caractères par token en français, soit à peu près 750 mots pour 1 000 tokens.
Pourquoi ma facture dépasse-t-elle mon estimation ?
Quatre causes reviennent systématiquement : les tokens de raisonnement facturés au tarif de sortie sans apparaître dans la réponse, l’historique de conversation qui regonfle l’entrée à chaque tour, les nouvelles tentatives après échec, et le franchissement du seuil de contexte long qui double le tarif d’entrée sur toute la requête.
Abonnement mensuel ou API : que choisir ?
Pour un usage conversationnel individuel, un abonnement autour de 20 dollars par mois reste généralement plus économique jusqu’à environ 5 millions de tokens d’entrée mensuels. Au-delà, et pour tout usage applicatif, agent ou automatisation, l’API en paiement à l’usage revient presque toujours moins cher.
Existe-t-il des API de LLM gratuites ?
Google conserve l’offre gratuite la plus large, limitée depuis avril 2026 à certains modèles Flash et Flash-Lite avec des quotas réduits. Mistral propose un palier d’expérimentation gratuit. OpenAI et Anthropic n’offrent que des crédits de démarrage pour les nouveaux comptes, sans palier gratuit permanent.
Un modèle open source revient-il moins cher qu’une API ?
Rarement en dessous de très gros volumes. Les poids sont gratuits, mais l’inférence exige des GPU, de l’électricité, de l’hébergement et du temps d’ingénierie. Le point de bascule se situe généralement à plusieurs dizaines de millions de tokens par jour. En dessous, l’API reste plus économique.
Méthodologie et sources
Tous les tarifs de cet article ont été relevés le 25 août 2026 sur les pages tarifaires officielles des éditeurs, recoupées avec deux agrégateurs indépendants mis à jour quotidiennement. Le coût mixte 3:1 et les trois scénarios budgétaires sont des calculs réalisés à partir de ces tarifs publics. Les prix évoluant plusieurs fois par trimestre, vérifiez toujours la grille officielle avant d’engager un budget.
Les sources principales restent la documentation tarifaire OpenAI, la page tarifs Anthropic, la page tarifs Google Gemini, la page tarifs Mistral AI et la console xAI.
En résumé, le choix d’un modèle de langage en 2026 n’est plus uniquement une question de performance technique. C’est une décision financière et stratégique. En combinant un classement clair, des simulations chiffrées et des leviers concrets d’optimisation, vous disposez désormais des éléments pour construire une architecture IA à la fois performante et maîtrisée. Testez, mesurez, routez et cachez : votre facture vous remerciera.






