Claude, GPT ou Mistral : quel modèle pour quel usage, à quel coût par requête

Par Alexandre Rastello, publié le

  • modèles
  • comparatif
  • coût par requête

En résumé. Sur la même tâche, l’écart de facture entre le modèle le moins cher et le plus cher va de 1 à 100. Mistral Small 4 coûte 0,15 $ le million de tokens en entrée, GPT-5.6 Sol en coûte 5 $ et sort à 30 $. Mais ce n’est presque jamais le prix qui décide : un modèle bon marché qui répond juste 6 fois sur 10 vous coûte plus cher en reprises manuelles qu’un modèle à 3 000 $ par an. La règle qui marche : un petit modèle pour classer, extraire et router, un gros modèle pour rédiger, arbitrer et raisonner sur plusieurs documents. Et sur les gros volumes de contexte stable, le cache de prompt divise la facture par deux ou trois sans changer de modèle.

La réponse courte

Trois familles, trois positions.

Anthropic (Claude) vise le raisonnement long et l’usage agentique, avec une fenêtre de contexte de 1 million de tokens sur toute la gamme actuelle sauf Haiku. C’est la famille la plus chère en sortie, et celle qui tient le mieux sur des chaînes de dix ou quinze étapes.

OpenAI (GPT) couvre la gamme la plus large, du modèle à 0,05 $ le million au modèle à 30 $. Sa force est la profondeur du catalogue : il existe presque toujours un GPT au bon niveau de prix pour une tâche donnée.

Mistral est le moins cher des trois à qualité comparable sur les tâches structurées, et c’est le seul dont les modèles peuvent tourner chez un hébergeur français ou sur vos propres serveurs. Mistral Large 3 sort à 1,50 $ le million de tokens, dix fois moins cher que Claude Sonnet 5 et vingt fois moins que GPT-5.6 Sol.

Pour une PME qui automatise un processus administratif, la réponse tient en une ligne : commencez par Mistral Small 4 ou GPT-5.6 Luna, mesurez le taux de réussite, et ne montez en gamme que sur les étapes où il ne passe pas.

Les grilles tarifaires, août 2026

Les modèles se facturent au million de tokens, séparément en entrée et en sortie. Un token vaut environ trois quarts de mot en français. Prix publics relevés le 13 août 2026, en dollars.

Modèle Entrée ($/M) Sortie ($/M)
GPT-5 nano 0,05 0,40
Mistral Ministral 3 (3B) 0,10 0,10
Mistral Small 4 0,15 0,60
GPT-5.6 Luna 0,20 1,20
GPT-5 mini 0,25 2,00
Mistral Large 3 0,50 1,50
Claude Haiku 4.5 1,00 5,00
Mistral Medium 3.5 1,50 7,50
GPT-5.6 Terra 2,00 12,00
Claude Sonnet 5 3,00 15,00
Claude Opus 5 5,00 25,00
GPT-5.6 Sol 5,00 30,00

Côté fenêtre de contexte, Claude Opus 5 et Claude Sonnet 5 acceptent 1 million de tokens, Claude Haiku 4.5 plafonne à 200 000. C’est le critère qui décide dès qu’un corpus documentaire entier doit tenir dans une requête.

Deux remarques sur ce tableau.

Anthropic applique jusqu’au 31 août 2026 un tarif de lancement sur Claude Sonnet 5, à 2 $ en entrée et 10 $ en sortie. Si vous dimensionnez un budget sur ce modèle, prenez le prix plein de 3 $ et 15 $, pas le prix promotionnel.

Mistral Large 3 est l’anomalie du tableau. Il est positionné comme un modèle haut de gamme et se facture au niveau des petits modèles concurrents. Sur de l’extraction structurée et de la classification, c’est aujourd’hui le meilleur rapport résultat/prix du marché francophone.

Le prix affiché n’est pas la facture

Trois mécanismes font varier le coût réel d’un facteur trois à cinq, à modèle constant.

Le cache de prompt. Quand une grande partie du contexte ne change pas d’un appel à l’autre (les instructions, la base documentaire, les règles métier), les fournisseurs facturent ce contenu répété beaucoup moins cher. Chez OpenAI, l’entrée mise en cache coûte dix fois moins : GPT-5.6 Sol passe de 5 $ à 0,50 $ le million. Chez Anthropic, l’écriture en cache coûte 1,25 fois le prix normal et la lecture 0,1 fois, avec un seuil minimum de 512 tokens sur Claude Opus 5.

Le ratio entrée/sortie de votre tâche. Une extraction de facture consomme beaucoup d’entrée et peu de sortie ; un agent qui rédige des réponses clients fait l’inverse. Sur GPT-5.6 Sol, la sortie coûte six fois l’entrée. Un modèle « cher en sortie » ne l’est pas si votre tâche produit trois lignes.

Le nombre d’appels par tâche. Un agent qui raisonne, appelle deux outils et vérifie son résultat consomme quatre à six appels là où une extraction simple en consomme un. C’est le facteur que les comparatifs de prix oublient systématiquement, et c’est souvent le plus gros.

Le troisième point mérite d’être posé clairement : comparer deux modèles sur leur prix au million de tokens sans mesurer combien d’appels chacun consomme pour finir la tâche ne veut rien dire.

Quel modèle pour quelle tâche

Ce tableau est ma grille de départ sur les missions PME. Il ne remplace pas un test sur vos données, il évite de commencer au mauvais endroit.

Tâche Modèle de départ Pourquoi
Classer un email entrant (5 catégories) Mistral Ministral 3 ou GPT-5 nano Décision binaire ou à cinq issues, aucun raisonnement requis
Extraire les lignes d’une facture ou d’un bon de commande Mistral Small 4 ou GPT-5.6 Luna Sortie structurée courte, le petit modèle suffit dès que le prompt est propre
Router une demande vers le bon service Mistral Small 4 Même logique, volume élevé, coût déterminant
Rédiger une réponse client à partir d’une base de connaissance Claude Sonnet 5 ou GPT-5.6 Terra La qualité de rédaction se voit, et c’est le client qui la lit
Répondre sur un corpus documentaire de plusieurs centaines de pages Claude Sonnet 5 La fenêtre de 1 million de tokens évite de découper le corpus
Arbitrer un cas ambigu (litige, exception, écart de prix) Claude Opus 5 ou GPT-5.6 Sol Le coût d’une erreur dépasse largement le coût du modèle
Orchestrer un agent à plusieurs étapes avec outils Claude Opus 5 La tenue sur les chaînes longues est ce qui se paie ici

La ligne la plus rentable de ce tableau est la première. Beaucoup d’automatisations utilisent un modèle à 5 $ le million pour trancher entre « facture » et « bon de livraison ». C’est un gaspillage d’un facteur cinquante sur une tâche qu’un modèle à 0,10 $ traite aussi bien.

Le calcul sur quatre cas réels

Hypothèses posées, chiffres calculés. À vous de remplacer par vos volumes.

Cas 1. Classer 40 000 emails par an. 800 tokens en entrée, 20 en sortie.

Modèle Coût annuel
Mistral Ministral 3 (3B) 3,28 $
Mistral Small 4 5,28 $
GPT-5.6 Luna 7,36 $
Claude Sonnet 5 108 $

Cas 2. Extraire 9 000 factures fournisseurs par an. 4 000 tokens en entrée, 600 en sortie.

Modèle Coût annuel
Mistral Small 4 8,64 $
GPT-5.6 Luna 13,68 $
Mistral Large 3 26,10 $
Claude Sonnet 5 189 $
GPT-5.6 Sol 342 $

Sur ce volume, le débat ne vaut pas la réunion qu’il déclenche. 333 $ séparent les deux extrêmes, quand le développement a coûté quinze mille euros. Prenez le modèle qui donne le meilleur taux de réussite.

Cas 3. Assistant client, 50 000 conversations par an. 8 000 tokens en entrée dont 6 500 stables, 400 en sortie.

Modèle Sans cache Avec cache
Mistral Small 4 72 $ non documenté
Claude Haiku 4.5 500 $ 208 $
Claude Sonnet 5 1 500 $ 622 $
GPT-5.6 Terra 1 040 $ 455 $
GPT-5.6 Sol 2 600 $ 1 138 $

Le cache fait économiser 56 à 58 % sur ce profil, quel que soit le modèle. Quelques lignes de code au bon endroit, zéro perte de qualité, zéro changement de modèle. Demandez à votre prestataire s’il l’utilise : la réponse vous dira très vite s’il a déjà exploité un agent en production ou seulement développé un prototype.

Cas 4. Assistant documentaire interne, 3 000 requêtes par an sur un corpus de 400 pages. 250 000 tokens en entrée, 800 en sortie, sans découpage du corpus.

À 3 $ le million en entrée, Claude Sonnet 5 revient à 0,76 $ la requête, soit 2 286 $ par an. Avec le cache sur le corpus, on tombe autour de 300 $. Sans fenêtre de 1 million de tokens, il faut découper le corpus et faire de la recherche documentaire en amont, ce qui coûte moins cher en tokens mais bien plus cher en développement. C’est le seul cas de cette liste où la fenêtre de contexte, et non le prix, décide du choix.

L’option française : les mêmes modèles, hébergés à Paris

Les modèles ouverts changent la question. Mistral publie une partie de sa gamme sous licence libre, comme Meta, Alibaba et OpenAI avec gpt-oss. Ces modèles tournent chez des hébergeurs français, facturés au token comme les API américaines.

Chez Scaleway, en région Paris, les prix publics au million de tokens sont de 0,15 € en entrée et 0,35 € en sortie pour Mistral Small 3.2, 0,15 € et 0,60 € pour gpt-oss-120b, 0,20 € et 0,80 € pour Qwen3 Coder 30B, 1,50 € et 7,50 € pour Mistral Medium 3.5. Le premier million de tokens est offert et les requêtes en traitement par lot bénéficient de 50 % de remise. OVHcloud propose une offre équivalente avec une quarantaine de modèles, à 0,40 € et 2,70 € le million pour Qwen3.6-27B, et s’engage à ne jamais utiliser vos données pour entraîner ses modèles.

Deux choses à savoir avant de basculer. Le catalogue ne contient aucun modèle propriétaire : ni Claude, ni GPT, ni Mistral Large ne sont accessibles chez ces hébergeurs, seulement les modèles publiés en ouvert. Et si vous avez besoin d’un débit garanti, il faut passer sur un déploiement dédié facturé à l’heure de GPU : 0,93 € de l’heure pour une L4 chez Scaleway, 3,40 € pour une H100, soit environ 2 480 € par mois en service continu. À ce prix, le calcul ne redevient intéressant qu’au-delà d’un volume très élevé.

Le sujet de l’hébergement en France mérite son propre article, et le raccourci « souverain donc conforme » mérite d’être démonté avant de signer quoi que ce soit.

Comment ne pas se marier avec un fournisseur

Les trois APIs ont des formats de requête différents mais un socle commun : un prompt, des messages, des outils, une réponse. Si l’appel au modèle est isolé derrière une seule fonction de votre code, changer de fournisseur prend une demi-journée. S’il est appelé à trente endroits différents, ça prend une semaine et vous ne le ferez jamais.

Trois règles simples, à poser dès le premier jour du projet.

Le nom du modèle est une variable de configuration, jamais une valeur écrite en dur dans le code. Toutes les tâches ne partagent pas le même modèle : prévoyez un réglage par étape. Et gardez un jeu de vingt à cinquante cas de test avec les réponses attendues, pour mesurer en une heure ce que vaut un modèle candidat sur vos données réelles.

Ces vingt cas de test valent plus que tous les comparatifs publics, y compris celui-ci. Les classements généralistes mesurent des capacités moyennes sur des tâches génériques. Votre PDF de bon de commande à trois colonnes mal alignées n’est dans aucun benchmark.

Ce que je choisis, en pratique

Sur les missions PME que je livre, la répartition est stable depuis un an.

Mistral Small 4 et les petits GPT prennent tout ce qui est classification, extraction et routage, soit environ 70 % des appels en volume et moins de 10 % de la facture. Claude Sonnet 5 prend la rédaction, la synthèse documentaire et les cas où le contexte dépasse deux cents pages. Claude Opus 5 prend l’orchestration des agents à plusieurs étapes et les arbitrages où une erreur se voit.

Un mot sur ce que je ne fais pas : je ne fais pas d’auto-hébergement de modèle sur GPU dédié pour une PME. En dessous de plusieurs millions de requêtes par an, le coût du GPU réservé et de son exploitation dépasse ce que la même charge coûte en API, et vous héritez d’un serveur à maintenir. Le calcul change pour une contrainte réglementaire précise, pas pour une préférence.

Quand le choix du modèle ne compte pas

Trois situations où passer une semaine à comparer des modèles est du temps perdu.

Le volume est faible. En dessous de dix mille appels par an, l’écart de facture entre le modèle le moins cher et le plus cher se compte en centaines d’euros. Prenez le meilleur et arrêtez d’y penser.

La qualité des données d’entrée est le vrai problème. Un scan de travers, un PDF sans couche texte, un export CSV aux colonnes changeantes : aucun modèle ne rattrape ça. Le gain vient du nettoyage en amont, pas du modèle.

Le processus n’est pas écrit. Si personne dans l’entreprise ne sait dire précisément quelle règle s’applique dans quel cas, le modèle ne l’inventera pas. C’est un travail de cadrage, et il se fait avant d’écrire la première ligne de code. C’est la moitié du travail d’un audit d’automatisation : écrire les règles que personne n’a écrites, puis mesurer sur combien de cas elles tombent en défaut.


Tarifs relevés le 13 août 2026 sur les grilles publiques d’Anthropic, OpenAI, Mistral AI, Scaleway et OVHcloud. Les coûts annuels sont calculés sur les hypothèses de volume indiquées et varient avec la longueur réelle de vos documents.

Questions fréquentes

Quel est le modèle IA le moins cher pour une entreprise en 2026 ?
Sur les tâches structurées, Mistral Ministral 3 en version 3B à 0,10 $ le million de tokens en entrée comme en sortie, et GPT-5 nano à 0,05 $ et 0,40 $. Pour un usage plus large sans tomber dans le bas de gamme, Mistral Small 4 à 0,15 $ et 0,60 $ est le meilleur compromis du marché. Sur 40 000 classifications par an, la facture annuelle tient en dessous de 10 $.
Claude ou GPT : lequel choisir pour un agent IA d'entreprise ?
Claude Opus 5 et Claude Sonnet 5 tiennent mieux sur les chaînes d'actions longues avec appels d'outils, et disposent d'une fenêtre de contexte de 1 million de tokens qui évite de découper les gros corpus. GPT couvre une gamme de prix plus large, de 0,05 $ à 30 $ le million, ce qui permet d'ajuster le modèle à chaque étape. La plupart des projets utilisent les deux : un petit GPT ou Mistral pour le volume, un Claude pour les étapes qui demandent du raisonnement.
Mistral est-il aussi bon que Claude ou GPT ?
Sur l'extraction de données structurées, la classification et le routage, oui, et à un prix nettement inférieur : Mistral Large 3 sort à 1,50 $ le million contre 15 $ pour Claude Sonnet 5. Sur le raisonnement à plusieurs étapes, la synthèse de documents longs et la tenue d'un agent avec outils, les modèles Anthropic et OpenAI haut de gamme gardent une avance.
Comment calculer le coût par requête d'un modèle IA ?
Comptez les tokens en entrée (instructions, document, historique) et en sortie, un token valant environ trois quarts de mot en français. Multipliez chaque volume par le prix au million correspondant, puis par le nombre de requêtes annuel. Ajoutez le nombre d'appels par tâche si l'agent raisonne ou appelle des outils : ce facteur est le plus souvent oublié et multiplie facilement la facture par quatre.
Le cache de prompt réduit-il vraiment la facture d'un agent IA ?
Oui, dans un rapport de deux à trois quand une grande partie du contexte est stable d'un appel à l'autre. Sur un assistant client avec 6 500 tokens d'instructions et de base documentaire répétés à chaque requête, la facture annuelle passe de 1 500 $ à environ 622 $ sur Claude Sonnet 5. Chez OpenAI, l'entrée mise en cache est facturée dix fois moins cher que l'entrée normale.
Peut-on utiliser Claude ou GPT en restant conforme au RGPD ?
Anthropic et OpenAI proposent des engagements contractuels de non-entraînement sur les données API et des options de rétention réduite, avec des traitements pouvant impliquer un transfert hors Union européenne encadré par les clauses contractuelles types. Pour un traitement de données sensibles ou une exigence de localisation stricte, les modèles ouverts hébergés chez OVHcloud ou Scaleway en région française répondent mieux à la contrainte.
Quels modèles IA sont hébergés en France ?
OVHcloud et Scaleway servent une sélection de modèles ouverts par API depuis des centres de données français, dont Mistral Small, gpt-oss, Llama, Qwen et Deepseek. Scaleway affiche 0,15 € en entrée et 0,35 € en sortie au million de tokens pour Mistral Small 3.2 en région Paris. Aucun modèle propriétaire, ni Claude, ni GPT, ni Mistral Large, n'est disponible chez ces hébergeurs.
Faut-il utiliser un seul modèle IA pour toute une automatisation ?
Non, et c'est l'erreur la plus fréquente. Un projet type mélange trois modèles : un petit pour classer et extraire, un moyen pour rédiger, un gros pour les arbitrages. Cette répartition divise la facture par cinq à volume constant, à condition que le nom du modèle soit une variable de configuration réglable étape par étape.

Cet article fait partie du dossier Combien coûte un agent IA en 2026 : TJM, forfait et coût par requête.