Claude Opus 5, GPT-5.6, Gemini 3.6 : le comparatif des tarifs réels
Nous avons repris les grilles tarifaires sur les pages officielles des trois éditeurs. Résultat : le prix affiché de GPT-5.6 n'est pas celui que vous payez en contexte long, et l'écart peut atteindre vingt mille dollars par an sur une seule application.
[ Emplacement Google AdSense — Id: NEXT_PUBLIC_ADSENSE_CLIENT_ID non configuré ]
Il existe des dizaines de comparatifs de modèles d'IA. La plupart recopient les mêmes tableaux, les mêmes classements et les mêmes tarifs — sans les vérifier, et sans se demander si ces tarifs correspondent à ce que vous paierez réellement.
Nous avons repris l'exercice depuis les pages tarifaires officielles des trois éditeurs. Et nous y avons trouvé quelque chose qui n'apparaît dans aucun des comparatifs que nous avons lus : le prix affiché n'est pas le prix que vous payez dès que vous utilisez sérieusement la fenêtre de contexte.
Cette différence n'est pas marginale. Sur certains usages, elle double la facture et inverse le classement.
Notre méthode, en trois phrases
Tous les tarifs de cet article proviennent des pages officielles des éditeurs, consultées le 7 août 2026. Quand nous n'avons pas pu confirmer un chiffre à sa source, nous ne le publions pas — nous décrivons le mécanisme et nous le signalons.
Nous ne classons pas ces modèles par scores de benchmark. Nous expliquons pourquoi plus bas, et ce n'est pas une facilité.
Les prix de l'IA bougent vite. Un tarif de cet article change dans trois semaines, et nous le signalons à l'endroit concerné.
Les tarifs réels, au 7 août 2026
Tous les montants sont en dollars, par million de tokens, en entrée puis en sortie.
| Modèle | Entrée | Sortie | Contexte |
|---|---|---|---|
| Claude Fable 5 | 10,00 | 50,00 | 1 M |
| Claude Opus 5 | 5,00 | 25,00 | 1 M |
| Claude Sonnet 5 | 3,00 (2,00 jusqu'au 31 août) | 15,00 (10,00) | 1 M |
| Claude Haiku 4.5 | 1,00 | 5,00 | 200 k |
| GPT-5.6 Sol | 5,00 → 10,00 | 30,00 → 45,00 | — |
| GPT-5.6 Terra | 2,00 → 4,00 | 12,00 → 18,00 | — |
| GPT-5.6 Luna | 0,20 → 0,40 | 1,20 → 1,80 | — |
| Gemini 3.6 Flash | 1,50 | 7,50 | 1 M |
Les flèches sur la ligne OpenAI ne sont pas une coquille. C'est le sujet de la section suivante.
Le piège que personne ne mentionne : la surtaxe du contexte long
La grille tarifaire d'OpenAI distingue deux régimes pour chaque modèle de la gamme GPT-5.6 : un tarif contexte court et un tarif contexte long.
Le second est exactement le double du premier en entrée, et nettement plus élevé en sortie.
Reprenons le modèle haut de gamme. GPT-5.6 Sol est annoncé partout à 5 dollars l'entrée et 30 en sortie. C'est vrai — tant que vos requêtes restent courtes. Dès que vous dépassez le seuil de contexte court, la facture passe à 10 dollars l'entrée et 45 en sortie.
Or à quoi sert une fenêtre de contexte d'environ un million de tokens ? À y mettre beaucoup de choses. Une base de code entière, un corpus documentaire, un historique de conversation long. C'est précisément l'usage que le tarif de la colonne de gauche ne couvre pas.
Pourquoi cela change le classement
Comparons ce qui est comparable, sur un usage à contexte long.
En entrée, Claude Opus 5 et GPT-5.6 Sol sont tous deux à 5 dollars — égalité apparente. Mais Anthropic facture sa fenêtre d'un million de tokens au tarif standard, sans supplément de contexte long. Sur le même usage, Sol passe à 10 dollars, Opus 5 reste à 5.
En sortie, l'écart se creuse encore : 25 dollars contre 45.
Sur une charge de travail à contexte long, le rapport n'est donc pas « à peu près équivalent » comme le suggèrent les tableaux publiés partout, mais de l'ordre du simple au double.
L'inverse est vrai aussi, et il faut le dire : sur des requêtes courtes et à fort volume, GPT-5.6 Luna à 0,20 dollar l'entrée n'a aucun équivalent chez Anthropic, dont l'entrée de gamme démarre cinq fois plus haut. Chaque grille a son terrain.
Ce que nous n'avons pas pu vérifier
La documentation d'OpenAI ne précise pas, dans son tableau tarifaire, le seuil exact qui fait basculer une requête du régime court au régime long. Nous ne l'inventerons pas.
Retenez le principe et vérifiez le seuil dans votre tableau de bord de facturation avant de dimensionner un projet. C'est le genre de détail qui transforme une estimation budgétaire en mauvaise surprise au troisième mois.
Trois philosophies, pas seulement trois grilles
Derrière les chiffres, les trois éditeurs ont fait des paris différents sur la façon dont vous devez choisir.
OpenAI : trois étages, vous arbitrez
La gamme GPT-5.6 se décline en trois modèles distincts. Sol vise le raisonnement le plus exigeant, Terra l'usage courant en production, Luna le volume et la latence — classification, routage, tâches simples répétées des millions de fois.
L'écart tarifaire entre les extrêmes est considérable : d'après les tarifs officiels, Sol coûte vingt-cinq fois plus cher que Luna en entrée. La logique est celle du catalogue : vous identifiez votre besoin, vous choisissez l'étage, vous assumez de router vos requêtes vers le bon modèle.
C'est puissant et c'est du travail. Une application sérieuse ne tourne pas sur un seul étage : elle route, et ce routage est du code à écrire et à maintenir.
Anthropic : un modèle, un curseur d'effort
Anthropic propose aussi plusieurs modèles — Fable 5 au sommet, puis Opus 5, Sonnet 5, Haiku 4.5 — mais ajoute une dimension que les autres n'exposent pas de la même façon : un paramètre d'effort, réglable requête par requête, qui gouverne la profondeur de raisonnement engagée.
Concrètement, le même modèle peut répondre vite et à moindre coût sur une tâche simple, puis réfléchir longuement sur un problème difficile — sans changer de modèle, donc sans réécrire votre logique de routage.
Le pari est différent : plutôt que de vous faire choisir entre trois moteurs, on vous donne un moteur et une pédale.
Google : le rapport qualité-prix, et quatre régimes de service
Gemini 3.6 Flash est le moins cher des modèles haut de gamme de ce comparatif : 1,50 dollar en entrée, 7,50 en sortie, pour une fenêtre d'un million de tokens.
Google ajoute une souplesse que les deux autres n'offrent pas dans cette forme : quatre régimes de service au même modèle. Le mode standard aux tarifs ci-dessus ; les modes batch et flex à 0,75 et 3,75 dollars, soit la moitié, en échange d'une exécution différée ou non prioritaire ; et un mode priority à 2,70 et 13,50 dollars quand la latence prime.
Cette grille est un outil de pilotage budgétaire réel. Un traitement nocturne qui n'a pas besoin de répondre dans la seconde coûte littéralement moitié moins cher, sans changer une ligne de code applicatif.
Comment choisir, concrètement
Voici comment nous raisonnerions selon le cas d'usage. Ce sont des points de départ à valider sur vos propres données, pas des verdicts.
Vous traitez de gros volumes de texte court
Classification, extraction, étiquetage, routage de tickets. Regardez d'abord GPT-5.6 Luna et Gemini 3.6 Flash en mode batch.
À 0,20 dollar le million de tokens en entrée, Luna rend économiquement viables des usages qui ne l'étaient pas il y a un an. Et si votre traitement tolère un délai, le mode batch de Google divise la facture par deux sans autre effort que de changer un paramètre d'appel.
La question n'est pas « quel est le meilleur modèle » mais « le moins cher suffit-il ? ». Sur ces tâches, très souvent oui — testez avant de payer davantage.
Vous travaillez sur du contexte long
Analyse de base de code, corpus documentaire, conversations longues. C'est ici que la surtaxe change tout.
Claude Opus 5 facture sa fenêtre d'un million de tokens au tarif standard. Gemini 3.6 Flash offre la même fenêtre pour trois fois moins cher en entrée. GPT-5.6 bascule sur son régime long et double son entrée.
Entre Opus 5 et Gemini Flash, l'arbitrage n'est pas tarifaire mais qualitatif : Gemini est nettement moins cher, Opus se positionne sur les tâches les plus exigeantes. Testez les deux sur vos propres documents — c'est le seul juge qui compte, et cela coûte quelques dollars.
Vous développez avec l'aide d'une IA
Nous consacrons un article entier à cette question, tant les critères diffèrent. En résumé : le prix au token compte moins que le nombre d'allers-retours nécessaires pour obtenir un résultat correct.
Un modèle deux fois plus cher qui résout le problème du premier coup revient moins cher qu'un modèle bon marché qu'il faut relancer quatre fois — et il vous coûte surtout moins de votre temps, qui est la ressource réellement rare.
Vous construisez un produit grand public
Deux paramètres dominent : la latence et le coût par utilisateur actif.
Le mode priority de Google et les gammes basses des trois éditeurs sont vos terrains. Mesurez le coût réel par session sur un échantillon avant de vous engager sur un modèle économique — l'écart entre l'estimation et la réalité est régulièrement d'un facteur trois, presque toujours à la hausse, parce que les conversations réelles sont plus longues que celles des tests.
Un calcul que vous pouvez refaire
Prenons un cas simple : une application qui analyse cent documents par jour, chacun d'environ 50 000 tokens, et produit 2 000 tokens de synthèse.
Cela fait 5 millions de tokens en entrée et 200 000 en sortie par jour.
Avec Gemini 3.6 Flash en standard : 5 × 1,50 + 0,2 × 7,50, soit 9 dollars par jour. En mode batch, si le traitement peut attendre : 4,50 dollars.
Avec Claude Opus 5 : 5 × 5 + 0,2 × 25, soit 30 dollars par jour.
Avec GPT-5.6 Sol, en supposant que 50 000 tokens vous placent en régime de contexte long : 5 × 10 + 0,2 × 45, soit 59 dollars par jour. Au tarif court, ce serait 31 dollars — d'où l'importance de connaître le seuil.
Sur un an, l'écart entre la première et la dernière ligne dépasse vingt mille dollars. Pour la même tâche.
Ce calcul ne dit pas lequel choisir : il dit combien coûte le choix. Si le modèle le plus cher produit des synthèses nettement meilleures sur vos documents, l'écart peut être parfaitement justifié. Mais il doit être un choix, pas une découverte en fin de trimestre.
Les leviers que les comparatifs oublient
Comparer des grilles tarifaires suppose que vous payiez le tarif affiché. En pratique, trois mécanismes le font varier bien plus que le choix du modèle — et aucun des comparatifs que nous avons lus ne les mentionne.
La mise en cache du prompt
C'est le levier le plus rentable, et le plus ignoré.
Si vos requêtes partagent un long préambule identique — instructions système, documentation de référence, exemples — ce préambule est refacturé intégralement à chaque appel. Sauf si vous activez la mise en cache.
Le principe est simple : la portion stable de votre prompt est mémorisée côté serveur, et les requêtes suivantes la relisent au lieu de la retraiter. L'écriture initiale coûte un peu plus cher que la normale, la relecture coûte une fraction du tarif d'entrée.
L'arithmétique se retient : la première requête paie une majoration, et dès la deuxième ou la troisième vous êtes gagnant. Au-delà, l'économie sur la partie mise en cache devient considérable.
Deux conditions à respecter, et elles piègent tout le monde. La partie stable doit venir en premier dans le prompt — la mise en cache fonctionne par correspondance de préfixe, et le moindre octet modifié en amont invalide tout ce qui suit. Insérer la date du jour ou un identifiant de session en tête de votre prompt système suffit à supprimer tout bénéfice, sans le moindre message d'erreur.
Et il faut vérifier que le cache fonctionne. Les réponses d'API exposent le nombre de tokens réellement lus depuis le cache. Si ce compteur reste à zéro sur des requêtes qui partagent pourtant un préfixe, quelque chose l'invalide silencieusement. C'est la première chose à regarder quand une facture ne baisse pas comme prévu.
Le traitement par lots
Les trois éditeurs proposent une forme de traitement différé, à tarif réduit — nous avons vu que Google divise par deux.
La question à se poser n'est pas technique mais organisationnelle : quelle part de vos traitements a réellement besoin d'une réponse immédiate ? Un enrichissement de catalogue, une analyse de sentiment sur les avis de la veille, une génération de résumés nocturne : rien de tout cela ne justifie le tarif temps réel.
Beaucoup d'équipes paient le tarif interactif pour des traitements que personne n'attend.
Le rapport entrée-sortie
Regardez à nouveau le tableau : la sortie coûte systématiquement plusieurs fois le prix de l'entrée. Cinq fois chez Anthropic, six chez OpenAI, cinq chez Google.
Conséquence directe : un modèle bavard coûte cher. Deux modèles au même tarif affiché peuvent produire des factures très différentes si l'un répond en trois cents tokens et l'autre en mille deux cents pour dire la même chose.
Ce facteur n'apparaît sur aucune grille tarifaire, et il est mesurable en une heure sur vos propres requêtes. Comptez les tokens de sortie sur un échantillon représentatif avant de conclure quoi que ce soit sur le coût comparé.
Au-delà du prix : quatre questions qu'aucun tableau ne pose
Le tarif est le critère le plus facile à comparer, ce qui explique qu'on ne compare souvent que lui. Quatre autres méritent d'entrer dans la décision.
Où vont vos données ? Si vous traitez des données personnelles de résidents européens, la localisation du traitement n'est pas un détail de conformité mais une contrainte juridique. Les trois éditeurs proposent des options de résidence des données, avec des couvertures et des conditions différentes. Vérifiez-les avant de choisir, pas après.
Quelle latence réelle ? Le temps de réponse dépend du modèle, de la longueur du prompt, de la région et de la charge du service au moment de l'appel. Aucun tableau ne peut vous le dire — mais vingt requêtes chronométrées depuis votre serveur de production le mesurent en dix minutes.
Quel coût de sortie ? Pas le coût des tokens : le coût du changement d'avis. Un prompt finement réglé pour un modèle ne se transpose pas mécaniquement à un autre ; les formats de sortie, les conventions d'appel d'outils et les comportements diffèrent. Plus votre intégration est profonde, plus en changer coûte cher. Ce n'est pas une raison de ne pas s'engager, c'en est une de mesurer l'engagement.
Que se passe-t-il quand le modèle disparaît ? Les éditeurs retirent régulièrement leurs anciens modèles du service, avec des préavis. Une application qui fige une version précise doit prévoir sa migration. Vérifiez le calendrier de retrait annoncé avant de bâtir dessus.
Ce que nous ne comparons pas, et pourquoi
Vous remarquerez l'absence de tout classement de performance. C'est délibéré, et c'est notre position éditoriale.
Les scores de benchmark publics souffrent de deux maux difficiles à corriger.
La contamination. Ces jeux de tests circulent sur le web depuis des années. Les modèles sont entraînés sur du texte issu du web. Quand un modèle obtient un score élevé, il devient impossible de distinguer ce qu'il a raisonné de ce qu'il a mémorisé — et les éditeurs eux-mêmes ne peuvent pas toujours le garantir.
Les effets de harnais. Un même modèle obtient des scores très différents selon la façon dont on l'interroge : formulation du prompt, nombre de tentatives, outils mis à disposition, budget de raisonnement accordé. Le chiffre publié mesure autant l'ingénierie autour du modèle que le modèle lui-même.
Cela ne veut pas dire que ces scores sont sans valeur. Cela veut dire qu'ils ne constituent pas un argument de décision, et qu'un comparatif qui les classe vous donne une fausse impression de certitude.
Ce qui, en revanche, ne se truque pas : le tarif publié, la taille de la fenêtre de contexte, la licence, la localisation des données, la latence mesurée sur vos propres requêtes. Ce sont ces critères que nous comparons.
Et le seul test qui vaille reste le vôtre. Prenez vingt requêtes représentatives de votre usage réel, passez-les sur trois modèles, comparez les résultats à l'aveugle. Une demi-journée de travail, quelques dollars, et une réponse qui vaut cent classements.
Et les modèles ouverts ?
Une famille entière échappe à ce comparatif : les modèles à poids ouverts, que vous pouvez télécharger et exécuter vous-même.
Kimi K2.6 de Moonshot AI, DeepSeek V4, Qwen 3.6 d'Alibaba occupent aujourd'hui une place que personne ne leur prédisait il y a deux ans. Certains sont publiés sous des licences très permissives — MIT pour DeepSeek V4, Apache 2.0 pour les modèles ouverts d'Alibaba — ce qui change radicalement les questions de souveraineté et de dépendance.
Nous ne publions pas ici leurs tarifs d'API, faute d'avoir pu les confirmer sur des pages officielles au moment d'écrire. Nous y consacrons un article dédié.
Retenez toutefois le point de méthode : pour un modèle ouvert, le prix affiché par un hébergeur tiers n'est qu'une des options. Vous pouvez l'exécuter sur votre propre infrastructure, et l'équation économique devient alors complètement différente — coût de calcul contre coût de licence, avec une question de compétences internes qui ne figure sur aucune grille tarifaire.
Ce qui change dans trois semaines
Un chiffre de cet article a une date de péremption connue.
Claude Sonnet 5 est actuellement en tarif d'introduction, à 2 dollars l'entrée et 10 en sortie. Ce tarif prend fin le 31 août 2026. À partir du 1er septembre, le modèle passe à 3 dollars et 15 dollars, soit une hausse de 50 %.
Si vous construisez un budget sur les tarifs de Sonnet 5, prenez les tarifs de septembre, pas ceux d'aujourd'hui. Et si vous hésitez à tester ce modèle, les trois semaines qui viennent sont le bon moment.
C'est aussi un rappel plus général : les tarifs de l'IA générative baissent régulièrement, mais pas uniformément et pas toujours. Un budget annuel bâti sur une grille figée est un budget faux dans les deux sens.
Pour décider aujourd'hui
Si vous devez trancher cette semaine, voici la version courte.
Pour du volume et du texte court, commencez par GPT-5.6 Luna ou Gemini 3.6 Flash en batch, et ne payez plus cher que si la qualité ne suit pas.
Pour du contexte long, vérifiez d'abord le seuil de basculement tarifaire chez OpenAI avant toute comparaison — sans quoi vous comparez des choses différentes. Gemini 3.6 Flash offre le meilleur rapport fenêtre-prix du comparatif ; Claude Opus 5 facture sa fenêtre sans supplément.
Pour des tâches difficiles où la qualité prime, les modèles haut de gamme des trois éditeurs se tiennent — testez-les sur vos données plutôt que de croire un classement.
Et dans tous les cas, mesurez sur vos propres requêtes avant de vous engager. Les grilles tarifaires disent ce que coûte un million de tokens. Elles ne disent pas combien de tokens votre application va réellement consommer, et c'est là que se jouent les surprises.
Note de méthode
Tous les tarifs de cet article ont été relevés le 7 août 2026 sur les pages tarifaires officielles d'Anthropic, d'OpenAI et de Google. Aucun chiffre n'est repris d'une source secondaire.
Nous n'avons pas pu confirmer le seuil exact de basculement entre les régimes de contexte court et long d'OpenAI, ni les tarifs d'API des modèles à poids ouverts cités. Ces valeurs sont donc absentes de l'article plutôt qu'approximées.
Les fenêtres de contexte des modèles GPT-5.6 ne sont pas précisées dans le tableau tarifaire officiel d'OpenAI ; nous n'avons donc pas renseigné cette colonne pour ces modèles.
Les tarifs indiqués sont ceux des API officielles des éditeurs. Les mêmes modèles proposés via des plateformes tierces — Amazon Bedrock, Google Vertex AI, Microsoft Foundry — suivent des grilles distinctes.
Cet article contient des tarifs et sera périmé. Vérifiez toujours les pages officielles avant un engagement budgétaire.
Sources
À lire ensuite
- Comparatifs & Benchmarks
Modèles ouverts contre modèles fermés : deux malentendus à démonter
« Open source » et « gratuits » : les deux phrases que l'on répète sur Kimi, DeepSeek et Qwen sont fausses. Ce qu'elles cachent — licences modifiées, mémoire des architectures MoE, seuil de rentabilité réel — et les trois raisons valables de les choisir quand même.
19 min
- Comparatifs & Benchmarks
Le français vous coûte plus cher que l'anglais : la taxe cachée des tokenizers
Pour un contenu identique, le français consomme 25 à 45 % de tokens de plus que l'anglais. Votre facture augmente d'autant, votre fenêtre de contexte rétrécit — et, selon la recherche, la qualité des réponses baisse aussi. Un surcoût mesuré, publié, et absent de toutes les grilles tarifaires.
20 min
- Comparatifs & Benchmarks
Quel modèle d'IA pour coder en 2026 ? Le vrai calcul
Le meilleur modèle pour coder n'existe pas — mais le coût par tâche réussie, lui, se calcule. Nous l'avons fait à partir des tarifs officiels : selon le mode d'usage, le même travail revient à 212 ou 1 340 dollars par développeur et par mois.
20 min
- Comparatifs & Benchmarks
Comparatif des modèles IA 2026 : lequel choisir selon vos besoins ?
Tarifs vérifiés à la source, pièges de facturation que les grilles ne montrent pas, et le basculement réglementaire du 2 août 2026 : la méthode pour choisir votre modèle plutôt qu'un classement qui sera faux dans six semaines.
31 min
[ Emplacement Google AdSense — Id: NEXT_PUBLIC_ADSENSE_CLIENT_ID non configuré ]
Commentaires (0)
Laisser un commentaire
Soyez le premier à commenter cet article.