Le prix de vos tokens varie d’un facteur 120 — et cet écart se referme demain
Un million de tokens d'entrée coûte 0,435 $ s'il faut le lire, 0,003625 $ s'il a déjà été lu. Ce levier pèse plus que le choix du modèle — et il faiblit demain.
[ Emplacement Google AdSense — Id: NEXT_PUBLIC_ADSENSE_CLIENT_ID non configuré ]
Il existe, dans la tarification des modèles de langage, un levier qui pèse davantage que le choix du modèle lui-même, et presque personne ne l'active. Chez DeepSeek, ce matin, un million de tokens d'entrée coûte 0,435 dollar s'il faut le lire, et 0,003625 dollar s'il a déjà été lu. Un rapport de 120.
Ce n'est pas une remise de fidélité ni une offre promotionnelle. C'est le cache de contexte, et il récompense une seule chose : la stabilité de vos préfixes.
Ce que le cache fait réellement
Quand vous envoyez une requête, le modèle traite votre texte token par token pour construire son état interne. Ce travail est déterministe : à préfixe identique, état identique. Le fournisseur peut donc le conserver et le réutiliser, au lieu de le refaire.
D'où la règle, qui tient en une phrase : le cache ne fonctionne que sur le début de votre requête, et il s'arrête au premier caractère qui change.
Un prompt système de trois mille tokens, identique à chaque appel, suivi d'une question utilisateur : le prompt système est mis en cache, la question ne l'est pas. Le même prompt système dans lequel vous insérez la date du jour, ou l'identifiant de la session, ou le nom de l'utilisateur : plus rien n'est mis en cache, jamais, parce que la première ligne diffère à chaque appel.
C'est l'erreur la plus répandue, et la plus coûteuse. Une variable injectée en tête de prompt annule cent pour cent du bénéfice. La même variable déplacée en fin de prompt ne coûte rien du tout.
Ce qui change demain, et personne ne le relèvera
Le barème DeepSeek est révisé le 16 août 2026 à 16:00 UTC. Nous en avons détaillé l'effet global dans notre article sur le nouveau barème et ses heures pleines. Un point y mérite un traitement à part, parce qu'il va exactement à l'inverse de l'intuition.
Prix d'entrée par million de tokens, pour DeepSeek-V4-Pro, en dollars.
| Cache touché | Cache manqué | Rapport | |
|---|---|---|---|
| Jusqu'au 16 août | 0,003625 | 0,435 | 120 |
| Heures creuses | 0,022 | 0,66 | 30 |
| Heures pleines | 0,044 | 1,32 | 30 |
Le cache touché est multiplié par six. Le cache manqué, lui, ne l'est que par un peu plus de un et demi. L'écart entre les deux se referme donc violemment : de 120 à 30.
Le travail d'optimisation que vous engagez aujourd'hui rapportera quatre fois moins la semaine prochaine. Ce n'est pas une raison de ne pas le faire — un facteur 30 reste un des meilleurs retours sur investissement de toute l'ingénierie de prompt. C'est une raison de calibrer l'effort correctement, et de ne pas fonder un modèle économique sur un écart qui vient de se réduire des trois quarts.
Les trois gestes qui comptent
Le premier consiste à figer l'ordre de vos prompts. Tout ce qui est stable — instructions système, exemples, schémas, documentation de référence — en tête, dans un ordre invariable. Tout ce qui varie en queue. Ce seul réordonnancement suffit à faire passer un système de zéro à quatre-vingt-dix pour cent de cache touché.
Le deuxième consiste à traquer les variables invisibles. Un horodatage, un compteur de tokens, un identifiant de requête glissé dans l'en-tête « pour le débogage » : chacun de ces éléments, placé avant le contenu stable, coûte le prix fort sur la totalité du prompt. Ils sont d'autant plus difficiles à repérer qu'ils paraissent anodins.
Le troisième consiste à mesurer plutôt qu'à supposer. Les fournisseurs remontent le nombre de tokens servis depuis le cache dans la réponse d'API. Si vous ne lisez pas ce champ, vous ne savez pas si votre optimisation fonctionne — et l'expérience montre qu'elle échoue souvent pour une raison triviale.
Un effet qui se cumule avec la langue
Il y a une raison supplémentaire de s'en préoccuper quand on travaille en français. Le français consomme davantage de tokens que l'anglais pour un contenu identique, comme nous l'avons documenté dans notre article sur la taxe cachée des tokenizers. Un prompt système francophone est donc mécaniquement plus lourd, et le montant que le cache vous fait économiser — ou que son absence vous fait payer — est proportionnellement plus élevé.
Autrement dit, l'enjeu du cache n'est pas le même selon la langue. Il est plus fort pour vous que pour un développeur anglophone appelant la même API sur le même modèle.
Tarifs relevés le 15 août 2026 sur la documentation officielle de DeepSeek. Le barème « heures creuses / heures pleines » entre en vigueur le 16 août 2026 à 16:00 UTC.
Sources
- DeepSeek — Models & Pricing, grilles avant et après le 16 août 2026
- DeepSeek — DeepSeek-V4-Pro GA Release
À lire ensuite
- Actualités & Sorties
AI Act : l’obligation s’applique, mais qui vous contrôle en France ?
Il n'y a pas une autorité de contrôle en France, mais une quinzaine : DGCCRF en coordination, CNIL, Arcom, ACPR, AMF, ANSSI. Savoir de laquelle vous relevez.
7 min
- Actualités & Sorties
Gemini 3.7 Flash : le tarif affiché double le 1er janvier
0,75 $ en entrée jusqu'au 31 décembre, exactement le double au 1er janvier 2027. Troisième éditeur en un mois : votre budget 2027 calculé aujourd'hui est faux.
5 min
- Actualités & Sorties
DeepSeek annonce « moitié prix » et multiplie sa facture par 2,3
Le nouveau barème s'applique le 16 août à 16:00 UTC. L'annonce vante une remise de 50 % en heures creuses ; le tarif de sortie, lui, est multiplié par 2,3.
5 min
- Actualités & Sorties
Trois semaines entre deux versions : arrêtez de choisir un modèle
Gemini 3.7 Flash arrive trois semaines après la 3.6 ; votre cycle d'évaluation en prend six. Vous ne choisissez jamais le meilleur modèle, mais l'avant-dernier.
5 min
[ Emplacement Google AdSense — Id: NEXT_PUBLIC_ADSENSE_CLIENT_ID non configuré ]
Commentaires (0)
Laisser un commentaire
Soyez le premier à commenter cet article.