Trois semaines entre deux versions : arrêtez de choisir un modèle
Gemini 3.7 Flash arrive trois semaines après la 3.6 ; votre cycle d'évaluation en prend six. Vous ne choisissez jamais le meilleur modèle, mais l'avant-dernier.
[ Emplacement Google AdSense — Id: NEXT_PUBLIC_ADSENSE_CLIENT_ID non configuré ]
Google a publié Gemini 3.7 Flash le 13 août 2026, et écrit dans son annonce que le modèle arrive « just three weeks after Gemini 3.6 Flash ». Trois semaines. DeepSeek, de son côté, a mis V4-Flash en disponibilité générale le 31 juillet et V4-Pro le 13 août : treize jours.
Ces deux dates ne sont pas des exploits d'ingénierie qu'il faudrait saluer. Ce sont des données d'entrée pour vos décisions d'architecture, et elles invalident une pratique très répandue.
Le cycle de décision est plus long que le cycle de sortie
Évaluer sérieusement un modèle pour un usage de production demande du temps. Il faut constituer un jeu de cas représentatifs, calibrer les prompts, mesurer sur des critères qui vous concernent, éprouver les cas limites, faire valider par les personnes qui porteront la responsabilité du résultat. Dans une organisation ordinaire, cela prend de quatre à huit semaines.
Le fournisseur, lui, sort une version toutes les trois semaines.
Vous n'êtes donc jamais en train de choisir le meilleur modèle. Vous êtes en train de choisir le meilleur modèle d'il y a deux versions, et vous le découvrez au moment de la mise en production. Ce n'est pas un défaut d'organisation qu'un peu de rigueur corrigerait : c'est une propriété structurelle du marché actuel, et aucune accélération de votre processus ne vous fera gagner cette course.
La conclusion habituelle est mauvaise
La réaction spontanée consiste à vouloir suivre le rythme : veille permanente, réévaluation continue, mise à jour à chaque sortie. C'est épuisant, coûteux, et surtout, c'est faux comme raisonnement.
Une équipe qui change de modèle à chaque version passe son temps à recalibrer ce qui fonctionnait déjà. Chaque bascule remet en jeu des comportements éprouvés, des formulations ajustées, des garde-fous testés. Le gain marginal d'une version à l'autre est presque toujours inférieur au coût de la revalidation — surtout quand la version suivante arrive avant que la précédente ne soit stabilisée.
La bonne conclusion est ailleurs, et elle est plus confortable : cessez de choisir un modèle, choisissez une couche d'abstraction.
Ce que cela veut dire concrètement
Cela ne signifie pas installer une bibliothèque qui promet de tout unifier. La plupart ajoutent une dépendance et une latence pour un bénéfice qu'on obtient à moindre coût.
Cela signifie que trois choses, dans votre code, ne doivent dépendre d'aucun fournisseur en particulier.
Le nom du modèle, d'abord, qui n'a rien à faire ailleurs que dans une configuration. S'il apparaît dans plusieurs fichiers, vous avez déjà un problème, et vous le paierez au prochain changement.
La forme de vos prompts, ensuite. Un prompt affûté pendant des semaines pour un modèle précis est un actif qui perd toute valeur à la bascule suivante. Un prompt clair, explicite, qui ne repose sur aucune particularité comportementale, se transporte. Il sera légèrement moins performant sur le modèle du moment, et nettement plus durable.
Votre jeu d'évaluation, enfin, qui est le seul investissement dont la valeur augmente avec le temps. Trente à cinquante cas tirés de votre usage réel, avec le résultat attendu, permettent de trancher un changement de modèle en une heure au lieu d'un mois. C'est ce qui transforme la cadence des sorties de menace en opportunité : quand tester coûte une heure, sortir une version toutes les trois semaines devient une bonne nouvelle.
Le coût est ailleurs que là où on le cherche
Un point mérite d'être dit franchement, parce qu'il va à l'encontre du discours ambiant. Sur la grande majorité des usages professionnels, l'écart de qualité entre les modèles de tête est aujourd'hui inférieur à l'écart entre un prompt médiocre et un bon prompt sur le même modèle.
Autrement dit, le temps passé à comparer les modèles rapporte moins que le même temps passé à travailler ses prompts et à documenter ses cas d'usage. La cadence des sorties rend cet arbitrage plus tranché chaque mois : ce que vous optimisez côté fournisseur sera périmé dans trois semaines, ce que vous construisez côté méthode ne le sera pas.
Deux articles complètent utilement celui-ci sur le versant économique de cette décision : la manière dont les tarifs d'appel expirent, et le levier du cache de contexte, qui pèse davantage sur la facture que le choix du fournisseur.
Article publié le 15 août 2026. Les dates de sortie citées proviennent des annonces officielles des éditeurs.
Sources
À lire ensuite
- Actualités & Sorties
AI Act : l’obligation s’applique, mais qui vous contrôle en France ?
Il n'y a pas une autorité de contrôle en France, mais une quinzaine : DGCCRF en coordination, CNIL, Arcom, ACPR, AMF, ANSSI. Savoir de laquelle vous relevez.
7 min
- Actualités & Sorties
Gemini 3.7 Flash : le tarif affiché double le 1er janvier
0,75 $ en entrée jusqu'au 31 décembre, exactement le double au 1er janvier 2027. Troisième éditeur en un mois : votre budget 2027 calculé aujourd'hui est faux.
5 min
- Actualités & Sorties
DeepSeek annonce « moitié prix » et multiplie sa facture par 2,3
Le nouveau barème s'applique le 16 août à 16:00 UTC. L'annonce vante une remise de 50 % en heures creuses ; le tarif de sortie, lui, est multiplié par 2,3.
5 min
- Actualités & Sorties
Le prix de vos tokens varie d’un facteur 120 — et cet écart se referme demain
Un million de tokens d'entrée coûte 0,435 $ s'il faut le lire, 0,003625 $ s'il a déjà été lu. Ce levier pèse plus que le choix du modèle — et il faiblit demain.
5 min
[ Emplacement Google AdSense — Id: NEXT_PUBLIC_ADSENSE_CLIENT_ID non configuré ]
Commentaires (0)
Laisser un commentaire
Soyez le premier à commenter cet article.