Three Gemini Flash Models Ship — 3.5 Pro Still Delayed

Google DeepMind logoGoogle DeepMindImportant22 juillet 2026Modèles
Ce qui s’est passé
Google shipped Gemini 3.6 Flash ($1.50/$7.50 per 1M tokens with 49% DeepSWE), 3.5 Flash-Lite ($0.30/$2.50 at 350 tok/s), and Flash Cyber (government-gated cybersecurity model) — three efficiency-focused models optimized for agent workloads.
Pourquoi c’est important
Google is executing on cost and speed but cannot ship a frontier model — Gemini 3.5 Pro has missed its June release target, is reportedly months behind on coding benchmarks, and the competitive gap at the top is widening while Gemini 4 pretraining begins.
Que faire
Benchmark 3.6 Flash on your agent workloads — the 17% token reduction compounds at scale — and evaluate Flash-Lite for high-throughput pipelines, but build on what exists while 3.5 Pro remains unshipped.

Google DeepMind a livré trois modèles Gemini Flash mardi — et aucun d'entre eux n'est le modèle que tout le monde attendait.

Gemini 3.6 Flash (1,50 $/7,50 $ par million de tokens) est le nouveau cheval de trait : 17 % de tokens de sortie en moins que 3.5 Flash, un score DeepSWE de 49 % et 63,9 % sur MLE-Bench. Gemini 3.5 Flash-Lite (0,30 $/2,50 $) atteint 350 tokens par seconde — 2x plus rapide que son prédécesseur — et égale presque Gemini 3 Flash sur les benchmarks de codage pour une fraction du coût. Gemini 3.5 Flash Cyber est un modèle spécialisé en cybersécurité, disponible exclusivement pour les gouvernements et les partenaires de confiance via CodeMender (Blog Google, 2026).

Mais le flagship Gemini 3.5 Pro — annoncé à la conférence I/O en mai — a maintenant manqué plusieurs objectifs de sortie. Logan Kilpatrick, responsable produit chez Google, dit qu'il est « en test avec des partenaires. » Bloomberg rapporte que le modèle a des mois de retard sur les benchmarks de codage après avoir peiné à atteindre les objectifs de performance internes. Pendant ce temps, le pré-entraînement de Gemini 4 a commencé (Blog Google, 2026 ; TechCrunch, 2026).

Ce qui s'est passé

Gemini 3.6 Flash est le successeur direct de 3.5 Flash. À 1,50 $/M en entrée et 7,50 $/M en sortie avec une fenêtre de contexte d'1M de tokens, il offre les mêmes capacités tout en utilisant 17 % de tokens de sortie en moins — une attaque directe contre le problème de gonflement des tokens qui gonfle les coûts des agents.

BenchmarkGemini 3.5 FlashGemini 3.6 FlashAmélioration
DeepSWE37 %49 %+12 points
MLE-Bench49,7 %63,9 %+14,2 points
OSWorld-Verified78,4 %83,0 %+4,6 points

Gemini 3.5 Flash-Lite atteint 350 tokens par seconde — 2x plus rapide que 3.1 Flash-Lite — tout en scorant 54,2 % sur SWE-Bench Pro et 74,0 % sur OSWorld. À 0,30 $/M en entrée et 2,50 $/M en sortie, il se situe entre DeepSeek V4 Flash et Pro en termes de coût d'entrée (VentureBeat, 2026).

Gemini 3.5 Flash Cyber est fine-tuné pour la chasse aux vulnérabilités et le patching. Disponible exclusivement via CodeMender pour les gouvernements et les partenaires de confiance. Compétitif avec Mythos d'Anthropic sur CyberGym.

Gemini 3.5 Pro (annoncé à I/O en mai 2026) : repoussé à plusieurs reprises au-delà de sa sortie promise en juin. « En test avec des partenaires, j'espère atterrir bientôt » selon Logan Kilpatrick de Google. Le pré-entraînement de Gemini 4 a commencé.

Pourquoi c'est important

Google gagne sur le coût et la vitesse mais ne peut pas livrer de modèle frontalier. L'écart d'efficacité entre le niveau Flash de Google et ses concurrents s'élargit — 3.6 Flash à 1,50 $/7,50 $ avec 49 % DeepSWE est le meilleur rapport qualité-prix que Google ait jamais livré. Mais l'écart Pro au sommet est structurel : retards répétés, objectifs de performance internes manqués (selon Bloomberg) et aucun calendrier confirmé.

La course à l'IA est passée des scores de benchmark à l'efficacité des coûts. Les modèles qui gagnent les workloads d'agents ne sont pas ceux avec les scores de benchmark les plus élevés — ce sont ceux avec la meilleure performance par dollar. Google le comprend. La ligne Flash est optimisée exactement pour cette métrique.

Ce qui change pour vous

  • Benchmarkez Gemini 3.6 Flash sur vos workflows d'agents — 17 % de tokens de sortie en moins et 49 % DeepSWE à 1,50 $/M en entrée est une amélioration significative
  • Évaluez Flash-Lite pour les pipelines à haut débit — 350 tok/s à 0,30 $/M en entrée, 2x plus rapide que la génération précédente
  • Ne planifiez pas votre architecture autour de Gemini 3.5 Pro — il est repoussé à plusieurs reprises sans calendrier confirmé. Construisez sur ce qui existe
  • Flash Cyber est disponible uniquement pour les gouvernements et les partenaires de confiance — pas une option commerciale

FAQ

Gemini 3.6 Flash est-il un remplacement direct de 3.5 Flash ? Oui. Même API, même fenêtre de contexte d'1M, mais 17 % de tokens de sortie en moins sur les mêmes tâches.

Quand Gemini 3.5 Pro sera-t-il livré ? Inconnu. Google dit « bientôt » mais a manqué plusieurs échéances précédentes. Le modèle est en retard sur les benchmarks de codage.

Puis-je essayer Flash Cyber ? Non — il est exclusivement disponible pour les gouvernements et les partenaires de confiance via CodeMender.

Outils et modèles concernés

Ne ratez plus jamais une mise à jour

Le récap hebdomadaire — uniquement les changements de verdict et les actions urgentes. Sans remplissage.

En vous abonnant, vous acceptez notre Politique de confidentialité. Désabonnement à tout moment.