Gemini 3.7 Flash
Google · Veröffentlicht Aug. 2026
Gemini 3.7 Flash ist Googles bislang stärkstes Flash-Arbeitspferd für Coding und Agents — ein echter Schritt nach vorn gegenüber 3.6 Flash, bis 2026 zum halben vorherigen Preis. Bei den härtesten Terminal- und Computer-Use-Aufgaben liegt es weiterhin hinter der Frontier. Ein klares Upgrade für kostenbewusste Agent-Builder und solche im Google-Ökosystem; kein Frontier-Code-Ersatz.
Ist es das Richtige für dich?
Gut für
- Kostenbewusste Coding- und Agent-Workloads — die Einführungspreise von $0.75/$3.75 liegen bei etwa einem Drittel der Mischkosten von Claude Sonnet 5 oder GPT-5.6 Terra
- Software Engineering mit langem Horizont — DeepSWE v1.1 65,3 %, gegenüber 49,0 % für 3.6 Flash
- Webentwicklung — Code Arena Elo 1588, Spitzenplatz in Googles Vergleichstabelle, mit besserer Design-System-Konformität in weniger Prompts
- Agent-Builder im Google-Ökosystem — treibt Gemini Spark an; verfügbar über Gemini API, AI Studio, Android Studio und Antigravity
Nicht geeignet für
- Härtestes Terminal-/agentisches Coding, wo Frontier-Modelle führen — GPT-5.6 Terra liegt bei DeepSWE (69,6 %), Terminal-Bench 2.1 (87,4 %) und OSWorld-2.0 vorn
- Teams, die Preisstabilität über 2026 hinaus brauchen — der Einführungspreis läuft am 31. Dezember 2026 aus und verdoppelt sich dann auf $1.50/$7.50
Leistung nach Aufgabe
Software engineering (DeepSWE v1.1)
65,3 % bei DeepSWE v1.1, ein großer Zugewinn gegenüber den 49,0 % von 3.6 Flash, aber weiterhin hinter GPT-5.6 Terras 69,6 %
Production code quality (FrontierCode 1.1 Main)
43,6 % gegenüber 34,4 % für 3.6 Flash; führt GPT-5.6 Terra in Googles Tabelle an
Terminal/CLI agent work (Terminal-Bench 2.1)
85,8 % bei Terminal-Bench 2.1, knapp hinter GPT-5.6 Terras 87,4 %
Web development (Code Arena)
1588 Elo bei Code Arena — Spitzenwert in Googles Vergleichstabelle
Knowledge work / long context
1M Kontext, 97,0 % beim 128K-Langkontext-Needle-Test; GDPval-AA 1525 Elo liegt hinter Sonnet 5s 1598
Preise
Eingabe
$0.75 / 1M
Ausgabe
$3.75 / 1M
Kontext
1M context, 64K output
Benchmarks
Noch keine Urteilsänderungen
Die Uhr läuft ab dem ersten Tag — Änderungen erscheinen hier, sobald sich unser Urteil weiterentwickelt.
Quellen
Prüfprotokoll
Noch keine Prüfungen
Wir haben für diesen Eintrag noch keine Prüfung erfasst. Sobald eine Prüfung läuft, erscheint ihr Verlauf hier.