Gemini 3.5 Flash: Computer Use auf Augenhöhe mit GPT-5.5 – bei einem Drittel der Kosten
- Was ist passiert
- Google baked Computer Use into Gemini 3.5 Flash as a native tool on June 24, 2026, scoring 78.4 on OSWorld-Verified — within 0.3 points of GPT-5.5 at roughly one-third the cost.
- Warum es wichtig ist
- At $1.50/$9 per 1M tokens vs GPT-5.5's $5/$30, Gemini becomes the cost-effective default for agentic desktop automation — if the preview API gap closes and the self-reported benchmarks hold in production.
- Was zu tun ist
- If you run Computer Use on the standalone Gemini 2.5 model, start migration planning. If you're evaluating computer-use models, add Gemini 3.5 Flash to your benchmark list once the API endpoint goes GA.
Urteil: Gemini 3.5 Flash ist jetzt ein echter Anwärter für agentische Desktop-Automatisierung — es liegt gleichauf mit GPT-5.5 auf OSWorld-Verified bei etwa einem Drittel der Kosten, mit Sicherheitskontrollen auf Enterprise-Niveau. Das eigenständige Gemini 2.5 Computer-Use-Modell ist damit faktisch überholt.
Am 24. Juni 2026 lieferte Google ein Funktionsupgrade, das die Computer-Use-Landschaft neu ordnet: Computer Use ist jetzt ein natives, integriertes Tool innerhalb von Gemini 3.5 Flash — kein separates Modell mehr erforderlich. Die Funktion war zuvor nur über ein eigenständiges Gemini 2.5 Computer-Use-Modell zugänglich, das im Oktober 2025 eingeführt wurde; dieses Modell ist für diesen Anwendungsfall nun abgelöst.
Die Schlagzeilen-Zahl: 78,4 auf OSWorld-Verified, dem Standard-Benchmark für Computer-Use-Agenten auf Ubuntu, Windows und macOS. GPT-5.5 liegt bei 78,7 — ein Abstand von 0,3 Punkten, den unabhängige Berichterstattung effektiv als Dreikampf mit Claude Opus 4.7 bei 78,0 beschreibt. Der wichtigere Unterschied ist nicht der Benchmark-Abstand, sondern die Kosten: Gemini 3.5 Flash kostet $1,50/M Eingabe-Tokens und $9/M Ausgabe-Tokens, gegenüber GPT-5.5 mit $5/$30. Bei agentischen Workloads mit hohem Volumen summiert sich dieser Unterschied schnell.
Aber es gibt einen Haken, den man gleich klarstellen muss: Das Computer-Use-Tool ist für Gemini 3.5 Flash noch nicht in der öffentlichen API verfügbar. Der veröffentlichte Wert von 78,4 spiegelt interne Evaluierungen wider; die API-Dokumentation verweist für Computer-Use-Workloads weiterhin auf gemini-3-flash-preview. Google beschreibt dies als öffentliche Vorschau — GA-Preise und vollständige API-Verfügbarkeit stehen noch aus. Das ist kein Launch, den Sie heute in Produktion nehmen können; es ist ein Signal dafür, wohin die Flash-Linie sich entwickelt.
Was passiert ist: Gemini 3.5 Flash erhält natives Computer Use
Vor dieser Veröffentlichung erforderte die Kombination von Computer Use mit anderen Gemini-Funktionen eine Multi-Modell-Orchestrierung: ein Modell für die Bildschirminteraktion, ein anderes für Search Grounding oder Function Calling. Die native Integration beseitigt diese Einschränkung. Entwickler rufen Computer Use als einen einzigen Tool-Parameter neben Search, Maps und benutzerdefinierten Funktionsaufrufen auf — alles innerhalb eines einzigen Modellkontexts.
Das technische Upgrade umfasst ein Intent-Feld, das jeder Aktionsantwort hinzugefügt wurde. Frühere Computer-Use-Modelle gaben nur Pixelkoordinaten zurück; Gemini 3.5 Flash gibt nun zu jeder Aktion eine kurze Erklärung in natürlicher Sprache aus — zum Beispiel "Klicke auf das Suchfeld, um das Ziel einzugeben." Für Entwickler, die langlaufende Agenten-Durchläufe debuggen, macht dies die Argumentationskette bei jedem Schritt sichtbar, ohne separate Logging-Infrastruktur.
Die Verbesserung von Generation zu Generation ist erheblich: Gemini 3 Flash, der Vorgänger, erreichte 65,1 auf OSWorld. Der Sprung von 13,3 Punkten zwischen den Modellgenerationen ist der größte Einzelsprung auf der aktuellen Bestenliste.
Warum es wichtig ist
Das ist nicht nur eine Benchmark-Demonstration — es ist eine architektonische Verschiebung, die die Wirtschaftlichkeit der agentischen Automatisierung verändert. Ein einzelner Gemini 3.5 Flash(wird in einem neuen Tab geöffnet)-Agent kann jetzt einen Bildschirm sehen, Informationen per Search nachschlagen, mit Legacy-Software über die Benutzeroberfläche interagieren und Antworten in Maps verankern — alles ohne zwischen Modellen zu routen. Für Teams, die Software-Test-Agenten, Büroautomatisierung oder Enterprise-Workflows entwickeln, reduziert dies die technische Komplexität, die zuvor maßgeschneiderte Multi-Modell-Pipelines erforderte.
Das Wettbewerbsbild, mit Bewertungen:
| Modell | OSWorld-Verified | Eingabe / Ausgabe (pro 1M Tokens) | Status |
|---|---|---|---|
| Claude Fable 5 | 85,0 | $10 / $50 | Ausgesetzt (12. Juni 2026) |
| Claude Opus 4.8 | 83,4 | $15 / $75 | Verfügbar |
| GPT-5.5 | 78,7 | $5 / $30 | Verfügbar |
| Gemini 3.5 Flash | 78,4 | $1,50 / $9 | Vorschau |
| Claude Opus 4.7 | 78,0 | $15 / $75 | Verfügbar |
| Sonnet 4.6 | 78,4 | $3 / $15 | Verfügbar |
| Gemini 3.1 Pro | 76,2 | $1,25 / $10 | Verfügbar |
| Gemini 3 Flash | 65,1 | $0,15 / $0,60 | Verfügbar |
Zwei Einschränkungen sind wichtig: Erstens werden alle OSWorld-Verified-Ergebnisse von den Anbietern selbst gemeldet — keines wurde bis Juni 2026 unabhängig verifiziert. Zweitens ist Fable 5 mit 85,0 die eigentliche Spitze der Bestenliste, aber es ist seit der US-Exportkontrollrichtlinie vom 12. Juni ausgesetzt. Damit ist Opus 4.8 mit 83,4 die effektive Obergrenze unter den derzeit verfügbaren Modellen.
Google lieferte auch die Sicherheitskontrollen, die Computer Use für den Enterprise-Einsatz tragfähig machen:
- Adversarial Training speziell für Computer-Use-Prompt-Injection-Szenarien
- Explizite Benutzerbestätigung für sensible oder irreversible Aktionen — das Modell fragt, bevor es auf "Löschen" oder "Senden" klickt
- Automatischer Stopp bei Erkennung indirekter Prompt Injection — wenn eine Webseite versucht, Anweisungen einzuschleusen, wird die Sitzung beendet
- Defense-in-Depth-Bereitstellungsleitfaden mit Empfehlungen für Sandboxing, Human-in-the-Loop-Verifikation und strikte Zugriffskontrollen
Das ist die richtige Verpackung für den Produktiveinsatz. Computer Use ohne Schutzmaßnahmen ist ein Sicherheitsvorfall, der nur darauf wartet zu passieren — ein browserbasierter Agent mit Power-User-Zugriff ist genau die Angriffsfläche, die Prompt Injection gefährlich macht. Google hat sowohl die Funktion als auch die Kontrollen in einer Veröffentlichung geliefert, was mehr ist, als die meisten Anbieter bei einem ersten Launch schaffen.
Was sich für Sie ändert
Wenn Sie Computer-Use-Workloads auf dem eigenständigen Gemini 2.5 Pro(wird in einem neuen Tab geöffnet)-Modell betreiben: Planen Sie Ihre Migration. Das 2.5-Computer-Use-Modell ist für diesen Anwendungsfall faktisch veraltet. Warten Sie jedoch auf GA-Preise und vollständige API-Verfügbarkeit, bevor Sie Produktionssysteme umstellen — die öffentliche API stellt Computer Use für Gemini 3.5 Flash noch nicht bereit.
Wenn Sie Computer-Use-Modelle für agentische Automatisierung evaluieren: Nehmen Sie Gemini 3.5 Flash in Ihre Benchmark-Liste neben GPT-5.5 und Claude Opus 4.8 auf. Der 0,3-Punkte-Abstand auf OSWorld zu GPT-5.5 ist in der Praxis vernachlässigbar; der Kostenvorteil von über 70 % bei Skalierung ist es nicht.
Wenn Sie Enterprise-Agenten entwickeln: Die von Google gelieferten Sicherheitskontrollen sind eine gründliche Betrachtung wert, selbst wenn Sie ein anderes Modell einsetzen möchten. Die Kombination aus Adversarial Training + Benutzerbestätigung + automatischem Stopp bei Injection-Erkennung ist eine Vorlage für jede produktive Computer-Use-Bereitstellung.
FAQ
Kann ich Computer Use in Gemini 3.5 Flash heute nutzen?
Noch nicht über die öffentliche API. Google hat die Funktion am 24. Juni als öffentliche Vorschau angekündigt; das dokumentierte API-Modell für Computer Use bleibt gemini-3-flash-preview. Der OSWorld-Verified-Wert von 78,4 und die Enterprise-Sicherheitsmaßnahmen sind real, aber GA-Preise und vollständige API-Verfügbarkeit wurden noch nicht angekündigt. Behalten Sie die Gemini API-Dokumentation(wird in einem neuen Tab geöffnet) im Auge für den produktionsreifen Endpunkt.
Wie schneidet Gemini 3.5 Flash im Vergleich zu GPT-5.5 bei Computer Use ab?
Auf OSWorld-Verified beträgt der Abstand 0,3 Punkte — 78,4 vs. 78,7 — was effektiv ein Gleichstand ist. Der eigentliche Unterschied sind die Kosten: $1,50/$9 pro 1M Tokens für Gemini 3.5 Flash gegenüber $5/$30 für GPT-5.5. Alle OSWorld-Verified-Ergebnisse werden von den Anbietern selbst gemeldet und wurden bis Juni 2026 nicht unabhängig verifiziert.
Was ist mit dem eigenständigen Gemini 2.5 Computer-Use-Modell passiert?
Es ist weiterhin über seinen bestehenden API-Endpunkt zugänglich, aber Google hat Gemini 3.5 Flash als empfohlenes Modell für Computer-Use-Workloads positioniert. Das eigenständige Modell kann nicht gleichzeitig Search, Maps oder Function Calls innerhalb desselben Agentenkontexts nutzen — eine Einschränkung, die die native Flash-Integration beseitigt. Migrationsplanung ist die richtige Haltung; eine Notfallmigration ist es nicht (der 2.5-Endpunkt funktioniert weiterhin).
Betroffene Tools & Modelle
Nie wieder etwas verpassen
Das wöchentliche Delta — nur Urteilsänderungen und dringende Punkte. Kein Füllmaterial.