G

Grok 4.5

SpaceXAI · Veröffentlicht Juli 2026

Bedingt

Konkurrenzfaehig bepreistes Coding-/agentisches Modell zu $2/$6 pro 1M Token mit 500K Kontext -- xAIs veroeffentlichte Benchmarks platzieren es im Mittelfeld hinter Fable 5 und GPT-5.5, fuehrt jedoch Opus 4.8 bei DeepSWE und Terminal-Bench 2.1 an. Die eigentliche Staerke ist Kosteneffizienz: 4,2x token-effizienter als Opus 4.8 im SWE-Bench Pro. Am besten fuer Teams, die starke Coding-Leistung zu einem Bruchteil der Frontier-Preise benoetigen. Noch nicht in der EU verfuegbar.

Ist es das Richtige für dich?

Gut für

  • Kostensensitive Coding-Workloads — $2/$6-Preise unterbieten Opus um 60 % beim Input, 76 % beim Output
  • Token-effiziente agentische Aufgaben — löst SWE Bench Pro mit ~16K Output-Tokens, 4,2x weniger als Opus 4.8
  • Langlaufende Tool-Use- und mehrstufige Engineering-Aufgaben — zusammen mit Cursor für agentische Coding-Workflows trainiert
  • Office-Produktivität — integrierte Excel-, PowerPoint-, Word-Integration via Grok Build

Nicht geeignet für

  • Teams, die die absolute Frontier brauchen — Fable 5 und GPT-5.5 führen bei den meisten Coding-Benchmarks
  • EU-basierte Projekte — noch nicht in EU-Regionen verfügbar (Mitte Juli 2026 erwartet)
  • Workloads, die unabhängige Benchmark-Verifizierung erfordern — alle aktuellen Ergebnisse sind herstellerberichtet

Leistung nach Aufgabe

Codegenerierung

Very Good

Stark auf SWE Bench Pro (64,7 %) und Terminal Bench 2.1 (83,3 %); Mittelfeld unter Frontier-Modellen

Agentisches Coding

Very Good

Für langlaufenden Tool-Use mit Cursor-Trainingsdaten gebaut; 4,2x Token-Effizienzvorteil

Wissensarbeit

Good

Solide, aber laut Hersteller-Charts hinter Opus 4.8 und Fable 5 bei Wissens-Benchmarks

Reasoning

Good

Konfigurierbarer reasoning_effort (low/medium/high); ausreichend, aber nicht klassenführend

Multimodal

Good

Text- + Bild-Input, nur Text-Output; nativ keine Bildgenerierung

Preise

Eingabe

$2 / 1M tokens

Ausgabe

$6 / 1M tokens

Kontext

500K tokens

Alle Preise ansehen

Benchmarks

BenchmarkWertQuelle
DeepSWE 1.062.0% Quelle
DeepSWE 1.153% Quelle
SWE Marathon29.0% Quelle
Terminal Bench 2.183.3% Quelle
SWE Bench Pro64.7% Quelle

Urteilsverlauf

15. Juli 2026
copy edit to brevity standard — detail preserved in existing structured children

Prüfprotokoll

  • Preise— Keine Änderungen

    Automatisierter Agent

  • Preise— Keine Änderungen

    Automatisierter Agent

  • Profil— Keine Änderungen

    Beim Start importiert

  • Preise— Keine Änderungen

    Beim Start importiert

Wie wir bewerten