GPT-5.6 Luna fällt um 80 %, Terra um 20 % — Sol selbstoptimiert

OpenAI logoOpenAIWichtig31. Juli 2026Modelle
Was ist passiert
OpenAI cut GPT-5.6 Luna by 80% (now $0.20/$1.20) and Terra by 20% ($2/$12), three weeks after GA, funded by Sol autonomously rewriting its own GPU kernels.
Warum es wichtig ist
This is the first public case of a frontier model self-optimizing its production inference stack and having that work translate to customer pricing — not a hardware refresh.
Was zu tun ist
Re-benchmark your model-routing tier: at $0.20/$1.20 Luna is now cheaper than Haiku 4.5 with near-GPT-5.5 capability. Terra at $2/$12 undercuts your GPT-5.4 spend.

Der Kostenboden für Frontier-KI ist gerade eingebrochen. OpenAI senkte die Eingabepreise von GPT-5.6 Luna am 30. Juli um 80 % auf 0,20 $/1 Mio. Token und die von Terra um 20 % auf 2,00 $/1 Mio. Token — zwei Tage nachdem ein Sol-Update veröffentlicht wurde, das den Serving-Stack des Modells eigenständig optimiert hatte. Zum ersten Mal hat ein Modell seine eigene Preissenkung gebaut.

Die neue Preisstaffel, gültig ab 30. Juli:

ModellEingabe (pro 1 Mio. Token)Ausgabe (pro 1 Mio. Token)Änderung
GPT-5.6 Luna0,20 $1,20 $Eingabe −80 %
GPT-5.6 Terra2,00 $12,00 $Eingabe −20 %
GPT-5.6 Sol5,00 $30,00 $Keine Änderung

Batch-Preise senken Luna-Eingabe auf 0,10 $ (die Hälfte des ohnehin halbierten Preises) und Terra auf 1,00 $ bei 24-Stunden-Fertigstellungsfenstern. Cached Inference für Luna fällt auf 0,05 $ Eingabe. Luna bekam außerdem einen „Fast Mode" für 0,20 $/1,20 $ — das gleiche Low-Latency-Produkt, das Anthropic für Claude Opus 5 anbietet.

Luna startete im Mai bei 1,00 $/6,00 $. Mit dieser sechsten Preissenkung seit GA ist es nun 80 % günstiger auf der Eingabeseite — vom Frontier-Serien-Token zum günstigsten Low-Latency-Modell der GPT-5.6-Familie (VentureBeat(wird in einem neuen Tab geöffnet), 2026; Unite.AI(wird in einem neuen Tab geöffnet), 2026).

Wie GPT-5.6 Sol seine eigene Infrastruktur umschrieb

Das OpenAI-Entwicklerteam veröffentlichte, dass GPT-5.6 Sol eigenständig seine eigenen Produktions-GPU-Kernel innerhalb von Codex umgeschrieben hatte — das Modell identifizierte und ersetzte ineffizienten CUDA-Code in seinem Serving-Pfad. Das Ergebnis: 20 % Reduzierung der Token-Serving-Kosten, über 15 % Token-Effizienzgewinn durch Speculative-Decoding-Verbesserungen und insgesamt schnellere Antworten (OpenAI Engineering Post(wird in einem neuen Tab geöffnet), 2026).

Dies ist der erste öffentlich dokumentierte Fall, in dem ein Frontier-Modell seinen eigenen Inferenz-Stack selbst optimiert und diese Arbeit direkt in Kundenpreise übersetzt wurde (Unite.AI(wird in einem neuen Tab geöffnet), 2026). Sol bekam auch eine „Fast Mode"-Variante für 1,00 $/5,00 $, die laut OpenAI 80 % schneller und 40 % günstiger ist als die Standard-Sol-Inferenz und die veraltete Priority-Processing-Option ersetzt. Anthropic verkauft das gleiche Produkt unter dem gleichen Namen und denselben Bedingungen für Claude Opus 5 — die beiden Preisstaffeln konvergieren nun bei Low-Latency-Inferenz-Preisen (Unite.AI(wird in einem neuen Tab geöffnet), 2026).

OpenAI-CFO Sarah Friar sagte Mitarbeitern bei einem internen All-Hands, dass der ARR allein im Juli das gesamte Q2 übertraf, wie CNBC berichtete. Unabhängig davon stieg die interne Auto-Review-Pipeline des Unternehmens von GPT-5.4 auf GPT-5.6 Luna um — eine 10-fache Kosteneinsparung für den eigenen KI-Betrieb (TechTimes(wird in einem neuen Tab geöffnet), 2026).

Warum die GPT-5.6-Preise den Markt gerade neu ausrichten

Die Claude-Modellfamilie kontrolliert einen erheblichen Anteil der Enterprise-KI-Ausgaben — diese Kürzungen zielen direkt auf diesen Ausgabenmix ab.

Bei 0,20 $ Eingabe unterbietet Luna nun Anthropics Claude Haiku 4.5 (0,80 $/4,00 $) um das Vierfache auf der Eingabeseite. Bei 2 $/12 $ liegt Terra auf Augenhöhe mit Gemini 3.1 Pro Preview-Preisen (≤200K Kontext) und unter dem Post-Einführungspreis von Claude Sonnet 5 (3 $/15 $ nach dem 31. August). Sols Fast Mode für 1 $/5 $ konkurriert direkt mit Claude Opus 5 Fast (1 $/5 $) zu gleichen Bedingungen.

Die Enterprise-Kostenmüdigkeit hat eine Antwort. Uber verbrannte sein gesamtes KI-Budget 2026 in vier Monaten (Quartz / Yahoo Finance(wird in einem neuen Tab geöffnet), 2026); Amazon begann am selben Tag wie diese Kürzung, KI-Ausgaben zu deckeln (Unite.AI(wird in einem neuen Tab geöffnet), 2026). OpenAI lieferte harte API-Ausgabenlimits für Organisationen am 22. Juli (Unite.AI(wird in einem neuen Tab geöffnet), 2026). Die Modelle werden auch immer besser darin, Geld zu sparen.

Der Meilenstein der Selbstoptimierung verändert auch die Erzählung: KI-Kostensenkung geht nicht mehr nur um billigere Chips. Die Modelle gestalten nun aktiv ihre eigenen Kostenkurven — eine Rückkopplungsschleife, die Preis-Zeitpläne schneller komprimieren könnte, als das Mooresche Gesetz es je tat.

Was sich für Sie ändert

  • Wenn Sie GPT-5.6 Terra nutzen: Ihre Eingabekosten sind gerade um 20 % gefallen — ohne jegliche Migrationsarbeit.
  • Wenn Sie Claude-Modelle nutzen und Terra Ihren Qualitätsanspruch erfüllt: Der Wechsel spart allein beim Input 1 $/Mio.
  • Wenn Sie GPT-5.6 Luna für hochvolumige Batch-Inferenz einsetzen: Cached + Batch-Preise bringen den Input jetzt unter 10 Cent pro 1 Mio. Token — tragfähig für produktionsreife Textverarbeitung, wo es vorher grenzwertig war.
  • Wenn Sie Sol-Qualität zu niedrigeren Kosten brauchen: Fast Mode für 1 $/5 $ ist eine neue Stufe, die es vor dem 30. Juli nicht gab.
  • Wenn Sie auf der OpenAI-API mit knappen Budgets entwickeln: Legen Sie harte Ausgabenlimits fest — OpenAI hat die Funktion am 22. Juli eingeführt, und die Modelle geben nun intelligenter innerhalb Ihres Caps aus.

OpenAI kündigt weitere effizienzgetriebene Preissenkungen für den gesamten Juli an.

FAQ

Ist Luna zu diesem Preis tatsächlich für echte Arbeit nutzbar?

Ja. Luna liefert nahezu GPT-5.5-Fähigkeit. Für einfache API-Aufgaben — Klassifikation, Extraktion, Moderation, Übersetzung — ist Luna für 0,20 $ jetzt der günstigste Weg zu Frontier-Textintelligenz und mit ziemlicher Sicherheit gut genug.

Was ist Sol Fast Mode vs. Standard-Sol?

Fast Mode tauscht eine kleine Genauigkeitsmarge gegen etwa doppelt so schnelle Antworten bei 80 % niedrigeren Kosten. OpenAI bietet ihn als dedizierten Endpunkt für latenzempfindliche Anwendungsfälle an (Chat-UIs, Copilot-Vervollständigungen, Agent-Toolaufrufe). Er ersetzt die alte Priority-Processing-Option.

Hat Sol wirklich seinen eigenen Code umgeschrieben?

Ja. Der von Ferrari, Tillet, Ibrahim, Gershenson und Coffey verfasste OpenAI-Engineering-Post beschreibt, wie Sol ineffiziente GPU-Kernel in Codex identifizierte und durch optimierte Alternativen ersetzte — eine 20-prozentige Reduzierung der Serving-Kosten, verifiziert in Produktionstelemetrie. Sol verbesserte auch die Speculative-Decoding-Pipeline für Token-Effizienz (OpenAI Engineering Post(wird in einem neuen Tab geöffnet), 2026).

TL;DR

  • Was passiert ist: OpenAI senkte GPT-5.6 Luna um 80 % (jetzt 0,20 $/1,20 $) und Terra um 20 % (2 $/12 $), drei Wochen nach GA, finanziert durch Sols eigenständige Neuschreibung seiner eigenen GPU-Kernel.
  • Warum es wichtig ist: Dies ist der erste öffentliche Fall, in dem ein Frontier-Modell seinen Produktions-Inferenz-Stack selbst optimiert und diese Arbeit in Kundenpreise übersetzt — kein Hardware-Refresh.
  • Was zu tun ist: Benchmarken Sie Ihre Modell-Routing-Stufe neu: Für 0,20 $/1,20 $ ist Luna jetzt günstiger als Haiku 4.5 mit nahezu GPT-5.5-Fähigkeit. Terra für 2 $/12 $ unterbietet Ihre GPT-5.4-Ausgaben.

Betroffene Tools & Modelle

Nie wieder etwas verpassen

Das wöchentliche Delta — nur Urteilsänderungen und dringende Punkte. Kein Füllmaterial.

Mit dem Abonnieren stimmst du unserer Datenschutzerklärung zu. Jederzeit abbestellbar.