KI-Modelle

54

Finde das richtige Modell für deine Aufgabe. Nach Stärke filtern, Preise vergleichen, entscheiden.

Nach Anbieter filtern

54Modelle
Astra logo

Astra

OpenAI

pending

Erstes Modell, das OpenAIs „Critical"-Cybersicherheitsschwelle ausgelöst hat. Löste 10 offene Mathematikprobleme für etwa $2.000. Entwicklung ab August 2026 aktiv pausiert für Security-Hardening.

Eingabe
Not yet published
Ausgabe
Not yet published
Kontext
Development slowed Aug 2026. No GA date.
Claude Fable 5 logo

Claude Fable 5

Anthropic

Bedingt

Anthropics Frontier-Modell der Mythos-Klasse — das bislang stärkste öffentlich verfügbare Claude-Modell, das zum Start jeden wichtigen Benchmark anführt. Das Urteil bleibt CONDITIONAL wegen zweier aktueller Einschränkungen: reiner Credit-Preisgestaltung von $10/$50 per 1M tokens ohne Abo-Option und einem Sicherheitsklassifikator, der bei routinemäßigen Coding-Aufgaben zu oft anschlägt und sie stillschweigend auf einen Opus-4.8-Fallback umleitet. Greifen Sie zu Fable 5, wenn der Fähigkeitsvorsprung die Kosten rechtfertigt; für Routinearbeit ist Sonnet 5 die berechenbarere Alternative.

Eingabe
$10 / 1M tokens
Ausgabe
$50 / 1M tokens
Kontext
1M context, 128K max output
Claude Haiku 4.5 logo

Claude Haiku 4.5

Anthropic

Empfohlen

Anthropics Preis-Leistungs-Basis für $1/$5 per 1M tokens — die schnelle, günstige Stufe, an der sich die Konkurrenz misst, mit 200K Kontext und 64K Output. Am besten für latenzkritische Arbeit mit hohem Volumen: Klassifikation, Extraktion, Zusammenfassung, Routing. Greifen Sie zu Opus 4.8 oder Sonnet 5, wenn tiefes mehrstufiges Reasoning gefragt ist.

Eingabe
$1 / 1M tokens
Ausgabe
$5 / 1M tokens
Kontext
200K tokens
Claude Opus 4.8 logo

Claude Opus 4.8

Anthropic

Empfohlen

Anthropics Flaggschiff-Reasoning-Modell und der praktische Frontier-Platzhirsch für einsatzbereite Leistungsfähigkeit — 1M Token Kontext für $5/$25 per 1M tokens, in allen Abo-Plänen enthalten. Unsere Empfehlung für review-lastige Arbeit: Code-Review, Refactoring unter strikten Vorgaben und Aufgaben mit bedachtem Tempo. Starkes agentisches Coding, analytisches Reasoning auf Spitzenniveau und stabiler Abo-Zugang machen es zum Standard-Flaggschiff für die meisten Produktionsteams.

Eingabe
$5 / 1M tokens
Ausgabe
$25 / 1M tokens
Kontext
1M tokens
Claude Opus 5 logo

Claude Opus 5

Anthropic

Empfohlen

Fast Fable-5-Intelligenz zum halben Preis. SOTA bei Frontier-Bench und CursorBench. 85 % weniger Cybersicherheits-Safeguards als Fable 5. Das Arbeitstier-Frontier-Modell für den Coding-Alltag.

Eingabe
$5.00 / 1M tokens
Ausgabe
$25.00 / 1M tokens
Kontext
200K tokens
Claude Sonnet 4.6 logo

Claude Sonnet 4.6

Anthropic

Bedingt

Als Standard-Arbeitspferd der Mittelklasse von Claude Sonnet 5 (erschienen am 30. Juni 2026) abgelöst. Dem Preis von $3/$15 und dem 1M-Token-Kontext von Sonnet 4.6 steht nun ein Nachfolger mit einem Sprung von 13,4 Punkten auf Terminal-Bench 2.1 bei gleicher Preisliste gegenüber. Wählen Sie 4.6 nur für festgepinnte Deployments oder wenn die ~30 % höhere Token-Zahl und die entfernten Parameter temperature/top_p/top_k von Sonnet 5 ein Ausschlusskriterium sind.

Eingabe
$3 / 1M tokens
Ausgabe
$15 / 1M tokens
Kontext
1M tokens
Claude Sonnet 5 logo

Claude Sonnet 5

Anthropic

Empfohlen

Anthropics agentischstes Sonnet liefert nahezu Opus-4.8-Leistung zu rund dem halben Preis, mit +13,4 Punkten auf Terminal-Bench 2.1 gegenüber Sonnet 4.6. Der neue Tokenizer bläht die Token-Zahlen um ~30 % auf; das Einführungsangebot ($2/$10 per MTok bis 31. August) hält die Migration kostenneutral, doch Teams sollten ihre Budgets vor dem Wechsel neu durchrechnen. Es löst Sonnet 4.6 als Standard in allen Claude-Plänen ab und ist ideal für agentisches Coding, Brownfield-Debugging und Produktions-Pipelines — nicht für die härtesten Frontier-Reasoning- oder Cybersecurity-Aufgaben.

Eingabe
$3 / 1M
Ausgabe
$15 / 1M
Kontext
1M tokens
D

DeepSeek V4 Flash

DeepSeek

Empfohlen

DeepSeek's volume-tier open-weight model at 284B parameters (13B active MoE) with a 1M-token context window. SWE-bench Verified 79.0% at $0.22 input and $0.66 output per 1M tokens off-peak, doubling during the seven daily peak hours. The August 2026 price rise ended its run as the cheapest credible API (GPT-5.6 Luna now undercuts it on input at $0.20), but it remains a strong value pick, and the MIT license means self-hosting sidesteps API pricing entirely. Still the default workhorse for high-throughput agent pipelines that can run off-peak.

Eingabe
$0.22 / 1M tokens
Ausgabe
$0.66 / 1M tokens
Kontext
1M tokens. Peak 2x: 01-04 + 06-10 UTC
D

DeepSeek V4 Pro

DeepSeek

Empfohlen

The strongest open-weight coding model we've tested: SWE-bench Verified 80.6%, LiveCodeBench 93.5% and 3206 Codeforces Elo. At $0.66 input and $1.98 output per 1M tokens off-peak it stays far below Western flagship pricing even after the August 2026 rise, though rates double during the seven daily peak hours. The default for self-hosted agentic coding.

Eingabe
$0.66 / 1M tokens
Ausgabe
$1.98 / 1M tokens
Kontext
1M tokens. Peak 2x: 01-04 + 06-10 UTC
F

FLUX 3

Black Forest Labs

Bedingt

Einheitliches multimodales Foundation-Modell für Bild-, Video-, Audio- und Aktionsvorhersage.

Eingabe
Not yet published
Ausgabe
Not yet published
Kontext
Gated early access
G

GLM-5.2

Z.ai

Bedingt

Das führende Open-Weight-Modell fürs Coding mit 1M-Token-Kontext und MIT-Lizenz — übertrifft GPT-5.5 in mehreren Benchmarks zu einem Bruchteil der Kosten, liegt aber bei den härtesten Langhorizont-Aufgaben weiterhin hinter Claude Opus 4.8.

Eingabe
$1.40 / 1M tokens
Ausgabe
$4.40 / 1M tokens
Kontext
1M tokens
G

GLM-5.3

Z.ai

Bedingt

GLM-5.3 ist Z.ais neuestes Open-Weight-Modell für Coding und Cyber-Abwehr — dieselbe Basis wie GLM-5.2, jeder Zugewinn aus dem Post-Training. Aber die Schlagzeilen-Zahlen stammen weiterhin vom Hersteller, die Open Weights werden wegen neu aufgetretener Sicherheitsfähigkeiten rund 2 Wochen zurückgehalten, und die Preise pro Token sind unveröffentlicht. Greifen Sie jetzt zu für defensive Sicherheit und agentische Automatisierung; warten Sie auf die Gewichte und unabhängige Audits, bevor Sie standardisieren.

Eingabe
N/A (rate not yet published)
Ausgabe
N/A (rate not yet published)
Kontext
1M context
GPT-4.1 logo

GPT-4.1

OpenAI

Empfohlen

Das Standard-Migrationsziel für GPT-4-Turbo-Workloads: gleiche Anfragestruktur, niedrigere Kosten, 1M-Token-Kontext – wandeln Sie veraltete function_call-Payloads in das Tools-Format um und machen Sie weiter.

Eingabe
$2 / 1M tokens
Ausgabe
$8 / 1M tokens
Kontext
1M tokens
GPT-4o (Retired from ChatGPT, API-only) logo

GPT-4o (Retired from ChatGPT, API-only)

OpenAI

Bedingt

GPT-4o (May 2024) has been superseded by the GPT-5.x family and delisted from OpenAI's flagship API pricing page. It remains available through the API but is no longer a current-generation model. Use only where migration to GPT-5.x is blocked; otherwise, GPT-5.5 or GPT-5.4 offer better performance at comparable cost.

Eingabe
$2.50 / 1M tokens
Ausgabe
$10 / 1M tokens
Kontext
128K tokens
GPT-5.5 logo

GPT-5.5

OpenAI

Empfohlen

OpenAIs kommerzielles Allzweck-Frontier-Modell und der einsatzbereite OpenAI-Anker, solange die GPT-5.6-Familie regierungsbeschränkt bleibt — $5/$30 per 1M tokens mit über 1M Kontext. Starkes Reasoning, breite Ökosystem-Unterstützung und volle öffentliche Verfügbarkeit machen es zu einem soliden Produktionsstandard, auch wenn günstigere Modelle es bei bestimmten Aufgaben inzwischen erreichen. Für die meisten Teams bleibt es die Basislinie, an der neuere Modelle gemessen werden.

Eingabe
$5 / 1M tokens
Ausgabe
$30 / 1M tokens
Kontext
1M+ tokens (922K in / 128K out)
GPT-5.5-Cyber logo

GPT-5.5-Cyber

OpenAI

Bedingt

85,6 % CyberGym — bestes Einzelmodell-Ergebnis — aber Zugang nur für geprüfte Verteidiger.

Eingabe
N/A
Ausgabe
N/A
Kontext
Trusted Access for Cyber; not commercial API
GPT-5.6 Luna logo

GPT-5.6 Luna

OpenAI

Bedingt

GPT-5.6 Luna is OpenAI's budget tier — near-GPT-5.5 capability at $1/$6 per 1M tokens, the strongest capability-per-dollar value in the GPT-5.6 family. Now generally available via API and Codex after the July 9 government-gate lift. Remains conditional: all benchmarks are vendor-reported, Luna lacks activation classifiers, and it is not in the standard ChatGPT picker.

Eingabe
$0.20 / 1M tokens
Ausgabe
$1.20 / 1M tokens
Kontext
Fastest tier. 80% cut Jul 30 → $0.20/$1.20.
GPT-5.6 Sol logo

GPT-5.6 Sol

OpenAI

Empfohlen

GPT-5.6 Sol ist das kosteneffizienteste Frontier-Modell — führend bei Coding-Benchmarks und konkurrenzfähig bei hartem Reasoning zu einem Bruchteil der Kosten vergleichbarer Modelle. Das Urteil wird durch die GPT-Red-Offenlegung zur Sicherheitshärtung gestärkt: Das Modell wurde adversarial gegen ein dediziertes Self-Play-RL-Red-Teaming-Modell im Frontier-Maßstab trainiert und ist dadurch 6x robuster gegen Prompt-Injections.

Eingabe
$5 / 1M tokens
Ausgabe
$30 / 1M tokens
Kontext
Same $5/$30. Fast mode: 2.5× at 2× cost.
GPT-5.6 Terra logo

GPT-5.6 Terra

OpenAI

Bedingt

GPT-5.6 Terra is OpenAI's mid-tier workhorse — GPT-5.5-class capability at half the cost ($2.50/$15 per 1M tokens). Now generally available via API and Codex after the July 9 government-gate lift. Remains conditional: all benchmarks are vendor-reported without independent reproduction, and Terra is not selectable in the standard ChatGPT model picker.

Eingabe
$2.00 / 1M tokens
Ausgabe
$12.00 / 1M tokens
Kontext
Mid-tier. 20% cut Jul 30 → $2.00/$12.00.
GPT-5.6-Cyber logo

GPT-5.6-Cyber

OpenAI

Bedingt

GPT-5.6-Cyber ist OpenAIs speziell trainiertes Cybersicherheitsmodell, aufbauend auf GPT-5.6 Sol und ausschließlich über das geschützte Daybreak-Red-Programm verfügbar. Es ist das erste Modell, das OpenAIs 'Hohe'-Cyber-Fähigkeitsschwelle erreicht, mit Exploit-Chain- und Zero-Day-Leistung, die universelle Modelle weit übertrifft.

Eingabe
$12.50 / 1M tokens
Ausgabe
$75 / 1M tokens
Kontext
400K tokens
GPT-Live-1 logo

GPT-Live-1

OpenAI

Bedingt

OpenAIs erstes vollduplexes Sprachmodell — es hört und spricht gleichzeitig, ein Sprung über den wechselbasierten Advanced Voice Mode hinaus.

Eingabe
ChatGPT subscription
Ausgabe
ChatGPT subscription
Kontext
ChatGPT Voice only
GPT-Live-1 mini logo

GPT-Live-1 mini

OpenAI

Bedingt

Die kostenlose Variante von GPT-Live-1 — dieselbe Vollduplex-Architektur in einem kleineren, schnelleren Paket, das als Standard-Sprachmodell für ChatGPT Free-Nutzer dient. Teilt die Kerninnovationen: kontinuierliche Interaktion, Wake-Word-Unterstützung und GPT-5.5-Delegation. Dieselben Einschränkungen: keine API, ungleichmäßige Sprachqualität. Eine wesentliche Verbesserung gegenüber dem alten turn-basierten Sprachmodus für kostenlose Nutzer.

Eingabe
Free (ChatGPT)
Ausgabe
Free (ChatGPT)
Kontext
ChatGPT Voice only
GPT-Live-Transcribe logo

GPT-Live-Transcribe

OpenAI

Empfohlen

OpenAIs Streaming-Sprache-zu-Text-Modell mit niedriger Latenz liefert Live-Transkript-Deltas zu 0,017 $/Min. mit einstellbarer Latenz und kontextbewusster Transkription. Es verbessert die Fehlerrate von gpt-realtime-whisper und unterstützt Echtzeit-Keyword-Hinweise, Sprachhinweise und Konfigurationsaktualisierungen während der Sitzung über WebSocket oder WebRTC. Der Kompromiss: etwa das 3,8-fache der Kosten von Batch-GPT-Transcribe und keine Diarisierung, Wort-Timestamps oder Konfidenzwerte. Am besten für Live-Untertitelung, Meeting-Assistenten und Sprachagenten, bei denen die Anzeige von Transkripten unter einer Sekunde wichtiger ist als die Kosten pro Minute.

Eingabe
$0.017 / minute
Ausgabe
N/A
Kontext
Per-minute realtime audio billing
GPT-Transcribe logo

GPT-Transcribe

OpenAI

Empfohlen

OpenAIs neuestes Batch-Speech-to-Text-Modell erreicht 3,31 % AA-WER bei 0,0045 $/Min. — 25 % günstiger und messbar genauer als sein gpt-4o-transcribe-Vorgänger. Es unterstützt Kontext-Prompting, Keyword-Hinweise und Spracherkennung in über 22 Sprachen und ist damit der beste Standard für asynchrone Dateitranskription auf der OpenAI-Plattform. Einschränkung: keine Diarisierung oder wortgenaue Zeitstempel; nutzen Sie gpt-4o-transcribe-diarize für Sprecherlabels oder gpt-live-transcribe für Echtzeitanforderungen. Am besten für Entwickler, die Meeting-Transkription, Medienverarbeitung und Sprachschnittstellen auf der OpenAI API aufbauen.

Eingabe
$0.0045 / minute
Ausgabe
N/A
Kontext
Per-minute audio billing
Gemini 2.5 Pro logo

Gemini 2.5 Pro

Google

Empfohlen

Jetzt die Budget-Empfehlung für lange Kontexte: Eine Preissenkung um 40 % (Juni 2026) macht vollständige Korpus-Durchläufe auch für mittlere Budgets erschwinglich — das größte verfügbare Kontextfenster mit starker Google-Ökosystem-Integration.

Eingabe
$1.25 / 1M tokens
Ausgabe
$10 / 1M tokens
Kontext
1M tokens
Gemini 3.1 Pro logo

Gemini 3.1 Pro

Google

Bedingt

Googles leistungsfähigstes öffentlich verfügbares Pro-Tier-Modell mit 1M-Token-Kontext zu wettbewerbsfähigen Preisen. Vorgänger-Generation: Gemini 3.6 und 3.5 Flash schlagen es jetzt bei Coding- und agentischen Benchmarks zu niedrigeren Kosten. Bleib dabei in Google Cloud/Vertex AI; ansonsten liefern die Flash-Reihe oder Wettbewerber mehr.

Eingabe
$2 / 1M
Ausgabe
$12 / 1M
Kontext
1M tokens
Gemini 3.5 Flash logo

Gemini 3.5 Flash

Google

Empfohlen

Googles Kosteneffizienz-Highlight für agentische Desktop-Automatisierung zu $1.50/$9 per 1M tokens mit ~1M Kontext. Natives Computer Use erreicht 78,4 auf OSWorld-Verified — nur 0,3 Punkte hinter GPT-5.5, zu rund einem Drittel der Kosten. DER relevante Vorbehalt: Das Computer-Use-Tool ist eine öffentliche Preview und noch nicht in der Produktions-API — Endpoint-Verfügbarkeit vor der Anbindung prüfen.

Eingabe
$1.50 / 1M tokens
Ausgabe
$9 / 1M tokens
Kontext
1M tokens
Gemini 3.5 Flash Cyber logo

Gemini 3.5 Flash Cyber

Google

Vorsicht

Gemini 3.5 Flash Cyber ist Googles erstes Cybersicherheits-spezialisiertes Modell, feinabgestimmt aus 3.5 Flash, um Schwachstellen zu finden, zu validieren und zu patchen. Innerhalb der Multi-Agenten-Architektur von CodeMender erreicht es konkurrenzfähige CyberGym-Leistung gegenüber deutlich größeren Modellen wie Mythos — zu einem Bruchteil der Kosten. Doch die Einschränkungen sind gravierend: Es läuft ausschließlich innerhalb von CodeMender, ist nur für Regierungen und vertrauenswürdige Partner über ein limitiertes Pilotprogramm verfügbar, ohne öffentliche API, ohne veröffentlichte Benchmark-Zahlen und ohne Zeitplan für eine breitere Freigabe.

Eingabe
N/A
Ausgabe
N/A
Kontext
CodeMender-only, government-gated pilot
Gemini 3.5 Flash-Lite logo

Gemini 3.5 Flash-Lite

Google

Empfohlen

Gemini 3.5 Flash-Lite ist Googles schnellstes und günstigstes Modell der 3.5-Serie mit 350 Tok/s und $0,30/$2,50. Der Generationssprung von 3.1 Flash-Lite ist die eigentliche Geschichte — es übertrifft seinen Vorgänger dramatisch bei wichtigen agentischen Benchmarks und schlägt das vollwertige Gemini 3 Flash bei Coding- und Computer-Use-Aufgaben. Für Entwickler, die hochdurchsatzstarke agentische Subagents, Such-Pipelines und Dokumentenverarbeitung skalieren, ist Flash-Lites Preis-Leistungs-Verhältnis in Googles Produktpalette unerreicht.

Eingabe
$0.30 / 1M
Ausgabe
$2.50 / 1M
Kontext
1M context, 64K output, 350 tok/s
Gemini 3.5 Pro logo

Gemini 3.5 Pro

Google

pending

Googles Frontier-Modell vor der allgemeinen Verfügbarkeit — inzwischen bei der vierten Verschiebung und laut Bloomberg „Monate hinter dem Zeitplan“. Der 2M-Token-Kontext, die native multimodale Pipeline und das Deep-Think-Reasoning bleiben reale Fähigkeiten, doch ein bestätigter GA-Zeitplan existiert nicht. Die Coding-Fähigkeit ist das zentrale Defizit.

Eingabe
Not yet published
Ausgabe
Not yet published
Kontext
Est. $5-15/$30-60 per 1M. 2M ctx. Not GA.
Gemini 3.6 Flash logo

Gemini 3.6 Flash

Google

Empfohlen

Gemini 3.6 Flash ist Googles neues Standard-Arbeitspferd der Flash-Klasse — es ist sowohl besser als auch günstiger als 3.5 Flash, erzielt höhere Werte in jedem Benchmark und senkt gleichzeitig den Output-Preis von 9,00 $ auf 7,50 $ pro Million Tokens. Der 17%ige Token-Effizienzgewinn bedeutet niedrigere Kosten pro Aufgabe noch vor der Preissenkung, und das eingebaute Computer Use über die API macht es zu einer glaubwürdigen agentischen Coding-Option. Für Entwickler im Google-Ökosystem ist dies das klare Upgrade — es gibt keinen Grund, bei 3.5 Flash zu bleiben.

Eingabe
$1.50 / 1M
Ausgabe
$7.50 / 1M
Kontext
1M context, 64K output
Gemini 3.7 Flash logo

Gemini 3.7 Flash

Google

Empfohlen

Gemini 3.7 Flash ist Googles bislang stärkstes Flash-Arbeitspferd für Coding und Agents — ein echter Schritt nach vorn gegenüber 3.6 Flash, bis 2026 zum halben vorherigen Preis. Bei den härtesten Terminal- und Computer-Use-Aufgaben liegt es weiterhin hinter der Frontier. Ein klares Upgrade für kostenbewusste Agent-Builder und solche im Google-Ökosystem; kein Frontier-Code-Ersatz.

Eingabe
$0.75 / 1M
Ausgabe
$3.75 / 1M
Kontext
1M context, 64K output
Gemini 3.8 Flash logo

Gemini 3.8 Flash

Google

Empfohlen

Gemini 3.8 Flash is Google's strongest Flash workhorse yet — a genuine capability upgrade over the recommended 3.7 Flash at the same introductory price, with real gains across software engineering, agents and professional domains. The deciding caveat is Google's own: 3.8 "works harder," so per-task token burn runs well above 3.7, which remains the efficiency-first pick. Adopt 3.8 for long-horizon coding, agents and finance or legal work — benchmark your own workload before the intro price expires.

Eingabe
$0.75 / 1M
Ausgabe
$3.75 / 1M
Kontext
1M context, 64K output
Gemini 4 logo

Gemini 4

Google

pending

Google DeepMinds bestätigtes Next-Gen-Modell. Pre-Training begann am 21. Juli 2026. Keine Benchmarks, keine Preise, keine Specs, kein GA-Termin.

Eingabe
Not yet published
Ausgabe
Not yet published
Kontext
Pre-training started Jul 2026. No GA date.
G

Grok 4.5

SpaceXAI

Bedingt

Wettbewerbsfähig bepreistes Coding-/Agentic-Modell zu 2 $/6 $ pro 1M Token mit 500K Kontext — xAIs veröffentlichte Benchmarks platzieren es im Mittelfeld hinter Fable 5 und GPT-5.5, obwohl es Opus 4.8 bei DeepSWE und Terminal-Bench 2.1 anführt. Die eigentliche Geschichte ist die Kosteneffizienz: 4,2-fach token-effizienter als Opus 4.8 auf SWE-Bench Pro. Am besten für Teams, die starkes Coding zu einem Bruchteil der Frontier-Preise benötigen. Noch nicht in der EU verfügbar.

Eingabe
$2 / 1M tokens
Ausgabe
$6 / 1M tokens
Kontext
500K tokens
G

Grok 4.6

SpaceXAI

Bedingt

Wettbewerbsfähig an der Frontier zu $2/$6 mit einem AA Intelligence Index von 61 (gleichauf mit GPT-5.6 Sol) und einem GDPVal-AA, das nur hinter Claude Opus 5 liegt — ein starker Start, aber erst durch einen einzigen unabhängigen Evaluator belegt und einen Tag alt; Produktiveinsatz daher zurückhalten, bis breitere Benchmarks vorliegen.

Eingabe
$2.00 / 1M tokens
Ausgabe
$6.00 / 1M tokens
Kontext
Delayed past Aug 7. Now ~Aug 10-14. 500K ctx.
G

Grok Voice Think Fast 2.0

SpaceXAI

Bedingt

SpaceXAIs Sprach-zu-Sprache-Modell der nächsten Generation mit einer parallelen Reasoning-Architektur, die es deutlich intelligenter macht als herkömmliche Sprachmodelle.

Eingabe
$0.08 / min of audio (speech-to-speech)
Ausgabe
Included in speech-to-speech rate
Kontext
API-only
H

Hy3

Tencent

Bedingt

Apache-2.0-Open-Weight-MoE-agentisches Modell (295B gesamt, 21B aktiv) mit starker Tool-Calling-Zuverlaessigkeit und Anti-Halluzinations-Verhalten, aber Coding bleibt hinter GLM-5.2 zurueck und Self-Hosting erfordert 8+ GPUs. Kostenlose OpenRouter-Stufe bis 21. Juli — danach $0,20/$0,80 pro 1M Tokens. Am besten fuer selbst gehostete Coding-Agenten und Langkontext-Dokumentarbeit, bei der freizuegige Lizenzierung mehr zaehlt als absolute Benchmark-Ergebnisse.

Eingabe
$0.20 / 1M
Ausgabe
$0.80 / 1M
Kontext
256K tokens
I

Inkling

Thinking Machines Lab

Bedingt

Inkling ist der stärkste Grund bisher, Open-Weight-multimodale KI ernst zu nehmen. Es liefert wettbewerbsfähiges Reasoning und Coding mit erstklassiger Open-Weight-Sicherheit und kontrollierbarem Denkaufwand, alles unter Apache 2.0. Aber Thinking Machines ist ehrlich, dass es nicht das insgesamt stärkste ist — die Faktentreue hinkt hinterher (SimpleQA 43,9 %) und Self-Hosting erfordert ernsthafte Hardware (2 TB VRAM). Eingeschränkt: eine überzeugende Basis für Organisationen, die ein multimodales Modell besitzen und feintunen müssen, nicht für Teams, die Spitzenleistung von der Stange wollen.

Eingabe
$1.87 / 1M tokens
Ausgabe
$4.68 / 1M tokens
Kontext
Up to 1M tokens native
K

Kimi K3

Moonshot AI

Bedingt

Leistungsstarkes 2,8B-Parameter-MoE-Modell mit Arena WebDev #1 und Top-Terminal-Bench-Scores, aber nun unter aktiver Untersuchung durch das Weiße Haus wegen Diebstahls geistigen Eigentums im industriellen Maßstab, wobei das US-Finanzministerium mit Sanktionen droht.

Eingabe
$3.00 / 1M
Ausgabe
$15.00 / 1M
Kontext
1M ctx, $0.30 cached. Weights live (Jul 27).
L

Laguna S 2.1

poolside

Bedingt

Laguna S 2.1 ist das erste glaubwürdige westliche Open-Weight-Coding-Modell seit 11 Monaten — ein 118B MoE, das nur 8B Parameter pro Token aktiviert und dennoch 70,2 % auf Terminal-Bench 2.1 erreicht und damit Modelle mit 10-facher Größe schlägt. Aber es ist nicht an der Frontier — GPT-5.6 Sol und Kimi K3 liegen weit vorne — und bekannte Einschränkungen umfassen Harness-Overfitting und JSON-Verstümmelung. Am besten für selbstgehostetes agentenbasiertes Coding, wo Datensouveränität wichtiger ist als absolute Benchmark-Spitzenwerte.

Eingabe
$0.10 / 1M
Ausgabe
$0.20 / 1M
Kontext
OpenMDW-1.1 license, 1M context
Llama 4 Maverick logo

Llama 4 Maverick

Meta

Bedingt

Das fuehrende Open-Source-Modell fuer Teams, die selbst hosten wollen, Datenhoheit benoetigen oder API-Anbieterbindung vermeiden moechten.

Eingabe
Free (self-hosted) or $0.20 / 1M tokens (hosted)
Ausgabe
Free (self-hosted) or $0.60 / 1M tokens (hosted)
Kontext
10M tokens
MAI-Code-1-Flash logo

MAI-Code-1-Flash

Microsoft

Bedingt

Microsofts erstes hauseigenes Coding-Modell — ein kleines, schnelles, aggressiv kostenoptimiertes Sparse-MoE für $0.75/$4.50 per 1M tokens. Liefert einen Vorsprung von 16 Punkten gegenüber Claude Haiku 4.5 auf SWE-Bench Pro und verbraucht dabei bis zu 60 % weniger Tokens. Es ist gezielt für Copilot-Workflows mit hohem Volumen gebaut — Autovervollständigungen, Refactorings, Gerüstcode — kein Frontier-Modell. Am besten innerhalb des Copilot-Ökosystems; der API-Zugang außerhalb wird noch ausgerollt.

Eingabe
$0.75 / 1M tokens
Ausgabe
$4.50 / 1M tokens
Kontext
256K context
MAI-Code-1.1-Flash logo

MAI-Code-1.1-Flash

Microsoft

Bedingt

MAI-Code-1.1-Flash ist Microsofts aufgefrischtes Small-Tier-Coding-Modell für Copilot — ein Viertel der Kosten und 22 % besser bei Terminal-Bench 2.1 als sein Juni-Vorgänger, jetzt mit nativer Vision. Es ist für iterative Arbeit mit hohem Volumen gebaut statt für Frontier-Reasoning, was es zum günstigsten ernstzunehmenden Coding-Modell in Copilot macht. Greifen Sie danach für alltägliche Completions, Refactorings und bildgestütztes Debugging; verwenden Sie ein Flaggschiff für komplexe Architektur.

Eingabe
$0.20 / 1M
Ausgabe
$1.20 / 1M
Kontext
256K context
MAI-Cyber-1-Flash logo

MAI-Cyber-1-Flash

Microsoft

Bedingt

Microsofts erstes hauseigenes Cybersicherheitsmodell, aufgebaut auf der MAI-Thinking-1-Familie und eingebettet in das MDASH-Multi-Agenten-Harness. MAI-Cyber-1-Flash bewältigt ~90 % der Sicherheits-Workloads zu etwa der Hälfte der Kosten früherer Konfigurationen und reserviert GPT-5.4 für die härtesten 10 %. Es erreicht 95,95 % auf CyberGym — 12 Punkte über Mythos 5 — aber dies ist ein anbieterberichteter Benchmark aus einer optimierten Gesamtsystem-Konfiguration (Harness + zwei Modelle), kein unabhängiger Modell-gegen-Modell-Test. Nur über Azure AI Foundry mit geprüftem Enterprise-Zugang verfügbar; keine eigenständigen Preise oder öffentliche API.

Eingabe
N/A (MDASH SCU consumption)
Ausgabe
N/A (MDASH SCU consumption)
Kontext
Azure AI Foundry vetted access
Muse Glimmer logo

Muse Glimmer

Meta

Bedingt

Muse Glimmer ist Metas 30B Open-Weight-Agentenmodell, destilliert aus dem geschlossenen Muse-Spark-Frontier-Modell und unter Apache 2.0 veröffentlicht. Mit 4-Bit-Quantisierung führt es mehrschrittiges Tool Calling, multimodales Reasoning und Fehlerbehebung auf einer einzelnen 24-GB-Consumer-GPU ohne Cloud-Abhängigkeiten aus.

Eingabe
Free (open weights)
Ausgabe
Free (open weights)
Kontext
131K tokens
Muse Spark 1.1 logo

Muse Spark 1.1

Meta

Bedingt

Metas erstes kostenpflichtiges KI-Modell und erster Vorstoß in den kommerziellen Coding-Markt — 1,25 $/4,25 $ pro 1M Token mit 1M Kontext, nativer Subagenten-Orchestrierung, MCP/Tool-Unterstützung und Computer-Use-Fähigkeit zu etwa 4× unter Anthropic/OpenAI-Preisen. Führt bei Tool-Use-Benchmarks, liegt aber bei reinem Coding 7 Punkte hinter Opus 4.8 auf SWE-Bench Pro. Closed-Weight, US-only öffentliche Vorschau. Am besten für Teams, die Tool-Use-Orchestrierung zu niedrigen Kosten priorisieren.

Eingabe
$1.25 / 1M tokens
Ausgabe
$4.25 / 1M tokens
Kontext
1M tokens
Muse Spark 1.2 logo

Muse Spark 1.2

Meta

Bedingt

Metas Coding-fokussiertes Modell-Update, co-trainiert mit dem Muse Code Harness — 82,9 % bei Terminal-Bench 2.1 und 59,3 % bei DeepSWE 1.1, nur von Claude Opus 5 bei Ersterem übertroffen. Standardpreise unverändert bei $1,25 Eingabe / $4,25 Ausgabe pro 1M Token.

Eingabe
$1.25 / 1M tokens
Ausgabe
$4.25 / 1M tokens
Kontext
1M tokens
Mythos 5 (Claude Mythos 5) logo

Mythos 5 (Claude Mythos 5)

Anthropic

Bedingt

Das stärkste Cybersecurity-Modell der Welt (83,8 % CyberGym) — aufgebaut auf den Gewichten von Fable 5, mit aufgehobenen Sicherheitsklassifikatoren. Der Zugang wurde nach der Exportdirektive vom 12. Juni ausgesetzt und am 26. Juni teilweise für ~100 designierte US-Organisationen kritischer Infrastruktur wiederhergestellt (Project Glasswing). Das Urteil bleibt CONDITIONAL: Die Fähigkeiten sind Elite, aber der Zugang ist an eine bundesbehördliche Designation gebunden. Keine öffentliche API — nutzbar nur, wenn Ihre Organisation auf der Liste des Handelsministeriums steht.

Eingabe
$10 / 1M tokens
Ausgabe
$50 / 1M tokens
Kontext
1M tokens (restricted access)
O

Ornith-1.0

DeepReinforce

Bedingt

Eine starke MIT-lizenzierte Open-Source-Modellfamilie für agentisches Coding, die Spitzen-Benchmarks erreicht — schlägt Claude Opus 4.7 sowohl auf Terminal-Bench 2.1 als auch SWE-Bench Verified — erfordert aber Self-Hosting mit erheblicher GPU-Infrastruktur und stammt von einem neuen Labor mit begrenzter Erfolgsbilanz.

Eingabe
Free (MIT license)
Ausgabe
Free (MIT license)
Kontext
256K tokens
P

Palmyra X6

Writer

Bedingt

Palmyra X6 ist Writers agentisches Flaggschiff-Modell für Marketing- und Revenue-Workflows; post-trainiert auf dem Open-Weights-Modell GLM-5.2 von Z.ai zu $2/$8 pro 1M Token, ein Bruchteil der Frontier-Preise. Jede hervorgehobene Kennzahl stammt aus Writer-eigenen Messungen, und die GLM-5.2-Herkunft ist eine echte Beschaffungsfrage. Nutzen Sie es innerhalb von Writer für kostensensible GTM-Agent-Arbeit; für unabhängig gebenchmarkte allgemeine Leistungsfähigkeit schauen Sie sich anderweitig um.

Eingabe
$2 / 1M
Ausgabe
$8 / 1M
Kontext
1M context, 8K max output
Q

Qwen3.8-27B

Alibaba

Bedingt

Qwen3.8-27B ist Alibabas Open-Weight-Modell mit 27 Milliarden Parametern, jetzt unter Apache 2.0 mit 262K nativem Kontext und Single-GPU-Deployment verfügbar. Es ist der selbst-hosting-fähige Begleiter des 2,4T-Flaggschiffs Qwen3.8-Max. Die Benchmarks bleiben Alibaba-eigene Zahlen, daher das Urteil 'conditional': ein echtes, lauffähiges Modell, dessen vom Anbieter behauptete Coding-Gewinne noch unabhängig reproduziert werden müssen.

Eingabe
Free (open weights — self-hosted)
Ausgabe
Free (open weights — self-hosted)
Kontext
TBD — context window not published
Q

Qwen3.8-Max

Alibaba

pending

Multimodales 2,4B-Parameter-MoE-Flaggschiff. Noch nicht GA – keine Pro-Token-API-Preise, keine Benchmark-Tabelle, keine Open Weights veröffentlicht. $6/Monat-Einstieg über Token Plan Lite.

Eingabe
$2.00 / 1M tokens
Ausgabe
$6.00 / 1M tokens
Kontext
984K tokens. Open weights promised week of Aug 10.
S

Sakana Fugu

Sakana AI

Bedingt

Multi-Agent-Orchestrator, der Frontier-Modell-Niveau in zentralen Benchmarks durch Routing über einen Pool von Expertenagenten erreicht — aber intransparentes Routing und Plattformabhängigkeit schränken die Nachvollziehbarkeit ein.

Eingabe
$5 / 1M tokens
Ausgabe
$30 / 1M tokens
Kontext
272K tokens (>272K: $10/$45 per 1M)