KI-Modelle
46Finde das richtige Modell für deine Aufgabe. Nach Stärke filtern, Preise vergleichen, entscheiden.
Nach Anbieter filtern
Astra
OpenAI
Astra is OpenAI's first model to trigger the 'Critical' cybersecurity threshold under its Preparedness Framework — internal evaluations found it may autonomously exploit zero-day vulnerabilities and solved 10 open math problems for ~$2,000. But Astra is not a shipping product: development is actively paused as of August 2026 for security hardening, with no release timeline or pricing. Watch for the safety-governance outcome — this is the first time a major lab has publicly classified its own model as critically dangerous.
- Eingabe
- Not yet published
- Ausgabe
- Not yet published
- Kontext
- Development slowed Aug 2026. No GA date.
Claude Fable 5
Anthropic
Anthropics Frontier-Modell der Mythos-Klasse — das bislang stärkste öffentlich verfügbare Claude-Modell, das zum Start jeden wichtigen Benchmark anführt. Das Urteil bleibt CONDITIONAL wegen zweier aktueller Einschränkungen: reiner Credit-Preisgestaltung von $10/$50 per 1M tokens ohne Abo-Option und einem Sicherheitsklassifikator, der bei routinemäßigen Coding-Aufgaben zu oft anschlägt und sie stillschweigend auf einen Opus-4.8-Fallback umleitet. Greifen Sie zu Fable 5, wenn der Fähigkeitsvorsprung die Kosten rechtfertigt; für Routinearbeit ist Sonnet 5 die berechenbarere Alternative.
- Eingabe
- $10 / 1M tokens
- Ausgabe
- $50 / 1M tokens
- Kontext
- 1M context, 128K max output
Claude Haiku 4.5
Anthropic
Anthropics Preis-Leistungs-Basis für $1/$5 per 1M tokens — die schnelle, günstige Stufe, an der sich die Konkurrenz misst, mit 200K Kontext und 64K Output. Am besten für latenzkritische Arbeit mit hohem Volumen: Klassifikation, Extraktion, Zusammenfassung, Routing. Greifen Sie zu Opus 4.8 oder Sonnet 5, wenn tiefes mehrstufiges Reasoning gefragt ist.
- Eingabe
- $1 / 1M tokens
- Ausgabe
- $5 / 1M tokens
- Kontext
- 200K tokens
Claude Opus 4.8
Anthropic
Anthropics Flaggschiff-Reasoning-Modell und der praktische Frontier-Platzhirsch für einsatzbereite Leistungsfähigkeit — 1M Token Kontext für $5/$25 per 1M tokens, in allen Abo-Plänen enthalten. Unsere Empfehlung für review-lastige Arbeit: Code-Review, Refactoring unter strikten Vorgaben und Aufgaben mit bedachtem Tempo. Starkes agentisches Coding, analytisches Reasoning auf Spitzenniveau und stabiler Abo-Zugang machen es zum Standard-Flaggschiff für die meisten Produktionsteams.
- Eingabe
- $5 / 1M tokens
- Ausgabe
- $25 / 1M tokens
- Kontext
- 1M tokens
Claude Opus 5
Anthropic
Fast Fable-5-Intelligenz zum halben Preis ($5/$25 pro 1M). SOTA bei Frontier-Bench und CursorBench.
- Eingabe
- $5.00 / 1M tokens
- Ausgabe
- $25.00 / 1M tokens
- Kontext
- 200K tokens
Claude Sonnet 4.6
Anthropic
Als Standard-Arbeitspferd der Mittelklasse von Claude Sonnet 5 (erschienen am 30. Juni 2026) abgelöst. Dem Preis von $3/$15 und dem 1M-Token-Kontext von Sonnet 4.6 steht nun ein Nachfolger mit einem Sprung von 13,4 Punkten auf Terminal-Bench 2.1 bei gleicher Preisliste gegenüber. Wählen Sie 4.6 nur für festgepinnte Deployments oder wenn die ~30 % höhere Token-Zahl und die entfernten Parameter temperature/top_p/top_k von Sonnet 5 ein Ausschlusskriterium sind.
- Eingabe
- $3 / 1M tokens
- Ausgabe
- $15 / 1M tokens
- Kontext
- 1M tokens
Claude Sonnet 5
Anthropic
Anthropics agentischstes Sonnet liefert nahezu Opus-4.8-Leistung zu rund dem halben Preis, mit +13,4 Punkten auf Terminal-Bench 2.1 gegenüber Sonnet 4.6. Der neue Tokenizer bläht die Token-Zahlen um ~30 % auf; das Einführungsangebot ($2/$10 per MTok bis 31. August) hält die Migration kostenneutral, doch Teams sollten ihre Budgets vor dem Wechsel neu durchrechnen. Es löst Sonnet 4.6 als Standard in allen Claude-Plänen ab und ist ideal für agentisches Coding, Brownfield-Debugging und Produktions-Pipelines — nicht für die härtesten Frontier-Reasoning- oder Cybersecurity-Aufgaben.
- Eingabe
- $3 / 1M
- Ausgabe
- $15 / 1M
- Kontext
- 1M tokens
DeepSeek V4 Flash
DeepSeek
Volumen-Modell mit 284B Parametern (13B aktive MoE). SWE-bench 79,0 % bei $0,14/$0,28 pro 1M Tokens.
- Eingabe
- $0.14 / 1M tokens
- Ausgabe
- $0.28 / 1M tokens
- Kontext
- 1M tokens
DeepSeek V4 Pro
DeepSeek
Das stärkste Open-Weight-Modell zum Programmieren, das wir getestet haben. 99,2 % bei SWE-bench Verified.
- Eingabe
- $0.435 / 1M tokens
- Ausgabe
- $0.87 / 1M tokens
- Kontext
- 1M tokens
FLUX 3
Black Forest Labs
Einheitliches multimodales Foundation-Modell für Bild-, Video-, Audio- und Aktionsvorhersage.
- Eingabe
- Not yet published
- Ausgabe
- Not yet published
- Kontext
- Gated early access
GLM-5.2
Z.ai
Das führende Open-Weight-Modell fürs Coding mit 1M-Token-Kontext und MIT-Lizenz — übertrifft GPT-5.5 in mehreren Benchmarks zu einem Bruchteil der Kosten, liegt aber bei den härtesten Langhorizont-Aufgaben weiterhin hinter Claude Opus 4.8.
- Eingabe
- $1.40 / 1M tokens
- Ausgabe
- $4.40 / 1M tokens
- Kontext
- 1M tokens
GPT-4.1
OpenAI
Das Standard-Migrationsziel für GPT-4-Turbo-Workloads: gleiche Anfragestruktur, niedrigere Kosten, 1M-Token-Kontext – wandeln Sie veraltete function_call-Payloads in das Tools-Format um und machen Sie weiter.
- Eingabe
- $2 / 1M tokens
- Ausgabe
- $8 / 1M tokens
- Kontext
- 1M tokens
GPT-4o (Retired from ChatGPT, API-only)
OpenAI
GPT-4o (May 2024) has been superseded by the GPT-5.x family and delisted from OpenAI's flagship API pricing page. It remains available through the API but is no longer a current-generation model. Use only where migration to GPT-5.x is blocked; otherwise, GPT-5.5 or GPT-5.4 offer better performance at comparable cost.
- Eingabe
- $2.50 / 1M tokens
- Ausgabe
- $10 / 1M tokens
- Kontext
- 128K tokens
GPT-5.5
OpenAI
OpenAIs kommerzielles Allzweck-Frontier-Modell und der einsatzbereite OpenAI-Anker, solange die GPT-5.6-Familie regierungsbeschränkt bleibt — $5/$30 per 1M tokens mit über 1M Kontext. Starkes Reasoning, breite Ökosystem-Unterstützung und volle öffentliche Verfügbarkeit machen es zu einem soliden Produktionsstandard, auch wenn günstigere Modelle es bei bestimmten Aufgaben inzwischen erreichen. Für die meisten Teams bleibt es die Basislinie, an der neuere Modelle gemessen werden.
- Eingabe
- $5 / 1M tokens
- Ausgabe
- $30 / 1M tokens
- Kontext
- 1M+ tokens (922K in / 128K out)
GPT-5.5-Cyber
OpenAI
85,6 % CyberGym — bestes Einzelmodell-Ergebnis — aber Zugang nur für geprüfte Verteidiger.
- Eingabe
- N/A
- Ausgabe
- N/A
- Kontext
- Trusted Access for Cyber; not commercial API
GPT-5.6 Luna
OpenAI
GPT-5.6 Luna is OpenAI's budget tier — near-GPT-5.5 capability at $1/$6 per 1M tokens, the strongest capability-per-dollar value in the GPT-5.6 family. Now generally available via API and Codex after the July 9 government-gate lift. Remains conditional: all benchmarks are vendor-reported, Luna lacks activation classifiers, and it is not in the standard ChatGPT picker.
- Eingabe
- $0.20 / 1M tokens
- Ausgabe
- $1.20 / 1M tokens
- Kontext
- Fastest tier. 80% cut Jul 30 → $0.20/$1.20.
GPT-5.6 Sol
OpenAI
GPT-5.6 Sol ist das kosteneffizienteste Frontier-Modell — führend bei Coding-Benchmarks und konkurrenzfähig bei hartem Reasoning zu einem Bruchteil der Kosten vergleichbarer Modelle. Das Urteil wird durch die GPT-Red-Offenlegung zur Sicherheitshärtung gestärkt: Das Modell wurde adversarial gegen ein dediziertes Self-Play-RL-Red-Teaming-Modell im Frontier-Maßstab trainiert und ist dadurch 6x robuster gegen Prompt-Injections.
- Eingabe
- $5 / 1M tokens
- Ausgabe
- $30 / 1M tokens
- Kontext
- Same $5/$30. Fast mode: 2.5× at 2× cost.
GPT-5.6 Terra
OpenAI
GPT-5.6 Terra is OpenAI's mid-tier workhorse — GPT-5.5-class capability at half the cost ($2.50/$15 per 1M tokens). Now generally available via API and Codex after the July 9 government-gate lift. Remains conditional: all benchmarks are vendor-reported without independent reproduction, and Terra is not selectable in the standard ChatGPT model picker.
- Eingabe
- $2.00 / 1M tokens
- Ausgabe
- $12.00 / 1M tokens
- Kontext
- Mid-tier. 20% cut Jul 30 → $2.00/$12.00.
GPT-Live-1
OpenAI
OpenAIs erstes vollduplexes Sprachmodell — es hört und spricht gleichzeitig, ein Sprung über den wechselbasierten Advanced Voice Mode hinaus.
- Eingabe
- ChatGPT subscription
- Ausgabe
- ChatGPT subscription
- Kontext
- ChatGPT Voice only
GPT-Live-1 mini
OpenAI
Die kostenlose Variante von GPT-Live-1 — dieselbe Vollduplex-Architektur in einem kleineren, schnelleren Paket, das als Standard-Sprachmodell für ChatGPT Free-Nutzer dient. Teilt die Kerninnovationen: kontinuierliche Interaktion, Wake-Word-Unterstützung und GPT-5.5-Delegation. Dieselben Einschränkungen: keine API, ungleichmäßige Sprachqualität. Eine wesentliche Verbesserung gegenüber dem alten turn-basierten Sprachmodus für kostenlose Nutzer.
- Eingabe
- Free (ChatGPT)
- Ausgabe
- Free (ChatGPT)
- Kontext
- ChatGPT Voice only
GPT-Live-Transcribe
OpenAI
OpenAIs Streaming-Sprache-zu-Text-Modell mit niedriger Latenz liefert Live-Transkript-Deltas zu 0,017 $/Min. mit einstellbarer Latenz und kontextbewusster Transkription. Es verbessert die Fehlerrate von gpt-realtime-whisper und unterstützt Echtzeit-Keyword-Hinweise, Sprachhinweise und Konfigurationsaktualisierungen während der Sitzung über WebSocket oder WebRTC. Der Kompromiss: etwa das 3,8-fache der Kosten von Batch-GPT-Transcribe und keine Diarisierung, Wort-Timestamps oder Konfidenzwerte. Am besten für Live-Untertitelung, Meeting-Assistenten und Sprachagenten, bei denen die Anzeige von Transkripten unter einer Sekunde wichtiger ist als die Kosten pro Minute.
- Eingabe
- $0.017 / minute
- Ausgabe
- N/A
- Kontext
- Per-minute realtime audio billing
GPT-Transcribe
OpenAI
Batch-Speech-to-Text: 3,31 % AA-WER zu $0,0045/Min. 25 % günstiger als der Vorgänger.
- Eingabe
- $0.0045 / minute
- Ausgabe
- N/A
- Kontext
- Per-minute audio billing
Gemini 2.5 Pro
Jetzt die Budget-Empfehlung für lange Kontexte: Eine Preissenkung um 40 % (Juni 2026) macht vollständige Korpus-Durchläufe auch für mittlere Budgets erschwinglich — das größte verfügbare Kontextfenster mit starker Google-Ökosystem-Integration.
- Eingabe
- $1.25 / 1M tokens
- Ausgabe
- $10 / 1M tokens
- Kontext
- 1M tokens
Gemini 3.1 Pro
Googles leistungsfähigstes öffentlich verfügbares Pro-Tier-Modell mit 1M-Token-Kontext zu wettbewerbsfähigen Preisen. Vorgänger-Generation: Gemini 3.6 und 3.5 Flash schlagen es jetzt bei Coding- und agentischen Benchmarks zu niedrigeren Kosten. Bleib dabei in Google Cloud/Vertex AI; ansonsten liefern die Flash-Reihe oder Wettbewerber mehr.
- Eingabe
- $2 / 1M
- Ausgabe
- $12 / 1M
- Kontext
- 1M tokens
Gemini 3.5 Flash
Googles Kosteneffizienz-Highlight für agentische Desktop-Automatisierung zu $1.50/$9 per 1M tokens mit ~1M Kontext. Natives Computer Use erreicht 78,4 auf OSWorld-Verified — nur 0,3 Punkte hinter GPT-5.5, zu rund einem Drittel der Kosten. DER relevante Vorbehalt: Das Computer-Use-Tool ist eine öffentliche Preview und noch nicht in der Produktions-API — Endpoint-Verfügbarkeit vor der Anbindung prüfen.
- Eingabe
- $1.50 / 1M tokens
- Ausgabe
- $9 / 1M tokens
- Kontext
- 1M tokens
Gemini 3.5 Flash Cyber
Gemini 3.5 Flash Cyber ist Googles erstes Cybersicherheits-spezialisiertes Modell, feinabgestimmt aus 3.5 Flash, um Schwachstellen zu finden, zu validieren und zu patchen. Innerhalb der Multi-Agenten-Architektur von CodeMender erreicht es konkurrenzfähige CyberGym-Leistung gegenüber deutlich größeren Modellen wie Mythos — zu einem Bruchteil der Kosten. Doch die Einschränkungen sind gravierend: Es läuft ausschließlich innerhalb von CodeMender, ist nur für Regierungen und vertrauenswürdige Partner über ein limitiertes Pilotprogramm verfügbar, ohne öffentliche API, ohne veröffentlichte Benchmark-Zahlen und ohne Zeitplan für eine breitere Freigabe.
- Eingabe
- N/A
- Ausgabe
- N/A
- Kontext
- CodeMender-only, government-gated pilot
Gemini 3.5 Flash-Lite
Gemini 3.5 Flash-Lite ist Googles schnellstes und günstigstes Modell der 3.5-Serie mit 350 Tok/s und $0,30/$2,50. Der Generationssprung von 3.1 Flash-Lite ist die eigentliche Geschichte — es übertrifft seinen Vorgänger dramatisch bei wichtigen agentischen Benchmarks und schlägt das vollwertige Gemini 3 Flash bei Coding- und Computer-Use-Aufgaben. Für Entwickler, die hochdurchsatzstarke agentische Subagents, Such-Pipelines und Dokumentenverarbeitung skalieren, ist Flash-Lites Preis-Leistungs-Verhältnis in Googles Produktpalette unerreicht.
- Eingabe
- $0.30 / 1M
- Ausgabe
- $2.50 / 1M
- Kontext
- 1M context, 64K output, 350 tok/s
Gemini 3.5 Pro
Googles Frontier-Modell vor der allgemeinen Verfügbarkeit — inzwischen bei der vierten Verschiebung und laut Bloomberg „Monate hinter dem Zeitplan“. Der 2M-Token-Kontext, die native multimodale Pipeline und das Deep-Think-Reasoning bleiben reale Fähigkeiten, doch ein bestätigter GA-Zeitplan existiert nicht. Die Coding-Fähigkeit ist das zentrale Defizit.
- Eingabe
- Not yet published
- Ausgabe
- Not yet published
- Kontext
- Est. $5-15/$30-60 per 1M. 2M ctx. Not GA.
Gemini 3.6 Flash
Besser und günstiger als 3.5 Flash bei jedem Benchmark. Output-Preis von $9,00 auf $7,50 pro 1M Tokens gesenkt.
- Eingabe
- $1.50 / 1M
- Ausgabe
- $7.50 / 1M
- Kontext
- 1M context, 64K output
Gemini 4
Gemini 4 is Google DeepMind's confirmed next-generation frontier model — pre-training began July 21, 2026 on what Google calls its 'most ambitious' run yet. Sundar Pichai has positioned it as the answer to coding and agentic gaps, targeting where the frontier will be at launch, not where it sits today. But everything else is unknown: no benchmarks, no pricing, no specs, no GA release date, and the delayed Gemini 3.5 Pro's relationship to it remains unresolved. Watchlist-only until Google ships something concrete.
- Eingabe
- Not yet published
- Ausgabe
- Not yet published
- Kontext
- Pre-training started Jul 2026. No GA date.
Grok 4.5
SpaceXAI
Wettbewerbsfähig bepreistes Coding-/Agentic-Modell zu 2 $/6 $ pro 1M Token mit 500K Kontext — xAIs veröffentlichte Benchmarks platzieren es im Mittelfeld hinter Fable 5 und GPT-5.5, obwohl es Opus 4.8 bei DeepSWE und Terminal-Bench 2.1 anführt. Die eigentliche Geschichte ist die Kosteneffizienz: 4,2-fach token-effizienter als Opus 4.8 auf SWE-Bench Pro. Am besten für Teams, die starkes Coding zu einem Bruchteil der Frontier-Preise benötigen. Noch nicht in der EU verfügbar.
- Eingabe
- $2 / 1M tokens
- Ausgabe
- $6 / 1M tokens
- Kontext
- 500K tokens
Grok 4.6
SpaceXAI
SpaceXAIs 2-Billionen-Parameter-Modell der nächsten Generation, das am 21. Juli 2026 das Training abschloss und einen öffentlichen Launch am 7. August anstrebt. Es skaliert von Grok 4.5s 1,5 Bio. auf rund 2 Bio. Parameter und zielt darauf ab, die Leistungsfähigkeit von Kimi K3 zu erreichen oder zu übertreffen, bei gleichzeitiger Wahrung von Groks charakteristischer Token-Effizienz und rund 80 TPS Geschwindigkeit. Positioniert als Coding- und agentisches Modell der Opus-Klasse, mittrainiert mit Cursor-Daten, wird es in Cursor, Grok Build und über die API zu erwartbaren ~2 $/6 $ pro 1 Mio. Token verfügbar sein. Pre-GA: Es existieren noch keine unabhängigen Benchmarks; die Bewertung ist vorläufig, bis das Modell ausgeliefert wird und unabhängige Tests die Behauptungen validieren.
- Eingabe
- $2.00 / 1M tokens
- Ausgabe
- $6.00 / 1M tokens
- Kontext
- 500K tokens (expected, based on Grok 4.5)
Grok Voice Think Fast 2.0
SpaceXAI
SpaceXAIs Sprach-zu-Sprache-Modell der nächsten Generation mit einer parallelen Reasoning-Architektur, die es deutlich intelligenter macht als herkömmliche Sprachmodelle.
- Eingabe
- $0.08 / min of audio (speech-to-speech)
- Ausgabe
- Included in speech-to-speech rate
- Kontext
- API-only
Hy3
Tencent
Apache-2.0-Open-Weight-MoE-agentisches Modell (295B gesamt, 21B aktiv) mit starker Tool-Calling-Zuverlaessigkeit und Anti-Halluzinations-Verhalten, aber Coding bleibt hinter GLM-5.2 zurueck und Self-Hosting erfordert 8+ GPUs. Kostenlose OpenRouter-Stufe bis 21. Juli — danach $0,20/$0,80 pro 1M Tokens. Am besten fuer selbst gehostete Coding-Agenten und Langkontext-Dokumentarbeit, bei der freizuegige Lizenzierung mehr zaehlt als absolute Benchmark-Ergebnisse.
- Eingabe
- $0.20 / 1M
- Ausgabe
- $0.80 / 1M
- Kontext
- 256K tokens
Inkling
Thinking Machines Lab
Inkling ist der stärkste Grund, multimodale Open-Weight-KI ernst zu nehmen. Es liefert wettbewerbsfähiges Reasoning und Coding mit branchenführender Open-Weight-Sicherheit und steuerbarem Denkaufwand, alles unter Apache 2.0. Aber Thinking Machines ist ehrlich, dass es nicht das insgesamt stärkste ist — Faktenqualität hinkt hinterher (SimpleQA 43,9 %) und Self-Hosting erfordert ernsthafte Hardware (2TB VRAM). Conditional: eine überzeugende Basis für Organisationen, die ein multimodales Modell besitzen und fine-tunen müssen, nicht für Teams, die Spitzenleistung von der Stange wollen.
- Eingabe
- $1.87 / 1M tokens
- Ausgabe
- $4.68 / 1M tokens
- Kontext
- Up to 1M tokens native
Kimi K3
Moonshot AI
Starkes Modell, das nun unter aktiver Untersuchung des Weißen Hauses wegen Diebstahls geistigen Eigentums im industriellen Maßstab steht. Das US-Finanzministerium droht mit Sanktionen — rechtliches und operationelles Risiko ist wesentlich. Technische Benchmarks unverändert.
- Eingabe
- $3.00 / 1M
- Ausgabe
- $15.00 / 1M
- Kontext
- 1M ctx, $0.30 cached. Weights live (Jul 27).
Laguna S 2.1
poolside
Laguna S 2.1 ist das erste glaubwürdige westliche Open-Weight-Coding-Modell seit 11 Monaten — ein 118B MoE, das nur 8B Parameter pro Token aktiviert und dennoch 70,2 % auf Terminal-Bench 2.1 erreicht und damit Modelle mit 10-facher Größe schlägt. Aber es ist nicht an der Frontier — GPT-5.6 Sol und Kimi K3 liegen weit vorne — und bekannte Einschränkungen umfassen Harness-Overfitting und JSON-Verstümmelung. Am besten für selbstgehostetes agentenbasiertes Coding, wo Datensouveränität wichtiger ist als absolute Benchmark-Spitzenwerte.
- Eingabe
- $0.10 / 1M
- Ausgabe
- $0.20 / 1M
- Kontext
- OpenMDW-1.1 license, 1M context
Llama 4 Maverick
Meta
Das fuehrende Open-Source-Modell fuer Teams, die selbst hosten wollen, Datenhoheit benoetigen oder API-Anbieterbindung vermeiden moechten.
- Eingabe
- Free (self-hosted) or $0.20 / 1M tokens (hosted)
- Ausgabe
- Free (self-hosted) or $0.60 / 1M tokens (hosted)
- Kontext
- 10M tokens
MAI-Code-1-Flash
Microsoft
Microsofts erstes hauseigenes Coding-Modell — ein kleines, schnelles, aggressiv kostenoptimiertes Sparse-MoE für $0.75/$4.50 per 1M tokens. Liefert einen Vorsprung von 16 Punkten gegenüber Claude Haiku 4.5 auf SWE-Bench Pro und verbraucht dabei bis zu 60 % weniger Tokens. Es ist gezielt für Copilot-Workflows mit hohem Volumen gebaut — Autovervollständigungen, Refactorings, Gerüstcode — kein Frontier-Modell. Am besten innerhalb des Copilot-Ökosystems; der API-Zugang außerhalb wird noch ausgerollt.
- Eingabe
- $0.75 / 1M tokens
- Ausgabe
- $4.50 / 1M tokens
- Kontext
- 256K context
MAI-Cyber-1-Flash
Microsoft
Microsofts erstes hauseigenes Cyber-Sicherheitsmodell, aufgebaut auf der MAI-Thinking-1-Familie und eingebettet in den MDASH-Multi-Agent-Harness. MAI-Cyber-1-Flash bewältigt ~90 % der Sicherheits-Workloads zu etwa der Hälfte der Kosten früherer Konfigurationen und reserviert GPT-5.4 für die härtesten 10 %. Es erreicht 95,95 % im CyberGym — 12 Punkte über Mythos 5 —, aber dies ist ein herstellergeführter Benchmark aus einer abgestimmten Gesamtsystem-Konfiguration (Harness + Dual-Modelle), kein unabhängiger Modell-gegen-Modell-Test. Nur über Azure AI Foundry mit geprüftem Enterprise-Zugang verfügbar; keine eigenständige Preisgestaltung oder öffentliche API.
- Eingabe
- N/A (MDASH SCU consumption)
- Ausgabe
- N/A (MDASH SCU consumption)
- Kontext
- Azure AI Foundry vetted access
Muse Spark 1.1
Meta
Metas erstes kostenpflichtiges KI-Modell und erster Vorstoß in den kommerziellen Coding-Markt — 1,25 $/4,25 $ pro 1M Token mit 1M Kontext, nativer Subagenten-Orchestrierung, MCP/Tool-Unterstützung und Computer-Use-Fähigkeit zu etwa 4× unter Anthropic/OpenAI-Preisen. Führt bei Tool-Use-Benchmarks, liegt aber bei reinem Coding 7 Punkte hinter Opus 4.8 auf SWE-Bench Pro. Closed-Weight, US-only öffentliche Vorschau. Am besten für Teams, die Tool-Use-Orchestrierung zu niedrigen Kosten priorisieren.
- Eingabe
- $1.25 / 1M tokens
- Ausgabe
- $4.25 / 1M tokens
- Kontext
- 1M tokens
Muse Spark 1.2
Meta
Meta's coding-focused model update, co-trained with the Muse Code harness — 82.9% on Terminal-Bench 2.1 and 59.3% on DeepSWE 1.1, second only to Claude Opus 5 on the former and trailing both Opus 5 and GPT-5.6 Terra on the latter. Standard pricing unchanged from 1.1 at $1.25 input / $4.25 output per 1M tokens; contributor tier drops to $0.10/$0.20 in exchange for training-data rights. All published benchmarks remain vendor-run with no independent reproduction. Best for cost-sensitive coding teams willing to test a model explicitly optimized for its own harness.
- Eingabe
- $1.25 / 1M tokens
- Ausgabe
- $4.25 / 1M tokens
- Kontext
- 1M tokens
Mythos 5 (Claude Mythos 5)
Anthropic
Das stärkste Cybersecurity-Modell der Welt (83,8 % CyberGym) — aufgebaut auf den Gewichten von Fable 5, mit aufgehobenen Sicherheitsklassifikatoren. Der Zugang wurde nach der Exportdirektive vom 12. Juni ausgesetzt und am 26. Juni teilweise für ~100 designierte US-Organisationen kritischer Infrastruktur wiederhergestellt (Project Glasswing). Das Urteil bleibt CONDITIONAL: Die Fähigkeiten sind Elite, aber der Zugang ist an eine bundesbehördliche Designation gebunden. Keine öffentliche API — nutzbar nur, wenn Ihre Organisation auf der Liste des Handelsministeriums steht.
- Eingabe
- $10 / 1M tokens
- Ausgabe
- $50 / 1M tokens
- Kontext
- 1M tokens (restricted access)
Ornith-1.0
DeepReinforce
Eine starke MIT-lizenzierte Open-Source-Modellfamilie für agentisches Coding, die Spitzen-Benchmarks erreicht — schlägt Claude Opus 4.7 sowohl auf Terminal-Bench 2.1 als auch SWE-Bench Verified — erfordert aber Self-Hosting mit erheblicher GPU-Infrastruktur und stammt von einem neuen Labor mit begrenzter Erfolgsbilanz.
- Eingabe
- Free (MIT license)
- Ausgabe
- Free (MIT license)
- Kontext
- 256K tokens
Qwen3.8-Max
Alibaba
Qwen3.8-Max is Alibaba's 2.4-trillion-parameter flagship, previewed July 2026 as a multimodal MoE model with a 984K context window. It is not yet GA — no per-token API pricing, no benchmark table, no open weights, and no model card have been published, and the "second only to Fable 5" claim is Alibaba's own unverified self-assessment. The preview is worth testing for coding and long-context agent workloads at $6/month entry cost, but wait for published benchmarks, per-token pricing, and the promised open-weight release before committing.
- Eingabe
- Credit-based only
- Ausgabe
- Credit-based only
- Kontext
- 984K tokens
Sakana Fugu
Sakana AI
Multi-Agent-Orchestrator, der Frontier-Modell-Niveau in zentralen Benchmarks durch Routing über einen Pool von Expertenagenten erreicht — aber intransparentes Routing und Plattformabhängigkeit schränken die Nachvollziehbarkeit ein.
- Eingabe
- $5 / 1M tokens
- Ausgabe
- $30 / 1M tokens
- Kontext
- 272K tokens (>272K: $10/$45 per 1M)