KI-Modelle
28Finde das richtige Modell für deine Aufgabe. Nach Stärke filtern, Preise vergleichen, entscheiden.
Nach Anbieter filtern
Claude Fable 5
Anthropic
Anthropics Frontier-Modell der Mythos-Klasse — das bislang stärkste öffentlich verfügbare Claude-Modell, das zum Start jeden wichtigen Benchmark anführt. Das Urteil bleibt CONDITIONAL wegen zweier aktueller Einschränkungen: reiner Credit-Preisgestaltung von $10/$50 per 1M tokens ohne Abo-Option und einem Sicherheitsklassifikator, der bei routinemäßigen Coding-Aufgaben zu oft anschlägt und sie stillschweigend auf einen Opus-4.8-Fallback umleitet. Greifen Sie zu Fable 5, wenn der Fähigkeitsvorsprung die Kosten rechtfertigt; für Routinearbeit ist Sonnet 5 die berechenbarere Alternative.
- Eingabe
- $10 / 1M tokens
- Ausgabe
- $50 / 1M tokens
- Kontext
- 1M context, 128K max output
Claude Haiku 4.5
Anthropic
Anthropics Preis-Leistungs-Basis für $1/$5 per 1M tokens — die schnelle, günstige Stufe, an der sich die Konkurrenz misst, mit 200K Kontext und 64K Output. Am besten für latenzkritische Arbeit mit hohem Volumen: Klassifikation, Extraktion, Zusammenfassung, Routing. Greifen Sie zu Opus 4.8 oder Sonnet 5, wenn tiefes mehrstufiges Reasoning gefragt ist.
- Eingabe
- $1 / 1M tokens
- Ausgabe
- $5 / 1M tokens
- Kontext
- 200K tokens
Claude Opus 4.8
Anthropic
Anthropics Flaggschiff-Reasoning-Modell und der praktische Frontier-Platzhirsch für einsatzbereite Leistungsfähigkeit — 1M Token Kontext für $5/$25 per 1M tokens, in allen Abo-Plänen enthalten. Unsere Empfehlung für review-lastige Arbeit: Code-Review, Refactoring unter strikten Vorgaben und Aufgaben mit bedachtem Tempo. Starkes agentisches Coding, analytisches Reasoning auf Spitzenniveau und stabiler Abo-Zugang machen es zum Standard-Flaggschiff für die meisten Produktionsteams.
- Eingabe
- $5 / 1M tokens
- Ausgabe
- $25 / 1M tokens
- Kontext
- 1M tokens
Claude Sonnet 4.6
Anthropic
Als Standard-Arbeitspferd der Mittelklasse von Claude Sonnet 5 (erschienen am 30. Juni 2026) abgelöst. Dem Preis von $3/$15 und dem 1M-Token-Kontext von Sonnet 4.6 steht nun ein Nachfolger mit einem Sprung von 13,4 Punkten auf Terminal-Bench 2.1 bei gleicher Preisliste gegenüber. Wählen Sie 4.6 nur für festgepinnte Deployments oder wenn die ~30 % höhere Token-Zahl und die entfernten Parameter temperature/top_p/top_k von Sonnet 5 ein Ausschlusskriterium sind.
- Eingabe
- $3 / 1M tokens
- Ausgabe
- $15 / 1M tokens
- Kontext
- 1M tokens
Claude Sonnet 5
Anthropic
Anthropics agentischstes Sonnet liefert nahezu Opus-4.8-Leistung zu rund dem halben Preis, mit +13,4 Punkten auf Terminal-Bench 2.1 gegenüber Sonnet 4.6. Der neue Tokenizer bläht die Token-Zahlen um ~30 % auf; das Einführungsangebot ($2/$10 per MTok bis 31. August) hält die Migration kostenneutral, doch Teams sollten ihre Budgets vor dem Wechsel neu durchrechnen. Es löst Sonnet 4.6 als Standard in allen Claude-Plänen ab und ist ideal für agentisches Coding, Brownfield-Debugging und Produktions-Pipelines — nicht für die härtesten Frontier-Reasoning- oder Cybersecurity-Aufgaben.
- Eingabe
- $3 / 1M
- Ausgabe
- $15 / 1M
- Kontext
- 1M tokens
GLM-5.2
Z.ai
Das führende Open-Weight-Modell fürs Coding mit 1M-Token-Kontext und MIT-Lizenz — übertrifft GPT-5.5 in mehreren Benchmarks zu einem Bruchteil der Kosten, liegt aber bei den härtesten Langhorizont-Aufgaben weiterhin hinter Claude Opus 4.8.
- Eingabe
- $1.40 / 1M tokens
- Ausgabe
- $4.40 / 1M tokens
- Kontext
- 1M tokens
GPT-4.1
OpenAI
Das Standard-Migrationsziel für GPT-4-Turbo-Workloads: gleiche Anfragestruktur, niedrigere Kosten, 1M-Token-Kontext – wandeln Sie veraltete function_call-Payloads in das Tools-Format um und machen Sie weiter.
- Eingabe
- $2 / 1M tokens
- Ausgabe
- $8 / 1M tokens
- Kontext
- 1M tokens
GPT-4o (Retired from ChatGPT, API-only)
OpenAI
GPT-4o (May 2024) has been superseded by the GPT-5.x family and delisted from OpenAI's flagship API pricing page. It remains available through the API but is no longer a current-generation model. Use only where migration to GPT-5.x is blocked; otherwise, GPT-5.5 or GPT-5.4 offer better performance at comparable cost.
- Eingabe
- $2.50 / 1M tokens
- Ausgabe
- $10 / 1M tokens
- Kontext
- 128K tokens
GPT-5.5
OpenAI
OpenAIs kommerzielles Allzweck-Frontier-Modell und der einsatzbereite OpenAI-Anker, solange die GPT-5.6-Familie regierungsbeschränkt bleibt — $5/$30 per 1M tokens mit über 1M Kontext. Starkes Reasoning, breite Ökosystem-Unterstützung und volle öffentliche Verfügbarkeit machen es zu einem soliden Produktionsstandard, auch wenn günstigere Modelle es bei bestimmten Aufgaben inzwischen erreichen. Für die meisten Teams bleibt es die Basislinie, an der neuere Modelle gemessen werden.
- Eingabe
- $5 / 1M tokens
- Ausgabe
- $30 / 1M tokens
- Kontext
- 1M+ tokens (922K in / 128K out)
GPT-5.5-Cyber
OpenAI
85,6 % CyberGym — bestes Einzelmodell-Ergebnis — aber Zugang nur für geprüfte Verteidiger.
- Eingabe
- N/A
- Ausgabe
- N/A
- Kontext
- Trusted Access for Cyber; not commercial API
GPT-5.6 Luna
OpenAI
OpenAIs günstigste GPT-5.6-Stufe — TerminalBench 2.1 mit 82,5 % für 1/6 $ pro 1M Tokens, günstiger als Claude Haiku 4.5 und Gemini Flash bei der Leistung pro Dollar. Der Haken: Luna ist auf rund 20 vertrauenswürdige Partner beschränkt, ohne unabhängige Überprüfung oder GA-Termin. Am besten geeignet für Teams, die Modell-Routing-Architekturen aufbauen und günstige Fehlschläge an Terra oder Sol eskalieren können.
- Eingabe
- $1 / 1M tokens
- Ausgabe
- $6 / 1M tokens
- Kontext
- Fastest and most cost-efficient GPT-5.6 tier.
GPT-5.6 Sol
OpenAI
GPT-5.6 Sol ist das kosteneffizienteste Frontier-Modell — führend bei Coding-Benchmarks und konkurrenzfähig bei hartem Reasoning zu einem Bruchteil der Kosten vergleichbarer Modelle. Das Urteil wird durch die GPT-Red-Offenlegung zur Sicherheitshärtung gestärkt: Das Modell wurde adversarial gegen ein dediziertes Self-Play-RL-Red-Teaming-Modell im Frontier-Maßstab trainiert und ist dadurch 6x robuster gegen Prompt-Injections.
- Eingabe
- $5 / 1M tokens
- Ausgabe
- $30 / 1M tokens
- Kontext
- Same rate card as GPT-5.5. Ultra mode costs more.
GPT-5.6 Terra
OpenAI
Das mittlere GPT-5.6-Arbeitstier — GPT-5.5-Klasse-Leistung zum halben Preis (2,50/15 $ pro 1M Tokens) mit TerminalBench 2.1 bei 84,3 %, gleichauf mit Claude Fable 5. Die Einschränkung: alle Angaben stammen vom Anbieter, Terra ist auf ~20 Partner beschränkt, und es gibt kein bestätigtes GA-Datum. Für die meisten Produktionsworkloads wäre Terra der pragmatische Standard, sobald verfügbar; GPT-5.5 und Opus 4.8 sind die heutigen Alternativen.
- Eingabe
- $2.50 / 1M tokens
- Ausgabe
- $15 / 1M tokens
- Kontext
- Roughly 2x cheaper than GPT-5.5 for similar perf.
GPT-Live-1
OpenAI
OpenAIs erstes Vollduplex-Sprachmodell -- hoert und spricht gleichzeitig, ein Sprung ueber den turnusbasierten Advanced Voice Mode hinaus. Delegiert komplexes Reasoning im Hintergrund an GPT-5.5, waehrend der Gespraechsfluss erhalten bleibt. Urteil CONDITIONAL: das beste verfuegbare ChatGPT-Spracherlebnis, aber ein produktintegriertes Modell ohne API und mit ungleichmaessiger Sprachunterstuetzung.
- Eingabe
- ChatGPT subscription
- Ausgabe
- ChatGPT subscription
- Kontext
- ChatGPT Voice only
GPT-Live-1 mini
OpenAI
Die kostenlose Variante von GPT-Live-1 -- dieselbe Vollduplex-Architektur in einem kleineren, schnelleren Paket, das als Standard-Sprachmodell fuer ChatGPT-Free-Nutzer dient. Teilt die Kerninnovationen: kontinuierliche Interaktion, Wake-Word-Unterstuetzung und GPT-5.5-Delegation. Dieselben Einschraenkungen: keine API, ungleichmaessige Sprachqualitaet. Ein deutliches Upgrade gegenueber dem alten turnusbasierten Sprachmodus fuer kostenlose Nutzer.
- Eingabe
- Free (ChatGPT)
- Ausgabe
- Free (ChatGPT)
- Kontext
- ChatGPT Voice only
Gemini 2.5 Pro
Jetzt die Budget-Empfehlung für lange Kontexte: Eine Preissenkung um 40 % (Juni 2026) macht vollständige Korpus-Durchläufe auch für mittlere Budgets erschwinglich — das größte verfügbare Kontextfenster mit starker Google-Ökosystem-Integration.
- Eingabe
- $1.25 / 1M tokens
- Ausgabe
- $10 / 1M tokens
- Kontext
- 1M tokens
Gemini 3.5 Flash
Googles Kosteneffizienz-Highlight für agentische Desktop-Automatisierung zu $1.50/$9 per 1M tokens mit ~1M Kontext. Natives Computer Use erreicht 78,4 auf OSWorld-Verified — nur 0,3 Punkte hinter GPT-5.5, zu rund einem Drittel der Kosten. DER relevante Vorbehalt: Das Computer-Use-Tool ist eine öffentliche Preview und noch nicht in der Produktions-API — Endpoint-Verfügbarkeit vor der Anbindung prüfen.
- Eingabe
- $1.50 / 1M tokens
- Ausgabe
- $9 / 1M tokens
- Kontext
- 1M tokens
Gemini 3.5 Pro
Googles Frontier-Modell vor der allgemeinen Verfügbarkeit — inzwischen bei der vierten Verschiebung und laut Bloomberg „Monate hinter dem Zeitplan“. Der 2M-Token-Kontext, die native multimodale Pipeline und das Deep-Think-Reasoning bleiben reale Fähigkeiten, doch ein bestätigter GA-Zeitplan existiert nicht. Die Coding-Fähigkeit ist das zentrale Defizit.
- Eingabe
- Not yet published
- Ausgabe
- Not yet published
- Kontext
- Est. $5-15/$30-60 per 1M. 2M ctx. Not GA.
Grok 4.5
SpaceXAI
Konkurrenzfaehig bepreistes Coding-/agentisches Modell zu $2/$6 pro 1M Token mit 500K Kontext -- xAIs veroeffentlichte Benchmarks platzieren es im Mittelfeld hinter Fable 5 und GPT-5.5, fuehrt jedoch Opus 4.8 bei DeepSWE und Terminal-Bench 2.1 an. Die eigentliche Staerke ist Kosteneffizienz: 4,2x token-effizienter als Opus 4.8 im SWE-Bench Pro. Am besten fuer Teams, die starke Coding-Leistung zu einem Bruchteil der Frontier-Preise benoetigen. Noch nicht in der EU verfuegbar.
- Eingabe
- $2 / 1M tokens
- Ausgabe
- $6 / 1M tokens
- Kontext
- 500K tokens
Hy3
Tencent
Apache-2.0-Open-Weight-MoE-agentisches Modell (295B gesamt, 21B aktiv) mit starker Tool-Calling-Zuverlaessigkeit und Anti-Halluzinations-Verhalten, aber Coding bleibt hinter GLM-5.2 zurueck und Self-Hosting erfordert 8+ GPUs. Kostenlose OpenRouter-Stufe bis 21. Juli — danach $0,20/$0,80 pro 1M Tokens. Am besten fuer selbst gehostete Coding-Agenten und Langkontext-Dokumentarbeit, bei der freizuegige Lizenzierung mehr zaehlt als absolute Benchmark-Ergebnisse.
- Eingabe
- $0.20 / 1M
- Ausgabe
- $0.80 / 1M
- Kontext
- 256K tokens
Inkling
Thinking Machines Lab
Inkling ist das bisher staerkste Argument, multimodale Open-Weight-KI ernst zu nehmen. Es liefert wettbewerbsfaehiges Reasoning und Coding mit branchenfuehrender Open-Weight-Sicherheit und steuerbarem Denkaufwand, alles unter Apache 2.0. Doch Thinking Machines ist ehrlich: Es ist nicht das staerkste Modell insgesamt -- die Faktenqualitaet haengt zurueck (SimpleQA 43,9 %) und Self-Hosting erfordert ernsthafte Hardware (2 TB VRAM). Conditional: eine ueberzeugende Basis fuer Organisationen, die ein multimodales Modell besitzen und fine-tunen muessen, nicht fuer Teams, die maximale Out-of-the-Box-Leistung wollen.
- Eingabe
- $1.87 / 1M tokens
- Ausgabe
- $4.68 / 1M tokens
- Kontext
- Up to 1M tokens native
Kimi K3
Moonshot AI
Moonshot AIs 2,8T-MoE-Flaggschiff -- das groesste jemals veroeffentlichte Open-Weight-Modell -- fuehrt bei Arena WebDev Frontend-Coding und liegt auf Augenhoehe mit Opus 4.8 bei langfristigen Coding-Aufgaben. Flatrate-Preise von $3/$15 pro 1M halten es zugaenglich, liegt aber weiterhin hinter Fable 5 und GPT 5.6 Sol bei Praezisions-Benchmarks, und die Gewichte bleiben bis zum 27. Juli nur ueber die API verfuegbar. Am besten fuer Teams mit langem Kontext und agentischem Coding, die Ausfuehrlichkeit tolerieren und kein sofortiges Self-Hosting benoetigen.
- Eingabe
- $3.00 / 1M
- Ausgabe
- $15.00 / 1M
- Kontext
- 1M tokens, $0.30/1M cached
Llama 4 Maverick
Meta
Das fuehrende Open-Source-Modell fuer Teams, die selbst hosten wollen, Datenhoheit benoetigen oder API-Anbieterbindung vermeiden moechten.
- Eingabe
- Free (self-hosted) or $0.20 / 1M tokens (hosted)
- Ausgabe
- Free (self-hosted) or $0.60 / 1M tokens (hosted)
- Kontext
- 10M tokens
MAI-Code-1-Flash
Microsoft
Microsofts erstes hauseigenes Coding-Modell — ein kleines, schnelles, aggressiv kostenoptimiertes Sparse-MoE für $0.75/$4.50 per 1M tokens. Liefert einen Vorsprung von 16 Punkten gegenüber Claude Haiku 4.5 auf SWE-Bench Pro und verbraucht dabei bis zu 60 % weniger Tokens. Es ist gezielt für Copilot-Workflows mit hohem Volumen gebaut — Autovervollständigungen, Refactorings, Gerüstcode — kein Frontier-Modell. Am besten innerhalb des Copilot-Ökosystems; der API-Zugang außerhalb wird noch ausgerollt.
- Eingabe
- $0.75 / 1M tokens
- Ausgabe
- $4.50 / 1M tokens
- Kontext
- 256K context
Muse Spark 1.1
Meta
Metas erstes kostenpflichtiges KI-Modell und die erste Salve im kommerziellen Coding-Markt -- $1,25/$4,25 pro 1M Token mit 1M Kontext, nativer Subagent-Orchestrierung, MCP-/Tool-Unterstuetzung und Computer-Use-Faehigkeit zu etwa einem Viertel der Preise von Anthropic/OpenAI. Fuehrt bei Tool-Use-Benchmarks, liegt aber 7 Punkte hinter Opus 4.8 im SWE-Bench Pro bei reinem Coding. Closed-Weight, US-only Public Preview. Am besten fuer Teams, die Tool-Use-Orchestrierung zu niedrigen Kosten priorisieren.
- Eingabe
- $1.25 / 1M tokens
- Ausgabe
- $4.25 / 1M tokens
- Kontext
- 1M tokens
Mythos 5 (Claude Mythos 5)
Anthropic
Das stärkste Cybersecurity-Modell der Welt (83,8 % CyberGym) — aufgebaut auf den Gewichten von Fable 5, mit aufgehobenen Sicherheitsklassifikatoren. Der Zugang wurde nach der Exportdirektive vom 12. Juni ausgesetzt und am 26. Juni teilweise für ~100 designierte US-Organisationen kritischer Infrastruktur wiederhergestellt (Project Glasswing). Das Urteil bleibt CONDITIONAL: Die Fähigkeiten sind Elite, aber der Zugang ist an eine bundesbehördliche Designation gebunden. Keine öffentliche API — nutzbar nur, wenn Ihre Organisation auf der Liste des Handelsministeriums steht.
- Eingabe
- $10 / 1M tokens
- Ausgabe
- $50 / 1M tokens
- Kontext
- 1M tokens (restricted access)
Ornith-1.0
DeepReinforce
Eine starke MIT-lizenzierte Open-Source-Modellfamilie für agentisches Coding, die Spitzen-Benchmarks erreicht — schlägt Claude Opus 4.7 sowohl auf Terminal-Bench 2.1 als auch SWE-Bench Verified — erfordert aber Self-Hosting mit erheblicher GPU-Infrastruktur und stammt von einem neuen Labor mit begrenzter Erfolgsbilanz.
- Eingabe
- Free (MIT license)
- Ausgabe
- Free (MIT license)
- Kontext
- 256K tokens
Sakana Fugu
Sakana AI
Multi-Agent-Orchestrator, der Frontier-Modell-Niveau in zentralen Benchmarks durch Routing über einen Pool von Expertenagenten erreicht — aber intransparentes Routing und Plattformabhängigkeit schränken die Nachvollziehbarkeit ein.
- Eingabe
- $5 / 1M tokens
- Ausgabe
- $30 / 1M tokens
- Kontext
- 272K tokens (>272K: $10/$45 per 1M)