Ornith-1.0
DeepReinforce · Veröffentlicht Juni 2026
Eine starke MIT-lizenzierte Open-Source-Modellfamilie für agentisches Coding, die Spitzen-Benchmarks erreicht — schlägt Claude Opus 4.7 sowohl auf Terminal-Bench 2.1 als auch SWE-Bench Verified — erfordert aber Self-Hosting mit erheblicher GPU-Infrastruktur und stammt von einem neuen Labor mit begrenzter Erfolgsbilanz.
Ist es das Richtige für dich?
Gut für
- Agentisches Coding mit mehrstufigen Tool-Aufrufen — übertrifft Claude Opus 4.7 bei Terminal-Bench 2.1 (77,5 vs. 70,3) und SWE-Bench Verified (82,4 vs. 80,8)
- Selbst gehostete Coding-Agenten mit vollständiger Datenprivatsphäre — MIT-Lizenz, keine API-Abhängigkeit, läuft auf deiner eigenen Infrastruktur
- Edge-Deployment mit der 9B-Variante — erreicht oder übertrifft Gemma 4-31B bei SWE-Bench Verified (69,4 vs. 52) und passt auf eine einzelne Consumer-GPU
- Selbstgerüstbauendes RL-Training erzeugt aufgabenspezifische Strategien, die feste, von Menschen entworfene Test-Harnesses bei agentischen Coding-Benchmarks übertreffen
Nicht geeignet für
- Teams ohne GPU-Infrastruktur — keine verwaltete API von DeepReinforce; du musst deine eigenen Inferenzserver bereitstellen und warten
- Allgemeine Chat- oder Nicht-Coding-Aufgaben — stark auf agentische Coding-Harnesses spezialisiert; nicht für Konversation, Schreiben oder multimodale Nutzung benchmarkt oder optimiert
- Produktionseinsatz mit Zuverlässigkeits-SLAs — von einem neuen Labor ohne verwalteten Dienst, begrenzten Community-Adoptionsdaten und ungeprüften Benchmark-Behauptungen
Leistung nach Aufgabe
Agentisches Coding (mehrstufige Tool-Nutzung)
SOTA unter Open-Source-Modellen; 397B schlägt Claude Opus 4.7 sowohl bei TB-2.1 als auch bei SWE-Bench Verified. Simon Willison hat das kompetente Multi-Tool-Aufrufverhalten unabhängig verifiziert.
Code-Generierung
Stark bei SWE-Bench Verified (82,4) und NL2Repo (48,2). Konkurrenzfähig mit geschlossenen Frontier-Modellen, liegt aber bei reinen Generierungs-Benchmarks hinter Claude Opus 4.8 und GLM-5.2.
Code-Debugging und Bug-Fixing
Solider SWE-Bench-Pro-Score (62,2) und starke SWE-Atlas-Ergebnisse. Bewältigt mehrdateiige Bug-Lokalisierung und testgetriebene Patches gut.
Mehrdateien-Refactoring
Für Aufgaben auf Repository-Ebene konzipiert. Das 256K-Kontextfenster ermöglicht das Arbeiten über große Codebasen hinweg. Stark bei SWE-Bench Multilingual (78,9).
Lokale/Edge-Inferenz
Die 9B-Variante (69,4 bei SWE-Bench Verified) schlägt weit über ihrer Gewichtsklasse und erreicht das Niveau von 31B-Klasse-Modellen. GGUF-Quantisierungen für llama.cpp und Ollama verfügbar.
Preise
Eingabe
Free (MIT license)
Ausgabe
Free (MIT license)
Kontext
256K tokens
Benchmarks
Noch keine Urteilsänderungen
Die Uhr läuft ab dem ersten Tag — Änderungen erscheinen hier, sobald sich unser Urteil weiterentwickelt.
Quellen
- Simon Willison — Ornith-1.0: Self-Scaffolding LLMs for Agentic CodingJuni 2026
- DeepReinforce Official AnnouncementJuni 2026
- Hugging Face — Ornith-1.0-397B Model CardJuni 2026
- Hugging Face — Ornith-1.0-9B Model CardJuni 2026
- GitHub — Ornith-1 RepositoryJuni 2026
- MarkTechPost — DeepReinforce Releases Ornith-1.0Juni 2026
- TechTimes — Open-Source Coding Model Ornith-1.0 Writes Its Own Training ScaffoldJuni 2026
- LLM Reference — Ornith 1.0Juni 2026
Prüfprotokoll
- Preise— Keine Änderungen
Automatisierter Agent
- Preise— Keine Änderungen
Automatisierter Agent
- Preise— Keine Änderungen
Automatisierter Agent
- Profil— Keine Änderungen
Beim Start importiert
- Preise— Keine Änderungen
Beim Start importiert