O

Ornith-1.0

DeepReinforce · Veröffentlicht Juni 2026

Bedingt

Eine starke MIT-lizenzierte Open-Source-Modellfamilie für agentisches Coding, die Spitzen-Benchmarks erreicht — schlägt Claude Opus 4.7 sowohl auf Terminal-Bench 2.1 als auch SWE-Bench Verified — erfordert aber Self-Hosting mit erheblicher GPU-Infrastruktur und stammt von einem neuen Labor mit begrenzter Erfolgsbilanz.

Ist es das Richtige für dich?

Gut für

  • Agentisches Coding mit mehrstufigen Tool-Aufrufen — übertrifft Claude Opus 4.7 bei Terminal-Bench 2.1 (77,5 vs. 70,3) und SWE-Bench Verified (82,4 vs. 80,8)
  • Selbst gehostete Coding-Agenten mit vollständiger Datenprivatsphäre — MIT-Lizenz, keine API-Abhängigkeit, läuft auf deiner eigenen Infrastruktur
  • Edge-Deployment mit der 9B-Variante — erreicht oder übertrifft Gemma 4-31B bei SWE-Bench Verified (69,4 vs. 52) und passt auf eine einzelne Consumer-GPU
  • Selbstgerüstbauendes RL-Training erzeugt aufgabenspezifische Strategien, die feste, von Menschen entworfene Test-Harnesses bei agentischen Coding-Benchmarks übertreffen

Nicht geeignet für

  • Teams ohne GPU-Infrastruktur — keine verwaltete API von DeepReinforce; du musst deine eigenen Inferenzserver bereitstellen und warten
  • Allgemeine Chat- oder Nicht-Coding-Aufgaben — stark auf agentische Coding-Harnesses spezialisiert; nicht für Konversation, Schreiben oder multimodale Nutzung benchmarkt oder optimiert
  • Produktionseinsatz mit Zuverlässigkeits-SLAs — von einem neuen Labor ohne verwalteten Dienst, begrenzten Community-Adoptionsdaten und ungeprüften Benchmark-Behauptungen

Leistung nach Aufgabe

Agentisches Coding (mehrstufige Tool-Nutzung)

Excellent

SOTA unter Open-Source-Modellen; 397B schlägt Claude Opus 4.7 sowohl bei TB-2.1 als auch bei SWE-Bench Verified. Simon Willison hat das kompetente Multi-Tool-Aufrufverhalten unabhängig verifiziert.

Code-Generierung

Very Good

Stark bei SWE-Bench Verified (82,4) und NL2Repo (48,2). Konkurrenzfähig mit geschlossenen Frontier-Modellen, liegt aber bei reinen Generierungs-Benchmarks hinter Claude Opus 4.8 und GLM-5.2.

Code-Debugging und Bug-Fixing

Very Good

Solider SWE-Bench-Pro-Score (62,2) und starke SWE-Atlas-Ergebnisse. Bewältigt mehrdateiige Bug-Lokalisierung und testgetriebene Patches gut.

Mehrdateien-Refactoring

Very Good

Für Aufgaben auf Repository-Ebene konzipiert. Das 256K-Kontextfenster ermöglicht das Arbeiten über große Codebasen hinweg. Stark bei SWE-Bench Multilingual (78,9).

Lokale/Edge-Inferenz

Excellent

Die 9B-Variante (69,4 bei SWE-Bench Verified) schlägt weit über ihrer Gewichtsklasse und erreicht das Niveau von 31B-Klasse-Modellen. GGUF-Quantisierungen für llama.cpp und Ollama verfügbar.

Preise

Eingabe

Free (MIT license)

Ausgabe

Free (MIT license)

Kontext

256K tokens

Alle Preise ansehen

Benchmarks

BenchmarkWertQuelle
SWE-Bench Verified82.4 Quelle
Terminal-Bench 2.1 (Terminus-2)77.5 Quelle
SWE-Bench Pro62.2 Quelle
SWE-Bench Multilingual78.9 Quelle

Noch keine Urteilsänderungen

Die Uhr läuft ab dem ersten Tag — Änderungen erscheinen hier, sobald sich unser Urteil weiterentwickelt.

Prüfprotokoll

  • Preise— Keine Änderungen

    Automatisierter Agent

  • Preise— Keine Änderungen

    Automatisierter Agent

  • Preise— Keine Änderungen

    Automatisierter Agent

  • Profil— Keine Änderungen

    Beim Start importiert

  • Preise— Keine Änderungen

    Beim Start importiert

Wie wir bewerten