O

Ornith-1.0

DeepReinforce · Sorti juin 2026

Conditionnel

Une famille de modèles open source agentic coding sous licence MIT qui atteint des benchmarks compétitifs avec les modèles frontier — battant Claude Opus 4.7 à la fois sur Terminal-Bench 2.1 et SWE-Bench Verified — mais qui nécessite un autohébergement avec des ressources GPU significatives et provient d'un nouveau labo au track record limité.

Est-ce fait pour vous ?

Recommandé pour

  • Codage agentique avec appels d'outils multi-étapes — surpasse Claude Opus 4.7 sur Terminal-Bench 2.1 (77,5 vs 70,3) et SWE-Bench Verified (82,4 vs 80,8)
  • Agents de codage auto-hébergés avec confidentialité totale des données — licence MIT, pas de dépendance API, fonctionne sur votre propre infrastructure
  • Déploiement edge avec la variante 9B — égale ou surpasse Gemma 4-31B sur SWE-Bench Verified (69,4 vs 52) tout en tenant sur un seul GPU grand public
  • L'entraînement RL auto-échafaudant produit des stratégies par tâche qui surpassent les harnais fixes conçus par des humains sur les benchmarks de codage agentique

Déconseillé pour

  • Équipes sans infrastructure GPU — pas d'API managée de DeepReinforce ; vous devez provisionner et maintenir vos propres serveurs d'inférence
  • Chat généraliste ou tâches non liées au codage — fortement spécialisé pour les harnais de codage agentique ; non benchmarké pour la conversation, la rédaction ou l'usage multimodal
  • Déploiement en production avec SLA de fiabilité — d'un nouveau labo sans service managé, données d'adoption communautaire limitées et revendications de benchmark non vérifiées

Performances par tâche

Codage agentique (utilisation d'outils multi-étapes)

Excellent

SOTA parmi les modèles open source ; 397B bat Claude Opus 4.7 sur TB-2.1 et SWE-Bench Verified. Simon Willison a vérifié indépendamment un comportement multi-appels d'outils compétent.

Génération de code

Very Good

Solide sur SWE-Bench Verified (82,4) et NL2Repo (48,2). Compétitif avec les modèles fermés frontière mais derrière Claude Opus 4.8 et GLM-5.2 sur les benchmarks de génération brute.

Débogage et correction de bugs

Very Good

Bon score SWE-Bench Pro (62,2) et solides résultats SWE Atlas. Gère bien la localisation de bugs multi-fichiers et les correctifs pilotés par les tests.

Refactorisation multi-fichiers

Very Good

Conçu pour les tâches à l'échelle du dépôt. La fenêtre de contexte de 256K permet de travailler sur de grandes codebases. Solide sur SWE-Bench Multilingual (78,9).

Inférence locale/edge

Excellent

La variante 9B (69,4 sur SWE-Bench Verified) surpasse largement sa catégorie, égalant les modèles de classe 31B. Quants GGUF disponibles pour llama.cpp et Ollama.

Tarifs

Entrée

Free (MIT license)

Sortie

Free (MIT license)

Contexte

256K tokens

Voir tous les tarifs

Tests de performance

TestScoreSource
SWE-Bench Verified82.4 Source
Terminal-Bench 2.1 (Terminus-2)77.5 Source
SWE-Bench Pro62.2 Source
SWE-Bench Multilingual78.9 Source

Aucun changement de verdict pour l’instant

L’horloge tourne dès le premier jour : les changements apparaîtront ici à mesure que notre verdict évolue.

Journal de vérification

  • Tarifs— Aucun changement

    Agent automatisé

  • Tarifs— Aucun changement

    Agent automatisé

  • Tarifs— Aucun changement

    Agent automatisé

  • Profil— Aucun changement

    Importé au lancement

  • Tarifs— Aucun changement

    Importé au lancement

Comment nous évaluons