Ornith-1.0
DeepReinforce · Sorti juin 2026
Une famille de modèles open source agentic coding sous licence MIT qui atteint des benchmarks compétitifs avec les modèles frontier — battant Claude Opus 4.7 à la fois sur Terminal-Bench 2.1 et SWE-Bench Verified — mais qui nécessite un autohébergement avec des ressources GPU significatives et provient d'un nouveau labo au track record limité.
Est-ce fait pour vous ?
Recommandé pour
- Codage agentique avec appels d'outils multi-étapes — surpasse Claude Opus 4.7 sur Terminal-Bench 2.1 (77,5 vs 70,3) et SWE-Bench Verified (82,4 vs 80,8)
- Agents de codage auto-hébergés avec confidentialité totale des données — licence MIT, pas de dépendance API, fonctionne sur votre propre infrastructure
- Déploiement edge avec la variante 9B — égale ou surpasse Gemma 4-31B sur SWE-Bench Verified (69,4 vs 52) tout en tenant sur un seul GPU grand public
- L'entraînement RL auto-échafaudant produit des stratégies par tâche qui surpassent les harnais fixes conçus par des humains sur les benchmarks de codage agentique
Déconseillé pour
- Équipes sans infrastructure GPU — pas d'API managée de DeepReinforce ; vous devez provisionner et maintenir vos propres serveurs d'inférence
- Chat généraliste ou tâches non liées au codage — fortement spécialisé pour les harnais de codage agentique ; non benchmarké pour la conversation, la rédaction ou l'usage multimodal
- Déploiement en production avec SLA de fiabilité — d'un nouveau labo sans service managé, données d'adoption communautaire limitées et revendications de benchmark non vérifiées
Performances par tâche
Codage agentique (utilisation d'outils multi-étapes)
SOTA parmi les modèles open source ; 397B bat Claude Opus 4.7 sur TB-2.1 et SWE-Bench Verified. Simon Willison a vérifié indépendamment un comportement multi-appels d'outils compétent.
Génération de code
Solide sur SWE-Bench Verified (82,4) et NL2Repo (48,2). Compétitif avec les modèles fermés frontière mais derrière Claude Opus 4.8 et GLM-5.2 sur les benchmarks de génération brute.
Débogage et correction de bugs
Bon score SWE-Bench Pro (62,2) et solides résultats SWE Atlas. Gère bien la localisation de bugs multi-fichiers et les correctifs pilotés par les tests.
Refactorisation multi-fichiers
Conçu pour les tâches à l'échelle du dépôt. La fenêtre de contexte de 256K permet de travailler sur de grandes codebases. Solide sur SWE-Bench Multilingual (78,9).
Inférence locale/edge
La variante 9B (69,4 sur SWE-Bench Verified) surpasse largement sa catégorie, égalant les modèles de classe 31B. Quants GGUF disponibles pour llama.cpp et Ollama.
Tarifs
Entrée
Free (MIT license)
Sortie
Free (MIT license)
Contexte
256K tokens
Tests de performance
Aucun changement de verdict pour l’instant
L’horloge tourne dès le premier jour : les changements apparaîtront ici à mesure que notre verdict évolue.
Sources
- Simon Willison — Ornith-1.0: Self-Scaffolding LLMs for Agentic Codingjuin 2026
- DeepReinforce Official Announcementjuin 2026
- Hugging Face — Ornith-1.0-397B Model Cardjuin 2026
- Hugging Face — Ornith-1.0-9B Model Cardjuin 2026
- GitHub — Ornith-1 Repositoryjuin 2026
- MarkTechPost — DeepReinforce Releases Ornith-1.0juin 2026
- TechTimes — Open-Source Coding Model Ornith-1.0 Writes Its Own Training Scaffoldjuin 2026
- LLM Reference — Ornith 1.0juin 2026
Journal de vérification
- Tarifs— Aucun changement
Agent automatisé
- Tarifs— Aucun changement
Agent automatisé
- Tarifs— Aucun changement
Agent automatisé
- Profil— Aucun changement
Importé au lancement
- Tarifs— Aucun changement
Importé au lancement