Ornith-1.0
DeepReinforce · Lanzado jun 2026
Una sólida familia de modelos de código agentivo de código abierto con licencia MIT que logra benchmarks competitivos con la frontera — supera a Claude Opus 4.7 tanto en Terminal-Bench 2.1 como en SWE-Bench Verified — pero requiere self-hosting con recursos GPU significativos y proviene de un laboratorio nuevo con un historial limitado.
¿Es adecuada para ti?
Bueno para
- Codificación agentiva con uso de herramientas en múltiples pasos — supera a Claude Opus 4.7 en Terminal-Bench 2.1 (77.5 vs 70.3) y SWE-Bench Verified (82.4 vs 80.8)
- Agentes de codificación autoalojados con privacidad total de datos — licencia MIT, sin dependencia de API, se ejecuta en tu propia infraestructura
- Despliegue en el borde con la variante de 9B — iguala o supera a Gemma 4-31B en SWE-Bench Verified (69.4 vs 52) funcionando en una sola GPU de consumo
- El entrenamiento RL con auto-andamiaje produce estrategias por tarea que superan a los entornos fijos diseñados por humanos en benchmarks de codificación agentiva
No recomendado para
- Equipos sin infraestructura GPU — no hay API gestionada de DeepReinforce; debes aprovisionar y mantener tus propios servidores de inferencia
- Chat de propósito general o tareas no relacionadas con código — altamente especializado en entornos de codificación agentiva; sin benchmarks ni ajuste para conversación, escritura o uso multimodal
- Despliegue en producción con SLAs de fiabilidad — de un laboratorio nuevo sin servicio gestionado, con datos limitados de adopción comunitaria y afirmaciones de benchmarks no verificadas
Rendimiento por tarea
Codificación agentiva (uso de herramientas en múltiples pasos)
SOTA entre modelos de código abierto; 397B supera a Claude Opus 4.7 tanto en TB-2.1 como en SWE-Bench Verified. Simon Willison verificó de forma independiente un comportamiento competente con múltiples herramientas.
Generación de código
Sólido en SWE-Bench Verified (82.4) y NL2Repo (48.2). Competitivo con modelos cerrados de frontera pero por detrás de Claude Opus 4.8 y GLM-5.2 en benchmarks de generación pura.
Depuración y corrección de errores
Buena puntuación en SWE-Bench Pro (62.2) y sólidos resultados en SWE Atlas. Maneja bien la localización de errores en múltiples archivos y parches guiados por tests.
Refactorización multiarchivo
Diseñado para tareas a escala de repositorio. La ventana de contexto de 256K permite trabajar en bases de código grandes. Sólido en SWE-Bench Multilingual (78.9).
Inferencia local/en el borde
La variante de 9B (69.4 en SWE-Bench Verified) rinde muy por encima de su categoría, igualando a modelos de clase 31B. Cuantizaciones GGUF disponibles para llama.cpp y Ollama.
Precios
Entrada
Free (MIT license)
Salida
Free (MIT license)
Contexto
256K tokens
Pruebas de rendimiento
Aún no hay cambios de veredicto
El reloj corre desde el primer día: los cambios aparecerán aquí a medida que evolucione nuestro veredicto.
Fuentes
- Simon Willison — Ornith-1.0: Self-Scaffolding LLMs for Agentic Codingjun 2026
- DeepReinforce Official Announcementjun 2026
- Hugging Face — Ornith-1.0-397B Model Cardjun 2026
- Hugging Face — Ornith-1.0-9B Model Cardjun 2026
- GitHub — Ornith-1 Repositoryjun 2026
- MarkTechPost — DeepReinforce Releases Ornith-1.0jun 2026
- TechTimes — Open-Source Coding Model Ornith-1.0 Writes Its Own Training Scaffoldjun 2026
- LLM Reference — Ornith 1.0jun 2026
Registro de verificación
- Precios— Sin cambios
Agente automatizado
- Precios— Sin cambios
Agente automatizado
- Precios— Sin cambios
Agente automatizado
- Perfil— Sin cambios
Importado en el lanzamiento
- Precios— Sin cambios
Importado en el lanzamiento