O

Ornith-1.0

DeepReinforce · Lanzado jun 2026

Condicional

Una sólida familia de modelos de código agentivo de código abierto con licencia MIT que logra benchmarks competitivos con la frontera — supera a Claude Opus 4.7 tanto en Terminal-Bench 2.1 como en SWE-Bench Verified — pero requiere self-hosting con recursos GPU significativos y proviene de un laboratorio nuevo con un historial limitado.

¿Es adecuada para ti?

Bueno para

  • Codificación agentiva con uso de herramientas en múltiples pasos — supera a Claude Opus 4.7 en Terminal-Bench 2.1 (77.5 vs 70.3) y SWE-Bench Verified (82.4 vs 80.8)
  • Agentes de codificación autoalojados con privacidad total de datos — licencia MIT, sin dependencia de API, se ejecuta en tu propia infraestructura
  • Despliegue en el borde con la variante de 9B — iguala o supera a Gemma 4-31B en SWE-Bench Verified (69.4 vs 52) funcionando en una sola GPU de consumo
  • El entrenamiento RL con auto-andamiaje produce estrategias por tarea que superan a los entornos fijos diseñados por humanos en benchmarks de codificación agentiva

No recomendado para

  • Equipos sin infraestructura GPU — no hay API gestionada de DeepReinforce; debes aprovisionar y mantener tus propios servidores de inferencia
  • Chat de propósito general o tareas no relacionadas con código — altamente especializado en entornos de codificación agentiva; sin benchmarks ni ajuste para conversación, escritura o uso multimodal
  • Despliegue en producción con SLAs de fiabilidad — de un laboratorio nuevo sin servicio gestionado, con datos limitados de adopción comunitaria y afirmaciones de benchmarks no verificadas

Rendimiento por tarea

Codificación agentiva (uso de herramientas en múltiples pasos)

Excellent

SOTA entre modelos de código abierto; 397B supera a Claude Opus 4.7 tanto en TB-2.1 como en SWE-Bench Verified. Simon Willison verificó de forma independiente un comportamiento competente con múltiples herramientas.

Generación de código

Very Good

Sólido en SWE-Bench Verified (82.4) y NL2Repo (48.2). Competitivo con modelos cerrados de frontera pero por detrás de Claude Opus 4.8 y GLM-5.2 en benchmarks de generación pura.

Depuración y corrección de errores

Very Good

Buena puntuación en SWE-Bench Pro (62.2) y sólidos resultados en SWE Atlas. Maneja bien la localización de errores en múltiples archivos y parches guiados por tests.

Refactorización multiarchivo

Very Good

Diseñado para tareas a escala de repositorio. La ventana de contexto de 256K permite trabajar en bases de código grandes. Sólido en SWE-Bench Multilingual (78.9).

Inferencia local/en el borde

Excellent

La variante de 9B (69.4 en SWE-Bench Verified) rinde muy por encima de su categoría, igualando a modelos de clase 31B. Cuantizaciones GGUF disponibles para llama.cpp y Ollama.

Precios

Entrada

Free (MIT license)

Salida

Free (MIT license)

Contexto

256K tokens

Ver precios completos

Pruebas de rendimiento

PruebaPuntuaciónFuente
SWE-Bench Verified82.4 Fuente
Terminal-Bench 2.1 (Terminus-2)77.5 Fuente
SWE-Bench Pro62.2 Fuente
SWE-Bench Multilingual78.9 Fuente

Aún no hay cambios de veredicto

El reloj corre desde el primer día: los cambios aparecerán aquí a medida que evolucione nuestro veredicto.

Registro de verificación

  • Precios— Sin cambios

    Agente automatizado

  • Precios— Sin cambios

    Agente automatizado

  • Precios— Sin cambios

    Agente automatizado

  • Perfil— Sin cambios

    Importado en el lanzamiento

  • Precios— Sin cambios

    Importado en el lanzamiento

Cómo evaluamos