O

Ornith-1.0

DeepReinforce · Lançado 06/2026

Condicional

Uma família de modelos open-source para programação agentiva com licença MIT que entrega resultados comparáveis aos melhores modelos — superando o Claude Opus 4.7 tanto no Terminal-Bench 2.1 quanto no SWE-Bench Verified — mas exige self-hosting com recursos significativos de GPU e vem de um laboratório novo com histórico limitado.

É adequada para ti?

Bom para

  • Codificação agêntica com chamada de ferramentas multi-etapa — supera o Claude Opus 4.7 no Terminal-Bench 2.1 (77,5 vs 70,3) e SWE-Bench Verified (82,4 vs 80,8)
  • Agentes de código self-hosted com total privacidade de dados — licença MIT, sem dependência de API, executa na sua própria infraestrutura
  • Implantação edge com a variante de 9B — iguala ou supera o Gemma 4-31B no SWE-Bench Verified (69,4 vs 52) cabendo numa única GPU de consumo
  • Treino RL com self-scaffolding produz estratégias por tarefa que superam harnesses fixos desenhados por humanos em benchmarks de codificação agêntica

Não recomendado para

  • Equipas sem infraestrutura de GPU — sem API gerida da DeepReinforce; tem de provisionar e manter os seus próprios servidores de inferência
  • Chat de uso geral ou tarefas não relacionadas com código — fortemente especializado para harnesses de codificação agêntica; não avaliado nem ajustado para conversa, escrita ou uso multimodal
  • Implantação em produção com SLAs de fiabilidade — de um laboratório novo sem serviço gerido, dados limitados de adoção pela comunidade e alegações de benchmark não verificadas

Desempenho por tarefa

Codificação agêntica (uso de ferramentas multi-etapa)

Excellent

SOTA entre modelos open-source; 397B supera o Claude Opus 4.7 tanto no TB-2.1 como no SWE-Bench Verified. Simon Willison verificou independentemente comportamento proficiente de chamada multi-ferramenta.

Geração de código

Very Good

Forte no SWE-Bench Verified (82,4) e NL2Repo (48,2). Competitivo com modelos fechados de fronteira mas fica atrás do Claude Opus 4.8 e GLM-5.2 em benchmarks de geração pura.

Depuração de código e correção de bugs

Very Good

Sólida pontuação no SWE-Bench Pro (62,2) e fortes resultados no SWE Atlas. Lida bem com localização de bugs multi-ficheiro e patches orientados a testes.

Refatoração multi-ficheiro

Very Good

Concebido para tarefas à escala de repositório. A janela de contexto de 256K permite trabalhar em grandes bases de código. Forte no SWE-Bench Multilingual (78,9).

Inferência local/edge

Excellent

A variante de 9B (69,4 no SWE-Bench Verified) está muito acima da sua classe de peso, igualando modelos da classe 31B. Quants GGUF disponíveis para llama.cpp e Ollama.

Preços

Entrada

Free (MIT license)

Saída

Free (MIT license)

Contexto

256K tokens

Ver preços completos

Testes de desempenho

TestePontuaçãoFonte
SWE-Bench Verified82.4 Fonte
Terminal-Bench 2.1 (Terminus-2)77.5 Fonte
SWE-Bench Pro62.2 Fonte
SWE-Bench Multilingual78.9 Fonte

Ainda sem alterações de veredicto

O relógio começa a contar no primeiro dia: as alterações aparecem aqui à medida que o nosso veredicto evolui.

Registo de verificação

  • Preços— Sem alterações

    Agente automatizado

  • Preços— Sem alterações

    Agente automatizado

  • Preços— Sem alterações

    Agente automatizado

  • Perfil— Sem alterações

    Importado no lançamento

  • Preços— Sem alterações

    Importado no lançamento

Como avaliamos