Ornith-1.0
DeepReinforce · Lançado 06/2026
Uma família de modelos open-source para programação agentiva com licença MIT que entrega resultados comparáveis aos melhores modelos — superando o Claude Opus 4.7 tanto no Terminal-Bench 2.1 quanto no SWE-Bench Verified — mas exige self-hosting com recursos significativos de GPU e vem de um laboratório novo com histórico limitado.
É adequada para ti?
Bom para
- Codificação agêntica com chamada de ferramentas multi-etapa — supera o Claude Opus 4.7 no Terminal-Bench 2.1 (77,5 vs 70,3) e SWE-Bench Verified (82,4 vs 80,8)
- Agentes de código self-hosted com total privacidade de dados — licença MIT, sem dependência de API, executa na sua própria infraestrutura
- Implantação edge com a variante de 9B — iguala ou supera o Gemma 4-31B no SWE-Bench Verified (69,4 vs 52) cabendo numa única GPU de consumo
- Treino RL com self-scaffolding produz estratégias por tarefa que superam harnesses fixos desenhados por humanos em benchmarks de codificação agêntica
Não recomendado para
- Equipas sem infraestrutura de GPU — sem API gerida da DeepReinforce; tem de provisionar e manter os seus próprios servidores de inferência
- Chat de uso geral ou tarefas não relacionadas com código — fortemente especializado para harnesses de codificação agêntica; não avaliado nem ajustado para conversa, escrita ou uso multimodal
- Implantação em produção com SLAs de fiabilidade — de um laboratório novo sem serviço gerido, dados limitados de adoção pela comunidade e alegações de benchmark não verificadas
Desempenho por tarefa
Codificação agêntica (uso de ferramentas multi-etapa)
SOTA entre modelos open-source; 397B supera o Claude Opus 4.7 tanto no TB-2.1 como no SWE-Bench Verified. Simon Willison verificou independentemente comportamento proficiente de chamada multi-ferramenta.
Geração de código
Forte no SWE-Bench Verified (82,4) e NL2Repo (48,2). Competitivo com modelos fechados de fronteira mas fica atrás do Claude Opus 4.8 e GLM-5.2 em benchmarks de geração pura.
Depuração de código e correção de bugs
Sólida pontuação no SWE-Bench Pro (62,2) e fortes resultados no SWE Atlas. Lida bem com localização de bugs multi-ficheiro e patches orientados a testes.
Refatoração multi-ficheiro
Concebido para tarefas à escala de repositório. A janela de contexto de 256K permite trabalhar em grandes bases de código. Forte no SWE-Bench Multilingual (78,9).
Inferência local/edge
A variante de 9B (69,4 no SWE-Bench Verified) está muito acima da sua classe de peso, igualando modelos da classe 31B. Quants GGUF disponíveis para llama.cpp e Ollama.
Preços
Entrada
Free (MIT license)
Saída
Free (MIT license)
Contexto
256K tokens
Testes de desempenho
Ainda sem alterações de veredicto
O relógio começa a contar no primeiro dia: as alterações aparecem aqui à medida que o nosso veredicto evolui.
Fontes
- Simon Willison — Ornith-1.0: Self-Scaffolding LLMs for Agentic Coding06/2026
- DeepReinforce Official Announcement06/2026
- Hugging Face — Ornith-1.0-397B Model Card06/2026
- Hugging Face — Ornith-1.0-9B Model Card06/2026
- GitHub — Ornith-1 Repository06/2026
- MarkTechPost — DeepReinforce Releases Ornith-1.006/2026
- TechTimes — Open-Source Coding Model Ornith-1.0 Writes Its Own Training Scaffold06/2026
- LLM Reference — Ornith 1.006/2026
Registo de verificação
- Preços— Sem alterações
Agente automatizado
- Preços— Sem alterações
Agente automatizado
- Preços— Sem alterações
Agente automatizado
- Perfil— Sem alterações
Importado no lançamento
- Preços— Sem alterações
Importado no lançamento