Modelos de IA
54Encontra o modelo certo para a tua tarefa. Filtra por pontos fortes, compara preços e decide.
Filtrar por fornecedor
Astra
OpenAI
Primeiro modelo a acionar o limite "Critical" de cibersegurança da OpenAI. Resolveu 10 problemas abertos de matemática por aproximadamente $2.000. Desenvolvimento ativamente pausado em agosto de 2026 para reforço de segurança.
- Entrada
- Not yet published
- Saída
- Not yet published
- Contexto
- Development slowed Aug 2026. No GA date.
Claude Fable 5
Anthropic
Modelo de fronteira da classe Mythos da Anthropic — o Claude mais forte disponível publicamente até hoje, liderando todos os principais benchmarks no lançamento. O veredicto permanece CONDITIONAL por duas restrições ativas: preço apenas por créditos a $10/$50 por 1M de tokens sem opção de assinatura, e um classificador de segurança que dispara em excesso em tarefas rotineiras de código, redirecionando-as silenciosamente para um fallback no Opus 4.8. Recorra ao Fable 5 quando o delta de capacidade justificar o custo; para trabalho rotineiro, o Sonnet 5 é a alternativa mais previsível.
- Entrada
- $10 / 1M tokens
- Saída
- $50 / 1M tokens
- Contexto
- 1M context, 128K max output
Claude Haiku 4.5
Anthropic
A referência de custo-benefício da Anthropic a $1/$5 por 1M de tokens — o nível rápido e barato contra o qual os concorrentes se comparam, com contexto de 200K e saída de 64K. Melhor para trabalho de alto volume e sensível à latência: classificação, extração, sumarização, roteamento. Recorra ao Opus 4.8 ou ao Sonnet 5 quando for necessário raciocínio profundo em múltiplas etapas.
- Entrada
- $1 / 1M tokens
- Saída
- $5 / 1M tokens
- Contexto
- 200K tokens
Claude Opus 4.8
Anthropic
O modelo de raciocínio carro-chefe da Anthropic e o incumbente prático da fronteira em capacidade implantável — contexto de 1M tokens a $5/$25 por 1M de tokens, incluído em todos os planos de assinatura. Nossa escolha para trabalho intensivo em revisão: revisão de código, refatoração sob restrições e tarefas de ritmo deliberado. Codificação agêntica forte, raciocínio analítico de primeira linha e acesso estável por assinatura fazem dele o carro-chefe padrão para a maioria das equipes em produção.
- Entrada
- $5 / 1M tokens
- Saída
- $25 / 1M tokens
- Contexto
- 1M tokens
Claude Opus 5
Anthropic
Inteligência quase no nível do Fable 5 pela metade do preço. SOTA no Frontier-Bench e CursorBench. 85% menos salvaguardas cibernéticas que o Fable 5. O cavalo de batalha dos modelos de fronteira para codificação do dia a dia.
- Entrada
- $5.00 / 1M tokens
- Saída
- $25.00 / 1M tokens
- Contexto
- 200K tokens
Claude Sonnet 4.6
Anthropic
Superado pelo Claude Sonnet 5 (lançado em 30 de junho de 2026) como o cavalo de batalha padrão de nível médio. O preço de $3/$15 e o contexto de 1M tokens do Sonnet 4.6 agora são igualados por um sucessor com um salto de 13,4 pontos no Terminal-Bench 2.1 pela mesma tabela de preços. Escolha o 4.6 apenas para implantações fixadas ou onde os ~30% a mais de tokens do Sonnet 5 e a remoção de temperature/top_p/top_k sejam desclassificantes.
- Entrada
- $3 / 1M tokens
- Saída
- $15 / 1M tokens
- Contexto
- 1M tokens
Claude Sonnet 5
Anthropic
O Sonnet mais agêntico da Anthropic entrega desempenho próximo ao do Opus 4.8 por cerca de metade do preço, com +13,4 pontos no Terminal-Bench 2.1 sobre o Sonnet 4.6. O novo tokenizador infla as contagens em ~30%, então o preço introdutório ($2/$10 por MTok até 31 de agosto) mantém a migração neutra em custo, mas as equipes devem recalcular os orçamentos antes de trocar. Ele substitui o Sonnet 4.6 como padrão em todos os planos Claude, ideal para codificação agêntica, depuração brownfield e pipelines de produção — não para as tarefas mais difíceis de raciocínio de fronteira ou cibersegurança.
- Entrada
- $3 / 1M
- Saída
- $15 / 1M
- Contexto
- 1M tokens
DeepSeek V4 Flash
DeepSeek
DeepSeek's volume-tier open-weight model at 284B parameters (13B active MoE) with a 1M-token context window. SWE-bench Verified 79.0% at $0.22 input and $0.66 output per 1M tokens off-peak, doubling during the seven daily peak hours. The August 2026 price rise ended its run as the cheapest credible API (GPT-5.6 Luna now undercuts it on input at $0.20), but it remains a strong value pick, and the MIT license means self-hosting sidesteps API pricing entirely. Still the default workhorse for high-throughput agent pipelines that can run off-peak.
- Entrada
- $0.22 / 1M tokens
- Saída
- $0.66 / 1M tokens
- Contexto
- 1M tokens. Peak 2x: 01-04 + 06-10 UTC
DeepSeek V4 Pro
DeepSeek
The strongest open-weight coding model we've tested: SWE-bench Verified 80.6%, LiveCodeBench 93.5% and 3206 Codeforces Elo. At $0.66 input and $1.98 output per 1M tokens off-peak it stays far below Western flagship pricing even after the August 2026 rise, though rates double during the seven daily peak hours. The default for self-hosted agentic coding.
- Entrada
- $0.66 / 1M tokens
- Saída
- $1.98 / 1M tokens
- Contexto
- 1M tokens. Peak 2x: 01-04 + 06-10 UTC
FLUX 3
Black Forest Labs
Modelo fundamental multimodal unificado para imagem, vídeo, áudio e previsão de ações.
- Entrada
- Not yet published
- Saída
- Not yet published
- Contexto
- Gated early access
GLM-5.2
Z.ai
Melhor modelo de código com pesos abertos, 1M tokens de contexto e licença MIT — supera o GPT-5.5 em múltiplos benchmarks por uma fração do custo, mas ainda fica atrás do Claude Opus 4.8 nas tarefas mais difíceis de longa duração.
- Entrada
- $1.40 / 1M tokens
- Saída
- $4.40 / 1M tokens
- Contexto
- 1M tokens
GLM-5.3
Z.ai
O GLM-5.3 é o mais recente modelo de pesos abertos de código e ciberdefesa da Z.ai — a mesma base do GLM-5.2, com todos os ganhos vindos do pós-treinamento. Mas os números de destaque ainda são executados pelo fornecedor, os pesos abertos estão retidos por ~2 semanas por causa da capacidade de segurança emergente, e o preço por token não foi publicado. Use-o já para segurança defensiva e automação agêntica; aguarde os pesos e auditorias independentes antes de padronizar.
- Entrada
- N/A (rate not yet published)
- Saída
- N/A (rate not yet published)
- Contexto
- 1M context
GPT-4.1
OpenAI
O destino padrão de migração para cargas de trabalho do GPT-4 Turbo: mesmo formato de requisição, custo menor, contexto de 1M tokens — converta payloads legados de function_call para o formato tools e siga em frente.
- Entrada
- $2 / 1M tokens
- Saída
- $8 / 1M tokens
- Contexto
- 1M tokens
GPT-4o (Retired from ChatGPT, API-only)
OpenAI
GPT-4o (May 2024) has been superseded by the GPT-5.x family and delisted from OpenAI's flagship API pricing page. It remains available through the API but is no longer a current-generation model. Use only where migration to GPT-5.x is blocked; otherwise, GPT-5.5 or GPT-5.4 offer better performance at comparable cost.
- Entrada
- $2.50 / 1M tokens
- Saída
- $10 / 1M tokens
- Contexto
- 128K tokens
GPT-5.5
OpenAI
O modelo fronteira comercial de uso geral da OpenAI e a âncora implantável da OpenAI enquanto a família GPT-5.6 permanece sob restrição governamental — $5/$30 por 1M de tokens com contexto de 1M+. Raciocínio sólido, amplo suporte ao ecossistema e disponibilidade pública total fazem dele um padrão de produção confiável, embora modelos mais baratos agora o igualem em tarefas específicas. Para a maioria das equipes, ele continua sendo a referência pela qual os novos modelos são medidos.
- Entrada
- $5 / 1M tokens
- Saída
- $30 / 1M tokens
- Contexto
- 1M+ tokens (922K in / 128K out)
GPT-5.5-Cyber
OpenAI
85,6% no CyberGym — maior pontuação de modelo único — mas acesso restrito apenas para defensores credenciados.
- Entrada
- N/A
- Saída
- N/A
- Contexto
- Trusted Access for Cyber; not commercial API
GPT-5.6 Luna
OpenAI
GPT-5.6 Luna is OpenAI's budget tier — near-GPT-5.5 capability at $1/$6 per 1M tokens, the strongest capability-per-dollar value in the GPT-5.6 family. Now generally available via API and Codex after the July 9 government-gate lift. Remains conditional: all benchmarks are vendor-reported, Luna lacks activation classifiers, and it is not in the standard ChatGPT picker.
- Entrada
- $0.20 / 1M tokens
- Saída
- $1.20 / 1M tokens
- Contexto
- Fastest tier. 80% cut Jul 30 → $0.20/$1.20.
GPT-5.6 Sol
OpenAI
O GPT-5.6 Sol é o modelo de fronteira mais custo-efetivo, liderando em benchmarks de codificação e competitivo em raciocínio complexo a uma fração do custo dos concorrentes. O veredicto é reforçado pela divulgação do endurecimento de segurança GPT-Red — o modelo foi treinado adversarialmente contra um modelo dedicado de red-teaming por RL de auto-jogo em escala de fronteira, tornando-o 6x mais robusto a injeções de prompt.
- Entrada
- $5 / 1M tokens
- Saída
- $30 / 1M tokens
- Contexto
- Same $5/$30. Fast mode: 2.5× at 2× cost.
GPT-5.6 Terra
OpenAI
GPT-5.6 Terra is OpenAI's mid-tier workhorse — GPT-5.5-class capability at half the cost ($2.50/$15 per 1M tokens). Now generally available via API and Codex after the July 9 government-gate lift. Remains conditional: all benchmarks are vendor-reported without independent reproduction, and Terra is not selectable in the standard ChatGPT model picker.
- Entrada
- $2.00 / 1M tokens
- Saída
- $12.00 / 1M tokens
- Contexto
- Mid-tier. 20% cut Jul 30 → $2.00/$12.00.
GPT-5.6-Cyber
OpenAI
O GPT-5.6-Cyber é o modelo de cibersegurança da OpenAI treinado especificamente para esse fim, construído sobre o GPT-5.6 Sol e disponível exclusivamente através do programa restrito Daybreak Red. É o primeiro modelo a atingir o limiar 'Alto' de capacidade cibernética da OpenAI, com desempenho em cadeias de exploit e zero-day que supera em muito os modelos de propósito geral.
- Entrada
- $12.50 / 1M tokens
- Saída
- $75 / 1M tokens
- Contexto
- 400K tokens
GPT-Live-1
OpenAI
O primeiro modelo de voz full-duplex da OpenAI — ouve e fala simultaneamente, um salto além do Advanced Voice Mode baseado em turnos.
- Entrada
- ChatGPT subscription
- Saída
- ChatGPT subscription
- Contexto
- ChatGPT Voice only
GPT-Live-1 mini
OpenAI
A variante gratuita do GPT-Live-1 — mesma arquitetura duplex completo em um pacote menor e mais rápido, servindo como modelo de voz padrão para usuários do ChatGPT Free. Compartilha as inovações principais: interação contínua, suporte a wake word e delegação ao GPT-5.5. As mesmas limitações se aplicam: sem API, qualidade de idioma desigual. Uma atualização substancial em relação ao antigo modo de voz baseado em turnos para usuários gratuitos.
- Entrada
- Free (ChatGPT)
- Saída
- Free (ChatGPT)
- Contexto
- ChatGPT Voice only
GPT-Live-Transcribe
OpenAI
O modelo de voz para texto com streaming de baixa latência da OpenAI entrega deltas de transcrição ao vivo a US$ 0,017/min com latência ajustável e transcrição sensível a contexto.
- Entrada
- $0.017 / minute
- Saída
- N/A
- Contexto
- Per-minute realtime audio billing
GPT-Transcribe
OpenAI
O mais recente modelo de transcrição de fala em lote da OpenAI pontua 3,31% AA-WER a $0,0045/min — 25% mais barato e mensuravelmente mais preciso que seu antecessor gpt-4o-transcribe. Suporta prompts de contexto, dicas de palavras-chave e detecção de idioma em mais de 22 idiomas, tornando-o a melhor opção padrão para transcrição assíncrona de arquivos na plataforma OpenAI. Ressalva: sem diarização ou timestamps em nível de palavra; use gpt-4o-transcribe-diarize para rótulos de falante ou gpt-live-transcribe para necessidades em tempo real. Melhor para desenvolvedores criando transcrição de reuniões, processamento de mídia e interfaces de voz na API da OpenAI.
- Entrada
- $0.0045 / minute
- Saída
- N/A
- Contexto
- Per-minute audio billing
Gemini 2.5 Pro
Agora a escolha econômica para contexto longo: um corte de 40% no preço (junho de 2026) tornou as análises de corpus completo acessíveis para orçamentos médios — a maior janela de contexto disponível com forte integração ao ecossistema Google.
- Entrada
- $1.25 / 1M tokens
- Saída
- $10 / 1M tokens
- Contexto
- 1M tokens
Gemini 3.1 Pro
O modelo Pro mais capaz do Google disponível publicamente, com contexto de 1M tokens a preços competitivos. Geração anterior: Gemini 3.6 e 3.5 Flash agora o superam em benchmarks de codificação e agentes com custo menor. Mantenha-o no Google Cloud/Vertex AI; caso contrário, a linha Flash ou os concorrentes entregam mais.
- Entrada
- $2 / 1M
- Saída
- $12 / 1M
- Contexto
- 1M tokens
Gemini 3.5 Flash
O destaque de eficiência de custos do Google para automação agêntica de desktop a $1,50/$9 por 1M de tokens com contexto de ~1M. O Computer Use nativo atinge 78,4 no OSWorld-Verified — a apenas 0,3 pontos do GPT-5.5 por aproximadamente um terço do custo. A ressalva relevante: a ferramenta Computer Use é uma prévia pública que ainda não está na API de produção, portanto verifique a disponibilidade do endpoint antes de integrá-la.
- Entrada
- $1.50 / 1M tokens
- Saída
- $9 / 1M tokens
- Contexto
- 1M tokens
Gemini 3.5 Flash Cyber
O Gemini 3.5 Flash Cyber é o primeiro modelo do Google especializado em cibersegurança, com fine-tune do 3.5 Flash para encontrar, validar e corrigir vulnerabilidades. Dentro da arquitetura multiagente do CodeMender, ele atinge desempenho competitivo no CyberGym contra modelos muito maiores como o Mythos por uma fração do custo. Mas as restrições são severas: roda exclusivamente dentro do CodeMender, disponível apenas para governos e parceiros confiáveis através de um piloto de acesso limitado, sem API pública, sem números de benchmark publicados e sem cronograma para lançamento mais amplo.
- Entrada
- N/A
- Saída
- N/A
- Contexto
- CodeMender-only, government-gated pilot
Gemini 3.5 Flash-Lite
O Gemini 3.5 Flash-Lite é o modelo mais rápido e barato da série 3.5 do Google, a 350 tok/s e $0,30/$2,50. O salto geracional em relação ao 3.1 Flash-Lite é a verdadeira história — ele supera dramaticamente seu antecessor em benchmarks agênticos chave e vence o Gemini 3 Flash completo em tarefas de codificação e uso de computador. Para desenvolvedores escalando subagentes agênticos de alta vazão, pipelines de busca e processamento de documentos, a relação preço-desempenho do Flash-Lite é inigualável na linha do Google.
- Entrada
- $0.30 / 1M
- Saída
- $2.50 / 1M
- Contexto
- 1M context, 64K output, 350 tok/s
Gemini 3.5 Pro
O modelo de fronteira pré-GA do Google — agora em seu quarto adiamento e 'meses atrasado' segundo a Bloomberg. O contexto de 2M tokens, o pipeline multimodal nativo e o raciocínio Deep Think continuam sendo capacidades reais, mas não há um cronograma de GA confirmado. A capacidade de codificação é a principal deficiência.
- Entrada
- Not yet published
- Saída
- Not yet published
- Contexto
- Est. $5-15/$30-60 per 1M. 2M ctx. Not GA.
Gemini 3.6 Flash
O Gemini 3.6 Flash é o novo modelo de trabalho padrão da linha Flash do Google — é melhor e mais barato que o 3.5 Flash, pontuando mais alto em todos os benchmarks enquanto reduz o preço de saída de $9,00 para $7,50 por milhão de tokens. O ganho de 17% em eficiência de tokens significa menor custo por tarefa mesmo antes do corte de preço, e o Computer Use integrado via API o torna uma opção crível de codificação agêntica. Para desenvolvedores no ecossistema Google, este é o upgrade evidente — não há motivo para permanecer no 3.5 Flash.
- Entrada
- $1.50 / 1M
- Saída
- $7.50 / 1M
- Contexto
- 1M context, 64K output
Gemini 3.7 Flash
O Gemini 3.7 Flash é o cavalo de batalha Flash mais forte do Google até agora para código e agentes — um avanço genuíno em relação ao 3.6 Flash pela metade do preço anterior até 2026. Ele ainda fica atrás da fronteira nas tarefas mais difíceis de terminal e uso de computador. Um upgrade claro para construtores de agentes sensíveis a custo e do ecossistema Google; não é um substituto de código de fronteira.
- Entrada
- $0.75 / 1M
- Saída
- $3.75 / 1M
- Contexto
- 1M context, 64K output
Gemini 3.8 Flash
Gemini 3.8 Flash is Google's strongest Flash workhorse yet — a genuine capability upgrade over the recommended 3.7 Flash at the same introductory price, with real gains across software engineering, agents and professional domains. The deciding caveat is Google's own: 3.8 "works harder," so per-task token burn runs well above 3.7, which remains the efficiency-first pick. Adopt 3.8 for long-horizon coding, agents and finance or legal work — benchmark your own workload before the intro price expires.
- Entrada
- $0.75 / 1M
- Saída
- $3.75 / 1M
- Contexto
- 1M context, 64K output
Gemini 4
Modelo de próxima geração confirmado pelo Google DeepMind. Pré-treinamento iniciado em 21 de julho de 2026. Sem benchmarks, sem preços, sem especificações, sem data de GA.
- Entrada
- Not yet published
- Saída
- Not yet published
- Contexto
- Pre-training started Jul 2026. No GA date.
Grok 4.5
SpaceXAI
Modelo de codificação agêntica com preço competitivo a US$ 2/US$ 6 por 1M de tokens com 500K de contexto — os benchmarks publicados pela xAI o colocam no meio do pelotão, atrás do Fable 5 e GPT-5.5, embora lidere sobre o Opus 4.8 no DeepSWE e Terminal-Bench 2.1. A verdadeira história é a eficiência de custo: 4,2× mais eficiente em tokens que o Opus 4.8 no SWE-Bench Pro. Melhor para equipes que precisam de codificação forte por uma fração dos preços de fronteira. Ainda não disponível na UE.
- Entrada
- $2 / 1M tokens
- Saída
- $6 / 1M tokens
- Contexto
- 500K tokens
Grok 4.6
SpaceXAI
Competitivo com a fronteira a $2/$6, com 61 no Índice de Inteligência AA (empata com o GPT-5.6 Sol) e GDPVal-AA atrás apenas do Claude Opus 5 — forte logo de saída, mas com uma única camada de avaliação e um dia de vida, então segure as apostas de produção até que benchmarks mais amplos cheguem.
- Entrada
- $2.00 / 1M tokens
- Saída
- $6.00 / 1M tokens
- Contexto
- Delayed past Aug 7. Now ~Aug 10-14. 500K ctx.
Grok Voice Think Fast 2.0
SpaceXAI
O modelo de voz speech-to-speech de última geração da SpaceXAI com uma arquitetura de raciocínio paralelo que o torna substancialmente mais inteligente que os modelos de voz convencionais.
- Entrada
- $0.08 / min of audio (speech-to-speech)
- Saída
- Included in speech-to-speech rate
- Contexto
- API-only
Hy3
Tencent
Modelo agêntico MoE de pesos abertos Apache 2.0 (295B total, 21B ativos) com forte confiabilidade em chamadas de ferramentas e comportamento anti-alucinação, mas a codificação fica atrás do GLM-5.2 e o self-hosting exige 8+ GPUs. Nível gratuito no OpenRouter até 21 de julho — depois $0,20/$0,80 por 1M de tokens. Ideal para agentes de programação self-hosted e trabalho com documentos de contexto longo, onde licenciamento permissivo importa mais do que pontuações absolutas em benchmarks.
- Entrada
- $0.20 / 1M
- Saída
- $0.80 / 1M
- Contexto
- 256K tokens
Inkling
Thinking Machines Lab
O Inkling é a razão mais forte até agora para levar a sério a IA multimodal de pesos abertos. Ele oferece raciocínio e codificação competitivos com a melhor segurança de pesos abertos da categoria e esforço de raciocínio controlável, tudo sob Apache 2.0. Mas a Thinking Machines é honesta ao admitir que não é o mais forte em termos gerais — a factualidade deixa a desejar (SimpleQA 43,9%) e a auto-hospedagem exige hardware sério (2TB VRAM). Condicional: uma base atraente para organizações que precisam possuir e ajustar um modelo multimodal, não para equipes que buscam desempenho máximo pronto para uso.
- Entrada
- $1.87 / 1M tokens
- Saída
- $4.68 / 1M tokens
- Contexto
- Up to 1M tokens native
Kimi K3
Moonshot AI
Modelo MoE robusto de 2.8T parâmetros, #1 no Arena WebDev e pontuações de topo no Terminal-Bench, mas agora sob investigação ativa da Casa Branca por roubo de propriedade intelectual em escala industrial, com o Tesouro dos EUA ameaçando sanções.
- Entrada
- $3.00 / 1M
- Saída
- $15.00 / 1M
- Contexto
- 1M ctx, $0.30 cached. Weights live (Jul 27).
Laguna S 2.1
poolside
O Laguna S 2.1 é o primeiro modelo de codificação open weight ocidental confiável em 11 meses — um MoE de 118B que ativa apenas 8B de parâmetros por token e ainda assim marca 70,2% no Terminal-Bench 2.1, superando modelos 10× maiores. Mas não está na fronteira — GPT-5.6 Sol e Kimi K3 estão muito à frente — e limitações conhecidas incluem overfitting de harness e problemas com JSON. Melhor para codificação agêntica self-hosted onde a soberania de dados importa mais do que liderança absoluta em benchmarks.
- Entrada
- $0.10 / 1M
- Saída
- $0.20 / 1M
- Contexto
- OpenMDW-1.1 license, 1M context
Llama 4 Maverick
Meta
O principal modelo de código aberto para equipes que precisam de auto-hospedagem, soberania de dados ou querem evitar dependência de fornecedor de API.
- Entrada
- Free (self-hosted) or $0.20 / 1M tokens (hosted)
- Saída
- Free (self-hosted) or $0.60 / 1M tokens (hosted)
- Contexto
- 10M tokens
MAI-Code-1-Flash
Microsoft
O primeiro modelo de codificação interno da Microsoft — um MoE esparso pequeno, rápido e agressivamente otimizado em custo a $0,75/$4,50 por 1M de tokens. Oferece uma vantagem de 16 pontos sobre o Claude Haiku 4.5 no SWE-Bench Pro usando até 60% menos tokens. Ele foi construído especificamente para fluxos de trabalho Copilot de alto volume — autocompletar, refatorações, scaffolds — não é um modelo de fronteira. Melhor dentro do ecossistema Copilot; o acesso por API externo ainda está sendo implementado.
- Entrada
- $0.75 / 1M tokens
- Saída
- $4.50 / 1M tokens
- Contexto
- 256K context
MAI-Code-1.1-Flash
Microsoft
O MAI-Code-1.1-Flash é o modelo de código de nível small renovado da Microsoft para o Copilot — um quarto do custo e 22% melhor no Terminal-Bench 2.1 do que seu antecessor de junho, agora com visão nativa. Ele foi construído para trabalho iterativo de alto volume, e não para raciocínio de fronteira, o que o torna o modelo de código sério mais barato do Copilot. Use-o em autocompleções cotidianas, refatorações e depuração assistida por imagem; use um carro-chefe para arquitetura complexa.
- Entrada
- $0.20 / 1M
- Saída
- $1.20 / 1M
- Contexto
- 256K context
MAI-Cyber-1-Flash
Microsoft
O primeiro modelo de cibersegurança interno da Microsoft, construído sobre a família MAI-Thinking-1 e incorporado ao harness multiagente MDASH. O MAI-Cyber-1-Flash lida com ~90% das cargas de trabalho de segurança por aproximadamente metade do custo das configurações anteriores, reservando o GPT-5.4 para os 10% mais difíceis. Pontua 95,95% no CyberGym — 12 pontos acima do Mythos 5 — mas este é um benchmark reportado pelo fornecedor a partir de uma configuração de sistema completo ajustada (harness + dois modelos), não um teste independente de modelo contra modelo. Disponível apenas via Azure AI Foundry com acesso empresarial avaliado; sem preços avulsos ou API pública.
- Entrada
- N/A (MDASH SCU consumption)
- Saída
- N/A (MDASH SCU consumption)
- Contexto
- Azure AI Foundry vetted access
Muse Glimmer
Meta
O Muse Glimmer é o modelo agentivo de pesos abertos de 30B da Meta, destilado do modelo de fronteira fechado Muse Spark e lançado sob Apache 2.0. Com quantização de 4 bits, ele executa chamadas de ferramentas multi-etapas, raciocínio multimodal e recuperação de falhas em uma única GPU de consumo de 24GB sem dependências de nuvem.
- Entrada
- Free (open weights)
- Saída
- Free (open weights)
- Contexto
- 131K tokens
Muse Spark 1.1
Meta
O primeiro modelo de IA pago da Meta e primeiro disparo no mercado comercial de codificação — US$ 1,25/US$ 4,25 por 1M de tokens com 1M de contexto, orquestração nativa de subagentes, suporte a MCP/ferramentas e capacidade de computer use por cerca de 4× abaixo dos preços da Anthropic/OpenAI. Lidera em benchmarks de uso de ferramentas, mas fica atrás do Opus 4.8 em codificação pura por 7 pontos no SWE-Bench Pro. Peso fechado, prévia pública apenas nos EUA. Melhor para equipes que priorizam orquestração de uso de ferramentas a baixo custo.
- Entrada
- $1.25 / 1M tokens
- Saída
- $4.25 / 1M tokens
- Contexto
- 1M tokens
Muse Spark 1.2
Meta
Atualização do modelo focado em codificação da Meta, co-treinado com o harness Muse Code — 82,9% no Terminal-Bench 2.1 e 59,3% no DeepSWE 1.1, segundo apenas ao Claude Opus 5 no primeiro. Preços padrão inalterados a $1,25 entrada / $4,25 saída por 1M de tokens.
- Entrada
- $1.25 / 1M tokens
- Saída
- $4.25 / 1M tokens
- Contexto
- 1M tokens
Mythos 5 (Claude Mythos 5)
Anthropic
O modelo de cibersegurança mais forte do mundo (83,8% CyberGym) — construído sobre os pesos do Fable 5 com os classificadores de segurança removidos. O acesso foi suspenso após a diretiva de exportação de 12 de junho; parcialmente restaurado em 26 de junho para ~100 organizações críticas dos EUA designadas (Project Glasswing). O veredicto permanece CONDITIONAL: a capacidade é de elite, mas o acesso é controlado por designação federal. Não é uma API pública — utilizável apenas se sua organização estiver na lista do Departamento de Comércio.
- Entrada
- $10 / 1M tokens
- Saída
- $50 / 1M tokens
- Contexto
- 1M tokens (restricted access)
Ornith-1.0
DeepReinforce
Uma família de modelos open-source para programação agentiva com licença MIT que entrega resultados comparáveis aos melhores modelos — superando o Claude Opus 4.7 tanto no Terminal-Bench 2.1 quanto no SWE-Bench Verified — mas exige self-hosting com recursos significativos de GPU e vem de um laboratório novo com histórico limitado.
- Entrada
- Free (MIT license)
- Saída
- Free (MIT license)
- Contexto
- 256K tokens
Palmyra X6
Writer
O Palmyra X6 é o modelo agêntico carro-chefe da Writer para fluxos de trabalho de marketing e receita — pós-treinado sobre o GLM-5.2 de pesos abertos da Z.ai a $2/$8 por 1M de tokens, uma fração da taxa dos modelos de fronteira. Todos os números de destaque são alegados pela Writer, e a proveniência do GLM-5.2 é uma questão real de procurement. Adote-o dentro da Writer para trabalho de agente GTM sensível a custo; procure em outro lugar por capacidade geral com benchmark independente.
- Entrada
- $2 / 1M
- Saída
- $8 / 1M
- Contexto
- 1M context, 8K max output
Qwen3.8-27B
Alibaba
O Qwen3.8-27B é o modelo open-weight de 27 bilhões de parâmetros da Alibaba, agora disponível sob Apache 2.0 com 262K de contexto nativo e implantação em uma única GPU. É o companheiro auto-hospedável do carro-chefe Qwen3.8-Max de 2,4T. Os benchmarks seguem sendo números da própria Alibaba, então fica em 'conditional': um modelo real e executável cujos ganhos de codificação declarados pela fornecedora ainda aguardam reprodução independente.
- Entrada
- Free (open weights — self-hosted)
- Saída
- Free (open weights — self-hosted)
- Contexto
- TBD — context window not published
Qwen3.8-Max
Alibaba
Carro-chefe MoE multimodal de 2.4T parâmetros. Ainda não está em GA -- sem preços de API por token, sem tabela de benchmarks, sem pesos abertos publicados. Entrada a $6/mês via Token Plan Lite.
- Entrada
- $2.00 / 1M tokens
- Saída
- $6.00 / 1M tokens
- Contexto
- 984K tokens. Open weights promised week of Aug 10.
Sakana Fugu
Sakana AI
Orquestrador multiagente que iguala modelos de fronteira em benchmarks-chave ao rotear por um pool de agentes especialistas — mas o roteamento opaco e a dependência de plataforma limitam a transparência.
- Entrada
- $5 / 1M tokens
- Saída
- $30 / 1M tokens
- Contexto
- 272K tokens (>272K: $10/$45 per 1M)