Modelos de IA

54

Encontra o modelo certo para a tua tarefa. Filtra por pontos fortes, compara preços e decide.

Filtrar por fornecedor

54modelos
Astra logo

Astra

OpenAI

pending

Primeiro modelo a acionar o limite "Critical" de cibersegurança da OpenAI. Resolveu 10 problemas abertos de matemática por aproximadamente $2.000. Desenvolvimento ativamente pausado em agosto de 2026 para reforço de segurança.

Entrada
Not yet published
Saída
Not yet published
Contexto
Development slowed Aug 2026. No GA date.
Claude Fable 5 logo

Claude Fable 5

Anthropic

Condicional

Modelo de fronteira da classe Mythos da Anthropic — o Claude mais forte disponível publicamente até hoje, liderando todos os principais benchmarks no lançamento. O veredicto permanece CONDITIONAL por duas restrições ativas: preço apenas por créditos a $10/$50 por 1M de tokens sem opção de assinatura, e um classificador de segurança que dispara em excesso em tarefas rotineiras de código, redirecionando-as silenciosamente para um fallback no Opus 4.8. Recorra ao Fable 5 quando o delta de capacidade justificar o custo; para trabalho rotineiro, o Sonnet 5 é a alternativa mais previsível.

Entrada
$10 / 1M tokens
Saída
$50 / 1M tokens
Contexto
1M context, 128K max output
Claude Haiku 4.5 logo

Claude Haiku 4.5

Anthropic

Recomendado

A referência de custo-benefício da Anthropic a $1/$5 por 1M de tokens — o nível rápido e barato contra o qual os concorrentes se comparam, com contexto de 200K e saída de 64K. Melhor para trabalho de alto volume e sensível à latência: classificação, extração, sumarização, roteamento. Recorra ao Opus 4.8 ou ao Sonnet 5 quando for necessário raciocínio profundo em múltiplas etapas.

Entrada
$1 / 1M tokens
Saída
$5 / 1M tokens
Contexto
200K tokens
Claude Opus 4.8 logo

Claude Opus 4.8

Anthropic

Recomendado

O modelo de raciocínio carro-chefe da Anthropic e o incumbente prático da fronteira em capacidade implantável — contexto de 1M tokens a $5/$25 por 1M de tokens, incluído em todos os planos de assinatura. Nossa escolha para trabalho intensivo em revisão: revisão de código, refatoração sob restrições e tarefas de ritmo deliberado. Codificação agêntica forte, raciocínio analítico de primeira linha e acesso estável por assinatura fazem dele o carro-chefe padrão para a maioria das equipes em produção.

Entrada
$5 / 1M tokens
Saída
$25 / 1M tokens
Contexto
1M tokens
Claude Opus 5 logo

Claude Opus 5

Anthropic

Recomendado

Inteligência quase no nível do Fable 5 pela metade do preço. SOTA no Frontier-Bench e CursorBench. 85% menos salvaguardas cibernéticas que o Fable 5. O cavalo de batalha dos modelos de fronteira para codificação do dia a dia.

Entrada
$5.00 / 1M tokens
Saída
$25.00 / 1M tokens
Contexto
200K tokens
Claude Sonnet 4.6 logo

Claude Sonnet 4.6

Anthropic

Condicional

Superado pelo Claude Sonnet 5 (lançado em 30 de junho de 2026) como o cavalo de batalha padrão de nível médio. O preço de $3/$15 e o contexto de 1M tokens do Sonnet 4.6 agora são igualados por um sucessor com um salto de 13,4 pontos no Terminal-Bench 2.1 pela mesma tabela de preços. Escolha o 4.6 apenas para implantações fixadas ou onde os ~30% a mais de tokens do Sonnet 5 e a remoção de temperature/top_p/top_k sejam desclassificantes.

Entrada
$3 / 1M tokens
Saída
$15 / 1M tokens
Contexto
1M tokens
Claude Sonnet 5 logo

Claude Sonnet 5

Anthropic

Recomendado

O Sonnet mais agêntico da Anthropic entrega desempenho próximo ao do Opus 4.8 por cerca de metade do preço, com +13,4 pontos no Terminal-Bench 2.1 sobre o Sonnet 4.6. O novo tokenizador infla as contagens em ~30%, então o preço introdutório ($2/$10 por MTok até 31 de agosto) mantém a migração neutra em custo, mas as equipes devem recalcular os orçamentos antes de trocar. Ele substitui o Sonnet 4.6 como padrão em todos os planos Claude, ideal para codificação agêntica, depuração brownfield e pipelines de produção — não para as tarefas mais difíceis de raciocínio de fronteira ou cibersegurança.

Entrada
$3 / 1M
Saída
$15 / 1M
Contexto
1M tokens
D

DeepSeek V4 Flash

DeepSeek

Recomendado

DeepSeek's volume-tier open-weight model at 284B parameters (13B active MoE) with a 1M-token context window. SWE-bench Verified 79.0% at $0.22 input and $0.66 output per 1M tokens off-peak, doubling during the seven daily peak hours. The August 2026 price rise ended its run as the cheapest credible API (GPT-5.6 Luna now undercuts it on input at $0.20), but it remains a strong value pick, and the MIT license means self-hosting sidesteps API pricing entirely. Still the default workhorse for high-throughput agent pipelines that can run off-peak.

Entrada
$0.22 / 1M tokens
Saída
$0.66 / 1M tokens
Contexto
1M tokens. Peak 2x: 01-04 + 06-10 UTC
D

DeepSeek V4 Pro

DeepSeek

Recomendado

The strongest open-weight coding model we've tested: SWE-bench Verified 80.6%, LiveCodeBench 93.5% and 3206 Codeforces Elo. At $0.66 input and $1.98 output per 1M tokens off-peak it stays far below Western flagship pricing even after the August 2026 rise, though rates double during the seven daily peak hours. The default for self-hosted agentic coding.

Entrada
$0.66 / 1M tokens
Saída
$1.98 / 1M tokens
Contexto
1M tokens. Peak 2x: 01-04 + 06-10 UTC
F

FLUX 3

Black Forest Labs

Condicional

Modelo fundamental multimodal unificado para imagem, vídeo, áudio e previsão de ações.

Entrada
Not yet published
Saída
Not yet published
Contexto
Gated early access
G

GLM-5.2

Z.ai

Condicional

Melhor modelo de código com pesos abertos, 1M tokens de contexto e licença MIT — supera o GPT-5.5 em múltiplos benchmarks por uma fração do custo, mas ainda fica atrás do Claude Opus 4.8 nas tarefas mais difíceis de longa duração.

Entrada
$1.40 / 1M tokens
Saída
$4.40 / 1M tokens
Contexto
1M tokens
G

GLM-5.3

Z.ai

Condicional

O GLM-5.3 é o mais recente modelo de pesos abertos de código e ciberdefesa da Z.ai — a mesma base do GLM-5.2, com todos os ganhos vindos do pós-treinamento. Mas os números de destaque ainda são executados pelo fornecedor, os pesos abertos estão retidos por ~2 semanas por causa da capacidade de segurança emergente, e o preço por token não foi publicado. Use-o já para segurança defensiva e automação agêntica; aguarde os pesos e auditorias independentes antes de padronizar.

Entrada
N/A (rate not yet published)
Saída
N/A (rate not yet published)
Contexto
1M context
GPT-4.1 logo

GPT-4.1

OpenAI

Recomendado

O destino padrão de migração para cargas de trabalho do GPT-4 Turbo: mesmo formato de requisição, custo menor, contexto de 1M tokens — converta payloads legados de function_call para o formato tools e siga em frente.

Entrada
$2 / 1M tokens
Saída
$8 / 1M tokens
Contexto
1M tokens
GPT-4o (Retired from ChatGPT, API-only) logo

GPT-4o (Retired from ChatGPT, API-only)

OpenAI

Condicional

GPT-4o (May 2024) has been superseded by the GPT-5.x family and delisted from OpenAI's flagship API pricing page. It remains available through the API but is no longer a current-generation model. Use only where migration to GPT-5.x is blocked; otherwise, GPT-5.5 or GPT-5.4 offer better performance at comparable cost.

Entrada
$2.50 / 1M tokens
Saída
$10 / 1M tokens
Contexto
128K tokens
GPT-5.5 logo

GPT-5.5

OpenAI

Recomendado

O modelo fronteira comercial de uso geral da OpenAI e a âncora implantável da OpenAI enquanto a família GPT-5.6 permanece sob restrição governamental — $5/$30 por 1M de tokens com contexto de 1M+. Raciocínio sólido, amplo suporte ao ecossistema e disponibilidade pública total fazem dele um padrão de produção confiável, embora modelos mais baratos agora o igualem em tarefas específicas. Para a maioria das equipes, ele continua sendo a referência pela qual os novos modelos são medidos.

Entrada
$5 / 1M tokens
Saída
$30 / 1M tokens
Contexto
1M+ tokens (922K in / 128K out)
GPT-5.5-Cyber logo

GPT-5.5-Cyber

OpenAI

Condicional

85,6% no CyberGym — maior pontuação de modelo único — mas acesso restrito apenas para defensores credenciados.

Entrada
N/A
Saída
N/A
Contexto
Trusted Access for Cyber; not commercial API
GPT-5.6 Luna logo

GPT-5.6 Luna

OpenAI

Condicional

GPT-5.6 Luna is OpenAI's budget tier — near-GPT-5.5 capability at $1/$6 per 1M tokens, the strongest capability-per-dollar value in the GPT-5.6 family. Now generally available via API and Codex after the July 9 government-gate lift. Remains conditional: all benchmarks are vendor-reported, Luna lacks activation classifiers, and it is not in the standard ChatGPT picker.

Entrada
$0.20 / 1M tokens
Saída
$1.20 / 1M tokens
Contexto
Fastest tier. 80% cut Jul 30 → $0.20/$1.20.
GPT-5.6 Sol logo

GPT-5.6 Sol

OpenAI

Recomendado

O GPT-5.6 Sol é o modelo de fronteira mais custo-efetivo, liderando em benchmarks de codificação e competitivo em raciocínio complexo a uma fração do custo dos concorrentes. O veredicto é reforçado pela divulgação do endurecimento de segurança GPT-Red — o modelo foi treinado adversarialmente contra um modelo dedicado de red-teaming por RL de auto-jogo em escala de fronteira, tornando-o 6x mais robusto a injeções de prompt.

Entrada
$5 / 1M tokens
Saída
$30 / 1M tokens
Contexto
Same $5/$30. Fast mode: 2.5× at 2× cost.
GPT-5.6 Terra logo

GPT-5.6 Terra

OpenAI

Condicional

GPT-5.6 Terra is OpenAI's mid-tier workhorse — GPT-5.5-class capability at half the cost ($2.50/$15 per 1M tokens). Now generally available via API and Codex after the July 9 government-gate lift. Remains conditional: all benchmarks are vendor-reported without independent reproduction, and Terra is not selectable in the standard ChatGPT model picker.

Entrada
$2.00 / 1M tokens
Saída
$12.00 / 1M tokens
Contexto
Mid-tier. 20% cut Jul 30 → $2.00/$12.00.
GPT-5.6-Cyber logo

GPT-5.6-Cyber

OpenAI

Condicional

O GPT-5.6-Cyber é o modelo de cibersegurança da OpenAI treinado especificamente para esse fim, construído sobre o GPT-5.6 Sol e disponível exclusivamente através do programa restrito Daybreak Red. É o primeiro modelo a atingir o limiar 'Alto' de capacidade cibernética da OpenAI, com desempenho em cadeias de exploit e zero-day que supera em muito os modelos de propósito geral.

Entrada
$12.50 / 1M tokens
Saída
$75 / 1M tokens
Contexto
400K tokens
GPT-Live-1 logo

GPT-Live-1

OpenAI

Condicional

O primeiro modelo de voz full-duplex da OpenAI — ouve e fala simultaneamente, um salto além do Advanced Voice Mode baseado em turnos.

Entrada
ChatGPT subscription
Saída
ChatGPT subscription
Contexto
ChatGPT Voice only
GPT-Live-1 mini logo

GPT-Live-1 mini

OpenAI

Condicional

A variante gratuita do GPT-Live-1 — mesma arquitetura duplex completo em um pacote menor e mais rápido, servindo como modelo de voz padrão para usuários do ChatGPT Free. Compartilha as inovações principais: interação contínua, suporte a wake word e delegação ao GPT-5.5. As mesmas limitações se aplicam: sem API, qualidade de idioma desigual. Uma atualização substancial em relação ao antigo modo de voz baseado em turnos para usuários gratuitos.

Entrada
Free (ChatGPT)
Saída
Free (ChatGPT)
Contexto
ChatGPT Voice only
GPT-Live-Transcribe logo

GPT-Live-Transcribe

OpenAI

Recomendado

O modelo de voz para texto com streaming de baixa latência da OpenAI entrega deltas de transcrição ao vivo a US$ 0,017/min com latência ajustável e transcrição sensível a contexto.

Entrada
$0.017 / minute
Saída
N/A
Contexto
Per-minute realtime audio billing
GPT-Transcribe logo

GPT-Transcribe

OpenAI

Recomendado

O mais recente modelo de transcrição de fala em lote da OpenAI pontua 3,31% AA-WER a $0,0045/min — 25% mais barato e mensuravelmente mais preciso que seu antecessor gpt-4o-transcribe. Suporta prompts de contexto, dicas de palavras-chave e detecção de idioma em mais de 22 idiomas, tornando-o a melhor opção padrão para transcrição assíncrona de arquivos na plataforma OpenAI. Ressalva: sem diarização ou timestamps em nível de palavra; use gpt-4o-transcribe-diarize para rótulos de falante ou gpt-live-transcribe para necessidades em tempo real. Melhor para desenvolvedores criando transcrição de reuniões, processamento de mídia e interfaces de voz na API da OpenAI.

Entrada
$0.0045 / minute
Saída
N/A
Contexto
Per-minute audio billing
Gemini 2.5 Pro logo

Gemini 2.5 Pro

Google

Recomendado

Agora a escolha econômica para contexto longo: um corte de 40% no preço (junho de 2026) tornou as análises de corpus completo acessíveis para orçamentos médios — a maior janela de contexto disponível com forte integração ao ecossistema Google.

Entrada
$1.25 / 1M tokens
Saída
$10 / 1M tokens
Contexto
1M tokens
Gemini 3.1 Pro logo

Gemini 3.1 Pro

Google

Condicional

O modelo Pro mais capaz do Google disponível publicamente, com contexto de 1M tokens a preços competitivos. Geração anterior: Gemini 3.6 e 3.5 Flash agora o superam em benchmarks de codificação e agentes com custo menor. Mantenha-o no Google Cloud/Vertex AI; caso contrário, a linha Flash ou os concorrentes entregam mais.

Entrada
$2 / 1M
Saída
$12 / 1M
Contexto
1M tokens
Gemini 3.5 Flash logo

Gemini 3.5 Flash

Google

Recomendado

O destaque de eficiência de custos do Google para automação agêntica de desktop a $1,50/$9 por 1M de tokens com contexto de ~1M. O Computer Use nativo atinge 78,4 no OSWorld-Verified — a apenas 0,3 pontos do GPT-5.5 por aproximadamente um terço do custo. A ressalva relevante: a ferramenta Computer Use é uma prévia pública que ainda não está na API de produção, portanto verifique a disponibilidade do endpoint antes de integrá-la.

Entrada
$1.50 / 1M tokens
Saída
$9 / 1M tokens
Contexto
1M tokens
Gemini 3.5 Flash Cyber logo

Gemini 3.5 Flash Cyber

Google

Cuidado

O Gemini 3.5 Flash Cyber é o primeiro modelo do Google especializado em cibersegurança, com fine-tune do 3.5 Flash para encontrar, validar e corrigir vulnerabilidades. Dentro da arquitetura multiagente do CodeMender, ele atinge desempenho competitivo no CyberGym contra modelos muito maiores como o Mythos por uma fração do custo. Mas as restrições são severas: roda exclusivamente dentro do CodeMender, disponível apenas para governos e parceiros confiáveis através de um piloto de acesso limitado, sem API pública, sem números de benchmark publicados e sem cronograma para lançamento mais amplo.

Entrada
N/A
Saída
N/A
Contexto
CodeMender-only, government-gated pilot
Gemini 3.5 Flash-Lite logo

Gemini 3.5 Flash-Lite

Google

Recomendado

O Gemini 3.5 Flash-Lite é o modelo mais rápido e barato da série 3.5 do Google, a 350 tok/s e $0,30/$2,50. O salto geracional em relação ao 3.1 Flash-Lite é a verdadeira história — ele supera dramaticamente seu antecessor em benchmarks agênticos chave e vence o Gemini 3 Flash completo em tarefas de codificação e uso de computador. Para desenvolvedores escalando subagentes agênticos de alta vazão, pipelines de busca e processamento de documentos, a relação preço-desempenho do Flash-Lite é inigualável na linha do Google.

Entrada
$0.30 / 1M
Saída
$2.50 / 1M
Contexto
1M context, 64K output, 350 tok/s
Gemini 3.5 Pro logo

Gemini 3.5 Pro

Google

pending

O modelo de fronteira pré-GA do Google — agora em seu quarto adiamento e 'meses atrasado' segundo a Bloomberg. O contexto de 2M tokens, o pipeline multimodal nativo e o raciocínio Deep Think continuam sendo capacidades reais, mas não há um cronograma de GA confirmado. A capacidade de codificação é a principal deficiência.

Entrada
Not yet published
Saída
Not yet published
Contexto
Est. $5-15/$30-60 per 1M. 2M ctx. Not GA.
Gemini 3.6 Flash logo

Gemini 3.6 Flash

Google

Recomendado

O Gemini 3.6 Flash é o novo modelo de trabalho padrão da linha Flash do Google — é melhor e mais barato que o 3.5 Flash, pontuando mais alto em todos os benchmarks enquanto reduz o preço de saída de $9,00 para $7,50 por milhão de tokens. O ganho de 17% em eficiência de tokens significa menor custo por tarefa mesmo antes do corte de preço, e o Computer Use integrado via API o torna uma opção crível de codificação agêntica. Para desenvolvedores no ecossistema Google, este é o upgrade evidente — não há motivo para permanecer no 3.5 Flash.

Entrada
$1.50 / 1M
Saída
$7.50 / 1M
Contexto
1M context, 64K output
Gemini 3.7 Flash logo

Gemini 3.7 Flash

Google

Recomendado

O Gemini 3.7 Flash é o cavalo de batalha Flash mais forte do Google até agora para código e agentes — um avanço genuíno em relação ao 3.6 Flash pela metade do preço anterior até 2026. Ele ainda fica atrás da fronteira nas tarefas mais difíceis de terminal e uso de computador. Um upgrade claro para construtores de agentes sensíveis a custo e do ecossistema Google; não é um substituto de código de fronteira.

Entrada
$0.75 / 1M
Saída
$3.75 / 1M
Contexto
1M context, 64K output
Gemini 3.8 Flash logo

Gemini 3.8 Flash

Google

Recomendado

Gemini 3.8 Flash is Google's strongest Flash workhorse yet — a genuine capability upgrade over the recommended 3.7 Flash at the same introductory price, with real gains across software engineering, agents and professional domains. The deciding caveat is Google's own: 3.8 "works harder," so per-task token burn runs well above 3.7, which remains the efficiency-first pick. Adopt 3.8 for long-horizon coding, agents and finance or legal work — benchmark your own workload before the intro price expires.

Entrada
$0.75 / 1M
Saída
$3.75 / 1M
Contexto
1M context, 64K output
Gemini 4 logo

Gemini 4

Google

pending

Modelo de próxima geração confirmado pelo Google DeepMind. Pré-treinamento iniciado em 21 de julho de 2026. Sem benchmarks, sem preços, sem especificações, sem data de GA.

Entrada
Not yet published
Saída
Not yet published
Contexto
Pre-training started Jul 2026. No GA date.
G

Grok 4.5

SpaceXAI

Condicional

Modelo de codificação agêntica com preço competitivo a US$ 2/US$ 6 por 1M de tokens com 500K de contexto — os benchmarks publicados pela xAI o colocam no meio do pelotão, atrás do Fable 5 e GPT-5.5, embora lidere sobre o Opus 4.8 no DeepSWE e Terminal-Bench 2.1. A verdadeira história é a eficiência de custo: 4,2× mais eficiente em tokens que o Opus 4.8 no SWE-Bench Pro. Melhor para equipes que precisam de codificação forte por uma fração dos preços de fronteira. Ainda não disponível na UE.

Entrada
$2 / 1M tokens
Saída
$6 / 1M tokens
Contexto
500K tokens
G

Grok 4.6

SpaceXAI

Condicional

Competitivo com a fronteira a $2/$6, com 61 no Índice de Inteligência AA (empata com o GPT-5.6 Sol) e GDPVal-AA atrás apenas do Claude Opus 5 — forte logo de saída, mas com uma única camada de avaliação e um dia de vida, então segure as apostas de produção até que benchmarks mais amplos cheguem.

Entrada
$2.00 / 1M tokens
Saída
$6.00 / 1M tokens
Contexto
Delayed past Aug 7. Now ~Aug 10-14. 500K ctx.
G

Grok Voice Think Fast 2.0

SpaceXAI

Condicional

O modelo de voz speech-to-speech de última geração da SpaceXAI com uma arquitetura de raciocínio paralelo que o torna substancialmente mais inteligente que os modelos de voz convencionais.

Entrada
$0.08 / min of audio (speech-to-speech)
Saída
Included in speech-to-speech rate
Contexto
API-only
H

Hy3

Tencent

Condicional

Modelo agêntico MoE de pesos abertos Apache 2.0 (295B total, 21B ativos) com forte confiabilidade em chamadas de ferramentas e comportamento anti-alucinação, mas a codificação fica atrás do GLM-5.2 e o self-hosting exige 8+ GPUs. Nível gratuito no OpenRouter até 21 de julho — depois $0,20/$0,80 por 1M de tokens. Ideal para agentes de programação self-hosted e trabalho com documentos de contexto longo, onde licenciamento permissivo importa mais do que pontuações absolutas em benchmarks.

Entrada
$0.20 / 1M
Saída
$0.80 / 1M
Contexto
256K tokens
I

Inkling

Thinking Machines Lab

Condicional

O Inkling é a razão mais forte até agora para levar a sério a IA multimodal de pesos abertos. Ele oferece raciocínio e codificação competitivos com a melhor segurança de pesos abertos da categoria e esforço de raciocínio controlável, tudo sob Apache 2.0. Mas a Thinking Machines é honesta ao admitir que não é o mais forte em termos gerais — a factualidade deixa a desejar (SimpleQA 43,9%) e a auto-hospedagem exige hardware sério (2TB VRAM). Condicional: uma base atraente para organizações que precisam possuir e ajustar um modelo multimodal, não para equipes que buscam desempenho máximo pronto para uso.

Entrada
$1.87 / 1M tokens
Saída
$4.68 / 1M tokens
Contexto
Up to 1M tokens native
K

Kimi K3

Moonshot AI

Condicional

Modelo MoE robusto de 2.8T parâmetros, #1 no Arena WebDev e pontuações de topo no Terminal-Bench, mas agora sob investigação ativa da Casa Branca por roubo de propriedade intelectual em escala industrial, com o Tesouro dos EUA ameaçando sanções.

Entrada
$3.00 / 1M
Saída
$15.00 / 1M
Contexto
1M ctx, $0.30 cached. Weights live (Jul 27).
L

Laguna S 2.1

poolside

Condicional

O Laguna S 2.1 é o primeiro modelo de codificação open weight ocidental confiável em 11 meses — um MoE de 118B que ativa apenas 8B de parâmetros por token e ainda assim marca 70,2% no Terminal-Bench 2.1, superando modelos 10× maiores. Mas não está na fronteira — GPT-5.6 Sol e Kimi K3 estão muito à frente — e limitações conhecidas incluem overfitting de harness e problemas com JSON. Melhor para codificação agêntica self-hosted onde a soberania de dados importa mais do que liderança absoluta em benchmarks.

Entrada
$0.10 / 1M
Saída
$0.20 / 1M
Contexto
OpenMDW-1.1 license, 1M context
Llama 4 Maverick logo

Llama 4 Maverick

Meta

Condicional

O principal modelo de código aberto para equipes que precisam de auto-hospedagem, soberania de dados ou querem evitar dependência de fornecedor de API.

Entrada
Free (self-hosted) or $0.20 / 1M tokens (hosted)
Saída
Free (self-hosted) or $0.60 / 1M tokens (hosted)
Contexto
10M tokens
MAI-Code-1-Flash logo

MAI-Code-1-Flash

Microsoft

Condicional

O primeiro modelo de codificação interno da Microsoft — um MoE esparso pequeno, rápido e agressivamente otimizado em custo a $0,75/$4,50 por 1M de tokens. Oferece uma vantagem de 16 pontos sobre o Claude Haiku 4.5 no SWE-Bench Pro usando até 60% menos tokens. Ele foi construído especificamente para fluxos de trabalho Copilot de alto volume — autocompletar, refatorações, scaffolds — não é um modelo de fronteira. Melhor dentro do ecossistema Copilot; o acesso por API externo ainda está sendo implementado.

Entrada
$0.75 / 1M tokens
Saída
$4.50 / 1M tokens
Contexto
256K context
MAI-Code-1.1-Flash logo

MAI-Code-1.1-Flash

Microsoft

Condicional

O MAI-Code-1.1-Flash é o modelo de código de nível small renovado da Microsoft para o Copilot — um quarto do custo e 22% melhor no Terminal-Bench 2.1 do que seu antecessor de junho, agora com visão nativa. Ele foi construído para trabalho iterativo de alto volume, e não para raciocínio de fronteira, o que o torna o modelo de código sério mais barato do Copilot. Use-o em autocompleções cotidianas, refatorações e depuração assistida por imagem; use um carro-chefe para arquitetura complexa.

Entrada
$0.20 / 1M
Saída
$1.20 / 1M
Contexto
256K context
MAI-Cyber-1-Flash logo

MAI-Cyber-1-Flash

Microsoft

Condicional

O primeiro modelo de cibersegurança interno da Microsoft, construído sobre a família MAI-Thinking-1 e incorporado ao harness multiagente MDASH. O MAI-Cyber-1-Flash lida com ~90% das cargas de trabalho de segurança por aproximadamente metade do custo das configurações anteriores, reservando o GPT-5.4 para os 10% mais difíceis. Pontua 95,95% no CyberGym — 12 pontos acima do Mythos 5 — mas este é um benchmark reportado pelo fornecedor a partir de uma configuração de sistema completo ajustada (harness + dois modelos), não um teste independente de modelo contra modelo. Disponível apenas via Azure AI Foundry com acesso empresarial avaliado; sem preços avulsos ou API pública.

Entrada
N/A (MDASH SCU consumption)
Saída
N/A (MDASH SCU consumption)
Contexto
Azure AI Foundry vetted access
Muse Glimmer logo

Muse Glimmer

Meta

Condicional

O Muse Glimmer é o modelo agentivo de pesos abertos de 30B da Meta, destilado do modelo de fronteira fechado Muse Spark e lançado sob Apache 2.0. Com quantização de 4 bits, ele executa chamadas de ferramentas multi-etapas, raciocínio multimodal e recuperação de falhas em uma única GPU de consumo de 24GB sem dependências de nuvem.

Entrada
Free (open weights)
Saída
Free (open weights)
Contexto
131K tokens
Muse Spark 1.1 logo

Muse Spark 1.1

Meta

Condicional

O primeiro modelo de IA pago da Meta e primeiro disparo no mercado comercial de codificação — US$ 1,25/US$ 4,25 por 1M de tokens com 1M de contexto, orquestração nativa de subagentes, suporte a MCP/ferramentas e capacidade de computer use por cerca de 4× abaixo dos preços da Anthropic/OpenAI. Lidera em benchmarks de uso de ferramentas, mas fica atrás do Opus 4.8 em codificação pura por 7 pontos no SWE-Bench Pro. Peso fechado, prévia pública apenas nos EUA. Melhor para equipes que priorizam orquestração de uso de ferramentas a baixo custo.

Entrada
$1.25 / 1M tokens
Saída
$4.25 / 1M tokens
Contexto
1M tokens
Muse Spark 1.2 logo

Muse Spark 1.2

Meta

Condicional

Atualização do modelo focado em codificação da Meta, co-treinado com o harness Muse Code — 82,9% no Terminal-Bench 2.1 e 59,3% no DeepSWE 1.1, segundo apenas ao Claude Opus 5 no primeiro. Preços padrão inalterados a $1,25 entrada / $4,25 saída por 1M de tokens.

Entrada
$1.25 / 1M tokens
Saída
$4.25 / 1M tokens
Contexto
1M tokens
Mythos 5 (Claude Mythos 5) logo

Mythos 5 (Claude Mythos 5)

Anthropic

Condicional

O modelo de cibersegurança mais forte do mundo (83,8% CyberGym) — construído sobre os pesos do Fable 5 com os classificadores de segurança removidos. O acesso foi suspenso após a diretiva de exportação de 12 de junho; parcialmente restaurado em 26 de junho para ~100 organizações críticas dos EUA designadas (Project Glasswing). O veredicto permanece CONDITIONAL: a capacidade é de elite, mas o acesso é controlado por designação federal. Não é uma API pública — utilizável apenas se sua organização estiver na lista do Departamento de Comércio.

Entrada
$10 / 1M tokens
Saída
$50 / 1M tokens
Contexto
1M tokens (restricted access)
O

Ornith-1.0

DeepReinforce

Condicional

Uma família de modelos open-source para programação agentiva com licença MIT que entrega resultados comparáveis aos melhores modelos — superando o Claude Opus 4.7 tanto no Terminal-Bench 2.1 quanto no SWE-Bench Verified — mas exige self-hosting com recursos significativos de GPU e vem de um laboratório novo com histórico limitado.

Entrada
Free (MIT license)
Saída
Free (MIT license)
Contexto
256K tokens
P

Palmyra X6

Writer

Condicional

O Palmyra X6 é o modelo agêntico carro-chefe da Writer para fluxos de trabalho de marketing e receita — pós-treinado sobre o GLM-5.2 de pesos abertos da Z.ai a $2/$8 por 1M de tokens, uma fração da taxa dos modelos de fronteira. Todos os números de destaque são alegados pela Writer, e a proveniência do GLM-5.2 é uma questão real de procurement. Adote-o dentro da Writer para trabalho de agente GTM sensível a custo; procure em outro lugar por capacidade geral com benchmark independente.

Entrada
$2 / 1M
Saída
$8 / 1M
Contexto
1M context, 8K max output
Q

Qwen3.8-27B

Alibaba

Condicional

O Qwen3.8-27B é o modelo open-weight de 27 bilhões de parâmetros da Alibaba, agora disponível sob Apache 2.0 com 262K de contexto nativo e implantação em uma única GPU. É o companheiro auto-hospedável do carro-chefe Qwen3.8-Max de 2,4T. Os benchmarks seguem sendo números da própria Alibaba, então fica em 'conditional': um modelo real e executável cujos ganhos de codificação declarados pela fornecedora ainda aguardam reprodução independente.

Entrada
Free (open weights — self-hosted)
Saída
Free (open weights — self-hosted)
Contexto
TBD — context window not published
Q

Qwen3.8-Max

Alibaba

pending

Carro-chefe MoE multimodal de 2.4T parâmetros. Ainda não está em GA -- sem preços de API por token, sem tabela de benchmarks, sem pesos abertos publicados. Entrada a $6/mês via Token Plan Lite.

Entrada
$2.00 / 1M tokens
Saída
$6.00 / 1M tokens
Contexto
984K tokens. Open weights promised week of Aug 10.
S

Sakana Fugu

Sakana AI

Condicional

Orquestrador multiagente que iguala modelos de fronteira em benchmarks-chave ao rotear por um pool de agentes especialistas — mas o roteamento opaco e a dependência de plataforma limitam a transparência.

Entrada
$5 / 1M tokens
Saída
$30 / 1M tokens
Contexto
272K tokens (>272K: $10/$45 per 1M)