GPT-5.6 Luna cai 80%, Terra 20% — Sol se auto-otimizou

OpenAI logoOpenAIImportante31 de julho de 2026Modelos
O que aconteceu
OpenAI cut GPT-5.6 Luna by 80% (now $0.20/$1.20) and Terra by 20% ($2/$12), three weeks after GA, funded by Sol autonomously rewriting its own GPU kernels.
Porque é importante
This is the first public case of a frontier model self-optimizing its production inference stack and having that work translate to customer pricing — not a hardware refresh.
O que fazer
Re-benchmark your model-routing tier: at $0.20/$1.20 Luna is now cheaper than Haiku 4.5 with near-GPT-5.5 capability. Terra at $2/$12 undercuts your GPT-5.4 spend.

Veredito: A OpenAI acaba de tornar a IA de ponta barata demais para ignorar — e foi o próprio modelo que construiu a redução de custo.

O piso de custo da IA de fronteira desabou. A OpenAI cortou os preços de entrada do GPT-5.6 Luna em 80%, para US$ 0,20/1M tokens, e do Terra em 20%, para US$ 2,00/1M tokens, em 30 de julho — dois dias após lançar uma atualização do Sol que otimizou autonomamente a pilha de inferência do modelo. Pela primeira vez na história, um modelo construiu seu próprio corte de preço.

Nova tabela de preços em vigor desde 30 de julho:

ModeloEntrada (por 1M tokens)Saída (por 1M tokens)Alteração
GPT-5.6 LunaUS$ 0,20US$ 1,20Entrada −80%
GPT-5.6 TerraUS$ 2,00US$ 12,00Entrada −20%
GPT-5.6 SolUS$ 5,00US$ 30,00Sem alteração

Preços em lote reduzem a entrada do Luna para US$ 0,10 (metade do preço já reduzido) e do Terra para US$ 1,00 para janelas de conclusão de 24h. Inferência em cache do Luna cai para US$ 0,05 de entrada. O Luna também ganhou um "Modo Rápido" a US$ 0,20/US$ 1,20 — o mesmo produto de baixa latência que a Anthropic oferece para o Claude Opus 5.

O Luna foi lançado a US$ 1,00/US$ 6,00 em maio. Com este sexto corte de preço desde o lançamento, está agora 80% mais barato no lado de entrada — passou de token de série fronteira para o modelo de baixa latência mais barato da família GPT-5.6 (VentureBeat(abre num novo separador), 2026; Unite.AI(abre num novo separador), 2026).

Como o GPT-5.6 Sol reescreveu sua própria infraestrutura

A equipe de engenharia da OpenAI publicou que o GPT-5.6 Sol reescreveu autonomamente seus próprios kernels de GPU de produção dentro do Codex — o modelo identificou e substituiu código CUDA ineficiente em seu caminho de inferência. O resultado: redução de 20% no custo de servir tokens, ganho de eficiência de 15%+ em tokens via melhorias em decodificação especulativa e respostas mais rápidas em geral (Post de Engenharia da OpenAI(abre num novo separador), 2026).

Este é o primeiro caso documentado publicamente de um modelo de fronteira auto-otimizando sua própria pilha de inferência e tendo esse trabalho traduzido diretamente em preços para o cliente (Unite.AI(abre num novo separador), 2026). O Sol também ganhou uma variante "Modo Rápido" a US$ 1,00/US$ 5,00 que a OpenAI afirma ser 80% mais rápida e 40% mais barata que a inferência padrão do Sol, substituindo a opção obsoleta de Processamento Prioritário. A Anthropic vende o mesmo produto com o mesmo nome e termos para o Claude Opus 5 — as duas tabelas de preços agora convergem no preço de inferência de baixa latência (Unite.AI(abre num novo separador), 2026).

A CFO da OpenAI, Sarah Friar, disse aos funcionários em uma reunião geral interna que a ARR de julho sozinha superou todo o Q2, segundo a CNBC. Separadamente, o próprio pipeline interno de auto-revisão da empresa migrou do GPT-5.4 para o GPT-5.6 Luna — uma economia de 10× para suas próprias operações de IA (TechTimes(abre num novo separador), 2026).

Por que os preços do GPT-5.6 acabam de redefinir o mercado

A família de modelos Claude detém uma fatia significativa dos gastos empresariais com IA — esses cortes miram diretamente essa distribuição de gastos.

A US$ 0,20 de entrada, o Luna agora reduz em 4× o Claude Haiku 4.5 (US$ 0,80/US$ 4,00) da Anthropic no lado de entrada. A US$ 2/US$ 12, o Terra iguala o preço do Gemini 3.1 Pro Preview (contexto ≤200K) e fica abaixo da taxa pós-introdutória do Claude Sonnet 5 (US$ 3/US$ 15 após 31 de agosto). O Modo Rápido do Sol a US$ 1/US$ 5 compete diretamente com o Claude Opus 5 Fast (US$ 1/US$ 5) em paridade.

A fadiga de custo empresarial tem resposta. A Uber queimou todo o seu orçamento de IA de 2026 em quatro meses (Quartz / Yahoo Finance(abre num novo separador), 2026); a Amazon decidiu limitar gastos com IA no mesmo dia deste corte (Unite.AI(abre num novo separador), 2026). A OpenAI lançou limites rígidos de gastos de API para organizações em 22 de julho (Unite.AI(abre num novo separador), 2026). Os modelos também estão ficando mais inteligentes em economizar dinheiro.

O marco da auto-otimização também muda a narrativa: redução de custo de IA não depende mais apenas de chips mais baratos. Os modelos agora estão ativamente projetando suas próprias curvas de custo — um ciclo de feedback que pode comprimir os cronogramas de preços mais rápido do que a Lei de Moore jamais fez.

O que muda para você

  • Se você usa GPT-5.6 Terra: seus custos de entrada acabaram de cair 20% com zero trabalho de migração.
  • Se você usa modelos Claude e o Terra atende sua barra de qualidade: migrar economiza US$ 1/M só em entrada.
  • Se você está no GPT-5.6 Luna para inferência em lote de alto volume: preços em cache + lote agora trazem a entrada para menos de dez centavos por 1M tokens — viável para processamento de texto em escala de produção onde antes era marginal.
  • Se você precisa de qualidade Sol com custo menor: o Modo Rápido a US$ 1/US$ 5 é um nível novo que não existia antes de 30 de julho.
  • Se você está construindo sobre a API da OpenAI com orçamentos apertados: fixe limites rígidos de gastos — a OpenAI adicionou a funcionalidade em 22 de julho, e os modelos agora gastarão de forma mais inteligente dentro do seu limite.

A OpenAI afirma que quedas adicionais de preço impulsionadas por eficiência estão planejadas ao longo de julho.

Perguntas frequentes

O Luna realmente é usável para trabalho real a esse preço?

Sim. O Luna entrega capacidade próxima ao GPT-5.5. Para tarefas simples de API — classificação, extração, moderação, tradução — o Luna a US$ 0,20 é agora o caminho mais barato para inteligência de texto de nível fronteira e quase certamente é bom o suficiente.

Qual a diferença entre o Modo Rápido do Sol e o Sol padrão?

O Modo Rápido troca uma pequena margem de precisão por respostas aproximadamente 2× mais rápidas com custo 80% menor. A OpenAI oferece como um endpoint dedicado para casos de uso sensíveis à latência (UIs de chat, completions de copilot, chamadas de ferramentas de agentes). Substitui a antiga opção de Processamento Prioritário.

O Sol realmente reescreveu seu próprio código?

Sim. O post de engenharia da OpenAI assinado por Ferrari, Tillet, Ibrahim, Gershenson e Coffey descreve o Sol identificando kernels de GPU ineficientes no Codex e os substituindo por alternativas otimizadas — uma redução de 20% no custo de inferência verificada em telemetria de produção. O Sol também melhorou o pipeline de decodificação especulativa para eficiência de tokens (Post de Engenharia da OpenAI(abre num novo separador), 2026).

TL;DR

  • O que aconteceu: A OpenAI cortou o GPT-5.6 Luna em 80% (agora US$ 0,20/US$ 1,20) e o Terra em 20% (US$ 2/US$ 12), três semanas após o lançamento, financiado pelo Sol reescrevendo autonomamente seus próprios kernels de GPU.
  • Por que importa: Este é o primeiro caso público de um modelo de fronteira auto-otimizando sua pilha de inferência de produção e tendo esse trabalho traduzido em preços para o cliente — não uma renovação de hardware.
  • O que fazer: Refaça o benchmark do seu nível de roteamento de modelos: a US$ 0,20/US$ 1,20 o Luna agora é mais barato que o Haiku 4.5 com capacidade próxima ao GPT-5.5. O Terra a US$ 2/US$ 12 reduz seus gastos com GPT-5.4.

Ferramentas e modelos afetados

Nunca mais precisas de te pôr a par

O resumo semanal — apenas mudanças de veredicto e ações urgentes. Sem enchimento.

Ao subscreveres, aceitas a nossa Política de Privacidade. Cancela a subscrição quando quiseres.