Gemini 3.5 Flash: Uso de Computador Empata com GPT-5.5 por 1/3 do Custo

Google logoGoogleVeredicto alterado28 de junho de 2026Modelos
O que aconteceu
Google baked Computer Use into Gemini 3.5 Flash as a native tool on June 24, 2026, scoring 78.4 on OSWorld-Verified — within 0.3 points of GPT-5.5 at roughly one-third the cost.
Porque é importante
At $1.50/$9 per 1M tokens vs GPT-5.5's $5/$30, Gemini becomes the cost-effective default for agentic desktop automation — if the preview API gap closes and the self-reported benchmarks hold in production.
O que fazer
If you run Computer Use on the standalone Gemini 2.5 model, start migration planning. If you're evaluating computer-use models, add Gemini 3.5 Flash to your benchmark list once the API endpoint goes GA.

Veredito: O Gemini 3.5 Flash agora é um concorrente real para automação de desktop baseada em agentes — iguala o GPT-5.5 no OSWorld-Verified por cerca de um terço do custo, com controles de segurança de nível empresarial integrados. O modelo independente Gemini 2.5 Computer Use está efetivamente obsoleto.

Em 24 de junho de 2026, o Google lançou uma atualização de capacidade que reorganiza o cenário de uso de computador: o Uso de Computador agora é uma ferramenta nativa integrada ao Gemini 3.5 Flash — sem necessidade de um modelo separado. O recurso antes só era acessível por meio de um modelo independente Gemini 2.5 de uso de computador, lançado em outubro de 2025; esse modelo agora foi substituído para este caso de uso.

O número principal: 78,4 no OSWorld-Verified, o benchmark padrão para agentes de uso de computador em Ubuntu, Windows e macOS. O GPT-5.5 marca 78,7 — uma diferença de 0,3 pontos que a cobertura independente descreve como efetivamente um empate triplo com o Claude Opus 4.7 em 78,0. O diferenciador mais significativo não é a diferença no benchmark, mas o custo: o Gemini 3.5 Flash custa $1,50/M de tokens de entrada e $9/M de saída, contra $5/$30 do GPT-5.5. Para cargas de trabalho baseadas em agentes em alto volume, essa diferença se acumula rapidamente.

Mas há uma ressalva que precisa ser dita desde já: a ferramenta de Uso de Computador ainda não está disponível para o Gemini 3.5 Flash na API pública. A pontuação publicada de 78,4 reflete avaliação interna; a documentação da API ainda aponta para gemini-3-flash-preview para cargas de trabalho de uso de computador. O Google descreve isso como uma prévia pública — preços de disponibilidade geral e acesso completo à API ainda estão por vir. Este não é um lançamento que você pode colocar em produção hoje; é um sinal de para onde a linha Flash está indo.

O que aconteceu: Gemini 3.5 Flash ganha Uso de Computador nativo

Antes deste lançamento, combinar uso de computador com outras capacidades do Gemini exigia orquestração de múltiplos modelos: um modelo para interação com a tela, outro para busca com grounding ou chamadas de função. A integração nativa elimina essa restrição. Desenvolvedores invocam o uso de computador como um único parâmetro de ferramenta ao lado de Busca, Maps e chamadas de função personalizadas — tudo dentro de um único contexto de modelo.

A atualização técnica inclui um campo de intenção adicionado a cada resposta de ação. Modelos anteriores de uso de computador retornavam coordenadas de pixel puras; o Gemini 3.5 Flash agora produz uma breve explicação em linguagem natural a cada ação — por exemplo, "Clicar na caixa de busca para digitar o destino." Para desenvolvedores depurando execuções de agentes de longa duração, isso torna a cadeia de raciocínio visível a cada etapa sem infraestrutura de logging separada.

A melhoria entre gerações é substancial: o Gemini 3 Flash, seu antecessor, marcou 65,1 no OSWorld. O ganho de 13,3 pontos entre gerações é o maior salto único no quadro de líderes atual.

Por que isso importa

Não é só exibicionismo de benchmark — é uma mudança arquitetural que altera a economia da automação baseada em agentes. Um único agente Gemini 3.5 Flash(abre num novo separador) agora pode ver uma tela, buscar informações na Busca, interagir com software legado via interface e fundamentar respostas no Maps — tudo sem roteamento entre modelos. Para equipes que constroem agentes de teste de software, automação de escritório ou fluxos de trabalho empresariais, isso reduz a complexidade de engenharia que antes exigia pipelines multi-modelo sob medida.

O cenário competitivo, com pontuações:

ModeloOSWorld-VerifiedEntrada / Saída (por 1M tokens)Status
Claude Fable 585,0$10 / $50Suspenso (12 jun 2026)
Claude Opus 4.883,4$15 / $75Disponível
GPT-5.578,7$5 / $30Disponível
Gemini 3.5 Flash78,4$1,50 / $9Prévia
Claude Opus 4.778,0$15 / $75Disponível
Sonnet 4.678,4$3 / $15Disponível
Gemini 3.1 Pro76,2$1,25 / $10Disponível
Gemini 3 Flash65,1$0,15 / $0,60Disponível

Duas ressalvas importam: primeiro, todas as pontuações do OSWorld-Verified são auto-reportadas pelos fornecedores — nenhuma foi verificada independentemente até junho de 2026. Segundo, os 85,0 do Fable 5 são o verdadeiro teto do quadro de líderes, mas ele está suspenso desde a diretiva de controle de exportação dos EUA de 12 de junho. Isso torna o Opus 4.8 em 83,4 o teto efetivo entre os modelos atualmente disponíveis.

O Google também implementou os controles de segurança que tornam o Uso de Computador viável para implantações empresariais:

  • Treinamento adversarial especificamente para cenários de injeção de prompts em uso de computador
  • Confirmação explícita do usuário para ações sensíveis ou irreversíveis — o modelo pergunta antes de clicar em "Excluir" ou "Enviar"
  • Parada automática ao detectar injeção indireta de prompts — se uma página web tentar injetar instruções, a sessão é encerrada
  • Guia de implantação com defesa em profundidade recomendando sandboxing, verificação com supervisão humana e controles de acesso rigorosos

Esta é a embalagem certa para produção. Uso de Computador sem proteções é um incidente de segurança esperando para acontecer — um agente baseado em navegador com acesso de superusuário é exatamente a superfície de ataque que torna a injeção de prompts perigosa. O Google entregou tanto a capacidade quanto os controles em um único lançamento, o que é mais do que a maioria dos fornecedores consegue em um primeiro lançamento.

O que muda para você

Se você executa cargas de trabalho de Uso de Computador no modelo independente Gemini 2.5 Pro(abre num novo separador): planeje sua migração. O modelo 2.5 de uso de computador está efetivamente obsoleto para este caso de uso. No entanto, aguarde preços de disponibilidade geral e acesso completo à API antes de migrar sistemas em produção — a API pública ainda não expõe Uso de Computador para o Gemini 3.5 Flash.

Se você está avaliando modelos de uso de computador para automação baseada em agentes: adicione o Gemini 3.5 Flash à sua lista de benchmarks ao lado do GPT-5.5 e Claude Opus 4.8. A diferença de 0,3 pontos no OSWorld em relação ao GPT-5.5 é insignificante na prática; a vantagem de custo de mais de 70% em escala não é.

Se você está construindo agentes empresariais: vale a pena estudar os controles de segurança que o Google implementou, mesmo que você planeje usar outro modelo. A combinação de treinamento adversarial + portões de confirmação do usuário + parada automática na detecção de injeção é um modelo para qualquer implantação de uso de computador em produção.

FAQ

Posso usar Uso de Computador no Gemini 3.5 Flash hoje?

Ainda não pela API pública. O Google anunciou a capacidade em 24 de junho como prévia pública; o modelo documentado na API para uso de computador permanece gemini-3-flash-preview. A pontuação de 78,4 no OSWorld-Verified e as salvaguardas empresariais são reais, mas os preços de disponibilidade geral e o acesso completo à API não foram anunciados. Acompanhe a documentação da API Gemini(abre num novo separador) para o endpoint pronto para produção.

Como o Gemini 3.5 Flash se compara ao GPT-5.5 para uso de computador?

No OSWorld-Verified, a diferença é de 0,3 pontos — 78,4 vs 78,7 — o que é efetivamente um empate. A diferença real é o custo: $1,50/$9 por 1M de tokens para o Gemini 3.5 Flash contra $5/$30 para o GPT-5.5. Todas as pontuações do OSWorld-Verified são auto-reportadas pelos fornecedores e não foram verificadas independentemente até junho de 2026.

O que aconteceu com o modelo independente Gemini 2.5 Computer Use?

Ele ainda pode ser acessado pelo endpoint de API existente, mas o Google posicionou o Gemini 3.5 Flash como o modelo recomendado para cargas de trabalho de uso de computador daqui para frente. O modelo independente não pode usar simultaneamente Busca, Maps ou chamadas de função no mesmo contexto de agente — uma limitação que a integração nativa do Flash elimina. Planejamento de migração é a postura certa; migração de emergência não é (o endpoint 2.5 ainda funciona).

Ferramentas e modelos afetados

Nunca mais precisas de te pôr a par

O resumo semanal — apenas mudanças de veredicto e ações urgentes. Sem enchimento.

Ao subscreveres, aceitas a nossa Política de Privacidade. Cancela a subscrição quando quiseres.