Gemini 3.5 Flash: Uso de Computador Empata com GPT-5.5 por 1/3 do Custo
- O que aconteceu
- Google baked Computer Use into Gemini 3.5 Flash as a native tool on June 24, 2026, scoring 78.4 on OSWorld-Verified — within 0.3 points of GPT-5.5 at roughly one-third the cost.
- Porque é importante
- At $1.50/$9 per 1M tokens vs GPT-5.5's $5/$30, Gemini becomes the cost-effective default for agentic desktop automation — if the preview API gap closes and the self-reported benchmarks hold in production.
- O que fazer
- If you run Computer Use on the standalone Gemini 2.5 model, start migration planning. If you're evaluating computer-use models, add Gemini 3.5 Flash to your benchmark list once the API endpoint goes GA.
Veredito: O Gemini 3.5 Flash agora é um concorrente real para automação de desktop baseada em agentes — iguala o GPT-5.5 no OSWorld-Verified por cerca de um terço do custo, com controles de segurança de nível empresarial integrados. O modelo independente Gemini 2.5 Computer Use está efetivamente obsoleto.
Em 24 de junho de 2026, o Google lançou uma atualização de capacidade que reorganiza o cenário de uso de computador: o Uso de Computador agora é uma ferramenta nativa integrada ao Gemini 3.5 Flash — sem necessidade de um modelo separado. O recurso antes só era acessível por meio de um modelo independente Gemini 2.5 de uso de computador, lançado em outubro de 2025; esse modelo agora foi substituído para este caso de uso.
O número principal: 78,4 no OSWorld-Verified, o benchmark padrão para agentes de uso de computador em Ubuntu, Windows e macOS. O GPT-5.5 marca 78,7 — uma diferença de 0,3 pontos que a cobertura independente descreve como efetivamente um empate triplo com o Claude Opus 4.7 em 78,0. O diferenciador mais significativo não é a diferença no benchmark, mas o custo: o Gemini 3.5 Flash custa $1,50/M de tokens de entrada e $9/M de saída, contra $5/$30 do GPT-5.5. Para cargas de trabalho baseadas em agentes em alto volume, essa diferença se acumula rapidamente.
Mas há uma ressalva que precisa ser dita desde já: a ferramenta de Uso de Computador ainda não está disponível para o Gemini 3.5 Flash na API pública. A pontuação publicada de 78,4 reflete avaliação interna; a documentação da API ainda aponta para gemini-3-flash-preview para cargas de trabalho de uso de computador. O Google descreve isso como uma prévia pública — preços de disponibilidade geral e acesso completo à API ainda estão por vir. Este não é um lançamento que você pode colocar em produção hoje; é um sinal de para onde a linha Flash está indo.
O que aconteceu: Gemini 3.5 Flash ganha Uso de Computador nativo
Antes deste lançamento, combinar uso de computador com outras capacidades do Gemini exigia orquestração de múltiplos modelos: um modelo para interação com a tela, outro para busca com grounding ou chamadas de função. A integração nativa elimina essa restrição. Desenvolvedores invocam o uso de computador como um único parâmetro de ferramenta ao lado de Busca, Maps e chamadas de função personalizadas — tudo dentro de um único contexto de modelo.
A atualização técnica inclui um campo de intenção adicionado a cada resposta de ação. Modelos anteriores de uso de computador retornavam coordenadas de pixel puras; o Gemini 3.5 Flash agora produz uma breve explicação em linguagem natural a cada ação — por exemplo, "Clicar na caixa de busca para digitar o destino." Para desenvolvedores depurando execuções de agentes de longa duração, isso torna a cadeia de raciocínio visível a cada etapa sem infraestrutura de logging separada.
A melhoria entre gerações é substancial: o Gemini 3 Flash, seu antecessor, marcou 65,1 no OSWorld. O ganho de 13,3 pontos entre gerações é o maior salto único no quadro de líderes atual.
Por que isso importa
Não é só exibicionismo de benchmark — é uma mudança arquitetural que altera a economia da automação baseada em agentes. Um único agente Gemini 3.5 Flash(abre num novo separador) agora pode ver uma tela, buscar informações na Busca, interagir com software legado via interface e fundamentar respostas no Maps — tudo sem roteamento entre modelos. Para equipes que constroem agentes de teste de software, automação de escritório ou fluxos de trabalho empresariais, isso reduz a complexidade de engenharia que antes exigia pipelines multi-modelo sob medida.
O cenário competitivo, com pontuações:
| Modelo | OSWorld-Verified | Entrada / Saída (por 1M tokens) | Status |
|---|---|---|---|
| Claude Fable 5 | 85,0 | $10 / $50 | Suspenso (12 jun 2026) |
| Claude Opus 4.8 | 83,4 | $15 / $75 | Disponível |
| GPT-5.5 | 78,7 | $5 / $30 | Disponível |
| Gemini 3.5 Flash | 78,4 | $1,50 / $9 | Prévia |
| Claude Opus 4.7 | 78,0 | $15 / $75 | Disponível |
| Sonnet 4.6 | 78,4 | $3 / $15 | Disponível |
| Gemini 3.1 Pro | 76,2 | $1,25 / $10 | Disponível |
| Gemini 3 Flash | 65,1 | $0,15 / $0,60 | Disponível |
Duas ressalvas importam: primeiro, todas as pontuações do OSWorld-Verified são auto-reportadas pelos fornecedores — nenhuma foi verificada independentemente até junho de 2026. Segundo, os 85,0 do Fable 5 são o verdadeiro teto do quadro de líderes, mas ele está suspenso desde a diretiva de controle de exportação dos EUA de 12 de junho. Isso torna o Opus 4.8 em 83,4 o teto efetivo entre os modelos atualmente disponíveis.
O Google também implementou os controles de segurança que tornam o Uso de Computador viável para implantações empresariais:
- Treinamento adversarial especificamente para cenários de injeção de prompts em uso de computador
- Confirmação explícita do usuário para ações sensíveis ou irreversíveis — o modelo pergunta antes de clicar em "Excluir" ou "Enviar"
- Parada automática ao detectar injeção indireta de prompts — se uma página web tentar injetar instruções, a sessão é encerrada
- Guia de implantação com defesa em profundidade recomendando sandboxing, verificação com supervisão humana e controles de acesso rigorosos
Esta é a embalagem certa para produção. Uso de Computador sem proteções é um incidente de segurança esperando para acontecer — um agente baseado em navegador com acesso de superusuário é exatamente a superfície de ataque que torna a injeção de prompts perigosa. O Google entregou tanto a capacidade quanto os controles em um único lançamento, o que é mais do que a maioria dos fornecedores consegue em um primeiro lançamento.
O que muda para você
Se você executa cargas de trabalho de Uso de Computador no modelo independente Gemini 2.5 Pro(abre num novo separador): planeje sua migração. O modelo 2.5 de uso de computador está efetivamente obsoleto para este caso de uso. No entanto, aguarde preços de disponibilidade geral e acesso completo à API antes de migrar sistemas em produção — a API pública ainda não expõe Uso de Computador para o Gemini 3.5 Flash.
Se você está avaliando modelos de uso de computador para automação baseada em agentes: adicione o Gemini 3.5 Flash à sua lista de benchmarks ao lado do GPT-5.5 e Claude Opus 4.8. A diferença de 0,3 pontos no OSWorld em relação ao GPT-5.5 é insignificante na prática; a vantagem de custo de mais de 70% em escala não é.
Se você está construindo agentes empresariais: vale a pena estudar os controles de segurança que o Google implementou, mesmo que você planeje usar outro modelo. A combinação de treinamento adversarial + portões de confirmação do usuário + parada automática na detecção de injeção é um modelo para qualquer implantação de uso de computador em produção.
FAQ
Posso usar Uso de Computador no Gemini 3.5 Flash hoje?
Ainda não pela API pública. O Google anunciou a capacidade em 24 de junho como prévia pública; o modelo documentado na API para uso de computador permanece gemini-3-flash-preview. A pontuação de 78,4 no OSWorld-Verified e as salvaguardas empresariais são reais, mas os preços de disponibilidade geral e o acesso completo à API não foram anunciados. Acompanhe a documentação da API Gemini(abre num novo separador) para o endpoint pronto para produção.
Como o Gemini 3.5 Flash se compara ao GPT-5.5 para uso de computador?
No OSWorld-Verified, a diferença é de 0,3 pontos — 78,4 vs 78,7 — o que é efetivamente um empate. A diferença real é o custo: $1,50/$9 por 1M de tokens para o Gemini 3.5 Flash contra $5/$30 para o GPT-5.5. Todas as pontuações do OSWorld-Verified são auto-reportadas pelos fornecedores e não foram verificadas independentemente até junho de 2026.
O que aconteceu com o modelo independente Gemini 2.5 Computer Use?
Ele ainda pode ser acessado pelo endpoint de API existente, mas o Google posicionou o Gemini 3.5 Flash como o modelo recomendado para cargas de trabalho de uso de computador daqui para frente. O modelo independente não pode usar simultaneamente Busca, Maps ou chamadas de função no mesmo contexto de agente — uma limitação que a integração nativa do Flash elimina. Planejamento de migração é a postura certa; migração de emergência não é (o endpoint 2.5 ainda funciona).
Ferramentas e modelos afetados
Nunca mais precisas de te pôr a par
O resumo semanal — apenas mudanças de veredicto e ações urgentes. Sem enchimento.