Gemini 3.5 Flash Computer Use Empata con GPT-5.5 a 1/3 del Costo

Google logoGoogleVeredicto cambiado28 de junio de 2026Modelos
Qué pasó
Google baked Computer Use into Gemini 3.5 Flash as a native tool on June 24, 2026, scoring 78.4 on OSWorld-Verified — within 0.3 points of GPT-5.5 at roughly one-third the cost.
Por qué importa
At $1.50/$9 per 1M tokens vs GPT-5.5's $5/$30, Gemini becomes the cost-effective default for agentic desktop automation — if the preview API gap closes and the self-reported benchmarks hold in production.
Qué hacer
If you run Computer Use on the standalone Gemini 2.5 model, start migration planning. If you're evaluating computer-use models, add Gemini 3.5 Flash to your benchmark list once the API endpoint goes GA.

Veredicto: Gemini 3.5 Flash es ahora un contendiente real para la automatización de escritorio con agentes — iguala a GPT-5.5 en OSWorld-Verified a aproximadamente un tercio del costo, con controles de seguridad de nivel empresarial incorporados. El modelo independiente Gemini 2.5 Computer Use queda efectivamente obsoleto.

El 24 de junio de 2026, Google lanzó una mejora de capacidades que redefine el panorama de computer use: Computer Use ahora es una herramienta nativa integrada dentro de Gemini 3.5 Flash — sin necesidad de un modelo separado. Anteriormente, esta funcionalidad solo estaba disponible a través de un modelo independiente Gemini 2.5 de computer use lanzado en octubre de 2025; ese modelo ahora queda superado para este caso de uso.

La cifra principal: 78.4 en OSWorld-Verified, el benchmark estándar para agentes de computer use en Ubuntu, Windows y macOS. GPT-5.5 alcanza 78.7 — una diferencia de 0.3 puntos que la cobertura independiente describe como un empate técnico a tres bandas con Claude Opus 4.7 en 78.0. El diferenciador más significativo no es la brecha del benchmark sino el costo: Gemini 3.5 Flash opera a $1.50/M tokens de entrada y $9/M de salida, frente a GPT-5.5 a $5/$30. Para cargas de trabajo con agentes de alto volumen, esa diferencia se acumula rápidamente.

Pero hay una salvedad que vale la pena señalar desde el principio: la herramienta Computer Use aún no está expuesta para Gemini 3.5 Flash en la API pública. El puntaje publicado de 78.4 refleja evaluación interna; la documentación de la API todavía apunta a gemini-3-flash-preview para cargas de trabajo de computer use. Google describe esto como una vista previa pública — los precios GA y la disponibilidad completa de la API aún están por llegar. Este no es un lanzamiento que puedas llevar a producción hoy; es una señal de hacia dónde se dirige la línea Flash.

Qué pasó: Gemini 3.5 Flash recibe Computer Use nativo

Antes de este lanzamiento, combinar computer use con otras capacidades de Gemini requería orquestación multi-modelo: un modelo para la interacción con la pantalla, otro para búsqueda con Search o llamadas a funciones. La integración nativa elimina esa restricción. Los desarrolladores invocan computer use como un único parámetro de herramienta junto a Search, Maps y llamadas a funciones personalizadas — todo dentro de un solo contexto de modelo.

La mejora técnica incluye un campo de intención añadido a cada respuesta de acción. Los modelos anteriores de computer use devolvían coordenadas de píxeles sin contexto; Gemini 3.5 Flash ahora genera una breve explicación en lenguaje natural con cada acción — por ejemplo, "Hacer clic en la caja de búsqueda para escribir el destino". Para desarrolladores depurando ejecuciones de agentes de larga duración, esto hace visible la cadena de razonamiento en cada paso sin necesidad de infraestructura de registro separada.

La mejora generación tras generación es sustancial: Gemini 3 Flash, el predecesor, obtuvo 65.1 en OSWorld. La ganancia de 13.3 puntos entre generaciones de modelo es el mayor salto individual en la tabla de clasificación actual.

Por qué importa

Esto no es solo una demostración de benchmarks — es un cambio arquitectónico que altera la economía de la automatización con agentes. Un solo agente Gemini 3.5 Flash(se abre en una pestaña nueva) ahora puede ver una pantalla, buscar información en Search, interactuar con software legacy mediante la interfaz de usuario y fundamentar respuestas en Maps — todo sin enrutar entre modelos. Para equipos que construyen agentes de prueba de software, automatización de oficina o flujos de trabajo empresariales, esto colapsa la complejidad de ingeniería que antes requería pipelines multi-modelo personalizados.

El panorama competitivo, con puntajes:

ModeloOSWorld-VerifiedEntrada / Salida (por 1M tokens)Estado
Claude Fable 585.0$10 / $50Suspendido (12 jun 2026)
Claude Opus 4.883.4$15 / $75Disponible
GPT-5.578.7$5 / $30Disponible
Gemini 3.5 Flash78.4$1.50 / $9Vista previa
Claude Opus 4.778.0$15 / $75Disponible
Sonnet 4.678.4$3 / $15Disponible
Gemini 3.1 Pro76.2$1.25 / $10Disponible
Gemini 3 Flash65.1$0.15 / $0.60Disponible

Dos salvedades importan: primero, todos los puntajes de OSWorld-Verified son auto-reportados por los proveedores — ninguno ha sido verificado independientemente a junio de 2026. Segundo, los 85.0 de Fable 5 son el verdadero techo de la tabla, pero ha estado suspendido desde la directiva de control de exportaciones de EE.UU. del 12 de junio. Eso hace que Opus 4.8 con 83.4 sea el techo efectivo entre los modelos actualmente disponibles.

Google también incluyó los controles de seguridad que hacen viable Computer Use para despliegues empresariales:

  • Entrenamiento adversarial específicamente para escenarios de inyección de prompts en computer use
  • Confirmación explícita del usuario para acciones sensibles o irreversibles — el modelo pregunta antes de hacer clic en "Eliminar" o "Enviar"
  • Detención automática al detectar inyección indirecta de prompts — si una página web intenta inyectar instrucciones, la sesión se termina
  • Guía de despliegue de defensa en profundidad que recomienda sandboxing, verificación con humano en el circuito y controles de acceso estrictos

Este es el empaquetado correcto para producción. Computer Use sin barreras de seguridad es un incidente de seguridad esperando ocurrir — un agente basado en navegador con acceso de usuario avanzado es exactamente la superficie de ataque que hace peligrosa la inyección de prompts. Google entregó tanto la capacidad como los controles en un solo lanzamiento, algo que la mayoría de los proveedores no logran en un primer lanzamiento.

Qué cambia para ti

Si estás ejecutando cargas de trabajo de Computer Use en el modelo independiente Gemini 2.5 Pro(se abre en una pestaña nueva): planifica tu migración. El modelo 2.5 de computer use está efectivamente obsoleto para este caso de uso. Sin embargo, espera los precios GA y la disponibilidad completa de la API antes de migrar sistemas en producción — la API pública aún no expone Computer Use para Gemini 3.5 Flash.

Si estás evaluando modelos de computer use para automatización con agentes: añade Gemini 3.5 Flash a tu lista de benchmarks junto a GPT-5.5 y Claude Opus 4.8. La brecha de 0.3 puntos en OSWorld frente a GPT-5.5 es insignificante en la práctica; la ventaja de costo del 70%+ a escala no lo es.

Si estás construyendo agentes empresariales: vale la pena estudiar los controles de seguridad que Google implementó incluso si planeas usar un modelo diferente. La combinación de entrenamiento adversarial + barreras de confirmación del usuario + detención automática ante detección de inyección es una plantilla para cualquier despliegue de computer use en producción.

FAQ

¿Puedo usar Computer Use en Gemini 3.5 Flash hoy?

Todavía no a través de la API pública. Google anunció la capacidad el 24 de junio como vista previa pública; el modelo documentado de la API para computer use sigue siendo gemini-3-flash-preview. El puntaje de 78.4 en OSWorld-Verified y las salvaguardas empresariales son reales, pero los precios GA y la disponibilidad completa de la API no han sido anunciados. Sigue la documentación de la API de Gemini(se abre en una pestaña nueva) para el endpoint listo para producción.

¿Cómo se compara Gemini 3.5 Flash con GPT-5.5 para computer use?

En OSWorld-Verified, la brecha es de 0.3 puntos — 78.4 vs 78.7 — lo que es efectivamente un empate. La diferencia real está en el costo: $1.50/$9 por 1M tokens para Gemini 3.5 Flash versus $5/$30 para GPT-5.5. Todos los puntajes de OSWorld-Verified son auto-reportados por los proveedores y no han sido verificados independientemente a junio de 2026.

¿Qué pasó con el modelo independiente Gemini 2.5 Computer Use?

Sigue siendo accesible a través de su endpoint de API existente, pero Google ha posicionado a Gemini 3.5 Flash como el modelo recomendado para cargas de trabajo de computer use de ahora en adelante. El modelo independiente no puede usar simultáneamente Search, Maps o llamadas a funciones dentro del mismo contexto de agente — una limitación que la integración nativa en Flash elimina. La planificación de migración es la postura correcta; la migración de emergencia no lo es (el endpoint 2.5 todavía funciona).

Herramientas y modelos afectados

No vuelvas a tener que ponerte al día

El resumen semanal — solo cambios de veredicto y acciones urgentes. Sin relleno.

Al suscribirte aceptas nuestra Política de privacidad. Cancela cuando quieras.