Gemini 3.5 Flash Computer Use égale GPT-5.5 pour un tiers du coût

Google logoGoogleVerdict modifié28 juin 2026Modèles
Ce qui s’est passé
Google baked Computer Use into Gemini 3.5 Flash as a native tool on June 24, 2026, scoring 78.4 on OSWorld-Verified — within 0.3 points of GPT-5.5 at roughly one-third the cost.
Pourquoi c’est important
At $1.50/$9 per 1M tokens vs GPT-5.5's $5/$30, Gemini becomes the cost-effective default for agentic desktop automation — if the preview API gap closes and the self-reported benchmarks hold in production.
Que faire
If you run Computer Use on the standalone Gemini 2.5 model, start migration planning. If you're evaluating computer-use models, add Gemini 3.5 Flash to your benchmark list once the API endpoint goes GA.

Verdict : Gemini 3.5 Flash est désormais un concurrent sérieux pour l'automatisation desktop agentique — il égale GPT-5.5 sur OSWorld-Verified pour environ un tiers du coût, avec des contrôles de sécurité de niveau entreprise intégrés. Le modèle autonome Gemini 2.5 Computer Use est de facto obsolète.

Le 24 juin 2026, Google a livré une mise à niveau qui redessine le paysage de l'utilisation d'ordinateur : Computer Use est désormais un outil natif intégré à Gemini 3.5 Flash — aucun modèle séparé requis. La fonctionnalité n'était auparavant accessible que via un modèle autonome Gemini 2.5 Computer Use lancé en octobre 2025 ; ce modèle est désormais dépassé pour ce cas d'usage.

Le chiffre clé : 78,4 sur OSWorld-Verified, le benchmark standard pour les agents d'utilisation d'ordinateur sur Ubuntu, Windows et macOS. GPT-5.5 affiche 78,7 — un écart de 0,3 point que les observateurs indépendants décrivent comme une quasi-égalité à trois avec Claude Opus 4.7 à 78,0. Le différenciateur le plus significatif n'est pas l'écart de benchmark mais le coût : Gemini 3.5 Flash fonctionne à 1,50 $/M de tokens en entrée et 9 $/M en sortie, contre 5 $/30 $ pour GPT-5.5. Pour les workloads agentiques à haut volume, cet écart se creuse rapidement.

Mais il y a un bémol qu'il faut énoncer d'emblée : l'outil Computer Use n'est pas encore exposé pour Gemini 3.5 Flash dans l'API publique. Le score publié de 78,4 reflète une évaluation interne ; la documentation de l'API pointe toujours vers gemini-3-flash-preview pour les workloads Computer Use. Google décrit cela comme une preview publique — la tarification GA et la disponibilité complète de l'API sont encore à venir. Ce n'est pas un lancement que vous pouvez déployer en production aujourd'hui ; c'est un signal de la direction que prend la gamme Flash.

Ce qui s'est passé : Gemini 3.5 Flash intègre Computer Use en natif

Avant cette sortie, combiner l'utilisation d'ordinateur avec d'autres capacités de Gemini nécessitait une orchestration multi-modèles : un modèle pour l'interaction avec l'écran, un autre pour l'ancrage Search ou les appels de fonction. L'intégration native supprime cette contrainte. Les développeurs invoquent l'utilisation d'ordinateur comme un simple paramètre d'outil aux côtés de Search, Maps et des appels de fonction personnalisés — le tout dans un contexte de modèle unique.

La mise à niveau technique inclut un champ d'intention ajouté à chaque réponse d'action. Les précédents modèles Computer Use renvoyaient des coordonnées de pixels brutes ; Gemini 3.5 Flash produit désormais une brève explication en langage naturel avec chaque action — par exemple, « Cliquer sur la barre de recherche pour saisir la destination ». Pour les développeurs qui déboguent des exécutions d'agents à horizon long, cela rend la chaîne de raisonnement visible à chaque étape sans infrastructure de journalisation séparée.

L'amélioration générationnelle est substantielle : Gemini 3 Flash, le prédécesseur, obtenait 65,1 sur OSWorld. Le gain de 13,3 points entre les générations de modèles est le plus grand saut unique du classement actuel.

Pourquoi c'est important

Ce n'est pas juste un exploit de benchmark — c'est un changement architectural qui modifie l'économie de l'automatisation agentique. Un seul agent Gemini 3.5 Flash(s’ouvre dans un nouvel onglet) peut désormais voir un écran, rechercher des informations sur Search, interagir avec des logiciels legacy via l'interface utilisateur et ancrer ses réponses dans Maps — le tout sans routage entre modèles. Pour les équipes qui construisent des agents de test logiciel, d'automatisation bureautique ou des workflows d'entreprise, cela réduit une complexité d'ingénierie qui nécessitait auparavant des pipelines multi-modèles sur mesure.

Le tableau concurrentiel, avec les scores :

ModèleOSWorld-VerifiedEntrée / Sortie (par 1M tokens)Statut
Claude Fable 585,010 $ / 50 $Suspendu (12 juin 2026)
Claude Opus 4.883,415 $ / 75 $Disponible
GPT-5.578,75 $ / 30 $Disponible
Gemini 3.5 Flash78,41,50 $ / 9 $Preview
Claude Opus 4.778,015 $ / 75 $Disponible
Sonnet 4.678,43 $ / 15 $Disponible
Gemini 3.1 Pro76,21,25 $ / 10 $Disponible
Gemini 3 Flash65,10,15 $ / 0,60 $Disponible

Deux réserves importantes : premièrement, tous les scores OSWorld-Verified sont auto-déclarés par les fournisseurs — aucun n'a été vérifié de manière indépendante en juin 2026. Deuxièmement, le 85,0 de Fable 5 est le véritable plafond du classement, mais le modèle est suspendu depuis la directive américaine de contrôle des exportations du 12 juin. Cela fait d'Opus 4.8 à 83,4 le plafond effectif parmi les modèles actuellement disponibles.

Google a également livré les contrôles de sécurité qui rendent l'utilisation d'ordinateur viable pour les déploiements en entreprise :

  • Entraînement adversarial spécifiquement pour les scénarios d'injection de prompt en Computer Use
  • Confirmation explicite de l'utilisateur pour les actions sensibles ou irréversibles — le modèle demande avant de cliquer sur « Supprimer » ou « Envoyer »
  • Arrêt automatique en cas de détection d'injection de prompt indirecte — si une page web tente d'injecter des instructions, la session se termine
  • Guide de déploiement en défense en profondeur recommandant le sandboxing, la vérification humaine dans la boucle et des contrôles d'accès stricts

C'est le bon conditionnement pour la production. L'utilisation d'ordinateur sans garde-fous est un incident de sécurité en puissance — un agent basé navigateur avec un accès power-user est exactement la surface d'attaque qui rend l'injection de prompt dangereuse. Google a livré à la fois la capacité et les contrôles en une seule sortie, ce que peu de fournisseurs réussissent dès un premier lancement.

Ce qui change pour vous

Si vous exécutez des workloads Computer Use sur le modèle autonome Gemini 2.5 Pro(s’ouvre dans un nouvel onglet) : planifiez votre migration. Le modèle Computer Use 2.5 est effectivement déprécié pour ce cas d'usage. Cependant, attendez la tarification GA et la disponibilité complète de l'API avant de basculer vos systèmes de production — l'API publique n'expose pas encore Computer Use pour Gemini 3.5 Flash.

Si vous évaluez des modèles Computer Use pour l'automatisation agentique : ajoutez Gemini 3.5 Flash à votre liste de benchmarks aux côtés de GPT-5.5 et Claude Opus 4.8. L'écart de 0,3 point sur OSWorld avec GPT-5.5 est négligeable en pratique ; l'avantage de coût de plus de 70 % à l'échelle ne l'est pas.

Si vous construisez des agents d'entreprise : les contrôles de sécurité livrés par Google méritent d'être étudiés même si vous prévoyez d'utiliser un autre modèle. La combinaison entraînement adversarial + portes de confirmation utilisateur + arrêt automatique sur détection d'injection est un modèle pour tout déploiement en production d'utilisation d'ordinateur.

FAQ

Puis-je utiliser Computer Use dans Gemini 3.5 Flash aujourd'hui ?

Pas encore via l'API publique. Google a annoncé la capacité le 24 juin en preview publique ; le modèle documenté de l'API pour l'utilisation d'ordinateur reste gemini-3-flash-preview. Le score de 78,4 sur OSWorld-Verified et les garde-fous entreprise sont réels, mais la tarification GA et la disponibilité complète de l'API n'ont pas été annoncées. Surveillez la documentation de l'API Gemini(s’ouvre dans un nouvel onglet) pour le endpoint prêt pour la production.

Comment Gemini 3.5 Flash se compare-t-il à GPT-5.5 pour l'utilisation d'ordinateur ?

Sur OSWorld-Verified, l'écart est de 0,3 point — 78,4 contre 78,7 — ce qui est effectivement une égalité. La vraie différence est le coût : 1,50 $/9 $ par 1M de tokens pour Gemini 3.5 Flash contre 5 $/30 $ pour GPT-5.5. Tous les scores OSWorld-Verified sont auto-déclarés par les fournisseurs et n'ont pas été vérifiés de manière indépendante en juin 2026.

Qu'est-il arrivé au modèle autonome Gemini 2.5 Computer Use ?

Il est toujours accessible via son endpoint API existant, mais Google a positionné Gemini 3.5 Flash comme le modèle recommandé pour les workloads Computer Use à l'avenir. Le modèle autonome ne peut pas utiliser simultanément Search, Maps ou les appels de fonction dans le même contexte d'agent — une limitation que l'intégration native Flash élimine. La planification de migration est la bonne posture ; une migration d'urgence ne l'est pas (le endpoint 2.5 fonctionne toujours).

Outils et modèles concernés

Ne ratez plus jamais une mise à jour

Le récap hebdomadaire — uniquement les changements de verdict et les actions urgentes. Sans remplissage.

En vous abonnant, vous acceptez notre Politique de confidentialité. Désabonnement à tout moment.