Gemini 3.1 Pro logo

Gemini 3.1 Pro

Google · Sorti févr. 2026

Conditionnel

Le modèle Pro le plus performant de Google accessible au public, avec un contexte d'un million de tokens à un tarif compétitif. Génération précédente : Gemini 3.6 et 3.5 Flash le surpassent désormais en codage et en benchmarks agentiques à moindre coût. Restez-y si vous êtes dans l'écosystème Google Cloud/Vertex AI ; sinon, la gamme Flash ou les concurrents offrent davantage.

Est-ce fait pour vous ?

Recommandé pour

  • Raisonnement approfondi sur des problèmes scientifiques et mathématiques complexes
  • Analyse de très grands contextes avec 1M tokens
  • Équipes soucieuses des coûts ayant besoin d'un raisonnement de niveau Pro à 2 $/12 $
  • Utilisateurs de l'écosystème Google Cloud/Vertex AI

Déconseillé pour

  • Codage de pointe et workflows agentiques — les modèles Flash le surpassent
  • Déploiements sensibles à la sécurité — FAR.AI a trouvé 249 jailbreaks universels pour ~278 $

Performances par tâche

Complex reasoning / science

Excellent

ARC-AGI-2 77.1% (2.5x Gemini 3 Pro), GPQA Diamond 94.3% — top-tier reasoning at launch

Long-context analysis

Excellent

1M token context window, MRCR v2 84.9% at 128K — process entire codebases or multi-document research

Coding

Very Good

SWE-Bench Verified 80.6% is strong but now trails Gemini 3.6 Flash and Claude Opus 5

Agentic workflows

Very Good

APEX-Agents 33.5%, MCP Atlas 69.2% — solid but Flash models are better for production agents

Math

Excellent

LiveCodeBench 2887 Elo, HLE 44.4% no-tools — strong mathematical reasoning

Multimodal understanding

Very Good

MMMU-Pro 80.5% — competitive, natively multimodal across text, audio, images, video

Security / safety

Fair

FAR.AI found 249 universal jailbreaks for ~$278 — significantly weaker safeguards than Claude Fable 5 and GPT-5.6 Sol

Tarifs

Entrée

$2 / 1M

Sortie

$12 / 1M

Contexte

1M tokens

Voir tous les tarifs

Tests de performance

TestScoreSource
ARC-AGI-277.1% Source
MMLU (MMMLU)92.6% Source
GPQA Diamond94.3% Source
SWE-Bench Verified80.6% Source
SWE-Bench Pro (Public)54.2% Source
Terminal-Bench 2.068.5% Source
LiveCodeBench Pro2887 Elo Source
APEX-Agents33.5% Source
HLE (no tools)44.4% Source
HLE (with tools)51.4% Source
MCP Atlas69.2% Source
BrowseComp85.9% Source
MRCR v2 (128K)84.9% Source
MMMU-Pro80.5% Source
GDPval-AA Elo1317 Source

Aucun changement de verdict pour l’instant

L’horloge tourne dès le premier jour : les changements apparaîtront ici à mesure que notre verdict évolue.

Journal de vérification

  • Tarifs— Aucun changement

    Agent automatisé

Comment nous évaluons