Gemini 3.1 Pro logo

Gemini 3.1 Pro

Google · Lanzado feb 2026

Condicional

El modelo Pro más capaz de Google disponible públicamente, con contexto de 1M tokens a precios competitivos. Generación anterior: Gemini 3.6 y 3.5 Flash ya lo superan en benchmarks de codificación y agentes a menor coste. Mantenlo si usas Google Cloud/Vertex AI; si no, la línea Flash o los competidores ofrecen más.

¿Es adecuada para ti?

Bueno para

  • Razonamiento profundo en problemas científicos y matemáticos complejos
  • Análisis de contextos muy extensos con 1M tokens
  • Equipos con presupuesto ajustado que necesitan razonamiento de nivel Pro a $2/$12
  • Usuarios del ecosistema Google Cloud/Vertex AI

No recomendado para

  • Codificación de vanguardia y flujos de trabajo agénticos — los modelos Flash lo superan
  • Despliegues sensibles a la seguridad — FAR.AI encontró 249 jailbreaks universales por ~$278

Rendimiento por tarea

Complex reasoning / science

Excellent

ARC-AGI-2 77.1% (2.5x Gemini 3 Pro), GPQA Diamond 94.3% — top-tier reasoning at launch

Long-context analysis

Excellent

1M token context window, MRCR v2 84.9% at 128K — process entire codebases or multi-document research

Coding

Very Good

SWE-Bench Verified 80.6% is strong but now trails Gemini 3.6 Flash and Claude Opus 5

Agentic workflows

Very Good

APEX-Agents 33.5%, MCP Atlas 69.2% — solid but Flash models are better for production agents

Math

Excellent

LiveCodeBench 2887 Elo, HLE 44.4% no-tools — strong mathematical reasoning

Multimodal understanding

Very Good

MMMU-Pro 80.5% — competitive, natively multimodal across text, audio, images, video

Security / safety

Fair

FAR.AI found 249 universal jailbreaks for ~$278 — significantly weaker safeguards than Claude Fable 5 and GPT-5.6 Sol

Precios

Entrada

$2 / 1M

Salida

$12 / 1M

Contexto

1M tokens

Ver precios completos

Pruebas de rendimiento

PruebaPuntuaciónFuente
ARC-AGI-277.1% Fuente
MMLU (MMMLU)92.6% Fuente
GPQA Diamond94.3% Fuente
SWE-Bench Verified80.6% Fuente
SWE-Bench Pro (Public)54.2% Fuente
Terminal-Bench 2.068.5% Fuente
LiveCodeBench Pro2887 Elo Fuente
APEX-Agents33.5% Fuente
HLE (no tools)44.4% Fuente
HLE (with tools)51.4% Fuente
MCP Atlas69.2% Fuente
BrowseComp85.9% Fuente
MRCR v2 (128K)84.9% Fuente
MMMU-Pro80.5% Fuente
GDPval-AA Elo1317 Fuente

Aún no hay cambios de veredicto

El reloj corre desde el primer día: los cambios aparecerán aquí a medida que evolucione nuestro veredicto.

Registro de verificación

  • Precios— Sin cambios

    Agente automatizado

Cómo evaluamos