Gemini 3.8 Flash TTS y Flash-Lite TTS llegan a la API de Gemini a $9 y $6 por 1M de tokens de audio, y ambas tarifas se duplican el 1 de enero

Google logoGoogleImportante3 de octubre de 2026Modelos
Qué pasó
Google shipped Gemini 3.8 Flash TTS and Flash-Lite TTS to the Gemini API and AI Studio on 23 September 2026, at $9.00 and $6.00 per 1M audio output tokens.
Por qué importa
Both undercut Gemini 3.1 Flash TTS Preview's $20.00 today, but every 3.8 rate doubles on 1 January 2027.
Qué hacer
Test gemini-3.8-flash-tts or gemini-3.8-flash-lite-tts against your current TTS model, and budget at the 2027 rates.

Nuestro veredicto: condicional en ambos. Si generas voz con Gemini 3.1 Flash TTS Preview, prueba ya Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS: ambos son hoy más baratos por token de audio, y Flash TTS sigue siendo más barato incluso después del salto de precio. La condición es el calendario. Todas las tarifas de 3.8 se duplican el 1 de enero de 2027, y las clasificaciones de calidad que cita Google son los resultados que el propio Google comunica de un benchmark de terceros, no algo que hayamos medido nosotros. Dimensiona cualquier carga de trabajo con las tarifas de 2027 antes de migrarla.

Qué ocurrió

Google anunció Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS el 23 de septiembre de 2026. Ambos están disponibles "hoy" en la API de Gemini y en Google AI Studio. Flash TTS también está en Gemini Notebook, y Flash-Lite TTS en Google Vids. La API de Gemini Enterprise llegará "próximamente".

  • Cobertura: "más de 100 idiomas" y "más de 2.000 voces listas para producción", según la publicación de lanzamiento de Google.
  • Procedencia: cada clip lleva una marca de agua SynthID, y Google añade credenciales C2PA.
  • Replicación de voz: Google afirma que puedes replicar una voz a partir de "una muestra de audio de 30 segundos", con verificación de consentimiento integrada.

La página de precios de la API de Gemini enumera estas tarifas por 1M de tokens:

Modelo (id de API)Entrada de textoSalida de audioDesde el 1 de enero de 2027 (entrada / salida)
Gemini 3.8 Flash TTS (gemini-3.8-flash-tts)$0,50$9,00$1,00 / $18,00
Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts)$0,50$6,00$1,00 / $12,00
Gemini 3.1 Flash TTS Preview (gemini-3.1-flash-tts-preview)$1,00$20,00sin cambios indicados

El procesamiento por lotes cuesta la mitad de la tarifa estándar en ambos modelos 3.8 ($4,50 y $3,00 por 1M de tokens de salida de audio hasta el 31 de diciembre de 2026), y el nivel gratuito cubre ambos.

Por qué importa

La diferencia de precio es la noticia. La salida de audio de Flash TTS cuesta hoy un 55% menos que la de la versión preview 3.1, y la de Flash-Lite TTS un 70% menos. Después del 1 de enero, Flash TTS ($18,00) sigue por debajo de los $20,00 de la preview, y Flash-Lite TTS ($12,00) sigue un 40% por debajo. La entrada de texto cuesta ahora la mitad del $1,00 de la preview y lo iguala a partir de 2027.

Eso hace que migrar desde la preview sea una decisión fácil solo por coste. Lo que mantiene a ambos modelos en condicional y no en recomendado:

  • Las tarifas de lanzamiento son temporales. Un presupuesto construido sobre $9,00 o $6,00 se rompe el 1 de enero de 2027.
  • La calidad es la que reporta Google. Google dice que Flash TTS logró el "puesto n.º 1 general en el Voice Design Benchmark de Hume AI (71,4)" y que los dos modelos lograron "los puestos n.º 1 y n.º 2, respectivamente, en el Overall Quality Index de Hume AI". Son citas de Google de un benchmark de terceros. No hemos ejecutado ninguno de los dos modelos.
  • La replicación de voz está limitada por regiones. "La replicación de voz a través de AI Studio no está disponible en Illinois, Texas, el EEE, Reino Unido, Suiza e India."

Qué cambia para ti

  • Si usas la preview 3.1: pasa tus guiones actuales por gemini-3.8-flash-tts y gemini-3.8-flash-lite-tts y compara lado a lado la calidad de salida y el coste.
  • Elegir nivel: Flash-Lite TTS es el nivel económico para narración de alto volumen y cascadas de agentes de voz; Flash TTS es el que conviene probar para voces expresivas o de personajes.
  • Presupuesto: dimensiona las cargas de trabajo de larga duración con $18,00 y $12,00 por 1M de tokens de salida de audio, no con las tarifas de 2026. Usa el procesamiento por lotes donde la latencia lo permita para reducir a la mitad cualquiera de las dos cifras.
  • Replicación de voz: si tus usuarios o tu equipo están en Illinois, Texas, el EEE, Reino Unido, Suiza o India, la función de replicación de AI Studio no está disponible para ellos.

Qué hacer

  1. 1 If you use gemini-3.1-flash-tts-preview, run the same scripts through gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts and compare quality and cost.
  2. 2 Size any long-running workload at the rates from 1 January 2027 ($18.00 and $12.00 per 1M audio output tokens), not the 2026 rates.
  3. 3 If you plan to use voice replication, check the geographic exclusions first: Illinois, Texas, the EEA, the UK, Switzerland and India.

Herramientas y modelos afectados

No vuelvas a tener que ponerte al día

El resumen semanal — solo cambios de veredicto y acciones urgentes. Sin relleno.

Al suscribirte aceptas nuestra Política de privacidad. Cancela cuando quieras.