Gemini 3.8 Flash TTS et Flash-Lite TTS arrivent dans l'API Gemini à $9 et $6 par million de tokens audio, et les deux tarifs doublent le 1er janvier

Google logoGoogleImportant3 octobre 2026Modèles
Ce qui s’est passé
Google shipped Gemini 3.8 Flash TTS and Flash-Lite TTS to the Gemini API and AI Studio on 23 September 2026, at $9.00 and $6.00 per 1M audio output tokens.
Pourquoi c’est important
Both undercut Gemini 3.1 Flash TTS Preview's $20.00 today, but every 3.8 rate doubles on 1 January 2027.
Que faire
Test gemini-3.8-flash-tts or gemini-3.8-flash-lite-tts against your current TTS model, and budget at the 2027 rates.

Notre verdict : conditionnel pour les deux. Si vous générez de la parole avec Gemini 3.1 Flash TTS Preview, testez dès maintenant Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS : les deux sont aujourd'hui moins chers par token audio, et Flash TTS reste moins cher même après la hausse. La condition tient au calendrier. Tous les tarifs 3.8 doublent le 1er janvier 2027, et les classements de qualité cités par Google sont sa propre présentation d'un benchmark tiers, pas quelque chose que nous avons mesuré. Dimensionnez toute charge de travail aux tarifs de 2027 avant de la migrer.

Ce qui s'est passé

Google a annoncé Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS le 23 septembre 2026. Les deux sont disponibles « dès aujourd'hui » dans l'API Gemini et Google AI Studio. Flash TTS est aussi dans Gemini Notebook, et Flash-Lite TTS dans Google Vids. L'API Gemini Enterprise est « bientôt disponible ».

  • Couverture : « plus de 100 langues » et « plus de 2 000 voix prêtes pour la production », selon l'annonce de lancement de Google.
  • Provenance : chaque clip est filigrané avec SynthID, et Google ajoute des identifiants C2PA.
  • Réplication de voix : Google affirme qu'on peut répliquer une voix à partir d'« un échantillon audio de 30 secondes », avec vérification intégrée du consentement.

La page de tarifs de l'API Gemini indique ces tarifs par million de tokens :

Modèle (identifiant d'API)Entrée texteSortie audioÀ partir du 1er janv. 2027 (entrée / sortie)
Gemini 3.8 Flash TTS (gemini-3.8-flash-tts)$0,50$9,00$1,00 / $18,00
Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts)$0,50$6,00$1,00 / $12,00
Gemini 3.1 Flash TTS Preview (gemini-3.1-flash-tts-preview)$1,00$20,00aucun changement indiqué

Le mode batch coûte la moitié du tarif standard sur les deux modèles 3.8 ($4,50 et $3,00 par million de tokens audio en sortie jusqu'au 31 décembre 2026), et l'offre gratuite couvre les deux.

Pourquoi c'est important

Tout se joue sur l'écart de prix. La sortie audio de Flash TTS coûte aujourd'hui 55 % de moins que la préversion 3.1, et celle de Flash-Lite TTS 70 % de moins. Après le 1er janvier, Flash TTS ($18,00) reste en dessous des $20,00 de la préversion, et Flash-Lite TTS ($12,00) reste 40 % en dessous. L'entrée texte coûte aujourd'hui la moitié des $1,00 de la préversion, puis le même prix à partir de 2027.

Le passage depuis la préversion est donc une décision facile sur le seul critère du coût. Ce qui maintient les deux modèles à conditionnel plutôt qu'à recommandé :

  • Les tarifs de lancement sont temporaires. Un budget bâti sur $9,00 ou $6,00 saute le 1er janvier 2027.
  • La qualité est déclarée par Google. Google affirme que Flash TTS a pris la « 1re place au classement général du Voice Design Benchmark de Hume AI (71,4) » et que les deux modèles ont pris respectivement les « 1re et 2e places de l'Overall Quality Index de Hume AI ». Ce sont des citations par Google d'un benchmark tiers. Nous n'avons testé aucun des deux modèles.
  • La réplication de voix est verrouillée par région. « La réplication de voix via AI Studio n'est pas disponible en Illinois, au Texas, dans l'EEE, au Royaume-Uni, en Suisse et en Inde. »

Ce qui change pour vous

  • Si vous êtes sur la préversion 3.1 : passez vos scripts existants dans gemini-3.8-flash-tts et gemini-3.8-flash-lite-tts et comparez côte à côte la qualité de sortie et le coût.
  • Choisir un modèle : Flash-Lite TTS est le modèle économique pour la narration à gros volume et les architectures d'agent vocal en cascade ; Flash TTS est celui à tester pour les voix expressives ou de personnage.
  • Budget : dimensionnez les charges de travail de longue durée à $18,00 et $12,00 par million de tokens audio en sortie, et non aux tarifs de 2026. Utilisez le mode batch quand la latence le permet pour diviser l'un ou l'autre de ces montants par deux.
  • Réplication de voix : si vos utilisateurs ou votre équipe se trouvent en Illinois, au Texas, dans l'EEE, au Royaume-Uni, en Suisse ou en Inde, la fonction de réplication d'AI Studio ne leur est pas accessible.

Que faire

  1. 1 If you use gemini-3.1-flash-tts-preview, run the same scripts through gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts and compare quality and cost.
  2. 2 Size any long-running workload at the rates from 1 January 2027 ($18.00 and $12.00 per 1M audio output tokens), not the 2026 rates.
  3. 3 If you plan to use voice replication, check the geographic exclusions first: Illinois, Texas, the EEA, the UK, Switzerland and India.

Outils et modèles concernés

Ne ratez plus jamais une mise à jour

Le récap hebdomadaire — uniquement les changements de verdict et les actions urgentes. Sans remplissage.

En vous abonnant, vous acceptez notre Politique de confidentialité. Désabonnement à tout moment.