Deux modèles, deux usages

Le text-to-speech (TTS) transforme un texte écrit en audio parlé. Les nouvelles capacités que Google présente dans son billet du 23 septembre cherchent à dépasser la voix unique qui lit chaque phrase de la même manière. Le modèle Flash TTS vise une narration travaillée : on peut décrire le rôle et le caractère d’une voix, puis diriger la façon de prononcer chaque réplique. Flash-Lite TTS privilégie le débit, la latence et le coût, notamment pour le doublage à grande échelle ou les interfaces conversationnelles.

Une nuance de calendrier compte : les notes de version de l’API Gemini datent la disponibilité générale des deux modèles du 22 septembre 2026. Le billet du 23 septembre en expose les usages et l’arrivée progressive dans plusieurs produits. Pour un article d’actualité, il serait donc inexact d’affirmer qu’ils ont été lancés pour la première fois le 23.

Créer une voix et diriger sa prestation

Selon Google, Flash TTS peut créer une identité vocale à partir d’instructions en langage naturel : rôle, accent, timbre ou style. La société indique plus de 100 langues et dialectes pour la conception de voix et une bibliothèque de plus de 2 000 voix prêtes à l’emploi. L’utilisateur peut donner des consignes ligne par ligne, par exemple demander une phrase murmurée, un changement de rythme ou une réaction vocale. Une même scène peut comprendre deux interlocuteurs distincts. Source : présentation de Google.

La documentation distingue la conception d’une voix originale de la reproduction d’une voix existante. Dans le second cas, Google annonce qu’un échantillon de trente secondes peut suffire pour reconstituer un profil vocal persistant, mais seulement pour sa propre voix ou une voix dont on possède les droits. Le billet précise une vérification du consentement et l’emploi d’un filigrane audio SynthID ainsi que d’identifiants C2PA. Ce sont les garde-fous annoncés par Google ; ils ne démontrent pas qu’aucun abus ou contournement ne sera possible. Source : Google.

Pour les créateurs, cela ouvre des scénarios concrets : enregistrer plusieurs versions d’un personnage sans repartir de zéro, produire une narration multilingue ou tester le rythme d’un dialogue avant de réserver un studio. Pour une entreprise, Flash-Lite peut servir à générer beaucoup de messages parlés avec une identité stable. Le gain réel dépendra de la qualité sur la langue visée, du temps passé à écouter et corriger, et des droits associés aux voix et aux textes. Un résultat convaincant dans une démonstration ne remplace pas un contrôle éditorial sur un livre audio, un film ou un message public.

Où les modèles sont-ils accessibles ?

Google annonce le déploiement des deux modèles dans Google AI Studio et la Gemini API pour les développeurs. Flash TTS est également annoncé dans Gemini Notebook ; Flash-Lite TTS est associé à Google Vids. L’accès via l’API de Gemini Enterprise est présenté comme à venir. Il faut donc distinguer l’accès développeur, les intégrations produit et les déploiements futurs, qui n’ont pas nécessairement les mêmes conditions. Source : tableau de disponibilité de Google.

Le calendrier de Google Vids illustre cette prudence. Dans son article consacré à Vids, Google indique que la narration par Flash-Lite TTS arrivera prochainement. La mention de Vids dans le billet TTS ne doit donc pas être traduite par « disponible pour tous immédiatement » sans vérifier l’interface et le compte concernés.

Combien coûte l’API ?

Sur la grille officielle de l’API Gemini, le tarif standard payant, valable jusqu’au 31 décembre 2026, est de 0,50 dollar par million de tokens de texte en entrée pour chacun des deux modèles. L’audio généré coûte 9 dollars par million de tokens pour Flash TTS et 6 dollars pour Flash-Lite TTS. Google prévoit, à partir du 1er janvier 2027, respectivement 18 et 12 dollars par million de tokens audio, ainsi que 1 dollar par million de tokens texte. La même page affiche aussi un niveau gratuit soumis à ses conditions. Source : tarifs officiels.

Ces chiffres sont des prix par tokens, pas des forfaits fixes par épisode ou par minute. Google indique que l’audio représente 25 tokens par seconde. Une estimation de coût doit donc tenir compte de la durée produite, de la facturation du texte et du mode d’usage choisi. Les modalités Batch, Flex et Priority suivent d’autres tarifs. Avant un projet commercial, il faut recalculer sur la grille en vigueur, car prix et limites de service peuvent évoluer.

Une restriction majeure pour la France

La note de bas de page de l’annonce Google précise que la reproduction de voix dans Google AI Studio n’est pas disponible dans l’Espace économique européen, ni au Royaume-Uni, en Suisse, en Inde, dans l’Illinois et au Texas. La France appartenant à l’EEE, un utilisateur français ne doit pas s’attendre à utiliser cette fonction de clonage dans AI Studio à la date de l’annonce. Cette restriction porte explicitement sur la reproduction vocale dans AI Studio ; elle ne signifie pas, à elle seule, que toute synthèse vocale Gemini est indisponible en France.

Cette distinction est essentielle. La conception d’une voix fictive, l’utilisation d’une voix de bibliothèque et la copie d’une voix réelle n’ont pas les mêmes implications pour le consentement, la propriété intellectuelle et la tromperie. Google décrit une procédure de vérification, mais les éditeurs et producteurs restent responsables de leur usage concret, notamment lorsqu’une voix peut faire croire qu’une personne a prononcé des propos qu’elle n’a jamais tenus.

Ce qu’il reste à juger

Google cite des évaluations favorables à ses modèles pour la qualité vocale et les accents. Ces résultats viennent de l’entreprise et de classements mentionnés dans son communiqué ; ils ne garantissent pas que le modèle sera le meilleur pour chaque accent, chaque script ou chaque environnement sonore. La fiche technique du modèle et les essais indépendants restent les meilleurs points de départ pour confronter la promesse à un usage réel.

L’intérêt de Gemini 3.8 TTS est néanmoins clair : Google relie création de voix, direction de jeu et production à grande échelle dans une même famille. Pour les développeurs, le choix se résume moins à « quelle voix sonne le mieux ? » qu’à un compromis entre contrôle artistique, débit, coût, disponibilité et droits. C’est sur ces critères que les deux modèles devront être évalués.

Sources principales : présentation de Google du 23 septembre ; notes de version de l’API ; documentation des modèles ; tarifs ; annonce Google Vids.