Trois modèles, deux fonctions distinctes

Le premier composant transforme la parole en texte : c’est le rôle de MAI-Transcribe-2-Streaming. Les deux autres font le trajet inverse : MAI-Voice-2.1 et MAI-Voice-2.1-Flash génèrent une voix à partir de texte. Les réunir peut former la partie « oreilles et voix » d’un agent conversationnel. Un système complet doit encore comprendre la demande, décider de la réponse, appeler éventuellement des outils et gérer les erreurs. Les trois annonces ne signifient donc pas qu’un agent autonome prêt à l’emploi est apparu pour tous les usages. Source : Microsoft AI.

La distinction avec un modèle déjà publié est importante : Microsoft avait annoncé MAI-Transcribe-2 en septembre. La nouveauté du 1er octobre est la version Streaming, conçue pour produire du texte pendant qu’une personne parle, au lieu d’attendre la fin d’un fichier audio. Elle n’efface pas automatiquement les fonctions ou les conditions de la version non streaming. Sources : annonce du 1er octobre ; annonce de MAI-Transcribe-2.

Une transcription qui évolue pendant la phrase

Selon Microsoft, MAI-Transcribe-2-Streaming prend en charge 60 langues et détecte automatiquement la langue en continu. Le modèle émet des hypothèses de transcription provisoires un peu plus de 100 millisecondes après réception de l’audio, puis les corrige à mesure que la phrase se précise avant de stabiliser le texte. Cette mécanique est essentielle pour un agent vocal : elle permet de commencer à préparer une réponse pendant que l’utilisateur parle encore. Source : Microsoft AI.

Il faut cependant comprendre ce que signifie ce chiffre. Cent millisecondes concernent les premiers fragments provisoires, pas le délai de transcription définitive de toute la phrase, ni le temps nécessaire pour produire une réponse parlée correcte. Un système réel ajoute le réseau, le raisonnement de l’agent, ses éventuels appels à des services et la génération de voix. Microsoft affirme aussi, sur ses évaluations internes, que les mots apparaissent deux fois plus vite qu’avec son concurrent le plus proche dans certains usages. Sans détail complet du contexte d’intégration, ce rapport ne doit pas devenir une promesse générale pour chaque centre d’appels ou application. Source : Microsoft AI.

L’entreprise indique que le modèle se classe premier pour la précision des transcriptions provisoires et finales dans les évaluations d’Artificial Analysis qu’elle cite. Un classement est utile pour présélectionner des outils, mais il ne répond pas seul aux besoins d’un utilisateur français : accents, bruit, vocabulaire métier, enregistrements téléphoniques et alternance des langues peuvent changer le résultat. Avant d’intégrer le modèle à une activité sensible, il faudrait le tester sur des conversations représentatives et mesurer les erreurs qui ont réellement un coût. Source : Microsoft AI.

Une même voix à travers plusieurs langues

MAI-Voice-2.1 est présenté comme le modèle vocal multilingue le plus avancé de Microsoft AI à ce jour. L’entreprise annonce 23 langues et 26 variantes locales. Son argument principal est la continuité d’une même identité vocale quand le texte passe d’une langue à l’autre, par exemple dans une leçon multilingue ou un service international. Une voix de marque cohérente pourrait faciliter ces usages ; elle ne garantit toutefois pas la justesse de la traduction ou la pertinence de la réponse produite par un autre modèle. Source : Microsoft AI.

La version Flash vise davantage le volume et les applications sensibles à la latence. Microsoft affirme qu’elle peut produire 45 secondes d’audio avec une latence de bout en bout de 150 millisecondes dans la démonstration qu’il décrit. La société annonce également une inférence 55 % plus rapide et un coût d’environ 60 % inférieur à ceux de modèles comparables. Ces comparaisons viennent de Microsoft ; elles n’identifient pas dans l’article toutes les conditions techniques ou chaque concurrent retenu. Les équipes devraient donc vérifier la vitesse et la qualité sur leurs propres textes. Source : Microsoft AI.

Les deux modèles vocaux prennent en charge la reproduction d’une voix à partir de quelques secondes d’enregistrement de référence, selon Microsoft. Cette capacité intéresse les marques et les médias, mais elle soulève aussi un risque d’imitation non consentie. Microsoft affirme avoir prévu des garde-fous liés au consentement. L’annonce ne suffit pas à évaluer leur efficacité face à toutes les tentatives d’abus ; les conditions d’utilisation et les contrôles concrets méritent d’être vérifiés avant un déploiement. Source : Microsoft AI.

Combien coûtent ces modèles ?

Microsoft publie trois tarifs dans son annonce : 0,54 dollar par heure d’audio pour MAI-Transcribe-2-Streaming à titre introductif jusqu’à la fin de 2026 ; 22 dollars par million de caractères pour MAI-Voice-2.1 ; 15 dollars par million de caractères pour Flash. Le prix futur de la transcription après la période introductive n’est pas indiqué. Les unités diffèrent : on ne peut pas comparer directement une heure de parole entrante et un million de caractères de parole générée.

La facture complète d’un agent vocal ne se limite pas à ces tarifs. Il faut ajouter, selon l’architecture choisie, le modèle qui réfléchit, l’hébergement, la téléphonie, le stockage éventuel et les services appelés en cours de conversation. Le coût réel dépend aussi de la durée des appels, de la quantité de texte générée et de la gestion des silences. Les prix publiés fournissent une base de calcul, pas un coût total universel par conversation.

Où les essayer et pour qui ?

Microsoft indique que les trois modèles sont accessibles via Microsoft Foundry et son MAI Playground. Les modèles vocaux sont également annoncés sur OpenRouter ; d’autres voies d’accès figurent dans le communiqué, dont Vercel et Azure Voice Live. LiveKit est présenté comme à venir, et ne doit pas être compté comme disponible immédiatement. La documentation de MAI-Transcribe dans Azure Speech rappelle que certaines fonctions de la famille sont encore en preview, avec des conditions différentes d’un service de production. Il faut vérifier, pour le modèle précis et la région Azure choisie, les limites, les langues et les garanties contractuelles avant toute mise en service. Sources : Microsoft AI ; Microsoft Learn.

Les développeurs d’assistants clients, de dictée en direct, de sous-titrage et d’outils pédagogiques sont les premiers concernés. Pour le grand public, ce n’est pas l’annonce d’une nouvelle fonction vocale déjà activée partout dans Windows ou Copilot. Microsoft décrit des composants pour construire des applications. Il ne détaille pas dans l’article une disponibilité identique dans tous les pays ni un calendrier de déploiement dans chacun de ses produits.

Ce que cette sortie change réellement

La compétition des agents vocaux se joue désormais sur la qualité de chaque maillon et sur leur coordination. Une transcription partielle rapide peut réduire le temps mort perçu ; une voix multilingue stable peut rendre un service plus fluide. Mais une réponse fiable exige aussi des contrôles sur le raisonnement, les données personnelles et les actions déclenchées. Microsoft propose ici des pièces plus rapides et des prix publics ; leur valeur finale dépendra de la qualité mesurée dans des applications réelles, notamment en français et dans des environnements bruyants.

Sources principales