Google ajoute trois modèles audio à Gemini API et AI Studio : Gemini 3.8 Live, une variante Extended Thinking et Gemini 3.5 Transcribe. L'objectif est de mener un dialogue vocal fluide tout en exécutant des tâches et en comprenant une entrée visuelle.

La réponse rapide

ModèleUsage principal
Gemini 3.8 LiveDialogue à faible latence et passage à l'action.
Extended ThinkingRaisonnement vocal complexe en plusieurs étapes.
Gemini 3.5 TranscribeReconnaissance vocale dans plus de 85 langues.

La voix devient une interface d'agent

Le modèle ne se limite pas à transcrire puis lire une réponse. Il gère les interruptions, le rythme de conversation et les appels d'outils pendant l'échange. La variante Extended Thinking accepte davantage de latence pour traiter les demandes complexes.

Transcription spécialisée

Gemini 3.5 Transcribe cible les sous-titres, comptes rendus et indexations. Les équipes devront mesurer noms propres, accents, bruit et changement de langue sur leurs propres enregistrements plutôt que se fier à un score global.

Sécurité et transparence

Google indique intégrer un filigrane imperceptible aux sorties audio générées. Cela aide à identifier un contenu synthétique, mais ne remplace ni l'annonce à l'interlocuteur ni la protection des enregistrements et journaux.

Comment évaluer en production

Testez latence de bout en bout, interruptions, échecs d'outil et coût par conversation. Une voix naturelle peut masquer une erreur avec plus d'autorité qu'un texte. Les actions sensibles doivent donc rester confirmées explicitement et traçables.