Google ajoute trois modèles audio à Gemini API et AI Studio : Gemini 3.8 Live, une variante Extended Thinking et Gemini 3.5 Transcribe. L'objectif est de mener un dialogue vocal fluide tout en exécutant des tâches et en comprenant une entrée visuelle.
La réponse rapide
| Modèle | Usage principal |
|---|---|
| Gemini 3.8 Live | Dialogue à faible latence et passage à l'action. |
| Extended Thinking | Raisonnement vocal complexe en plusieurs étapes. |
| Gemini 3.5 Transcribe | Reconnaissance vocale dans plus de 85 langues. |
La voix devient une interface d'agent
Le modèle ne se limite pas à transcrire puis lire une réponse. Il gère les interruptions, le rythme de conversation et les appels d'outils pendant l'échange. La variante Extended Thinking accepte davantage de latence pour traiter les demandes complexes.
Transcription spécialisée
Gemini 3.5 Transcribe cible les sous-titres, comptes rendus et indexations. Les équipes devront mesurer noms propres, accents, bruit et changement de langue sur leurs propres enregistrements plutôt que se fier à un score global.
Sécurité et transparence
Google indique intégrer un filigrane imperceptible aux sorties audio générées. Cela aide à identifier un contenu synthétique, mais ne remplace ni l'annonce à l'interlocuteur ni la protection des enregistrements et journaux.
Comment évaluer en production
Testez latence de bout en bout, interruptions, échecs d'outil et coût par conversation. Une voix naturelle peut masquer une erreur avec plus d'autorité qu'un texte. Les actions sensibles doivent donc rester confirmées explicitement et traçables.




La discussion
Commentaires
Chargement des commentaires…