Gemini 3.8 Live : Google muscle fortement ses agents vocaux en temps réel
Google a lancé Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, deux nouveaux modèles conçus pour converser naturellement, analyser ce qu’un utilisateur voit et exécuter des tâches pendant que la discussion continue.
Qu’est-ce que Gemini 3.8 Live ?
Google a présenté Gemini 3.8 Live le 15 septembre 2026, puis a mis à jour son annonce le 17 septembre. Le modèle est pensé pour les interactions audio en temps réel : l’utilisateur peut parler naturellement, montrer une image ou un flux vidéo, et laisser l’IA appeler des outils ou des API sans interrompre entièrement la conversation.
La différence importante avec un simple chatbot vocal est la continuité. Google explique que les appels de fonctions peuvent désormais s’exécuter de manière asynchrone : le modèle peut reconnaître une demande, continuer à parler et intégrer le résultat lorsqu’il arrive.
Gemini 3.8 Live
Version conçue pour la faible latence, la fluidité du dialogue, l’efficacité économique et le déploiement à grande échelle.
Gemini 3.8 Live Extended Thinking
Version destinée aux demandes complexes nécessitant davantage de raisonnement et plusieurs étapes.
Les 5 nouveautés à retenir
1. L’IA peut continuer à parler pendant qu’elle exécute une action
Les appels d’API et de fonctions peuvent être lancés en arrière-plan. Pour un agent de réservation, un support client ou un assistant d’entreprise, cela évite qu’une conversation paraisse figée pendant qu’un système externe répond.
2. Gemini peut tenir compte de ce que la caméra voit
Gemini 3.8 Live accepte le texte, les images, l’audio et la vidéo en entrée. Google met en avant le « visual grounding » en quasi-temps réel : un agent peut donc combiner ce que l’utilisateur dit avec ce qui apparaît devant la caméra.
3. Le modèle passe automatiquement d’une langue à l’autre
Google annonce la prise en charge de 97 langues avec détection et transition automatiques au cours d’une même conversation. Cela ouvre la porte à des assistants multilingues plus naturels dans le support, le voyage ou les services internationaux.
4. Extended Thinking raisonne tout en gardant une conversation naturelle
La version Extended Thinking est conçue pour les workflows plus complexes. Google explique qu’elle peut donner de premiers signaux vocaux, poursuivre son raisonnement et commenter l’avancement d’une tâche en plusieurs étapes.
5. Les développeurs peuvent déjà l’utiliser
Gemini 3.8 Live et Extended Thinking sont disponibles dans la Gemini API et Google AI Studio. Le code de modèle principal est gemini-3.8-live. La documentation indique une fenêtre d’entrée de 131 072 jetons et une limite de sortie de 65 536 jetons.
Gemini 3.8 Live : combien ça coûte ?
| Type | Tarif API payant |
|---|---|
| Texte en entrée | 0,75 $ / million de jetons |
| Audio en entrée | 3 $ / million de jetons, soit environ 0,005 $/min |
| Image / vidéo en entrée | 1 $ / million de jetons, soit environ 0,002 $/min |
| Texte en sortie | 4,50 $ / million de jetons |
| Audio en sortie | 12 $ / million de jetons, soit environ 0,018 $/min |
Google propose également un niveau sans frais. Pour les sessions longues, il faut cependant surveiller le coût : l’API Live conserve un contexte de conversation persistant et peut retraiter l’historique à chaque tour.
Où peut-on utiliser Gemini 3.8 Live ?
Le déploiement concerne plusieurs produits. Pour les développeurs, les modèles sont accessibles via Gemini API et Google AI Studio. Google indique également un déploiement dans Search Live, Gemini Live et certaines expériences Google Workspace. Côté entreprise, plusieurs usages sont encore en préversion privée.
Pourquoi cette sortie est importante
La bataille de l’IA ne se limite plus aux réponses textuelles. Les grands acteurs cherchent désormais à construire des assistants capables de voir, parler, raisonner et agir dans une même interaction. Gemini 3.8 Live illustre ce déplacement vers des agents multimodaux capables d’exécuter des tâches sans casser la fluidité d’une conversation.
Pour les entreprises, les cas d’usage les plus évidents concernent le support client, l’assistance en direct, la formation, les réservations, les interfaces vocales et les outils internes. Pour le grand public, l’enjeu est plutôt de rendre l’IA moins proche d’un formulaire de chat et davantage d’un assistant avec lequel on peut collaborer en continu.
Gemini 3.8 Live ou un chatbot classique : quelle différence ?
Un chatbot classique attend généralement une demande, produit une réponse, puis recommence. Gemini 3.8 Live est conçu autour d’une session continue : l’audio, les images, les actions externes et le contexte peuvent s’enchaîner dans une même interaction.
À lire aussi sur Portail IA
Pour aller plus loin : Gemini Omni Flash, notre dossier ChatGPT vs Claude vs Gemini et notre guide sur les agents IA capables d’utiliser un ordinateur.
Sources officielles
Crédit image : Jumping Jax / Unsplash.



