Gemini 3.8 Live : Google muscle ses agents vocaux en temps réel

Date:

Actualité IA · Google · 20 septembre 2026

Gemini 3.8 Live : Google muscle fortement ses agents vocaux en temps réel

Google a lancé Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, deux nouveaux modèles conçus pour converser naturellement, analyser ce qu’un utilisateur voit et exécuter des tâches pendant que la discussion continue.

Réponse rapide : Gemini 3.8 Live vise les assistants vocaux rapides et économiques. Gemini 3.8 Live Extended Thinking ajoute davantage de raisonnement pour les tâches complexes, tout en maintenant une conversation vocale continue.

Qu’est-ce que Gemini 3.8 Live ?

Google a présenté Gemini 3.8 Live le 15 septembre 2026, puis a mis à jour son annonce le 17 septembre. Le modèle est pensé pour les interactions audio en temps réel : l’utilisateur peut parler naturellement, montrer une image ou un flux vidéo, et laisser l’IA appeler des outils ou des API sans interrompre entièrement la conversation.

La différence importante avec un simple chatbot vocal est la continuité. Google explique que les appels de fonctions peuvent désormais s’exécuter de manière asynchrone : le modèle peut reconnaître une demande, continuer à parler et intégrer le résultat lorsqu’il arrive.

Gemini 3.8 Live

Version conçue pour la faible latence, la fluidité du dialogue, l’efficacité économique et le déploiement à grande échelle.

Gemini 3.8 Live Extended Thinking

Version destinée aux demandes complexes nécessitant davantage de raisonnement et plusieurs étapes.

Les 5 nouveautés à retenir

1. L’IA peut continuer à parler pendant qu’elle exécute une action

Les appels d’API et de fonctions peuvent être lancés en arrière-plan. Pour un agent de réservation, un support client ou un assistant d’entreprise, cela évite qu’une conversation paraisse figée pendant qu’un système externe répond.

2. Gemini peut tenir compte de ce que la caméra voit

Gemini 3.8 Live accepte le texte, les images, l’audio et la vidéo en entrée. Google met en avant le « visual grounding » en quasi-temps réel : un agent peut donc combiner ce que l’utilisateur dit avec ce qui apparaît devant la caméra.

3. Le modèle passe automatiquement d’une langue à l’autre

Google annonce la prise en charge de 97 langues avec détection et transition automatiques au cours d’une même conversation. Cela ouvre la porte à des assistants multilingues plus naturels dans le support, le voyage ou les services internationaux.

4. Extended Thinking raisonne tout en gardant une conversation naturelle

La version Extended Thinking est conçue pour les workflows plus complexes. Google explique qu’elle peut donner de premiers signaux vocaux, poursuivre son raisonnement et commenter l’avancement d’une tâche en plusieurs étapes.

5. Les développeurs peuvent déjà l’utiliser

Gemini 3.8 Live et Extended Thinking sont disponibles dans la Gemini API et Google AI Studio. Le code de modèle principal est gemini-3.8-live. La documentation indique une fenêtre d’entrée de 131 072 jetons et une limite de sortie de 65 536 jetons.

Gemini 3.8 Live : combien ça coûte ?

Type Tarif API payant
Texte en entrée 0,75 $ / million de jetons
Audio en entrée 3 $ / million de jetons, soit environ 0,005 $/min
Image / vidéo en entrée 1 $ / million de jetons, soit environ 0,002 $/min
Texte en sortie 4,50 $ / million de jetons
Audio en sortie 12 $ / million de jetons, soit environ 0,018 $/min

Google propose également un niveau sans frais. Pour les sessions longues, il faut cependant surveiller le coût : l’API Live conserve un contexte de conversation persistant et peut retraiter l’historique à chaque tour.

Où peut-on utiliser Gemini 3.8 Live ?

Le déploiement concerne plusieurs produits. Pour les développeurs, les modèles sont accessibles via Gemini API et Google AI Studio. Google indique également un déploiement dans Search Live, Gemini Live et certaines expériences Google Workspace. Côté entreprise, plusieurs usages sont encore en préversion privée.

Pourquoi cette sortie est importante

La bataille de l’IA ne se limite plus aux réponses textuelles. Les grands acteurs cherchent désormais à construire des assistants capables de voir, parler, raisonner et agir dans une même interaction. Gemini 3.8 Live illustre ce déplacement vers des agents multimodaux capables d’exécuter des tâches sans casser la fluidité d’une conversation.

Pour les entreprises, les cas d’usage les plus évidents concernent le support client, l’assistance en direct, la formation, les réservations, les interfaces vocales et les outils internes. Pour le grand public, l’enjeu est plutôt de rendre l’IA moins proche d’un formulaire de chat et davantage d’un assistant avec lequel on peut collaborer en continu.

Gemini 3.8 Live ou un chatbot classique : quelle différence ?

Un chatbot classique attend généralement une demande, produit une réponse, puis recommence. Gemini 3.8 Live est conçu autour d’une session continue : l’audio, les images, les actions externes et le contexte peuvent s’enchaîner dans une même interaction.

Verdict Portail IA : la nouveauté la plus intéressante n’est pas seulement la qualité de la voix. C’est la combinaison d’une conversation temps réel, d’entrées visuelles et d’actions exécutées en arrière-plan. C’est ce qui rapproche Gemini d’un véritable agent vocal plutôt que d’un simple assistant qui lit ses réponses à haute voix.

À lire aussi sur Portail IA

Pour aller plus loin : Gemini Omni Flash, notre dossier ChatGPT vs Claude vs Gemini et notre guide sur les agents IA capables d’utiliser un ordinateur.

Sources officielles

Crédit image : Jumping Jax / Unsplash.

Guide gratuit

Recevez gratuitement le guide Portail IA

Inscrivez-vous à la newsletter et recevez le guide : 10 outils IA utiles pour gagner du temps en 2026.

Vous recevrez aussi chaque semaine une sélection claire d’outils IA utiles, de tendances importantes et d’opportunités à ne pas manquer.

Rédaction Portail IA
Rédaction Portail IAhttps://portailia.com
La rédaction de Portail IA analyse les outils, les tendances et les usages de l’intelligence artificielle pour proposer des contenus clairs, pratiques et accessibles.

LAISSER UN COMMENTAIRE

S'il vous plaît entrez votre commentaire!
S'il vous plaît entrez votre nom ici

Partager cet article:

Recevez la veille IA

spot_imgspot_img

Populaire

Encore plus d'articles
En rapport

GPT-6 Astra : ce que change le nouveau modèle d’OpenAI pour le travail

GPT-6 Astra est le nouveau modèle phare d’OpenAI pour les tâches complexes, le code, la navigation, l’utilisation d’ordinateur et les workflows professionnels.

Google Workspace DLP pour Gmail : protéger les données sensibles en 2026

Google Workspace DLP pour Gmail permet de détecter et contrôler l’envoi de données sensibles. Voici comment fonctionnent les règles DLP, les actions disponibles, les limites et les bonnes pratiques en 2026.

SaneBox vs Spark Mail : quel outil choisir pour mieux gérer ses emails en 2026 ?

SaneBox vs Spark Mail en 2026 : tri intelligent, priorisation, IA, recherche, rédaction, multi-comptes, prix et confidentialité. Notre comparatif pour mieux gérer sa boîte mail.

IA pour les emails : Gemini Gmail vs Copilot Outlook vs Superhuman vs Shortwave en 2026

Gemini Gmail vs Copilot Outlook vs Superhuman Mail vs Shortwave en 2026 : rédaction, résumés, recherche, tri, automatisation, prix et confidentialité.