Oracle voit ses revenus dans l'infrastructure cloud augmenter de 121 % grâce à l'intelligence artificielle
L'entreprise a entrepris une expansion de centres de données destinée à approvisionner OpenAI et d'autres clients du secteur.
Google a présenté Gemini 3.8 Live with Live Avatar, une fonctionnalité qui ajoute un visage animé et synchronisé avec la voix à son intelligence artificielle conversationnelle pour un usage corporatif. L'entreprise a effectué l'annonce et activé immédiatement le service pour les entreprises utilisant Google Cloud.
L'outil combine le dialogue en direct de Gemini avec la génération de vidéo à faible latence. Le résultat est un avatar qui écoute, regarde et répond avec une synchronisation des lèvres, des expressions faciales et des tours de conversation fluides.
Live Avatar s'adresse aux sociétés souhaitant offrir une assistance client ou des parcours interactifs via un personnage virtuel. Google le présente comme un moyen d'élargir les canaux de contact numérique avec une interaction plus proche d'une conversation avec une personne.
La fonctionnalité est déjà disponible dans Gemini Enterprise, la plateforme d'agents d'intelligence artificielle de Google Cloud. L'entreprise a renvoyé vers sa documentation technique pour permettre aux développeurs de commencer à l'intégrer dans leurs produits.
L'annonce intervient seulement neuf jours après le lancement de Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, les modèles de dialogue en direct sur lesquels repose cette nouvelle capacité visuelle de l'entreprise.
Ce lancement, du 15 septembre, avait amélioré le raisonnement et l'exécution de tâches par la voix, mais sans encore la composante visuelle que Live Avatar ajoute désormais.
Selon les données citées par Google à l'époque, Gemini 3.8 Live Extended Thinking a dominé l'indice de qualité de la voix à la voix de la société Artificial Analysis, avec un score de 82,6 points, et a résolu 97,7 % des tests de raisonnement audio de Big Bench Audio.
Dans cette annonce précédente, l'entreprise avait déjà mentionné Salesforce, Genspark et Lumeris parmi les entreprises ayant testé les modèles de dialogue en direct, soulignant leur faible latence et leur capacité à exécuter des outils pendant la conversation.
Google a également indiqué que des plateformes de développement telles qu'Agora, LiveKit, Pipecat et Vercel ont déjà intégré l'interface de programmation de dialogue en direct, permettant à d'autres équipes de construire des interfaces vocales sans gérer l'infrastructure de diffusion en temps réel.
L'un des attributs mis en avant par Google est l'exécution asynchrone des outils. L'avatar peut activer des fonctions et rechercher des données en arrière-plan tout en poursuivant la conversation, sans interrompre l'échange avec la personne en face.
À titre d'exemple, l'entreprise a présenté un cas d'usage dans lequel l'avatar gère l'enregistrement d'un client dans un hôtel : il consulte la réservation et exécute les formalités internes tout en continuant à parler normalement.
Cette fonction vise également l'échelle mondiale. Live Avatar synchronise le mouvement des lèvres et les expressions avec la parole dans 97 langues et peut basculer entre elles au milieu d'une même conversation sans perdre la qualité vidéo.
Cette transition, selon Google, se produit sans dégrader la fidélité visuelle ni générer d'artefacts perceptibles sur le visage de l'avatar.
Contrairement aux modèles de base, qui sont également accessibles au grand public depuis le 15 septembre via Search Live et l'application Gemini, Live Avatar reste pour l'instant limité à l'environnement d'entreprise de Google Cloud.
Google a montré dans la même annonce des exemples de différents personnages avec des voix et des styles visuels propres, pour illustrer la gamme d'identités qu'un même avatar peut adopter selon la marque qui le déploie.
Les organisations peuvent choisir entre une bibliothèque d'avatars prédéfinis ou en générer un à partir d'une image de référence, en conservant la ressemblance et le style visuel de cette marque.
Pour l'instant, la création d'avatars personnalisés n'est activée que pour les clients d'entreprise autorisés par Google via un système de liste d'accès restreint.
Tout le contenu produit par Live Avatar, qu'il soit audio ou vidéo, est marqué avec SynthID, la technologie de filigrane développée par Google DeepMind. Selon l'entreprise, ce sceau est tissé de manière imperceptible dans l'audio et la vidéo, et permet d'identifier a posteriori que le matériel a été généré par l'intelligence artificielle.
Google a présenté cette protection comme faisant partie d'un objectif déclaré de transparence, visant à réduire la désinformation et l'attribution erronée du contenu généré par ses propres modèles.
L'entreprise a également publié une fiche technique du modèle audio sous-jacent, avec le détail de ses capacités et des mesures de sécurité appliquées avant ce lancement.
L'entreprise a renvoyé vers la documentation de l'interface de programmation de Gemini Enterprise et vers sa console d'administration pour les développeurs qui souhaitent commencer à construire avec la nouvelle fonction à partir d'aujourd'hui.
Bibliothèque Mot Avec
Trois guides choisis en fonction du sujet de cet article.
De l’intention à l’action
Transformez une intention importante en comportement régulier, sans méthode magique ni culpabilisation.
Découvrir le livre
Présenter, convaincre et captiver
Transformez vos idées en une présentation claire, mémorable et utile à votre public.
Découvrir le livre
Piloter un projet hybride en 2026
Choisissez le bon niveau de prévision, apprenez assez vite et gardez la décision humaine.
Découvrir le livre