Gemini 3.1 Flash Live Preview
Modèle audio-audio en avant-première de Google pour un dialogue à faible latence avec une conscience multimodale, une réflexion, une mise à la terre de recherche et un appel de fonction.
Modèle audio-audio en avant-première de Google pour un dialogue à faible latence avec une conscience multimodale, une réflexion, une mise à la terre de recherche et un appel de fonction.
Présentation de l'anglais simple
Gemini 3.1 Flash Live accepte l'audio en direct aux côtés du texte, des images et de la vidéo, puis renvoie le texte et l'audio. Il est destiné aux conversations qui bénéficient de nuances acoustiques et d’un contexte visuel plutôt que d’une simple lecture de synthèse vocale.
Google publie à la fois les tarifs des jetons et les équivalents audio par minute. Cela facilite la budgétisation précoce, mais l'ancrage de la recherche et les entrées multimodales peuvent toujours ajouter une utilisation distincte.
Comparaison des catégories
Il s'agit de spécifications publiées par le fournisseur et non de scores de référence Cody. Suivez les sources liées pour connaître les limites actuelles et les exceptions spécifiques aux points de terminaison.
Accès API et fournisseur
Disponibilité
Accès en aperçu via l'API Gemini Live et Google AI Studio dans les régions prises en charge.
Utilisez la liste de régions Gemini API en direct de Google et confirmez l’éligibilité à l’aperçu.
Vérifier la disponibilité en directDonnées et formation
Google indique que le contenu Gemini API payant n'est pas utilisé pour améliorer ses produits ; les données de service non rémunérées peuvent généralement l'être. Confirmez l'état de facturation et les conditions actuelles avant d'envoyer des conversations sensibles.
Il s'agit d'une lecture concise du matériel du fournisseur cité, et non d'un avis juridique. Une passerelle tierce peut avoir des conditions de stockage, de routage, de formation et de résidence différentes de celles de l'API directe du modéliste.
Lire la politique du fournisseurQuestions fréquemment posées
Modèle audio-audio en avant-première de Google pour un dialogue à faible latence avec une conscience multimodale, une réflexion, une mise à la terre de recherche et un appel de fonction. Gemini 3.1 Flash Live accepte l'audio en direct aux côtés du texte, des images et de la vidéo, puis renvoie le texte et l'audio. Il est destiné aux conversations qui bénéficient de nuances acoustiques et d’un contexte visuel plutôt que d’une simple lecture de synthèse vocale.
Gemini 3.1 Flash Live Preview a été publié sur 1 mars 2026 selon les documents du fournisseur cités.
Accès en aperçu via l'API Gemini Live et Google AI Studio dans les régions prises en charge. Les voies d'accès répertoriées dans ce guide sont Google.
Entrée audio à 0,005 $/min · Sortie audio à 0,018 $/min. Les équivalents payants de Google ; l'entrée/sortie de texte coûte 0,75 $/4,50 $ par million de jetons et l'entrée d'image/vidéo équivaut à 0,002 $ par minute.
Accès en aperçu via l'API Gemini Live et Google AI Studio dans les régions prises en charge. Utilisez la liste de régions Gemini API en direct de Google et confirmez l’éligibilité à l’aperçu.
Google indique que le contenu Gemini API payant n'est pas utilisé pour améliorer ses produits ; les données de service non rémunérées peuvent généralement l'être. Confirmez l'état de facturation et les conditions actuelles avant d'envoyer des conversations sensibles. La politique appartient à l'itinéraire du fournisseur et aux conditions du compte, vérifiez-la donc à nouveau avant de l'utiliser en production.
Comparaisons associées
Modèle de raisonnement parole-parole en temps réel de OpenAI pour les agents vocaux utilisant des outils qui ont également besoin d'un contexte de texte et d'image.
Ouvrir la comparaison complèteModèle de synthèse vocale en temps réel expressif de ElevenLabs pour un dialogue naturel, une transmission émotionnelle, des balises audio et plus de 70 langues.
Ouvrir la comparaison complèteLe tout nouveau modèle expressif de synthèse vocale en temps réel d'Inworld, conçu pour mémoriser les conversations et parler dans plus de 100 langues.
Ouvrir la comparaison complèteModèle de parole en temps réel actuel de SpaceXAI pour les agents conversationnels en moins d'une seconde avec accès aux outils.
Ouvrir la comparaison complète