GPT-Realtime-2.1
Modèle de raisonnement parole-parole en temps réel de OpenAI pour les agents vocaux utilisant des outils qui ont également besoin d'un contexte de texte et d'image.
Modèle de raisonnement parole-parole en temps réel de OpenAI pour les agents vocaux utilisant des outils qui ont également besoin d'un contexte de texte et d'image.
Présentation de l'anglais simple
GPT-Realtime-2.1 est conçu pour les conversations en direct où le modèle doit écouter, parler, suivre les instructions et appeler des outils au cours d'une seule session en temps réel. OpenAI met en évidence une amélioration de la gestion des interruptions, du silence, du bruit et des caractères alphanumériques par rapport à la version précédente.
Les entrées audio, texte et image sont facturées dans différentes classes de jetons. Un budget réaliste nécessite donc une utilisation capturée à partir de conversations complètes, et non une simple conversion à partir des seules minutes audio.
Comparaison des catégories
Il s'agit de spécifications publiées par le fournisseur et non de scores de référence Cody. Suivez les sources liées pour connaître les limites actuelles et les exceptions spécifiques aux points de terminaison.
Accès API et fournisseur
Disponibilité
Disponible via l'API en temps réel de OpenAI dans les pays et territoires pris en charge.
L'accès direct suit la liste des pays pris en charge en direct par OpenAI.
Vérifier la disponibilité en directDonnées et formation
OpenAI indique que le contenu de l'API n'est pas utilisé par défaut pour la formation. Les journaux de surveillance des abus par défaut peuvent être conservés jusqu'à 30 jours, avec des contrôles supplémentaires disponibles pour les organisations éligibles.
Il s'agit d'une lecture concise du matériel du fournisseur cité, et non d'un avis juridique. Une passerelle tierce peut avoir des conditions de stockage, de routage, de formation et de résidence différentes de celles de l'API directe du modéliste.
Lire la politique du fournisseurQuestions fréquemment posées
Modèle de raisonnement parole-parole en temps réel de OpenAI pour les agents vocaux utilisant des outils qui ont également besoin d'un contexte de texte et d'image. GPT-Realtime-2.1 est conçu pour les conversations en direct où le modèle doit écouter, parler, suivre les instructions et appeler des outils au cours d'une seule session en temps réel. OpenAI met en évidence une amélioration de la gestion des interruptions, du silence, du bruit et des caractères alphanumériques par rapport à la version précédente.
Le fournisseur ne publie pas de date de sortie claire pour GPT-Realtime-2.1 dans le matériel source examiné par Cody.
Disponible via l'API en temps réel de OpenAI dans les pays et territoires pris en charge. Les voies d'accès répertoriées dans ce guide sont OpenAI.
Entrée audio à 32 $ · Sortie audio à 64 $ / 1 million de jetons. Le texte coûte 4 $ en entrée et 24 $ en sortie par million de jetons ; l'entrée d'image est de 5 $ par million de jetons. Les taux d'entrée en cache diffèrent.
Disponible via l'API en temps réel de OpenAI dans les pays et territoires pris en charge. L'accès direct suit la liste des pays pris en charge en direct par OpenAI.
OpenAI indique que le contenu de l'API n'est pas utilisé par défaut pour la formation. Les journaux de surveillance des abus par défaut peuvent être conservés jusqu'à 30 jours, avec des contrôles supplémentaires disponibles pour les organisations éligibles. La politique appartient à l'itinéraire du fournisseur et aux conditions du compte, vérifiez-la donc à nouveau avant de l'utiliser en production.
Comparaisons associées
Modèle audio-audio en avant-première de Google pour un dialogue à faible latence avec une conscience multimodale, une réflexion, une mise à la terre de recherche et un appel de fonction.
Ouvrir la comparaison complèteModèle de synthèse vocale en temps réel expressif de ElevenLabs pour un dialogue naturel, une transmission émotionnelle, des balises audio et plus de 70 langues.
Ouvrir la comparaison complèteLe tout nouveau modèle expressif de synthèse vocale en temps réel d'Inworld, conçu pour mémoriser les conversations et parler dans plus de 100 langues.
Ouvrir la comparaison complèteModèle de parole en temps réel actuel de SpaceXAI pour les agents conversationnels en moins d'une seconde avec accès aux outils.
Ouvrir la comparaison complète