GPT-Live 1
La interfaz de voz full-duplex de OpenAI para una conversación natural que delega razonamientos y acciones más profundos a un agente de backend independiente.
La interfaz de voz full-duplex de OpenAI para una conversación natural que delega razonamientos y acciones más profundos a un agente de backend independiente.
Descripción general en inglés sencillo
GPT-Live 1 escucha y habla al mismo tiempo, por lo que puede manejar pausas, reconocimientos, interrupciones y ruido de fondo sin forzar cada intercambio a giros rígidos. También proporciona transcripciones y texto de respuesta junto con el audio en vivo.
La arquitectura separa la conversación del trabajo más profundo. GPT-Live 1 gestiona la experiencia de voz mientras un modelo de Respuestas o un agente operado por una aplicación maneja el razonamiento y las herramientas aprobadas. Por lo tanto, el precio de voz publicado excluye el uso del modelo backend, las herramientas, la telefonía y la infraestructura de aplicaciones.
Comparación de categorías
Estas son especificaciones publicadas por el proveedor, no puntuaciones de referencia Cody. Siga las fuentes vinculadas para conocer los límites actuales y las excepciones específicas de los terminales.
Acceso a API y proveedores
Disponibilidad
Disponible a través de Live API de OpenAI para aplicaciones de voz de telefonía, navegador y servidor.
El acceso directo sigue la lista de países admitidos en vivo de OpenAI; el nivel de API gratuito no es compatible con este modelo.
Consultar disponibilidad en vivoDatos y entrenamiento
OpenAI dice que el contenido de la API no se utiliza para la capacitación de forma predeterminada. Los registros predeterminados de supervisión de abusos se pueden conservar hasta 30 días, con controles adicionales disponibles para las organizaciones que califiquen.
Esta es una lectura concisa del material del proveedor citado, no un asesoramiento legal. Una puerta de enlace de terceros puede tener términos de almacenamiento, enrutamiento, capacitación y residencia diferentes a los de la API directa del fabricante del modelo.
Lea la política del proveedor.Preguntas frecuentes
La interfaz de voz full-duplex de OpenAI para una conversación natural que delega razonamientos y acciones más profundos a un agente de backend independiente. GPT-Live 1 escucha y habla al mismo tiempo, por lo que puede manejar pausas, reconocimientos, interrupciones y ruido de fondo sin forzar cada intercambio a giros rígidos. También proporciona transcripciones y texto de respuesta junto con el audio en vivo.
GPT-Live 1 se lanzó en 10 de septiembre de 2026 según los materiales del proveedor citados.
Disponible a través de Live API de OpenAI para aplicaciones de voz de telefonía, navegador y servidor. Las rutas de acceso enumeradas en esta guía son OpenAI.
$0.05 / minuto de voz. Las sesiones de voz se facturan por segundo sin redondeo de minutos completos. El uso del modelo backend y de las herramientas se factura por separado, al igual que la telefonía y la infraestructura de aplicaciones.
Disponible a través de Live API de OpenAI para aplicaciones de voz de telefonía, navegador y servidor. El acceso directo sigue la lista de países admitidos en vivo de OpenAI; el nivel de API gratuito no es compatible con este modelo.
OpenAI dice que el contenido de la API no se utiliza para la capacitación de forma predeterminada. Los registros predeterminados de supervisión de abusos se pueden conservar hasta 30 días, con controles adicionales disponibles para las organizaciones que califiquen. La política pertenece a la ruta del proveedor y a los términos de la cuenta, así que verifíquela nuevamente antes de usarla en producción.
Comparaciones relacionadas
Modelo de razonamiento de voz a voz en tiempo real de OpenAI para agentes de voz que utilizan herramientas que también necesitan contexto de texto e imagen.
Abrir comparación completaModelo de vista previa de audio a audio de Google para diálogos de baja latencia con conciencia, pensamiento, base de búsqueda y llamadas de funciones multimodales.
Abrir comparación completaModelo expresivo de conversión de texto a voz en tiempo real ElevenLabs para diálogo natural, entrega emocional, etiquetas de audio y más de 70 idiomas.
Abrir comparación completaEl modelo expresivo de conversión de texto a voz en tiempo real más nuevo de Inworld, diseñado para recordar la entrega conversacional y hablar en más de 100 idiomas.
Abrir comparación completaModelo actual de voz a voz en tiempo real de SpaceXAI para agentes conversacionales en menos de un segundo con acceso a herramientas.
Abrir comparación completa