Todos los modelos
OpenAI

GPT-Realtime-2.1

Modelo de razonamiento de voz a voz en tiempo real de OpenAI para agentes de voz que utilizan herramientas que también necesitan contexto de texto e imagen.

Descripción general en inglés sencillo

Qué es realmente GPT-Realtime-2.1

GPT-Realtime-2.1 está diseñado para conversaciones en vivo donde el modelo debe escuchar, hablar, seguir instrucciones y llamar a herramientas en una sesión en tiempo real. OpenAI destaca la interrupción mejorada, el silencio, el ruido y el manejo alfanumérico con respecto a la versión anterior.

Las entradas de audio, texto e imágenes se facturan en diferentes clases de tokens. Por lo tanto, un presupuesto realista necesita capturar el uso de conversaciones completas, no una simple conversión de minutos de audio únicamente.

Buen ajuste para

  • Agentes de voz de clientes o empleados que utilizan herramientas
  • Asistentes multimodales en tiempo real
  • Pilas de agentes nativos OpenAI

Comparación de categorías

Los hechos que importan para los modelos voz

Estas son especificaciones publicadas por el proveedor, no puntuaciones de referencia Cody. Siga las fuentes vinculadas para conocer los límites actuales y las excepciones específicas de los terminales.

Base del precio
Audio $32 de entrada · $64 de salida / 1 millón de tokensPrecio basado en tokens, caracteres o minutos para la ruta de acceso indicada.
Modo de interacción
Habla a voz con contexto de texto/imagenComportamiento de voz a voz, audio a audio o texto a voz transmitido.
Latencia publicada
No publicadoMedición publicada por el proveedor con sus exclusiones indicadas; no es una prueba Cody.
Idiomas
Multilingüe; lista exacta no publicada aquíCobertura de idioma documentada por el proveedor o un marcador claro e inédito.
Herramientas y control
Llamada a funciones y razonamiento configurable.Funciones nativas de llamada de funciones, razonamiento o control de voz.
Contexto o límite de entrada
Entrada de 128K · Salida máxima de 32KToken documentado o límite de caracteres cuando sea significativo.

Acceso a API y proveedores

Dónde conseguir GPT-Realtime-2.1

Disponibilidad

Regiones y etapa de acceso

Disponible a través de la API en tiempo real de OpenAI en los países y territorios admitidos.

El acceso directo sigue la lista de países admitidos en vivo de OpenAI.

Consultar disponibilidad en vivo

Datos y entrenamiento

La ruta importa.

OpenAI dice que el contenido de la API no se utiliza para la capacitación de forma predeterminada. Los registros predeterminados de supervisión de abusos se pueden conservar hasta 30 días, con controles adicionales disponibles para las organizaciones que califiquen.

Esta es una lectura concisa del material del proveedor citado, no un asesoramiento legal. Una puerta de enlace de terceros puede tener términos de almacenamiento, enrutamiento, capacitación y residencia diferentes a los de la API directa del fabricante del modelo.

Lea la política del proveedor.

Preguntas frecuentes

Preguntas frecuentes sobre GPT-Realtime-2.1

¿Qué es GPT-Realtime-2.1?

Modelo de razonamiento de voz a voz en tiempo real de OpenAI para agentes de voz que utilizan herramientas que también necesitan contexto de texto e imagen. GPT-Realtime-2.1 está diseñado para conversaciones en vivo donde el modelo debe escuchar, hablar, seguir instrucciones y llamar a herramientas en una sesión en tiempo real. OpenAI destaca la interrupción mejorada, el silencio, el ruido y el manejo alfanumérico con respecto a la versión anterior.

¿Cuándo se lanzó GPT-Realtime-2.1?

El proveedor no publica una fecha de lanzamiento clara para GPT-Realtime-2.1 en el material fuente revisado por Cody.

¿Dónde puedo acceder a GPT-Realtime-2.1?

Disponible a través de la API en tiempo real de OpenAI en los países y territorios admitidos. Las rutas de acceso enumeradas en esta guía son OpenAI.

¿Cuánto cuesta GPT-Realtime-2.1?

Entrada de audio de $32 · Salida de audio de $64 / 1 millón de tokens. El texto cuesta $4 de entrada y $24 de salida por millón de tokens; La entrada de imágenes es de $5 por millón de tokens. Las tasas de entrada en caché difieren.

¿Dónde está disponible GPT-Realtime-2.1?

Disponible a través de la API en tiempo real de OpenAI en los países y territorios admitidos. El acceso directo sigue la lista de países admitidos en vivo de OpenAI.

¿Se utilizan mis datos API GPT-Realtime-2.1 para capacitación?

OpenAI dice que el contenido de la API no se utiliza para la capacitación de forma predeterminada. Los registros predeterminados de supervisión de abusos se pueden conservar hasta 30 días, con controles adicionales disponibles para las organizaciones que califiquen. La política pertenece a la ruta del proveedor y a los términos de la cuenta, así que verifíquela nuevamente antes de usarla en producción.