Todos os modelos
OpenAI

GPT-Realtime-2.1

Modelo de raciocínio de fala para fala em tempo real do OpenAI para agentes de voz que usam ferramentas e que também precisam de contexto de texto e imagem.

Visão geral em inglês simples

O que GPT-Realtime-2.1 realmente é

GPT-Realtime-2.1 foi projetado para conversas ao vivo em que o modelo deve ouvir, falar, seguir instruções e chamar ferramentas em uma sessão em tempo real. OpenAI destaca interrupção, silêncio, ruído e manuseio alfanumérico aprimorados em relação à versão anterior.

A entrada de áudio, texto e imagem é cobrada em diferentes classes de token. Portanto, um orçamento realista precisa do uso capturado de conversas completas, e não de uma simples conversão apenas de minutos de áudio.

Bom ajuste para

  • Agentes de voz de clientes ou funcionários que usam ferramentas
  • Assistentes multimodais em tempo real
  • Pilhas de agentes nativos OpenAI

Comparação de categorias

Os fatos que importam para os modelos voz

Estas são especificações publicadas pelo fornecedor, não pontuações de benchmark Cody. Siga as fontes vinculadas para limites atuais e exceções específicas de endpoint.

Base de preço
Entrada de áudio de US$ 32 · Saída de US$ 64/1 milhão de tokensPreço baseado em token, caractere ou minuto para a rota de acesso listada.
Modo de interação
Conversão de fala com contexto de texto/imagemComportamento de fala para fala, áudio para áudio ou transmissão de texto para fala.
Latência publicada
Não publicadoMedição publicada pelo provedor com suas exclusões declaradas; não é um teste Cody.
Idiomas
Multilíngue; lista exata não publicada aquiCobertura linguística documentada pelo fornecedor ou um marcador claro e não publicado.
Ferramentas e controle
Chamada de função e raciocínio configurávelRecursos nativos de chamada de função, raciocínio ou controle de fala.
Contexto ou limite de entrada
Entrada de 128K · Saída máxima de 32KToken documentado ou limite de caracteres onde for significativo.

Acesso à API e ao provedor

Onde obter GPT-Realtime-2.1

Disponibilidade

Regiões e estágio de acesso

Disponível por meio da API Realtime do OpenAI em países e territórios suportados.

O acesso direto segue a lista de países com suporte ao vivo do OpenAI.

Verifique a disponibilidade ao vivo

Dados e treinamento

A rota é importante.

OpenAI diz que o conteúdo da API não é usado para treinamento por padrão. Os registros padrão de monitoramento de abuso podem ser retidos por até 30 dias, com controles adicionais disponíveis para organizações qualificadas.

Esta é uma leitura concisa do material citado do fornecedor, e não um aconselhamento jurídico. Um gateway de terceiros pode ter diferentes termos de armazenamento, roteamento, treinamento e residência da API direta do criador do modelo.

Leia a política do provedor

Perguntas frequentes

Perguntas frequentes sobre GPT-Realtime-2.1

O que é GPT-Realtime-2.1?

Modelo de raciocínio de fala para fala em tempo real do OpenAI para agentes de voz que usam ferramentas e que também precisam de contexto de texto e imagem. GPT-Realtime-2.1 foi projetado para conversas ao vivo em que o modelo deve ouvir, falar, seguir instruções e chamar ferramentas em uma sessão em tempo real. OpenAI destaca interrupção, silêncio, ruído e manuseio alfanumérico aprimorados em relação à versão anterior.

Quando o GPT-Realtime-2.1 foi lançado?

O provedor não publica uma data de lançamento clara para GPT-Realtime-2.1 no material de origem revisado por Cody.

Onde posso acessar GPT-Realtime-2.1?

Disponível por meio da API Realtime do OpenAI em países e territórios suportados. As rotas de acesso listadas neste guia são OpenAI.

Quanto custa GPT-Realtime-2.1?

Entrada de áudio de US$ 32 · Saída de áudio de US$ 64/1 milhão de tokens. O texto custa US$ 4 de entrada e US$ 24 de saída por milhão de tokens; a entrada da imagem é de US$ 5 por milhão de tokens. As taxas de entrada em cache são diferentes.

Onde o GPT-Realtime-2.1 está disponível?

Disponível por meio da API Realtime do OpenAI em países e territórios suportados. O acesso direto segue a lista de países com suporte ao vivo do OpenAI.

Os dados da minha API GPT-Realtime-2.1 são usados ​​para treinamento?

OpenAI diz que o conteúdo da API não é usado para treinamento por padrão. Os registros padrão de monitoramento de abuso podem ser retidos por até 30 dias, com controles adicionais disponíveis para organizações qualificadas. A política pertence à rota do provedor e aos termos da conta, portanto, verifique-a novamente antes do uso em produção.