GPT-Realtime-2.1
Modelo de raciocínio de fala para fala em tempo real do OpenAI para agentes de voz que usam ferramentas e que também precisam de contexto de texto e imagem.
Modelo de raciocínio de fala para fala em tempo real do OpenAI para agentes de voz que usam ferramentas e que também precisam de contexto de texto e imagem.
Visão geral em inglês simples
GPT-Realtime-2.1 foi projetado para conversas ao vivo em que o modelo deve ouvir, falar, seguir instruções e chamar ferramentas em uma sessão em tempo real. OpenAI destaca interrupção, silêncio, ruído e manuseio alfanumérico aprimorados em relação à versão anterior.
A entrada de áudio, texto e imagem é cobrada em diferentes classes de token. Portanto, um orçamento realista precisa do uso capturado de conversas completas, e não de uma simples conversão apenas de minutos de áudio.
Comparação de categorias
Estas são especificações publicadas pelo fornecedor, não pontuações de benchmark Cody. Siga as fontes vinculadas para limites atuais e exceções específicas de endpoint.
Acesso à API e ao provedor
Disponibilidade
Disponível por meio da API Realtime do OpenAI em países e territórios suportados.
O acesso direto segue a lista de países com suporte ao vivo do OpenAI.
Verifique a disponibilidade ao vivoDados e treinamento
OpenAI diz que o conteúdo da API não é usado para treinamento por padrão. Os registros padrão de monitoramento de abuso podem ser retidos por até 30 dias, com controles adicionais disponíveis para organizações qualificadas.
Esta é uma leitura concisa do material citado do fornecedor, e não um aconselhamento jurídico. Um gateway de terceiros pode ter diferentes termos de armazenamento, roteamento, treinamento e residência da API direta do criador do modelo.
Leia a política do provedorPerguntas frequentes
Modelo de raciocínio de fala para fala em tempo real do OpenAI para agentes de voz que usam ferramentas e que também precisam de contexto de texto e imagem. GPT-Realtime-2.1 foi projetado para conversas ao vivo em que o modelo deve ouvir, falar, seguir instruções e chamar ferramentas em uma sessão em tempo real. OpenAI destaca interrupção, silêncio, ruído e manuseio alfanumérico aprimorados em relação à versão anterior.
O provedor não publica uma data de lançamento clara para GPT-Realtime-2.1 no material de origem revisado por Cody.
Disponível por meio da API Realtime do OpenAI em países e territórios suportados. As rotas de acesso listadas neste guia são OpenAI.
Entrada de áudio de US$ 32 · Saída de áudio de US$ 64/1 milhão de tokens. O texto custa US$ 4 de entrada e US$ 24 de saída por milhão de tokens; a entrada da imagem é de US$ 5 por milhão de tokens. As taxas de entrada em cache são diferentes.
Disponível por meio da API Realtime do OpenAI em países e territórios suportados. O acesso direto segue a lista de países com suporte ao vivo do OpenAI.
OpenAI diz que o conteúdo da API não é usado para treinamento por padrão. Os registros padrão de monitoramento de abuso podem ser retidos por até 30 dias, com controles adicionais disponíveis para organizações qualificadas. A política pertence à rota do provedor e aos termos da conta, portanto, verifique-a novamente antes do uso em produção.
Comparações relacionadas
Modelo de visualização de áudio para áudio do Google para diálogo de baixa latência com consciência multimodal, pensamento, base de pesquisa e chamada de função.
Abrir comparação completaModelo expressivo de conversão de texto em fala em tempo real do ElevenLabs para diálogo natural, entrega emocional, tags de áudio e mais de 70 idiomas.
Abrir comparação completaO mais novo modelo expressivo de conversão de texto em fala em tempo real da Inworld, projetado para lembrar a conversação e falar em mais de 100 idiomas.
Abrir comparação completaModelo atual de fala em fala em tempo real do SpaceXAI para agentes de conversação em menos de um segundo com acesso a ferramentas.
Abrir comparação completa