GPT-Live 1
Pełnodupleksowy interfejs głosowy OpenAI zapewniający naturalną konwersację, który przekazuje głębsze rozumowanie i działania oddzielnemu agentowi zaplecza.
Pełnodupleksowy interfejs głosowy OpenAI zapewniający naturalną konwersację, który przekazuje głębsze rozumowanie i działania oddzielnemu agentowi zaplecza.
Przegląd w prostym języku angielskim
GPT-Live 1 słucha i mówi w tym samym czasie, dzięki czemu radzi sobie z pauzami, potwierdzeniami, przerwami i hałasem w tle bez wymuszania każdej wymiany zdań w sztywnych zwrotach akcji. Zawiera także transkrypcje i tekst odpowiedzi wraz z dźwiękiem na żywo.
Architektura oddziela rozmowę od głębszej pracy. GPT-Live 1 zarządza obsługą głosu, podczas gdy model Responses lub agent obsługiwany przez aplikację obsługuje rozumowanie i zatwierdzone narzędzia. Opublikowana cena usług głosowych nie obejmuje zatem wykorzystania modelu backendu, narzędzi, telefonii i infrastruktury aplikacji.
Porównanie kategorii
Są to specyfikacje opublikowane przez dostawcę, a nie wyniki testów porównawczych Cody. Skorzystaj z połączonych źródeł, aby poznać aktualne limity i wyjątki specyficzne dla punktu końcowego.
Dostęp do API i dostawcy
Dostępność
Dostępne poprzez Live API OpenAI dla aplikacji głosowych przeglądarek, serwerów i telefonii.
Bezpośredni dostęp następuje po liście obsługiwanych krajów OpenAI; Warstwa bezpłatnego interfejsu API nie jest obsługiwana w tym modelu.
Sprawdź dostępność na żywoDane i szkolenia
OpenAI mówi, że zawartość interfejsu API nie jest domyślnie używana do szkolenia. Domyślne dzienniki monitorowania nadużyć mogą być przechowywane do 30 dni, a kwalifikujące się organizacje mają dostęp do dodatkowych kontroli.
Jest to zwięzła lektura cytowanych materiałów dostawcy, a nie porada prawna. Brama innej firmy może mieć inne warunki przechowywania, routingu, szkolenia i miejsca zamieszkania niż bezpośrednie API twórcy modelu.
Przeczytaj politykę dostawcyCzęsto zadawane pytania
Pełnodupleksowy interfejs głosowy OpenAI zapewniający naturalną konwersację, który przekazuje głębsze rozumowanie i działania oddzielnemu agentowi zaplecza. GPT-Live 1 słucha i mówi w tym samym czasie, dzięki czemu radzi sobie z pauzami, potwierdzeniami, przerwami i hałasem w tle bez wymuszania każdej wymiany zdań w sztywnych zwrotach akcji. Zawiera także transkrypcje i tekst odpowiedzi wraz z dźwiękiem na żywo.
Według materiałów cytowanego dostawcy GPT-Live 1 został wydany na 10 września 2026.
Dostępne poprzez Live API OpenAI dla aplikacji głosowych przeglądarek, serwerów i telefonii. Drogi dostępu wymienione w tym przewodniku to OpenAI.
0,05 USD / minutę głosu. Sesje głosowe rozliczane są sekundowo, bez zaokrąglania pełnych minut. Model zaplecza i użycie narzędzi są rozliczane osobno, podobnie jak infrastruktura telefoniczna i aplikacyjna.
Dostępne poprzez Live API OpenAI dla aplikacji głosowych przeglądarek, serwerów i telefonii. Bezpośredni dostęp następuje po liście obsługiwanych krajów OpenAI; Warstwa bezpłatnego interfejsu API nie jest obsługiwana w tym modelu.
OpenAI mówi, że zawartość interfejsu API nie jest domyślnie używana do szkolenia. Domyślne dzienniki monitorowania nadużyć mogą być przechowywane do 30 dni, a kwalifikujące się organizacje mają dostęp do dodatkowych kontroli. Polityka należy do warunków trasy dostawcy i konta, dlatego sprawdź ją ponownie przed użyciem w środowisku produkcyjnym.
Powiązane porównania
Model wnioskowania mowy na mowę OpenAI w czasie rzeczywistym dla agentów głosowych korzystających z narzędzi, którzy również potrzebują kontekstu tekstowego i obrazu.
Otwórz pełne porównanieModel Google typu audio-to-audio umożliwiający dialog o niskim opóźnieniu ze świadomością multimodalną, myśleniem, uziemieniem wyszukiwania i wywoływaniem funkcji.
Otwórz pełne porównanieEkspresyjny model syntezy mowy ElevenLabs w czasie rzeczywistym zapewniający naturalny dialog, dostarczanie emocji, znaczniki audio i ponad 70 języków.
Otwórz pełne porównanieNajnowszy, ekspresyjny model syntezy mowy firmy Inworld w czasie rzeczywistym, zaprojektowany z myślą o zapamiętywaniu przebiegu konwersacji i mówieniu w ponad 100 językach.
Otwórz pełne porównanieObecny model zamiany mowy na mowę SpaceXAI w czasie rzeczywistym dla agentów konwersacyjnych w czasie krótszym niż sekunda z dostępem do narzędzi.
Otwórz pełne porównanie