GPT-Live 1
Das Vollduplex-Sprach-Frontend von OpenAI für natürliche Konversation, das tiefergehende Überlegungen und Aktionen an einen separaten Backend-Agenten delegiert.
Das Vollduplex-Sprach-Frontend von OpenAI für natürliche Konversation, das tiefergehende Überlegungen und Aktionen an einen separaten Backend-Agenten delegiert.
Übersicht in einfacher englischer Sprache
GPT-Live 1 hört und spricht gleichzeitig, sodass es Pausen, Bestätigungen, Unterbrechungen und Hintergrundgeräusche bewältigen kann, ohne jeden Austausch in starre Wendungen zu zwingen. Neben dem Live-Audio werden auch Transkripte und Antworttexte bereitgestellt.
Die Architektur trennt Gespräche von tiefergehender Arbeit. GPT-Live 1 verwaltet das Spracherlebnis, während ein Antwortmodell oder ein anwendungsgesteuerter Agent Argumentation und genehmigte Tools übernimmt. Der veröffentlichte Sprachpreis schließt daher die Nutzung des Backend-Modells, Tools, Telefonie und Anwendungsinfrastruktur aus.
Kategorievergleich
Hierbei handelt es sich um vom Anbieter veröffentlichte Spezifikationen, nicht um Cody-Benchmark-Ergebnisse. Folgen Sie den verlinkten Quellen für aktuelle Grenzwerte und endpunktspezifische Ausnahmen.
API- und Provider-Zugriff
Verfügbarkeit
Verfügbar über die Live-API von OpenAI für Browser-, Server- und Telefon-Sprachanwendungen.
Der Direktzugriff folgt der Live-Liste der unterstützten Länder von OpenAI; Die kostenlose API-Stufe wird für dieses Modell nicht unterstützt.
Überprüfen Sie die Live-VerfügbarkeitDaten und Schulung
Laut OpenAI werden API-Inhalte standardmäßig nicht für das Training verwendet. Standardprotokolle zur Missbrauchsüberwachung können bis zu 30 Tage lang aufbewahrt werden, wobei berechtigten Organisationen zusätzliche Kontrollen zur Verfügung stehen.
Hierbei handelt es sich um eine prägnante Lektüre des zitierten Anbietermaterials und nicht um eine Rechtsberatung. Ein Drittanbieter-Gateway kann andere Speicher-, Routing-, Schulungs- und Residenzbedingungen haben als die direkte API des Modellherstellers.
Lesen Sie die Richtlinien des AnbietersHäufig gestellte Fragen
Das Vollduplex-Sprach-Frontend von OpenAI für natürliche Konversation, das tiefergehende Überlegungen und Aktionen an einen separaten Backend-Agenten delegiert. GPT-Live 1 hört und spricht gleichzeitig, sodass es Pausen, Bestätigungen, Unterbrechungen und Hintergrundgeräusche bewältigen kann, ohne jeden Austausch in starre Wendungen zu zwingen. Neben dem Live-Audio werden auch Transkripte und Antworttexte bereitgestellt.
GPT-Live 1 wurde gemäß den zitierten Anbietermaterialien auf 10. September 2026 veröffentlicht.
Verfügbar über die Live-API von OpenAI für Browser-, Server- und Telefon-Sprachanwendungen. Die in diesem Handbuch aufgeführten Zugriffsrouten sind OpenAI.
0,05 $/Sprachminute. Sprachsitzungen werden pro Sekunde abgerechnet, ohne Rundung auf ganze Minuten. Backend-Modell und Tool-Nutzung werden separat abgerechnet, ebenso wie Telefonie und Anwendungsinfrastruktur.
Verfügbar über die Live-API von OpenAI für Browser-, Server- und Telefon-Sprachanwendungen. Der Direktzugriff folgt der Live-Liste der unterstützten Länder von OpenAI; Die kostenlose API-Stufe wird für dieses Modell nicht unterstützt.
Laut OpenAI werden API-Inhalte standardmäßig nicht für das Training verwendet. Standardprotokolle zur Missbrauchsüberwachung können bis zu 30 Tage lang aufbewahrt werden, wobei berechtigten Organisationen zusätzliche Kontrollen zur Verfügung stehen. Die Richtlinie gehört zu den Routen- und Kontobedingungen des Anbieters. Überprüfen Sie sie daher vor der produktiven Nutzung erneut.
Verwandte Vergleiche
Das Echtzeit-Speech-to-Speech-Argumentationsmodell von OpenAI für Tool-verwendende Sprachagenten, die auch Text- und Bildkontext benötigen.
Vollständigen Vergleich öffnenDas Vorschau-Audio-zu-Audio-Modell von Google für Dialoge mit geringer Latenz mit multimodalem Bewusstsein, Denken, Sucherdung und Funktionsaufruf.
Vollständigen Vergleich öffnenElevenLabs‘ ausdrucksstarkes Echtzeit-Text-to-Speech-Modell für natürliche Dialoge, emotionale Übermittlung, Audio-Tags und mehr als 70 Sprachen.
Vollständigen Vergleich öffnenDas neueste ausdrucksstarke Echtzeit-Text-to-Speech-Modell von Inworld, das darauf ausgelegt ist, sich die gesprochene Sprache zu merken und in mehr als 100 Sprachen zu sprechen.
Vollständigen Vergleich öffnenDas aktuelle Echtzeit-Speech-to-Speech-Modell von SpaceXAI für Sub-Sekunden-Konversationsagenten mit Tool-Zugriff.
Vollständigen Vergleich öffnen