Inworld Realtime TTS-2
Das neueste ausdrucksstarke Echtzeit-Text-to-Speech-Modell von Inworld, das darauf ausgelegt ist, sich die gesprochene Sprache zu merken und in mehr als 100 Sprachen zu sprechen.
Das neueste ausdrucksstarke Echtzeit-Text-to-Speech-Modell von Inworld, das darauf ausgelegt ist, sich die gesprochene Sprache zu merken und in mehr als 100 Sprachen zu sprechen.
Übersicht in einfacher englischer Sprache
Inworld Realtime TTS-2 wandelt Text in gestreamte Sprache um und verwendet dabei frühere Audiodrehungen, um die Wiedergabe eines Charakters konsistent zu halten. Entwickler können die gewünschte Stimmung oder Übermittlung in natürlicher Sprache beschreiben, die Sprache wechseln und das Klonen von Stimmen verwenden, sofern ihre Rechte und Kontoeinstellungen dies zulassen.
Die Preise basieren auf Zeichen und nicht auf Audio-Tokens, was die Schätzung von Skripten erleichtert. Inworld meldet eine durchschnittliche Zeit bis zum ersten Ton von weniger als 200 ms, aber die Netzwerkentfernung, die Anwendungsarbeit und das Upstream-Sprachmodell wirken sich immer noch auf die vollständige Antwortzeit aus.
Kategorievergleich
Hierbei handelt es sich um vom Anbieter veröffentlichte Spezifikationen, nicht um Cody-Benchmark-Ergebnisse. Folgen Sie den verlinkten Quellen für aktuelle Grenzwerte und endpunktspezifische Ausnahmen.
API- und Provider-Zugriff
Verfügbarkeit
Allgemein verfügbar über die REST-TTS-API von Inworld und die OpenAI-kompatible Echtzeit-API.
Die Abdeckung der Standardregion ist auf der Modellseite nicht aufgeführt; Unternehmenspläne bieten Optionen für die Datenspeicherung in der EU und Indien an.
Überprüfen Sie die Live-VerfügbarkeitDaten und Schulung
Inworld bewirbt Zero Data Retention als Unternehmens-Add-on, auf der aktuell veröffentlichten ZDR-Supportseite werden jedoch nur TTS-1.5 Mini und Max genannt. Bestätigen Sie die TTS-2-Abdeckung direkt, bevor Sie regulierte oder vertrauliche Texte senden.
Hierbei handelt es sich um eine prägnante Lektüre des zitierten Anbietermaterials und nicht um eine Rechtsberatung. Ein Drittanbieter-Gateway kann andere Speicher-, Routing-, Schulungs- und Residenzbedingungen haben als die direkte API des Modellherstellers.
Lesen Sie die Richtlinien des AnbietersHäufig gestellte Fragen
Das neueste ausdrucksstarke Echtzeit-Text-to-Speech-Modell von Inworld, das darauf ausgelegt ist, sich die gesprochene Sprache zu merken und in mehr als 100 Sprachen zu sprechen. Inworld Realtime TTS-2 wandelt Text in gestreamte Sprache um und verwendet dabei frühere Audiodrehungen, um die Wiedergabe eines Charakters konsistent zu halten. Entwickler können die gewünschte Stimmung oder Übermittlung in natürlicher Sprache beschreiben, die Sprache wechseln und das Klonen von Stimmen verwenden, sofern ihre Rechte und Kontoeinstellungen dies zulassen.
Inworld Realtime TTS-2 wurde gemäß den zitierten Anbietermaterialien auf 31. August 2026 veröffentlicht.
Allgemein verfügbar über die REST-TTS-API von Inworld und die OpenAI-kompatible Echtzeit-API. Die in diesem Handbuch aufgeführten Zugriffsrouten sind Inworld AI.
25 $ / 1 Mio. Zeichen auf Anfrage. Die veröffentlichten Abonnementpreise sinken auf 20 $, 17,50 $, 15 $ und 12,50 $ pro Million Zeichen je Stufe, wobei die Preise für Unternehmen bereits bei 5 $ liegen.
Allgemein verfügbar über die REST-TTS-API von Inworld und die OpenAI-kompatible Echtzeit-API. Die Abdeckung der Standardregion ist auf der Modellseite nicht aufgeführt; Unternehmenspläne bieten Optionen für die Datenspeicherung in der EU und Indien an.
Inworld bewirbt Zero Data Retention als Unternehmens-Add-on, auf der aktuell veröffentlichten ZDR-Supportseite werden jedoch nur TTS-1.5 Mini und Max genannt. Bestätigen Sie die TTS-2-Abdeckung direkt, bevor Sie regulierte oder vertrauliche Texte senden. Die Richtlinie gehört zu den Routen- und Kontobedingungen des Anbieters. Überprüfen Sie sie daher vor der produktiven Nutzung erneut.
Verwandte Vergleiche
Das Echtzeit-Speech-to-Speech-Argumentationsmodell von OpenAI für Tool-verwendende Sprachagenten, die auch Text- und Bildkontext benötigen.
Vollständigen Vergleich öffnenDas Vorschau-Audio-zu-Audio-Modell von Google für Dialoge mit geringer Latenz mit multimodalem Bewusstsein, Denken, Sucherdung und Funktionsaufruf.
Vollständigen Vergleich öffnenElevenLabs‘ ausdrucksstarkes Echtzeit-Text-to-Speech-Modell für natürliche Dialoge, emotionale Übermittlung, Audio-Tags und mehr als 70 Sprachen.
Vollständigen Vergleich öffnenDas aktuelle Echtzeit-Speech-to-Speech-Modell von SpaceXAI für Sub-Sekunden-Konversationsagenten mit Tool-Zugriff.
Vollständigen Vergleich öffnen