Inworld Realtime TTS-2
Najnowszy, ekspresyjny model syntezy mowy firmy Inworld w czasie rzeczywistym, zaprojektowany z myślą o zapamiętywaniu przebiegu konwersacji i mówieniu w ponad 100 językach.
Najnowszy, ekspresyjny model syntezy mowy firmy Inworld w czasie rzeczywistym, zaprojektowany z myślą o zapamiętywaniu przebiegu konwersacji i mówieniu w ponad 100 językach.
Przegląd w prostym języku angielskim
Inworld Realtime TTS-2 zamienia tekst na mowę przesyłaną strumieniowo, korzystając z wcześniejszych zwrotów audio, aby zachować spójność odtwarzania postaci. Programiści mogą opisać pożądany nastrój lub prezentację w języku naturalnym, zmieniać języki i korzystać z klonowania głosu, jeśli pozwalają na to ich uprawnienia i konfiguracja konta.
Ceny opierają się na postaciach, a nie na tokenach dźwiękowych, co ułatwia oszacowanie skryptów. Inworld podaje, że średni czas do pierwszego dźwięku wynosi mniej niż 200 ms, ale odległość od sieci, praca aplikacji i model języka nadrzędnego nadal wpływają na całkowity czas odpowiedzi.
Porównanie kategorii
Są to specyfikacje opublikowane przez dostawcę, a nie wyniki testów porównawczych Cody. Skorzystaj z połączonych źródeł, aby poznać aktualne limity i wyjątki specyficzne dla punktu końcowego.
Dostęp do API i dostawcy
Dostępność
Ogólnie dostępne za pośrednictwem interfejsu API REST TTS firmy Inworld i interfejsu API czasu rzeczywistego zgodnego z OpenAI.
Standardowy zasięg regionu nie jest wymieniony na stronie modelu; plany korporacyjne reklamują opcje przechowywania danych w UE i Indiach.
Sprawdź dostępność na żywoDane i szkolenia
Inworld reklamuje dodatek dla przedsiębiorstw o zerowej retencji danych, ale obecnie opublikowana strona pomocy ZDR zawiera nazwy tylko TTS-1.5 Mini i Max. Potwierdź zasięg TTS-2 bezpośrednio przed wysłaniem tekstu objętego przepisami lub poufnego.
Jest to zwięzła lektura cytowanych materiałów dostawcy, a nie porada prawna. Brama innej firmy może mieć inne warunki przechowywania, routingu, szkolenia i miejsca zamieszkania niż bezpośrednie API twórcy modelu.
Przeczytaj politykę dostawcyCzęsto zadawane pytania
Najnowszy, ekspresyjny model syntezy mowy firmy Inworld w czasie rzeczywistym, zaprojektowany z myślą o zapamiętywaniu przebiegu konwersacji i mówieniu w ponad 100 językach. Inworld Realtime TTS-2 zamienia tekst na mowę przesyłaną strumieniowo, korzystając z wcześniejszych zwrotów audio, aby zachować spójność odtwarzania postaci. Programiści mogą opisać pożądany nastrój lub prezentację w języku naturalnym, zmieniać języki i korzystać z klonowania głosu, jeśli pozwalają na to ich uprawnienia i konfiguracja konta.
Według materiałów cytowanego dostawcy Inworld Realtime TTS-2 został wydany na 31 sierpnia 2026.
Ogólnie dostępne za pośrednictwem interfejsu API REST TTS firmy Inworld i interfejsu API czasu rzeczywistego zgodnego z OpenAI. Drogi dostępu wymienione w tym przewodniku to Inworld AI.
25 USD / 1 milion znaków na żądanie. Opublikowane stawki subskrypcji spadają do 20 USD, 17,50 USD, 15 USD i 12,50 USD za milion znaków według poziomu, a ceny dla przedsiębiorstw reklamowane są już od 5 USD.
Ogólnie dostępne za pośrednictwem interfejsu API REST TTS firmy Inworld i interfejsu API czasu rzeczywistego zgodnego z OpenAI. Standardowy zasięg regionu nie jest wymieniony na stronie modelu; plany korporacyjne reklamują opcje przechowywania danych w UE i Indiach.
Inworld reklamuje dodatek dla przedsiębiorstw o zerowej retencji danych, ale obecnie opublikowana strona pomocy ZDR zawiera nazwy tylko TTS-1.5 Mini i Max. Potwierdź zasięg TTS-2 bezpośrednio przed wysłaniem tekstu objętego przepisami lub poufnego. Polityka należy do warunków trasy dostawcy i konta, dlatego sprawdź ją ponownie przed użyciem w środowisku produkcyjnym.
Powiązane porównania
Model wnioskowania mowy na mowę OpenAI w czasie rzeczywistym dla agentów głosowych korzystających z narzędzi, którzy również potrzebują kontekstu tekstowego i obrazu.
Otwórz pełne porównanieModel Google typu audio-to-audio umożliwiający dialog o niskim opóźnieniu ze świadomością multimodalną, myśleniem, uziemieniem wyszukiwania i wywoływaniem funkcji.
Otwórz pełne porównanieEkspresyjny model syntezy mowy ElevenLabs w czasie rzeczywistym zapewniający naturalny dialog, dostarczanie emocji, znaczniki audio i ponad 70 języków.
Otwórz pełne porównanieObecny model zamiany mowy na mowę SpaceXAI w czasie rzeczywistym dla agentów konwersacyjnych w czasie krótszym niż sekunda z dostępem do narzędzi.
Otwórz pełne porównanie