Inworld Realtime TTS-2
Inworld の最新の表現力豊かなリアルタイム テキスト読み上げモデル。会話の内容を記憶し、100 以上の言語で話すように設計されています。
Inworld の最新の表現力豊かなリアルタイム テキスト読み上げモデル。会話の内容を記憶し、100 以上の言語で話すように設計されています。
平易な英語による概要
Inworld Realtime TTS-2 は、キャラクターの配信の一貫性を保つために以前のオーディオ ターンを使用しながら、テキストをストリーミング音声に変換します。開発者は、希望する雰囲気や表現を自然言語で説明したり、言語を切り替えたり、権利やアカウント設定が許可する場合は音声クローンを使用したりできます。
価格はオーディオ トークンではなくキャラクターに基づいているため、スクリプトの見積もりが容易になります。 Inworld は、最初の音声までの時間の中央値が 200 ミリ秒未満であると報告していますが、ネットワークの距離、アプリケーションの動作、上流の言語モデルが依然として完全な応答時間に影響を与えます。
カテゴリ比較
これらはプロバイダーが公開した仕様であり、Cody ベンチマーク スコアではありません。現在の制限とエンドポイント固有の例外については、リンクされたソースに従ってください。
APIとプロバイダーへのアクセス
可用性
Inworld の REST TTS API および OpenAI 互換の Realtime API を通じて一般的に利用可能です。
標準地域のカバー範囲はモデル ページには記載されていません。エンタープライズ プランでは、EU およびインドのデータ常駐オプションを宣伝しています。
ライブの空き状況を確認するデータとトレーニング
Inworld はエンタープライズ アドオンとしてデータ保持ゼロを宣伝していますが、現在公開されている ZDR サポート ページでは TTS-1.5 Mini と Max のみが名前として挙げられています。規制されたテキストまたは機密テキストを送信する前に、TTS-2 の範囲を直接確認してください。
これは、引用された提供者の資料を簡潔にまとめたものであり、法的アドバイスではありません。サードパーティのゲートウェイには、モデル メーカーの直接 API とは異なるストレージ、ルーティング、トレーニング、常駐条件が適用される場合があります。
プロバイダーポリシーを読むよくある質問
Inworld の最新の表現力豊かなリアルタイム テキスト読み上げモデル。会話の内容を記憶し、100 以上の言語で話すように設計されています。 Inworld Realtime TTS-2 は、キャラクターの配信の一貫性を保つために以前のオーディオ ターンを使用しながら、テキストをストリーミング音声に変換します。開発者は、希望する雰囲気や表現を自然言語で説明したり、言語を切り替えたり、権利やアカウント設定が許可する場合は音声クローンを使用したりできます。
引用されたプロバイダーの資料によると、Inworld Realtime TTS-2 は 2026年8月31日 でリリースされました。
Inworld の REST TTS API および OpenAI 互換の Realtime API を通じて一般的に利用可能です。 このガイドに記載されているアクセスルートは Inworld AI です。
オンデマンドで 100 万文字あたり 25 ドル. 公開されているサブスクリプション料金は、ティアごとに 100 万文字あたり 20 ドル、17.50 ドル、15 ドル、12.50 ドルに下がり、エンタープライズ価格は 5 ドルという低価格で宣伝されています。
Inworld の REST TTS API および OpenAI 互換の Realtime API を通じて一般的に利用可能です。 標準地域のカバー範囲はモデル ページには記載されていません。エンタープライズ プランでは、EU およびインドのデータ常駐オプションを宣伝しています。
Inworld はエンタープライズ アドオンとしてデータ保持ゼロを宣伝していますが、現在公開されている ZDR サポート ページでは TTS-1.5 Mini と Max のみが名前として挙げられています。規制されたテキストまたは機密テキストを送信する前に、TTS-2 の範囲を直接確認してください。 このポリシーはプロバイダーのルートとアカウントの条件に属しているため、運用環境で使用する前に再度確認してください。
関連する比較
OpenAI のリアルタイム音声合成推論モデルは、テキストと画像のコンテキストも必要とするツールを使用する音声エージェント向けです。
完全な比較を開くGoogle のプレビュー オーディオツーオーディオ モデル。マルチモーダルな認識、思考、検索グラウンディング、機能呼び出しを備えた低遅延対話を実現します。
完全な比較を開くElevenLabs の表現力豊かなリアルタイム テキスト読み上げモデルは、自然な対話、感情表現、オーディオ タグ、および 70 以上の言語に対応します。
完全な比較を開くSpaceXAI の現在のリアルタイム音声合成モデルは、ツールにアクセスできる 1 秒未満の会話エージェント向けです。
完全な比較を開く