OpenAI · 安定した
GPT-Realtime-2.1
OpenAI のリアルタイム音声合成推論モデルは、テキストと画像のコンテキストも必要とするツールを使用する音声エージェント向けです。
- 価格ベース
- オーディオ $32 イン · $64 アウト / 100 万トークン
- インタラクションモード
- テキスト/画像コンテキストを使用した音声合成
リソース
5 モデルの 1 ~ 5 を表示
OpenAI · 安定した
OpenAI のリアルタイム音声合成推論モデルは、テキストと画像のコンテキストも必要とするツールを使用する音声エージェント向けです。
Google のプレビュー オーディオツーオーディオ モデル。マルチモーダルな認識、思考、検索グラウンディング、機能呼び出しを備えた低遅延対話を実現します。
ElevenLabs の表現力豊かなリアルタイム テキスト読み上げモデルは、自然な対話、感情表現、オーディオ タグ、および 70 以上の言語に対応します。
Inworld の最新の表現力豊かなリアルタイム テキスト読み上げモデル。会話の内容を記憶し、100 以上の言語で話すように設計されています。
SpaceXAI の現在のリアルタイム音声合成モデルは、ツールにアクセスできる 1 秒未満の会話エージェント向けです。
このライブラリの使い方
実際の製品を決定するための実用的な API 情報を備えた、フロンティア、スペシャリスト、およびカテゴリ定義モデルの精選されたクロスカテゴリ セット。
Cody does not run a universal quality leaderboard.プロバイダーの主張にはラベルが付けられており、価格には税金とオプションのツールは含まれていません。製品の購入者は、モデルを選択する前にライブプロバイダーの条件を確認する必要があります。
技術的な制限、ライフサイクル、価格設定、地域アクセス、およびデータ ポリシーについては、ファーストパーティのドキュメントが存在する場合は必ずそれを使用します。
同じカテゴリ内のモデルのみを比較し、各プロバイダーの測定基準を保持します。
Show プロバイダーが比較可能な事実を推定せずに公表していない場合は、「未公表」と表示されます。
価格と在庫状況を日付のスナップショットとして扱い、すべてのページをプロバイダーのライブ ドキュメントにリンクします。
音声遅延、テキスト スループット、ビデオ レンダリング時間、ワールド モデル フレーム レートは互換性がありません。
リリース日、国リスト、またはレイテンシ番号が欠落している場合は、推定ではなく未公開としてラベルが付けられます。
モデル ページは基礎となるソースにリンクし、価格設定、アクセス、ポリシーが最後にチェックされた時期を示します。
モデルを機能させる
Cody の拡張されたプロンプト プレイブックと厳選されたエージェント スキルを使用して、モデルの選択を反復可能なワークフローに変えます。