Meta · プレビュー
Muse Voice Transcribe
Meta のストリーミング音声認識モデルは、ライブ キャプション、長い音声、多数のスピーカー、コード スイッチング、ドメイン対応の文字起こしに対応します。
- 転写価格
- $0.18 / 音声時間
- ライブまたはバッチ
- リアルタイムストリーミングと長編オーディオ
リソース
5 モデルの 1 ~ 5 を表示
Meta · プレビュー
Meta のストリーミング音声認識モデルは、ライブ キャプション、長い音声、多数のスピーカー、コード スイッチング、ドメイン対応の文字起こしに対応します。
Microsoft · プレビュー
Microsoft の高速バッチ文字起こしモデルは、長時間の録音、話者ラベル、単語のタイミング、キーワードのバイアス、クリーンなトランスクリプトまたは逐語的なトランスクリプトに対応します。
Google Cloud · 安定した
Google Cloud の一般的な音声テキスト変換モデル。多くの言語と地域にわたるストリーミング、ファイル、低コストの動的バッチ文字起こしに使用されます。
AssemblyAI · 安定した
コードスイッチング、スピーカーラベル、タイムスタンプ、コンテキストプロンプトを備えた、ファイルとライブオーディオ用の AssemblyAI の精度重視の文字起こしモデル。
ElevenLabs · 安定した
ElevenLabs の多言語音声テキスト変換モデル。多数の話者、単語のタイミング、音声イベント、および大規模なカスタム キーターム リストによる詳細なトランスクリプトを作成します。
このライブラリの使い方
実際の製品を決定するための実用的な API 情報を備えた、フロンティア、スペシャリスト、およびカテゴリ定義モデルの精選されたクロスカテゴリ セット。
Cody does not run a universal quality leaderboard.プロバイダーの主張にはラベルが付けられており、価格には税金とオプションのツールは含まれていません。製品の購入者は、モデルを選択する前にライブプロバイダーの条件を確認する必要があります。
技術的な制限、ライフサイクル、価格設定、地域アクセス、およびデータ ポリシーについては、ファーストパーティのドキュメントが存在する場合は必ずそれを使用します。
同じカテゴリ内のモデルのみを比較し、各プロバイダーの測定基準を保持します。
Show プロバイダーが比較可能な事実を推定せずに公表していない場合は、「未公表」と表示されます。
価格と在庫状況を日付のスナップショットとして扱い、すべてのページをプロバイダーのライブ ドキュメントにリンクします。
音声遅延、テキスト スループット、ビデオ レンダリング時間、ワールド モデル フレーム レートは互換性がありません。
リリース日、国リスト、またはレイテンシ番号が欠落している場合は、推定ではなく未公開としてラベルが付けられます。
モデル ページは基礎となるソースにリンクし、価格設定、アクセス、ポリシーが最後にチェックされた時期を示します。
モデルを機能させる
Cody の拡張されたプロンプト プレイブックと厳選されたエージェント スキルを使用して、モデルの選択を反復可能なワークフローに変えます。