リアルタイム AI アバター モデルの比較: 遅延、アーキテクチャ、コスト
アーキテクチャ、レイテンシの定義、トランスポート、価格設定、およびそれらを自分で評価する反復可能な方法 各リアルタイム アバター ベンダーはレイテンシの数値を公開しています。 Anam は、サーバー側の生成が約 150 ミリ秒で、1 秒未満の会話であることを示しています。 Tavus は 600 未満と言っています… 続きを読む »
アーキテクチャ、レイテンシーの定義、トランスポート、価格設定、およびそれらを自分で評価する再現可能な方法
すべてのリアルタイム アバター ベンダーはレイテンシの数値を公開しています。 Anam は、サーバー側での生成が約 150 ミリ秒で、1 秒未満の会話であることを示しています。 Tavus は 600 ミリ秒未満と表示されます。 Beyond Presence は 100 ミリ秒未満と表示されます。 Simli は 300 ミリ秒未満と表示されます。 LemonSlice は 471 ミリ秒と表示します。 Ojin は 200 ミリ秒未満と表示されます。
これらの数字はどれも嘘ではありません。同じものを測定するものはほとんどありません。
これが、2026 年にリアルタイム アバター プロバイダーを選択する際の中心的な問題であり、チームが定期的にスペック シートからアバター プロバイダーを選択して統合し、その後エクスペリエンスが約束された数値よりも遅く感じられることが判明するのはこのためです。この記事は、これらのシステムが実際に何であるか、モデルがアーキテクチャ的にどのように異なるか、公表されている各レイテンシの数値が実際に測定しているもの、ヘッドラインレートを超えた場合のコスト、そして最も役立つのは、午後に自分で実行できるテストプロトコルです。
同じ名前の 2 つの製品
何かを比較する前に、カテゴリを 2 つに分けてください。ほぼすべてのプロバイダーが次のいずれかまたは両方を販売していますが、それらは代替品ではありません。
エージェント API。 プロバイダーは、音声認識、言語モデル、テキスト読み上げ、レンダリング、トランスポート、そして通常はプロンプト フィールドとナレッジ ベースを備えたダッシュボードなど、スタック全体を所有します。ペルソナを設定し、ページにウィジェットをドロップします。出荷が早く、制御は最小限で、会話の品質はベンダーのモデルの選択によって制限されます。
オーディオからビデオへの API。 プロバイダーの範囲は、エージェントの音声を取得し、リップシンクされたビデオ ストリームをリアルタイムで返すという 1 つのジョブに止まります。独自の Speech-to-Text、独自の LLM、独自の音声、独自のオーケストレーションを持ち込むことができます。通常は、 Pipecat または LiveKit エージェント。これは「フェイス レイヤー」モデルであり、本格的な製品を構築するほとんどのチームが最終的に使用することになります。これは、アバターがすでに機能している音声エージェント上のオプションのインターフェイス レイヤーになるためです。
この違いは商業的にも重要です。 Beyond Presence では、エージェント モードと Speech-to-Video モードの料金がちょうど 2 倍になります。 HeyGen のライト モード (脳を持ち込む) は、フル モードの約半額です。
便利なルール: 最初に音声エージェントを構築し、うまく動作させてから、顔を追加します。アバターからスタートしたチームは、役に立たないことを言う美しいシステムで終わる傾向があります。
これらのモデルが実際にどのように機能するか
現在、根本的に異なる 3 つのレンダリング アプローチが運用中であり、その違いが重要な点で現れています。
すべてのリアルタイム アバターは基本的に同じ形状です。オーディオを入力し、生成されたフレームを出力し、同期を保つのに十分な速度を保ちます。 GPT イメージ 2 で生成されたイメージ。
ピクセル空間拡散
支配的なアプローチ。拡散モデルは、運転音声と参照アイデンティティに基づいてビデオ フレームを直接生成します。 Tavus は、Phoenix-4 をガウス拡散モデルとして説明しています。 LemonSliceは拡散トランスを使用しています。モデルはリグを駆動するのではなくピクセルを生成するため、リグ付きモデルが作成されていない表情、微小な動き、手のジェスチャーを生成できます。また、これは最もコンピューティングを必要とするアプローチでもあるため、このカテゴリでは分単位の料金が設定されています。
ガウス スプラッティングと学習された表現
Simli は、完全なピクセル空間生成ではなく、ガウス スプラッティング表現からレンダリングします。このトレードオフは両方向に見られます。Simli の 1 分当たりのコストは、ピクセル拡散プロバイダーよりもおよそ 1 桁低く、独立したレビュー担当者は、そのアイドル動作 (円形の目の動き、機械的な頭の回転、リスニングとスピーキング間の移行の不十分さ) を一貫して指摘しています。
3D レンダリング
Uneeq は、Unreal Engine でボリュメトリック デジタル ヒューマンを構築し、ピクセル ストリーミングで WebRTC 上で配信します。 NVIDIA の ACE スタックは関連するパスをたどります。 オーディオ2フェイス-3D マイクロサービスは、音声を 3D キャラクターを駆動する ARKit ブレンドシェイプに変換し、NVIDIA AI Enterprise ライセンスに基づいて自己ホスト可能な NIM コンテナーとして出荷されます。どちらも写真と間違えることはありません。その代わりに、完全なアート ディレクション、決定論的な動作、定型化された非人間キャラクター、そして NVIDIA ルートを使用した場合、ハイエンドで唯一の真のセルフホスト オプションが得られます。
アバターの作成: 写真とビデオ
これは密かに、実質的な最大の差別化要因となっています。 2 年前、どのプロバイダーも 2 分間のスタジオ録音を必要としていました。現在、Anam の Cara-4、Simli、LemonSlice、Hedra、Ojin、および bitHuman はすべて、トレーニング手順なしで 1 枚の写真からアバターを生成できます。 Tavus と HeyGen は依然として、記録されたビデオから最高品質のカスタム アバターを構築します。これには数秒ではなく数日かかりますが、単一画像モデルが推測する必要があるマルチアングルの顔データをキャプチャします。
このトレードオフは現実のものです。 1 枚の写真を生成するだけで、午後に 100 個のペルソナを作成できます。ビデオで訓練されたレプリカは、実際に人物の頭が回転するのをモデルが確認しているため、精査の下でもよりよく耐えられる傾向があります。
「レイテンシー」と呼ばれる 6 つの異なるもの
以下は、各ベンダーの価格設定ページに存在するはずの表ですが、存在しないものです。
| 測定されるもの | から→へ | 一般的な公開範囲 | ユーザーはそれを感じますか? |
|---|---|---|---|
| サーバー側での生成 | オーディオチャンクが到着→ビデオフレームが生成される | 100~250ミリ秒 | あくまで全体の一部として。最小のコンポーネント。 |
| ストリーミング推論のレイテンシ | レンダーループ内のみ | 100ミリ秒未満 | いいえ。ネットワークは完全に除外されます。 |
| 推論TTFB | リクエスト → 出力の最初のバイト | ~470 ミリ秒が要求されました | 部分的に。 LLM とその前の TTS を除きます。 |
| グローバルアバターレイテンシー | クライアントへのネットワーク下りを含む | ~250ミリ秒 | もっと近くに。それでも推論スタックは除外されます。 |
| エンドツーエンドの会話の遅延 | ユーザーが話し始める → アバターが話し始める | 600ミリ秒~1.5秒 | はい。これが重要なのです。 |
| フロア予測 / ターンテイク | システムが終了を判断するまでの速さ | 55~300ミリ秒 | はい、多くの場合、これは回復可能な最大のチャンクです。 |
100 ミリ秒を見積もるベンダーと 1 秒を見積もるベンダーは、同じシステムを記述している可能性があります。 1 つ目は、レンダリング ループを測定することです。 2 つ目は、会話全体のターンを測定することです。プロバイダーを比較するときは、単一のクロックで記録されたオーディオとビデオから測定された 5 行目を強調し、単なる中央値ではなく p95 を求めてください。
誰も公開していない数字がもう 1 つあり、誰もが次のことを行う必要があります。 セッション参加時の最初のフレームまでの時間。キオスクやブースの設定では、誰かが歩いてきてから顔が現れるまでのギャップが、システム全体の中で最も重大な遅延となり、独立したレビュー担当者は、いくつかのプロバイダーは、会話中の遅延が良好であっても、参加するのが遅いと指摘しています。
実際にどのレイテンシが満足度を予測するか
これまでに公開されたこのカテゴリの唯一のサードパーティによるブラインド評価は、178 人の参加者を対象としたもので、応答性が全体的なエクスペリエンスを予測する最も強力な単一予測因子であることがわかりました (スピアマン相関 0.697)。2 番目のビジュアル品質を上回りました。肌の質感を比較するのに 1 週間かかる前に、その結果を理解する価値があります。ユーザーは、どのモデルのレンダリングが優れているかを確実に認識することはできません。彼らは、どちらがより早く応答するかを即座に認識します。
プロバイダー
以下の図は、2026 年 8 月時点で各ベンダーが公表したもの、またはサードパーティのレビュー担当者によって報告されたものです。リアルタイムのアバター価格は急速に変化しており、今後も変化し続けるでしょう。すべての数値を仕様ではなく、独自の測定の開始点として扱います。
Anam
Anam は、元 Synthesia スタッフによって 2023 年に設立されたロンドンのスピンアウト企業です。 2026 年 7 月にリリースされたその Cara-4 モデルは、1 枚の写真から会話型アバターを 25 fps で生成し、横向きで 1152×768、縦向きで 768×1152 を出力します。 Anam は、約 150 ~ 180 ミリ秒のサーバー側生成で 1 秒未満の会話遅延の中央値を公表し、70 以上の言語をサポートし、独自の LLM を導入し、データ保持ゼロで SOC 2 Type II、HIPAA、および GDPR をカバーします。トランスポートは Pion 経由の WebRTC です。 178 人の参加者を対象としたブラインド調査では、ビジュアル品質、リップシンク、自然さ、反応性のすべてにおいて第 1 位にランクされました。
一貫した独立した批判はモデルではなく、レビュー担当者は Cara-4 のマイクロエクスプレッションをクラス最高だと評していますが、配管、つまり、セッションへの参加が遅いこと、帯域幅が制限されている場合の動作の悪さです。 LiveKit の統合にはこれまで回避策が必要でした。
Tavus
YCの卒業生であるサンフランシスコの研究所が2020年に設立。 Tavus 完全に販売します 会話型ビデオインターフェイス レンダー レイヤではなく、3 つの独自のモデルから構築されています。 フェニックス-4 レンダリングのために、 レイブン-1 知覚(視線、表情、環境コンテキスト)と Sparrow-1 会話フローの場合、Tavus はフロア予測遅延の中央値が 55 ミリ秒であると報告します。公表されている遅延時間は 600 ミリ秒未満です。交通機関は毎日 WebRTC です。 LiveKit アバター プラグインを最初に出荷したプラグインの 1 つです。カスタム レプリカは 2 分間の録音から作成され、標準プランでは 3 ~ 5 日、エンタープライズ プランでは 24 時間かかります。
Tavus は、ここで最も垂直統合されたオプションです。知覚、ターンテイク、レンダリング、LLM、TTS、および WebRTC はすべて分単位の料金に含まれており、最も高価でもあります。ある購入者の評価では、カスタム アバターの生成は、エラーが発生して再試行が必要になるまでに約 66% 完了に達したと報告されています。
HeyGen ライブアバター
HeyGen ビデオ翻訳からアバター生成にピボットし、カテゴリのビジュアル バーを設定します。 LiveAvatar は、古い Interactive Avatar 製品に取って代わり、LiveKit、Pipecat、および TEN フレームワークをサポートする LiveKit インフラストラクチャ上の WebSocket または WebRTC を介して、エージェント API と Audio-to-Video API の両方をベータ版で提供します。実稼働顧客として指定されているのは、Coursera、HP、Bosch などです。
独立した評価における際立った強みは、アイドル動作 (テストしたプロバイダーの中で最も自然な微動と瞬きのパターン) に加え、アバターが利用できない場合に音声またはテキストに自動的にフォールバックすることであり、これは真に思慮深い制作機能です。その顕著な弱点は感情の幅です。顔は言葉を正確に伝えますが、音域は平坦です。
カスタム アバターには 2 分間のノーカット録画と 同意ビデオおよびエンタープライズ プラン以外では、同意を Web カメラ経由でライブでキャプチャする必要があります。
Simli
Simli は 2023 YC 企業であり、自社をインフラストラクチャ、つまり音声エージェントの顔層として明確に位置づけています。これは、エージェント API と音声からビデオへの API の両方、単一画像のアバター作成、LiveKit および Pipecat のサポートを提供し、ほとんどが 8 ~ 35 セントの市場に対して 1 分あたり 0.009 ドルという他社の追随を許さない価格を提供します。レイテンシーは 300 ミリ秒未満であると主張されています。
コストは補助金ではなく建築から来ており、品質の上限も同様です。レビュー担当者は繰り返しアイドル状態にフラグを立てます。アバターは「決して休んでいると感じない」のです。セッションが短く、主に話している場合は、問題ないかもしれません。誰かがその前に15秒間黙って立っていると、そうなります。
Beyond Presence
Beyond Presence は 2024 年にドイツで設立され、Genesis アバター モデルを使用した販売、人事、コーチングのマネージド エージェントに焦点を当てています。これは、100 ミリ秒未満のストリーミング推論と 250 ミリ秒以下のグローバル アバター レイテンシーを公開しています。この 2 つの異なる測定値は、上記のセクションを考慮すると注目に値します。トランスポートは LiveKit 上の WebRTC で、LiveKit と Pipecat の両方がサポートされ、iframe が埋め込まれています。価格設定には、珍しく歓迎すべき特性があります。含まれている料金と超過料金が各段階で同一であるため、崖がありません。
独立した評論家は、そのビデオ品質と帯域幅の適応性をこのカテゴリで最高と評価しています。この批判は表現的なものです。静止画像からエンコードしているため、ある評価では、出力には上限があり、本格的な B2B 用途では「マスコットとして読み取れる」と説明されています。
LemonSlice
LemonSlice — 以前は Infinity AI — は、インタラクティブ ビデオのフロンティア研究所として 2024/25 年に再スタートしました。拡散トランスフォーマーに基づいて構築されたアバターは 1 枚の写真から作成され、ユニークな点として、現実的な人間だけでなく、様式化された非フォトリアリスティックなキャラクターもうまく処理できます。査読者は、そのジェスチャーと手の動きを最も表現力豊かなものとして挙げています。交通機関は毎日 WebRTC です。ウィジェットと REST API に加えて、自己管理型の LiveKit、Pipecat、または Daily パイプラインのサポートがあります。
LemonSlice は 471 ミリ秒の応答時間を公表しており、主要プロバイダーの中で最速であるとしています。少なくとも 1 つの競合他社の公開比較ページでは、471 ミリ秒という数値が HeyGen と同一であるとしていることに注意してください。両方が同じ測定値を説明することはできず、どちらも独立して検証されていません。これがまさにこの記事が警告するために存在する問題です。
Ojin
ジャーニー・テクノロジーズによって構築され、 Ojin 2 つの顔モデルを背後で実行します 1 つの API: 肖像画 スケールと 存在感 表現力については、どちらも Oris 1.0 音声ビデオ変換モデルによって推進されています。ペルソナは、トレーニング ステップなしで単一の参照画像から作成されます。 Ojin は 200 ミリ秒未満のレイテンシを発行し、WebSocket 経由で接続します。これにより、既存のパイプラインに簡単にドロップできますが、クライアント側のトランスポートを担当する必要があります。価格は Creator ($8/月)、Studio ($82/月)、Growth ($232/月)、Enterprise レベル全体でクレジット ベースであり、モデル API と 2 つのエージェント モードには個別の分単位の割り当てがあります。
ビットヒューマン
ビットヒューマン は、2023 年にサンフランシスコで設立されたエッジ コンピューティングの参入企業で、アバターはデバイス上で実行されるまでユビキタスにならないという前提に基づいて構築されています。セルフホストまたはクラウドで実行できる「必須」モデルと、クラウド専用の「表現力豊かな」モデルが同梱されています。報告されている料金は、クラウドで約 0.04 ドル/分、セルフホストで 0.01 ドル/分です。トランスポートは LiveKit 上の WebRTC で、ナレッジ ベース、Webhook、分析、およびクライアント側のジェスチャ イベントを備えています。
品質は優れているというよりむしろ許容範囲と評価されています。しかし、同社は、ローカル展開を提供する唯一の主流プロバイダーであり、オフライン キオスク、エアギャップ環境、および 8 時間のインストールで分単位のクラウド請求が受け入れられないあらゆる環境の計算を完全に変更します。
Hedra、D-ID、Uneeq
Hedra (2023 年、サンフランシスコ) は、実用性ではなく創造性に焦点を当てたデジタル キャラクターの基礎モデルを構築しました。単一画像のアバター、LiveKit 上の WebRTC、約 0.07 ドル/分。独立したテストでは、解像度とビットレートが低く、遅延が遅いことが報告されています。
D-ID (イスラエル、2017 年) は、Deep Nostalgia で公に知られているベテランで、現在はエンタープライズ ストリーミングに注力しています。 Janus 上の WebRTC、フレームワーク サポートなし、SDK なしの低レベル API。約 0.35 ドル/分、独立したテストでは遅延が遅いと評価されています。
ユニーク これはジェネレーティブ ブームより完全に前から存在しており、分単位の料金設定ではなく、ライセンスに基づいてピクセル ストリーミング経由で Unreal Engine のデジタル ヒューマンを提供していました。アバターは Uneeq によって手動で構築されます。遅延は良好です。帯域幅の回復力はありません。 3D レンダリングされていることがわかります。
Synthesiaは、非同期企業ビデオの既存のカテゴリであり、ライブ オファリングを実証しましたが、最新の独立調査の時点では公開されていませんでした。
比較表
| プロバイダー | APIの形状 | レンダリング | アバターソース | 輸送 | フレームワーク | 公表されたレイテンシ |
|---|---|---|---|---|---|---|
| Anam | エージェント | 拡散 (Cara-4) | 1枚の写真 | WebRTC (ピオン) | LiveKit (回避策) | サブ1の会話。 ~150 ~ 180 ミリ秒のサーバー |
| Tavus | エージェント | ガウス拡散 (Phoenix-4) | 2分のビデオ | WebRTC (毎日) | LiveKit、Pipecat | 600 ミリ秒未満。 55 ミリ秒の下限予測 |
| HeyGen ライブアバター | エージェント + A2V | 独自の | 2 分のビデオ + 同意 | WebSocket または WebRTC (LiveKit) | LiveKit、Pipecat、10 | ~471 ms TTFB (議論あり) |
| Simli | エージェント + A2V | ガウス スプラッティング | 1枚の写真 | WebRTC (毎日) | LiveKit、Pipecat | 300ミリ秒未満 |
| Beyond Presence | エージェント + A2V | プロプライエタリ (ジェネシス) | 短いビデオ | WebRTC (LiveKit) | LiveKit、Pipecat | 100 ミリ秒未満の推論。 ≤250ms グローバル |
| LemonSlice | エージェント | 拡散変圧器 | 1枚の写真 | WebRTC (毎日) | 自己管理 | 471 ミリ秒 (自己申告) |
| Ojin | エージェント + モデル API | Oris 1.0 スピーチトゥビデオ | 単一の画像 | WebSocket | パイプラインに依存しない | 200ミリ秒未満 |
| ビットヒューマン | エージェントまたはローカル | 独自の | 画像またはビデオ | WebRTC (LiveKit) | LiveKit | 非公開 |
| Hedra | エージェント | 独自の | 単一の画像 | WebRTC (LiveKit) | LiveKit (回避策) | 非公開 |
| D-ID | エージェント | 独自の | 画像 | WebRTC (ヤヌス) | なし | 「低遅延」、数値なし |
| ユニーク | エージェント | アンリアル エンジン 3D | Uneq によって構築されました | WebRTC (ピクセル ストリーミング) | なし | 非公開 |
かかる費用
このカテゴリの 3 分の 2 は、1 分あたり 0.08 ドルから 0.35 ドルの間に集中しています。異常値は構造的な理由からの異常値であるため、理解する価値があります。
| プロバイダー | 1分当たりの効果 | 構造 | 気をつけてください |
|---|---|---|---|
| Simli | $0.009 | 従量課金制、10 ドルのサインアップ クレジット | アイドル状態の品質 |
| ビットヒューマン | ~0.01 ドルのセルフホスト / ~0.04 ドルのクラウド | 分ごとまたはローカル | セルフホスティングとは、GPU を所有していることを意味します |
| Hedra | ~$0.07 | 1分あたり | 解像度とビットレート |
| Beyond Presence | €0.087–0.175 (S2V) / €0.175–0.35 (エージェント) | クレジット;含まれる = 超過料金 | エージェント モードはちょうど 2× S2V です |
| HeyGen ライブアバター | $0.095 (ライト、ビジネス) – $0.25 (フル、スターター) | クレジット、100 ドル = 1,000 | 価格単位が混在している。超過分はプランのクレジットコストを超える可能性があります |
| Anam | $0.18–0.24 ブレンド | サブスクリプション + 分 | 議事録は毎月有効期限が切れます。 999 ドル層は 299 ドル層よりも分あたりの料金が低くなります |
| LemonSlice | ~$0.21 | サブスクリプション + セッションのプリチャージ | セッションベースのプリチャージモデル |
| Tavus | $0.32 ブレンド (成長) / $0.59 (スターター) | サブスクリプション + 分 | 6 秒の丸め、最小 30 秒、カテゴリー内で最高のオーバーレージ |
| D-ID | ~$0.35 | サブスクリプション + クレジット | SDK はありません。統合コストは実際のコストです |
ヘッドラインレートよりも重要な 2 つの構造的なポイント:
同時実行性は隠れた制約です。 分単位の料金設定は拡張可能であることを意味しますが、プランには同時セッションの上限があり、その上限は低いです。公開されている評価の 1 つでは、Tavus では月額 395 ドルのプランで 15 の同時セッションが可能、Anam では ~299 ドルのプランで 5 つの同時セッションが可能、HeyGen では Essential レベルで 20 の同時セッションが可能であることがわかりました。カンファレンスの聴衆やマーケティング キャンペーンの前にアバターを配置する場合、実際に購入しているのは時間ではなく同時実行性です。価格を聞く前に聞いてください。
バンドルと持ち込みでは、比較が完全に変わります。 Tavus の 1 分あたりのレートには、認識、ターンテイク、レンダリング、LLM、TTS、および WebRTC が含まれます。 Simli の $0.009 にはレンダリング以外は含まれません。STT、LLM、TTS、トランスポートの料金は別途お支払いいただきます。同じものと同じものを比較しないと、安いオプションが実際の 35 倍安く見えます。
同意、肖像、および現在適用されるルール
すべてのプロバイダーは、実際の人のアバターを作成することに同意を必要とし、その仕組みはワークフローに影響を与えるほど異なります。 HeyGen では、描かれた人物からの同意ビデオの録画が必要であり、エンタープライズ プラン以外では、その同意を Web カメラ経由でライブでキャプチャする必要があります。つまり、標準プランではアーカイブされた映像からアバターをバッチ作成することはできません。
これとは別に、2026 年 8 月 2 日以降、EU AI 法第 50 条が適用されます。人間と直接対話するシステムは、対話が AI との対話であることを明確にし、合成または操作されたコンテンツを最初の公開時に明確に開示する必要があります。人間のフォトリアリスティックなアバターは、両方の義務の中にしっかりと含まれています。実際の意味は簡単です。最初のやり取りで開示し、フッターにボルトで開示するのではなく、エクスペリエンスに開示を設計します。
これらを自分で評価する方法
ベンダーのデモは調整されています。ベンダー数は比較にならないほどです。ここでは、約 1 日かかり、実際に比較できる数値を生成するプロトコルを示します。
1.アイドルテスト
セッションを開始し、15 秒間何も言わないでください。顔に注目してください。これは、背後に隠れる音声がないため、レンダリング品質を示す唯一の最も正直な信号であり、ほとんどのプロバイダーが最初に失敗する場所です。まばたきの数、呼吸、頭の微小な動き、聞いている状態から話している状態への移行状態を観察します。 30 秒間繰り返します。キオスク展開では、アバターは生涯のほとんどをこの状態で過ごします。
15 秒間の沈黙からサンプリングされた 3 つの瞬間。まばたきの速度、呼吸、微小な頭の動きは、レンダリング品質を偽るのが最も難しい部分です。 GPT イメージ 2 で生成されたイメージ。
2. クロックテスト
インタラクションの両側を 1 つのクロックで記録します。つまり、マイク入力とレンダリングされた出力が一緒にキャプチャされます。ベンダーが報告したタイミングは使用しないでください。スピーチの終わりから応答の最初に聞こえる単語までを少なくとも 30 ターンにわたって測定し、p50 と p95 を別々に報告します。 p95 はデモよりもかなり悪いことが予想され、それがユーザーが経験する数値になると予想してください。
3. 結合テスト
セッションを 20 回コールドスタートし、開始から最初にレンダリングされたフレームまでの実時間を測定します。これを公開する人は誰もおらず、ウォークアップ環境での第一印象はそれが支配的です。
4. バージインテスト
アバターの文の最初、途中、最後で中断します。これとは別に、バックチャネル (「mm-hm」)、本物の修正 (「いいえ、金曜日」)、および純粋なバックグラウンド ノイズをテストします。 3 つのことを確認してください: 停止すべきときに停止するか、停止するか そうではない 停止すべきではないときに停止し、コンテキストをそのままにして再開しますか。
5. 帯域幅テスト
1.5 Mbps にスロットルし、その後 500 ミリ秒のジッターを追加し、その後 500 kbps に調整します。これはプロバイダーが最も大きく分離される部分であり、オフィス接続では見えません。独立したテストでは、帯域幅が制限された状態でのファイバーのフリーズや切断に優れていると思われるプロバイダーがいくつか見つかりました。これはまさに会議用 Wi-Fi ネットワークです。
6. ブラインドテスト
どれがどれだかわからない10人の前に2~3人の候補者を出し、見た目ではなく経験で順位をつけてもらいます。視覚的な品質よりも応答性の方が満足度をより強く予測することを考えると、最も美しいモデルが負けても驚かないでください。
選び方
実際に分岐する決定を圧縮すると、次のようになります。
- すでに音声エージェントが動作しています。 エージェント API ではなく、Audio-to-Video API を購入します。 Beyond Presence、Simli と HeyGen はすべてレンダー レイヤのみを販売しており、会話が適切かどうかを決定するものを制御できます。
- 最高のビジュアルと表現力の品質が必要です。 Anam の Cara-4 と Tavus の Phoenix-4 は、価格帯のトップに位置し、独立した評価をリードしています。数分だけではなく同時実行の予算を設定します。
- 低コストで大量生産が必要です。 Simli、実際のセッション パターンに対してアイドル状態を検証した場合、フィールドよりも桁違いに小さくなります。
- オフライン、エアギャップ、または終日設置の経済性が必要です。 bitHuman のローカル モデル、または 3D パイプラインを搭載できる場合は、Audio2Face-3D を備えた NVIDIA ACE。
- 様式化されたキャラクターまたは人間以外のキャラクターが必要です。 生成されたスタイルの場合は LemonSlice。オーサリング 3D の場合は Uneeq または NVIDIA ACE。
- 今週はそれを製品に組み込む必要があります。 ウィジェットを備えたエージェント API。上限を受け入れ、会話の品質がバインディング制約になった場合に備えてレンダー レイヤへの移行を計画します。
結論
このカテゴリのモデルは、その周囲のマーケティングよりも早く収束しています。 10 社のプロバイダーを並べて評価した独立系レビュー担当者は、プロバイダー間に品質の差はあるものの大きくはなく、テクノロジーはトレーニング、人材採用、販売のユースケースに対応でき、コストは 35 倍の範囲に及び、急速に変化していると結論付けました。
収束していないのは測定です。すべてのベンダーが実行する共有ベンチマーク (現実的な帯域幅で、録音された音声からのエンドツーエンドの会話遅延、p50 および p95) を誰かが公開するまで、信頼できる唯一の数値は、自分で測定した数値です。
一日を過ごしてください。 6 つのテストを実行します。結果はスペックシートと一致せず、そのギャップが最大のポイントです。

