すべての記事
リアルタイムAI

AI 通話エージェントの比較: 遅延、方向転換検出、中断

公開されているすべてのベンチマークが一致しない理由、ターン検出に実際にどのようなコストがかかるのか、そしてそれを自分で測定する方法 ここでは、2026 年の AI 電話エージェントに関する 2 つの事実を紹介します。どちらも十分な情報源があり、両方とも真実であり、明らかに互換性がありません。事実 1: Vapi は以下の p50 をターゲットとしています… 続きを読む »

によって Om Kamath読書時間: 4
暗いフィールドを挟んで向かい合う 2 つのオーディオ波形、その間に光る交代のギャップがある

公開されているすべてのベンチマークが一致しない理由、ターン検出に実際にかかるコスト、およびそれを自分で測定する方法

ここでは、2026 年の AI 電話エージェントに関する 2 つの事実を紹介します。どちらも十分な情報源があり、両方とも真実ですが、明らかに互換性がありません。

事実 1: Vapi は 500 ミリ秒未満の p50 をターゲットとしています。 Retell は約 600 ミリ秒を発行します。 Bland のホームページには 400 ミリ秒と記載されています。 Twilio の内部 ConversationRelay テストでは、中央値 491 ミリ秒が報告されています。

事実 2: 実際の電話回線を介してこれらのプラットフォームにダイヤルし、録音された音声から測定した独立したベンチマークでは、中央値が 1,296 ミリ秒から 1,740 ミリ秒の間であることがわかりました。これは、どのプラットフォームも、公表されている数値よりも 2 ~ 4 倍遅いということです。

誰も嘘をついていません。彼らは、クロックの開始位置について異なる仮定を使用して、異なるトランスポート上で異なるものを測定しています。そして、それぞれの数字が何を表しているのかを正確に理解するまでは、プラットフォームを選択するためにそれらの数字を使用することはできません。

この記事では、測定の問題を真剣に受け止め、公開されているベンチマークとその方法論を並べて示し、言語モデルではなく方向転換検出が現在主要な変数となっている理由を説明し、実際に信頼できる数値を生成するためのプロトコルで終わります。

時間はどこへ行くのか

電話の音声ターンは 5 脚のリレー レースのようなもので、各ペアのランナーの間にバトンが置かれます。

しきい値ラインを越える 5 つの等しくないレイテンシ セグメントを示す抽象的な積み上げタイムライン バー

声番は5本足の駅伝です。そのうちの 1 つは常に他のものよりもはるかに幅が広くなります。 GPT イメージ 2 で生成されたイメージ。

ステージ 併置されたスタック 典型的なステッチスタック
ネットワーク/SIP 45ミリ秒 150ミリ秒
音声からテキストへの変換 100ミリ秒 225ミリ秒
LLM 推論 225ミリ秒 650ミリ秒
テキスト読み上げ 80ミリ秒 185ミリ秒
合計 450ミリ秒 1,210ミリ秒

二つの観察。 LLM は両方の列を支配しています。そのため、通常の会話のルーティングを小規模で高速なモデルにルーティングし、推論が本当に必要な場合にのみエスカレーションすることが、ほとんどのチームが利用できる最も効果の高い変更です。また、列間の 760 ミリ秒のギャップはモデルの品質に違いはありません。それは、地理、ホップ数、および音声が通過する別のベンダーのネットワークの数です。

この表が省略しているのは、通常、最もコストがかかる段階、つまり発信者が話し終えたと判断する段階です。これはリレーが開始する前に発生し、エンドポイントのしきい値が正しく設定されていないと、その下のパイプライン全体よりも遅延が増加する可能性があります。

ベンチマークとその方法論

4 つの独立系の研究が、2026 年のこれらのプラットフォームの数値を発表しました。それらの意見は一致せず、場合によってはランキングが完全に逆転します。ここに、それらを生み出した方法論が示されています。 です 結果。

研究 1: 実際の通話、録音された音声から測定

方法論的に最も透明性の高い公開ベンチマークは、固定スクリプトを読み上げる発信者ロボットを使用して実際の電話で各プラットフォームのエージェントにダイヤルし、単一のクロックで通話の両側を録音し、エネルギーを改良した Silero VAD を使用して録音内の音声境界を特定しました。プラットフォームによって報告されたタイムスタンプは使用されませんでした。 5 つのプラットフォームで 2,078 の使用可能なターン。構成可能な場合、エンドポイントは 0.1 秒で標準化されます。メトリックは、最初の音声バイトまでの時間です。

プラットフォーム p50 p95 テール比 使用可能ターン数
Telnyx 1,296ミリ秒 1,856ミリ秒 1.43× 419/432
ElevenLabs 1,424ミリ秒 1,768ミリ秒 1.24× 429/432
Bland AI 1,520ミリ秒 2,248ミリ秒 1.48× 429/432
Vapi 1,558ミリ秒 2,008ミリ秒 1.29× 382/432
Retell AI 1,740ミリ秒 2,259ミリ秒 1.30× 419/430

最後の列に注目してください。 Vapi は 50 ターン (10% 以上) を廃棄しましたが、他のターンは数ターンでした。時々、使用可能なターンをまったく生成できないプラットフォームは、レイテンシ パーセンタイルでは捉えられない何かを伝えています。

調査 2: プロダクション コール、音声対音声

2026 年 3 月の調査では、プラットフォームごとに 500 回の実稼働通話を実行し、音声間の通信を測定しました。

プラットフォーム 中央値 p95
Retell 680ミリ秒 920ミリ秒
Vapi 720ミリ秒 1,050ミリ秒
Bland 850ミリ秒 1,180ミリ秒

Retell はスタディ 1 で最下位、スタディ 2 で 1 位で終了しました。 同じプラットフォーム、同じ年、逆の結論。これがこの記事で最も重要なことです。現在の最先端技術では、プラットフォームよりも測定方法の方が結果に影響を与えます。

調査 3: サードパーティ製スタックの修正

別のアプローチ - モデルを一定に保持し (GPT-4.1、Deepgram Nova-3、ElevenLabs Flash)、オーケストレーション レイヤーを分離してフル ターンを測定します。

プラットフォーム フルターン、p50
ElevenLabs 1.73秒
Retell 1.96秒
Vapi 2.34秒

ここでのすべての数値は、ベンダーが宣伝しているものをはるかに上回っています。これは、固定サードパーティ スタックを完全にオンにすることには、ベンダーが独自の最適化されたパスを引用するときに除外する部分が含まれるためです。

研究 4: キャリアレッグのみ

最後に、2026 年 6 月に、通信事業者ごとに 120 件の発信通話をテストし、電話区間での往復時間を分離しました。

キャリア p50 RTT p95 RTT
Telnyx 71ミリ秒 118ミリ秒
Twilio 89ミリ秒 161ミリ秒
Vonage 94ミリ秒 152ミリ秒

有用なコンテキスト: キャリアは 100 ミリ秒未満に寄与します。エージェントが遅いと感じる場合、電話ネットワークが原因であることはほとんどありません。

同じ光るバーの異なるスパンをブラケットする 4 つの異なる測定器

1 つのオブジェクト、4 つの楽器、4 つの読み取り値。この記事のレイテンシの数値はすべて正確です。単に同じスパンを測定していないだけです。 GPT イメージ 2 で生成されたイメージ。

4つをまとめて読む方法

数値型 含まれるもの 何を隠しているのか 信頼してください
ベンダーの p50 の主張 最適化されたパス、多くの場合、テレフォニーではなく WebSocket エンドポイント待機、キャリアレッグ、テール 大まかなアーキテクチャの品質
コンポーネントの遅延 (例: 75 ミリ秒の TTS) 1 つのモデルの合成時間 その他すべて そのコンポーネントを選択する
録音された音声 TTFAB 発信者が聞くすべて 何もありません – ただし、録音オーバーヘッドが含まれます 実体験ランキング
固定スタックのフルターン オーケストレーションのオーバーヘッド、分離 各プラットフォーム独自のチューニングモデル オーケストレーション層の比較
キャリアRTT 電話転送のみ エージェントは完全に 通信事業者の選択

そして、知覚的に重要なしきい値は、人間の会話によるハンドオフは 200 ミリ秒近くです。約 800 ミリ秒を過ぎると、発信者は遅延を登録します。約 1,500 ミリ秒を超えると、壊れていると表示されます。研究 1 のほとんどの p95 数値が 2 番目の閾値の間違った側に位置していることに注意してください。 中央値は、デモがどのように感じられるかを表します。 p95 は、発信者がどのように感じているかを表します。

方向転換の検出が真の差別化要因となる

上記のすべてのプラットフォームは、GPT クラスのモデルを呼び出し、ElevenLabs クラスの音声をストリーミングできます。それらは商品です。自然の作用物質と消耗する作用物質を分けるものは、決定を下す部分である いつ話すかそして、ここに真のエンジニアリングの違いが存在します。

エンドポイント税

素朴なアプローチは沈黙を待ちます。しきい値を 800 ミリ秒に設定すると、処理が開始されるまでにすべての応答にほぼ 1 秒が追加されることになります。 10 分を超える通話は、構成値によって支払われ、実際にはデッドエアです。しきい値を下げると、エージェントは、アカウント番号の途中で立ち止まって考えている人すべてに割り込みを開始します。これは全員です。

それを修正するスタック

方向転換検出は、音声エージェントの中で最も魅力的ではなく、最も重要な部分です。 LiveKit 独自のセマンティック発話終了モデルのウォークスルーは、沈黙タイムアウトが十分ではない理由を最も明確に簡潔に説明しています。
レイヤー 何をするのか 代表的な実装
VAD 各オーディオフレームを音声かそうでないかを分類します Silero VAD — ほぼ世界的なデフォルト
エンドポイント設定 トランスクリプトストリームを監視して完了信号を確認します STT プロバイダーのエンドポイント構成
セマンティック方向転換検出 ターンの完了を意味から予測し、沈黙する前にコミットできる LiveKit ターン検出器 (Qwen2.5-0.5B 微調整、CPU 推論、14 言語); Pipecat スマートターン
会話型 STT 1 つのモデルでの認識と交代 Deepgram Flux; Tavus Sparrow-1

Deepgram の Flux は、2026 年 4 月 29 日から多言語形式で一般提供され、会話中の言語切り替え機能を備えた 10 か国語で利用可能です。ターン終了検出の中央値は 260 ミリ秒、p95 は 1.5 秒であると報告されており、構成可能な eot_threshold 待ち時間を精度と引き換えに、従来の STT プラス VAD と比較して、切断剤の応答待ち時間を 200 ~ 600 ミリ秒で報告します。 Tavus は、Sparrow-1 フロー モデルを 55 ミリ秒の中央値フロア予測レイテンシで報告します。

具体的に言うと、800 ミリ秒の無音タイムアウトからセマンティック ターン検出器に切り替えると、このページの他のすべての最適化を組み合わせた場合よりもレイテンシーを節約できます。レイテンシーを重視している場合は、プラットフォームがどのような方向転換検出を使用しているのか、またそれを変更できるかどうかを尋ねてください。その答えは、公開されているどの p50 よりも正確にエクスペリエンスを予測します。

割り込み処理: トグルではなくポリシー

バージインは通常、1 つのブール値として公開されます。これは問題の間違った形であり、レイテンシで良いスコアを出したエージェントが依然として話しかけるのが間違っていると感じる最も一般的な理由です。

その理由は、着信通話の音声が 1 つではないためです。便利な分類法では 6 つの方法に分割されており、それぞれに異なる動作が必要です。

入力クラス 正しい行動 故障信号
真の補正 「いいえ、金曜日です」 停止し、順番を受け入れ、タスクのコンテキストを保持します 発信者が同じ修正を繰り返す
バックチャネル 「うん」、「うーん」 話し続けてください。意図として扱わないでください エージェントが応答をキャンセルしてリセットする
背景雑音 キーボード、トラフィック、第 2 音声 続けてください。誤った中断を記録する 発信者のトランスクリプトが表示されずに再生が停止する
DTMF 発信者がメニュー中に 2 を押す トランスクリプトではなく数字によってルーティングする 数字は無視されるか、音声として処理されます
エンティティの長い一時停止 口座番号の途中で一時停止する 待って;早めに応答しないでください エンティティが完了する前にエージェントが中断する
エスカレーション 「人が欲しい」 すぐに停止して転送してください エージェントが主張する

信頼を最も早く失う失敗は、誤った停止です。エージェントが話の途中で発信者が「わかりました」と言うと、エージェントは停止し、「わかりました」を新しい質問として扱います。ある通話では、それは不具合です。何千回もの呼び出しを繰り返すと、完了率が目に見えて低下しますが、待ち時間の指標には現れません。

正しい構造は、メッセージ タイプごとのポリシーです。猶予期間の経過後に挨拶を中断可能。 DTMF と音声を受け入れるメニュー。実体捕獲患者。法的、同意および支払いの開示 無停電;ツール待機フィラーは即座にキャンセル可能。人間の譲渡の意図は常に尊重されます。

そしてそれを計器化します。毎ターンログに記録する価値のある 4 つのイベントは、中断の候補、それを生成した決定とポリシーのバージョン、回復位置、および確認された誤検知です。誤った中断率と見逃した中断率を別個のダッシュボードとして追跡します。これらは反対方向に移動し、平均化すると両方が非表示になります。バージイン テスト用のオープン シナリオ パックがあります。 GitHub これは、Vapi、Retell、Bland、Pipecat、およびセルフホスト型 LiveKit で動作します。

プラットフォーム

Vapi

Vapi は最も柔軟なオーケストレーション レイヤーです。独自の STT、LLM、TTS、およびテレフォニーを持ち込み、それらのいずれかを交換し、パイプラインを調整します。オーケストレーションの料金は約 0.05 ドル/分で、基盤となるプロバイダーごとに個別に請求されます。独立したテストでは、調整されたスタックは中央値 500 ~ 700 ミリ秒であり、デフォルトのパイプラインは大幅に遅くなります。すべてのコンポーネントを制御し、チューニングを自分で行う準備ができている場合は、これを選択してください。柔軟性は本物であり、構成の負担も軽減されます。

Retell AI

Retell は、構造化された対話フローと企業のコンプライアンスに重点を置いた管理されたスタックです。音声インフラストラクチャは約 0.055 ドル/分、従量課金制は約 0.07 ドル/分からです。ある調査では箱から出してすぐに約 600 ミリ秒が報告され、別の調査では最下位でした — 上のセクションを参照してください。コンポーネント キットではなく、強力なフロー制御を備えたサポートされているマネージド パイプラインが必要な場合に選択します。

Bland AI

Bland は、音声合成、LLM、音声合成、電話を 1 分あたり 0.09 ~ 0.14 ドルの料金でバンドルした価格設定を採用しており、大量のアウトバウンド向けに設計されています。パスウェイの複雑さに応じて、約 700 ~ 900 ミリ秒と測定されます。バンドルのほうが商業的には非常に単純です。その代償として、各レイヤーの制御が低下します。

ElevenLabs Agents

このカテゴリで最も評価の高い音声合成をベースに構築されており、その Flash モデルは約 75 ミリ秒で合成されます。エージェントの請求額は、年間ビジネス プランで約 0.08 ドル/分、クリエイターとプロで約 0.10 ドル/分で、LLM トークンは個別に通過し、各段階でバンドルされた分単位の割り当てが含まれます。 SIP トランキング 既存のテレフォニー (Twilio、Telnyx、セルフホステッド PBX) をダイジェストまたは ACL 認証、および会議、ブラインド、および SIP REFER スタイルをサポートする番号への転送ツールに接続します。注目すべきは、録音オーディオのベンチマークで最も狭いテール レシオを記録したことです。これは適切な中央値よりも重要です。

Telnyx

特徴的な特性は垂直統合です。 Telnyx はオーディオが通過するキャリア ネットワークを所有しており、そのアーキテクチャ バジェットの 450 ミリ秒は、より高速なモデルからではなく、スタックを同じ場所に配置することから来ています。録音音声調査では中央値が最も低く、輸送調査ではキャリア RTT が最も低かった。テレフォニーの接続が最重要事項である場合に選択してください。

OpenAI Realtime

プラットフォームではなくモデルであり、プラットフォームが構築されるものはますます増えています。の リアルタイムAPI は、ブラウザ用の WebRTC、サーバー用の WebSocket、および実際の電話通話をセッションに直接ルーティングする SIP の 3 つのトランスポートをサポートします。これはネイティブの音声合成です。音声入力、音声出力があり、中間テキストのボトルネックがなく、ターン全体を通じて韻律が保持されます。料金は分単位ではなくトークンベースであり、コンテキストとキャッシュをどの程度管理しているかに応じて、有効範囲が広くなります。達成可能なターン レイテンシを最小限に抑え、周囲のオーケストレーションを構築できる場合に選択します。検査するテキストがないため、中間推論を記録、監査、または制限する必要がある場合は避けてください。

Synthflow、Twilio ConversationRelay、および残り

Synthflow エンジニアではなくオペレーターを対象としたノーコードビルダーを備えた音声エンジンは、1 分あたり約 0.09 ドルです。 Twilioさん ConversationRelay AI エージェントを Twilio の既存のテレフォニー資産に接続し、内部報告では 491 ミリ秒 p50 および 713 ミリ秒 p95 と報告されています。通話インフラストラクチャがすでに存在している場合は魅力的です。

自分で構築する: Pipecat および LiveKit エージェント

どちらもオープンソースであり、実際に運用可能です。

PipecatDaily が開発したこのツールは、非常に大規模なプラグイン ライブラリとほぼ毎日の開発を使用して、音声とテキストが流れるプロセッサのパイプラインとして音声エージェントをモデル化します。 Pipecat クラウドは、1,000 を超えるチームによるベータ版を経て 2026 年に一般提供に達したため、必要に応じて管理されたパスが存在します。

LiveKit エージェント は LiveKit の WebRTC メディア サーバー上に構築されており、その際立った特徴はルーム モデルです。エージェントはユーザーと一緒に参加者として参加するため、複数参加者のシナリオがボルトオンではなくネイティブになります。あるチームは、クライアントの同時通話数が 20 から 400 に拡張されたときに、電話エージェントを Pipecat から LiveKit エージェントに再構築したことを公的に報告しました。

セルフホスティングの場合、ボリューム的には 0.05 ドル/分をはるかに下回る可能性があります。インフラストラクチャ、オンコール、レイテンシ調整作業と引き換えにプラットフォーム料金を支払うことになります。これは大規模な取引では良い取引ですが、製品と市場の適合性を見つける前は悪い取引になります。

実際にかかる費用

このカテゴリで最も一般的な予算設定エラーは、プラットフォームのみの料金とバンドル料金を比較することです。

プラットフォーム 見出し率 対象となる内容 現実的なオールイン
Vapi $0.05/分 オーケストレーションのみ STT、LLM、TTS、およびテレフォニーを追加すると、〜 $0.25 ~ 0.33/分
Retell $0.055/分 音声インフラストラクチャ ~$0.07/分からの従量課金制
Bland 0.09 ~ 0.14 ドル/分 全て同梱 おおよそのヘッドラインレート
Synthflow $0.09/分 音声エンジン さらに LLM とテレフォニー
ElevenLabs Agents 0.08 ~ 0.10 ドル/分 プラットフォーム + 音声 さらに LLM トークンが通過する
OpenAI Realtime トークンベース モデルのみ 非常に変化しやすい。キャッシュとコンテキストの規律が支配的
セルフホスト型 (Pipecat / LiveKit) インフラストラクチャー 何もバンドルされていません ボリュームとエンジニアリング時間で 0.05 ドル/分未満になる可能性があります

独自の見積もりを作成するためのコンポーネントの参照ポイント: 電話は約 0.014 ドル/分、ストリーミング音声テキスト変換は約 0.008 ドル/分、プレミアム TTS は約 0.05 ドル/分、小型高速 LLM は約 0.01 ドル/分です。市場全体では、2026 年のフルロード料金は、最も積極的なセルフサービス プランの約 0.05 ドル/分から、プレミアム エンタープライズ レベルの約 0.31 ドル/分まで、約 6 倍の範囲に及びます。

構造上の注意点が 1 つあります。プロンプトのキャッシュは、音声エージェントの丸め誤差ではありません。システム プロンプト (ペルソナ、ガードレール、ビジネス ルール、知識) は、すべての通話で同一です。リアルタイム モデルのキャッシュされた入力の価格は、標準入力のほんの一部です。キャッシュをオンにすると、モデルのコストが桁違いに変化することがよくあります。コストを節約するために、より悪いモデルへのダウングレードを提案する前に、最初に確認する必要があります。

ここではコンプライアンスは任意ではありません

電話エージェントには、ブラウザ エージェントにはない規制上のリスクがあります。

米国では、FCC 2024 年 2 月の確認判決 AIが生成した音声がTCPAに基づく「人工音声または事前に録音された音声」であることを確認しました。これにより、無線および住宅回線への通話に対する同意要件、本人確認と開示の義務、オプトアウトの処理が課せられ、法定損害賠償額は違反 1 件につき 500 ドルから、故意の違反の場合は 1,500 ドルに引き上げられます。 AIが生成した通話に関するさらなるFCC規則制定は、2026年末か2027年初頭頃に完了すると予想されており、広く期待されている結果は、通話開始時の明示的なAI識別要件と、AIを具体的に指定する同意文言となる。

EU では、AI 法第 50 条が 2026 年 8 月 2 日から適用され、AI と対話していることを人々に知らせることが義務付けられています。米国の州レベルでは、コロラド AI 法が 2026 年に発効し、このカテゴリーの多くが高リスクに分類される可能性があります。

実際の姿勢はシンプルで、費用はかかりません。冒頭で開示し、同意記録を保持し、オプトアウトを直ちに尊重し、人的転送を常に利用できるようにします。これらはいずれも、改造するよりも今から組み込んだ方が安価です。

自分でベンチマークしてみよう

2 つの信頼できる研究で同じ順位が逆転したことを考えると、行動すべきは自分自身の数字だけです。このプロトコルには 1 日かかります。

  1. 修正されたスクリプトを構築します。 少なくとも 1 つの長い数値、1 つの修正、および人間に対する 1 つのリクエストを含む、実際のユースケースをカバーする 20 ~ 30 ターン。
  2. 1 つの時計で両足を記録します。 プラットフォームによって報告されたタイミングは使用しないでください。発信者が体験するパスの一部は除外されます。実際の通話音声をキャプチャします。
  3. 最初のオーディオバイトまでの時間を測定する ベンダーのイベント ストリームではなく、録音上の VAD を使用して、発信者の音声の終わりから開始します。
  4. エンドポイントの標準化 テストするすべてのプラットフォームにわたって、またはアーキテクチャではなく構成のベンチマークを行っています。
  5. p50 と p95 を別々に報告します。 加えて、テール比率と、破棄しなければならなかったターン数も加算されます。時々何も生成しないプラットフォームは、一律に少し遅いプラットフォームよりも悪いです。
  6. 6 つの中断クラスを実行する 上の表から個別のテスト ケースとして抽出し、誤った停止と停止を逃したことを個別にスコアリングします。
  7. 負荷をかけた状態でテストします。 どのプラットフォームも 1 回の呼び出しで適切に表示されます。同時実行では、中央値が低下し、裾野が爆発します。
  8. 悪い接続でテストする ファイバー上の机からではなく、移動中の車内の携帯電話から。

結論

このカテゴリのプラットフォームは、マーケティングで示唆されているよりも緊密に連携しており、いずれかの 2 つのプラットフォーム間のギャップは、どちらかのデプロイメントが適切に調整されている場合と調整されていない場合のギャップよりも小さいです。

ベンダーを選ぶよりも重要なことが 3 つあります。ターン検出。これは回復可能なレイテンシーの最大のスライスであり、存在していると感じられるエージェントと電話ツリーのように感じられるエージェントの違いであるためです。中断ポリシー。最初の誤解の後に発信者がそのものを信頼するかどうかを決定するためです。また、テール レイテンシも、p95 が顧客が実際に経験するものであり、おおよその電話を切る場所に相当するためです。

どのベンダーも中央値を示します。 p95 を要求し、それがどのように測定されたかを尋ね、それから自分で測定してください。

最初のアシスタントは数分の距離にあります

ビジネス知識を活用しましょう。

無料の Cody アカウントから始めてください。コンテンツを追加し、アシスタントを構築し、最初の役立つ回答を今すぐ共有してください。