Skip to main content

ボイスAIのレイテンシーベンチマーク:sub-secondの本当の意味

ボイスAIのベンダーはどこもレイテンシーの数値を掲げています。Vapiは500ms、Retellは800ms、SynthflowはSTT 300msをうたうDeepgramのブログを引用します。しかし問題は…

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat
July 26, 2026
1 min read
日差しの中、緑と琥珀色の波状のアーチの下に置かれた無地のゴールドのストップウォッチと、隣にあるピーチ色の階段

ボイスAIのベンダーはどこもレイテンシーの数値を掲げています。Vapi500ms、Retell800ms、SynthflowはSTT ~300msをうたうDeepgramのブログを引用します。しかし問題は、それらの数値のどれ一つとして、電話の向こう側にいる発信者が実際に耳にしているものを表していない、という点です。

私たちは6週間かけて、本番稼働中の5つの音声プラットフォーム(Retell、Vapi、Synthflow、Deepgram Voice Agent、Finn)に対し、US-East、EU-West、インドの各ルートでオープンなテストハーネスを走らせました。本記事では、P50/P90/P99の実測値、読者自身が再現できる測定手法、そしてベンダーがマーケティング用グラフから静かに省いているパイプラインの各段階を公開します。

「レイテンシー」という数値が的外れな理由

ベンダーがlatency: 500msと打ち出すとき、それはほぼ必ずTTFB、つまりユーザーの発話終了からTTSが最初の音声バイトを出力するまでの時間を指します。エンジニアリング上は有用な指標です。ただし、ユーザーが体感するものではありません。

ユーザーが体感するのはターンテイキングの遅延、すなわち自分が話し終えてから自分がエージェントの声を聞くまでの沈黙です。この数値には次が含まれます。

  • エンドポインティングの遅延 — VADが「話し終わった」と判断するまでの待ち時間(通常は意図的な無音200〜600ms)。
  • SIP/WebRTC区間におけるネットワークジッターバッファ(40〜120ms)。
  • TTSの初回バイトから再生可能になるまで — 最初のチャンクは、ジッターに耐える再生ができるだけの大きさが必要です。
  • ユーザーが応答の途中で割り込んだ際の**バージインからの復帰**。

TTFBを500msと公表していてもエンドポインティングに600msかけるプラットフォームでは、体感のターンテイキング遅延は1.2sを超えます。一方、800msとうたっていても150msの積極的なセマンティックエンドポインティングを備えたベンダーは、通話中に明らかに速く感じられます。マーケティング上の数値と人間が体感する数値は、そもそも同じ軸にありません。

CX研究から得られた目安:体感のターンテイキングが800msを下回れば会話らしく感じられます。800〜1200msは「AIだが許容範囲」。1.2sを超えると、発信者はエージェントに話しかぶせ始めます。

ボイスAIリクエストの内訳

以下は1ターン分のパイプライン全体と、2026年に5つのプラットフォームを横断して計測した中央値の内訳です。

工程何が起きるか中央値 (ms)P90 (ms)
SIP/WebRTC受信音声フレームがメディアサーバーに到達2060
VAD + エンドポインティングユーザー発話の終端を検出280520
STTの確定処理部分認識結果を強制的に確定90180
LLMのTTFTモデルからの最初のトークン320780
LLM → TTSの受け渡し文の区切り+ストリーム開始40120
TTSの初回バイト最初の音声チャンクを出力180410
TTS → 再生可能安全に再生を始められるバッファ量60140
送出側ジッターバッファキャリア側での平滑化50110
体感の合計発話終了 → 最初の音声が聞こえるまで~1040~2320

ベンダーが最も激しく競い合う2つの工程、すなわちLLMのTTFTとTTSの初回バイトは、中央値の予算全体のわずか~48%にすぎません。テール部分を支配しているのは、エンドポインティングとジッターの積み重ねです。

2026年ベンチマーク表 — 宣伝値ではなく実測値

以下の数値はすべて体感のターンテイキング遅延で、US-Eastの発信者 → 各ベンダーのデフォルトリージョン、8ターン固定のアポイント調整スクリプトを用いてプラットフォームごとに500ターンを記録したものです。ハードウェアはMac mini M4、Twilio Programmable Voiceの番号を介してPSTNへブリッジし、録音は当社のオープンなスクリプト(下記リポジトリにリンクあり)で解析しました。詳細な測定手法は次のセクションに記載します。

プラットフォーム宣伝値P50実測P90実測P99実測バージインからの復帰
Retell~800ms118017402680410ms
Vapi(デフォルト)~500ms102016202510380ms
Vapi(STT/LLMをカスタム)88014102240360ms
Synthflow~600ms124019803120520ms
Deepgram Voice Agent~300ms STT94014802390290ms
Finn82012901980240ms

ベンダーのベンチマークの多くが埋もれさせている要点は次のとおりです。

  1. どのプラットフォームもP90はおおむね**P50の1.5〜2×**です。平均値しか見ていなければ、下位10%の通話はまるで別製品のように感じられます。
  2. P99は必ず2秒を超えます。ユーザーが電話を切るのは、このテールレイテンシーの領域です。
  3. バージインからの復帰、つまり割り込まれたときにエージェントがどれだけ速く黙るかは、2×の開きがあります。この一つの数値こそが、TTFBよりも多くの「通話品質が悪い」という苦情を生んでいます。

この数値を再現する方法

テストハーネスは意図的に地味な作りです。独自の負荷生成ツールも合成SIPも使わず、実際の電話番号から実際のエージェントに発信し、マイクループバックによるタイムスタンプ計測装置で記録します。

よくある質問

sub-secondのレイテンシーとは実際には何を指しますか?
何を測っているかによります。モデルの推論時間、最初の音声までの時間、そしてマウス・トゥ・イヤーのレイテンシーは互いに別物であり、発信者が体験するのは最後の一つだけです。

ベンダーにはどのレイテンシー指標を求めるべきですか?
実際のキャリアを経由した実通話でのマウス・トゥ・イヤーを、平均ではなくテールで測った値です。平均が良くてもp95が悪ければ、20件に1件は使いものにならない通話ということになります。

なぜテスト時よりも本番のほうがレイテンシーが悪化したのですか?
たいていはネットワーク経路が原因です。ローカル接続でのデモは、本番の通話が負担しているキャリア区間とリージョン間のホップを飛ばしています。

関連記事: Voice.aiとボイスAI:本当に必要なのはどちらか

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat

創業者、Finn AI

Digvijayは Finn を開発しています。通話の内容を推論し、データを抽出し、システムをリアルタイムで更新する、エンタープライズ向けの音声オーケストレーション層です。音声AI、市場開拓(Go-to-Market)、そして自律型エージェントを大規模に提供するために必要なことについて執筆しています。