Skip to main content

音声技術

音声レイテンシ

別名: 応答レイテンシ · ターンレイテンシ

音声レイテンシとは、発信者が発話を終えてからエージェントが応答を開始するまでの往復の遅延です。音声認識(STT)、言語モデル、音声合成(TTS)の時間の合計です。自然な会話の基準は1秒未満のレイテンシです。

人間は、おおよそ500〜800ミリ秒を超える間(ま)に気づきます。高いレイテンシはエージェントをロボットのように感じさせ、発信者がかぶせて話してしまう原因になります。レイテンシの最小化は、リアルタイム音声AIにおける中核的な技術課題です。

音声レイテンシを実際の通話で見る。

30分のデモを予約して、Finnがインバウンドとアウトバウンドの通話を最初から最後まで処理する様子をご覧ください——組み立てるべきスタックは不要です。