Skip to main content

AI音声エージェント: 仕組みと構築方法

AI音声エージェントを解説: STT-LLM-TTS パイプラインの仕組み、実際のユースケース、レイテンシ予算、そして電話に応答するエージェントの作り方。

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat
July 26, 2026
1 min read
ベージュとゴールドのマイクが、クリーム色、緑、ピーチ色の抽象的な幾何学図形の間に浮かんでいる

AI音声エージェント とは、電話を受発信し、発信者の発話をリアルタイムで理解し、自然な話し声で応答するソフトウェアシステムです。メニューも「1を押してください」もなく、人間を待つ必要もありません。従来のIVRツリーや硬直したチャットボットとは異なり、現代のAI音声エージェントは本物の会話を成立させます。割り込まれても自然に対応し、通話全体で文脈を記憶し、枠の予約やCRMレコードの更新といった実際のアクションを実行します。

本ガイドでは、AI音声エージェント とは何か、その基盤となるパイプラインがどう動くのか、どこで元が取れるのか、そして どう構築するか を扱います。顧客接点のワークフロー向けに voice ai を検討している開発者、PM、運用責任者の方は、ここから読み始めてください。

AI音声エージェントとは

AI音声エージェントとは、ライブの音声チャネル(電話回線、Webウィジェット、コンタクトセンターへのSIPトランク)上で動作する conversational ai 音声システムです。かつては別々の製品に分かれていた3つの能力を組み合わせています。すなわち、聞く(音声認識)、考える(何をし何を話すかを決める言語モデル)、話す(音声合成)です。

AI音声エージェントを理解する一番の近道は、何を置き換えるものかを見ることです。

  • IVR(「営業は1を押してください」)との比較: IVRは決定木です。押されたボタンか、短いキーワードのリストしか理解できません。AI音声エージェントは自由な発話 ——「火曜の予約を来週に変更したいのですが」—— を理解し、1ターンで処理します。
  • チャットボットとの比較: テキストチャットボットは入力された文字を扱います。ai phone agent は、話し言葉というもっと雑然とした現実を扱います。訛り、背景ノイズ、話がかぶること、そして即答されて当然という期待です。電話の沈黙は故障のように感じられますが、チャットの「入力中…」表示ではそうはなりません。
  • 旧来の留守番電話や電話代行との比較: それらは伝言を預かるだけです。AI音声エージェントは通話中に用件そのものを 解決 します。

この「解決できるかどうか」の差こそが要点です。留守番電話のメッセージは後で片付けるToDoにすぎませんが、音声エージェントは発信者がまだ回線につながっているうちに完結させます。

AI音声エージェントの仕組み: STT → LLM → TTS パイプライン

どのベンダーのAI音声エージェントでも、中核のループは同じです。音声が入り、テキストに変換され、モデルが何をするかを決め、テキストが再び音声に戻ります。

1. 音声認識(STT)

発信者の音声は、リアルタイムで文字起こしする音声認識モデル(Deepgram、Whisper、AssemblyAI など)へストリーミングされます。鍵になるのは「リアルタイム」という点です。エージェントは発信者が段落を話し終えるまで待てません。優れたパイプラインは 逐次的 に文字起こしし、エンドポインティング を用いて、発信者が本当に話し終えたのか、それとも考えの途中で一息ついただけなのかを判定します。

2. LLM(推論と対話)

文字起こしは言語モデルに渡され、応答が決まります。質問に答える、追加で聞き返す、あるいはツールを呼び出す(在庫を確認する、枠を予約する、注文を照会する)といった具合です。本物の音声エージェントとデモが分かれるのはここです。本番運用のエージェントは、ステートマシン や構造化されたプロンプトでLLMを制約し、筋書きから外れたり、ポリシーを幻覚したり、果たせない約束をしたりできないようにします。ツール呼び出しこそが、エージェントが話すだけでなく実際に物事を 行う ための手段です。

3. 音声合成(TTS)

モデルの応答は自然な音声に再合成され(ElevenLabs、Cartesia、PlayHT など)、発信者へストリーミングされます。現代のTTSは十分に高品質で、発信者はソフトウェアと話していると気づかないことがよくあります——午前2時に即座に応答されるまでは。

すべてを決める数値: レイテンシ

STT + LLM + TTS + ネットワークの往復を足し合わせると、応答レイテンシ になります。発信者が文を言い終えてから、エージェントが返答を始めるまでの間隔です。人間は会話のターンが ~800ms 以内 に返ってくることを期待します。~1.2秒を超えると、たとえ一語一句が完璧でも通話は機械的に 感じられ、発信者はエージェントにかぶせて話し始め、やり取り全体が崩れていきます。

だからこそ、本気で作られた voice agent platform のエンジニアリングはミリ秒を削ることに執着します。各段階を順番に実行せずすべてストリーミングし、計算資源を電話網のエッジ近くに配置し、応答全体をバッファリングせずにSTT、LLM、TTSの間で受け渡すのです。レイテンシこそが、電話で人に信頼される道具と、切られてしまう物珍しさとの分かれ目です。

AI音声エージェントの主要ユースケース

音声エージェントは、電話がボトルネックになっている場所——大量の着信、繰り返しの用件、営業時間外の対応——ならどこでも効果を発揮します。

  • カスタマーサポート: 注文状況、アカウントの質問、トラブルシューティングへの24時間365日対応。エージェントが定型的な60〜70%を解決し、残りは 文脈付きで 人へウォームトランスファーするので、発信者が同じ話を繰り返す必要はありません。
  • 予約管理: 予約、変更、確認の電話で無断キャンセルを減らします。医療やサービス業は、無断キャンセルがそのまま失われた売上になるため、ここで最も早くROIが出ます。
  • セールスとアウトバウンド: フォーム送信から数秒以内に発信するスピード・トゥ・リードの架電、選別、フォローアップを、人間のチームでは到底不可能な同時実行数でこなします。
  • 人事と採用: ファネル最上流でのスクリーニング通話、面接調整、候補者からの質問対応。ここは母数が最も多く、レスポンスの速さが候補者の関心を保てるかを左右します。

AI音声エージェントの構築方法

選択肢は2つです。自分でパイプラインを組み立てるか、配管まわりを引き受けてくれる voice agent platform を使うか。どちらにせよ、可動部は同じです。

  1. スタックを選ぶ。 STTプロバイダー、LLM、TTSの音声を選ぶ——あるいは、その3つに電話機能まで束ねたプラットフォームを選ぶ。自前で作ればレイテンシとコストを掌握でき、プラットフォームなら数か月ではなく数日で稼働します。
  2. ペルソナとスコープを定義する。 system prompt は、漠然と「役に立て」と書くのではなく、境界のあるステートマシンとして書きます。エージェントが何を扱い、何を断り、いつ人へエスカレーションするかを厳密に決めます。音声エージェントを信頼できるものにするのは、スコープの狭さです。
  3. 電話をつなぐ。 SIPまたはTwilio/Telnyxのようなプロバイダー経由で電話番号を接続し、エージェントが実際の通話を発着信できるようにします。レイテンシや通話品質の問題は、たいていここで最初に表面化します。
  4. ツールとデータを統合する。 CRM、カレンダー、データベースへのファンクションコールをエージェントに与えて 行動 できるようにし、幻覚を防ぐために回答を自社の実データに接地させます。
  5. スケールする前に評価する。 実際の録音通話——訛り、割り込み、エッジケース——に対してテストし、「感じの良い声だったか」ではなく解決率とレイテンシを測定します。

Finn が採用でAI音声エージェントをどう使っているか

Finn は、採用ファネルの最上流——純粋に量が勝負になる部分——のために作られたAI音声エージェントです。候補者が応募すると、Finn は 数秒で 電話をかけ、自然なスクリーニング会話を行い、職務についての質問に答え、面接をそのままリクルーターのカレンダーに予約します。電話のすれ違いも、「追ってご連絡します」も、3日間誰も折り返さなかったせいで候補者の熱が冷めることもありません。

内側は上で説明したのと同じ STT → LLM → TTS のループで、応答が1秒未満になるよう調整されています。だから電話の向こうの候補者は、機械ではなく切れ者のコーディネーターと話している感覚になります。違いはドメインです。Finn は自社の求人要件、スクリーニング基準、カレンダーに接地しているため、どの通話も候補者を単に集めるのではなく前へ進めます。

voice agent platform を選ぶときに見るべきこと

voice ai のプラットフォームはどれも同じではありません。評価の際は、次の点を厳しく突いてください。

  • 負荷時のレイテンシ。 空のシステム上のデモではなく、同時実行時の実測値を求めましょう。1秒未満の応答が基準です。
  • 信頼性と同時実行数。 数千の同時通話を、切断も品質低下もなく維持できますか。急激なスパイク時に何が起きるかを尋ねましょう。
  • 接地とガードレール。 幻覚した回答をどう防ぎ、どう筋書きを守らせているのか。ここで曖昧な答えが返ってくるのは危険信号です。
  • 統合。 CRM、カレンダー、電話まわりのネイティブ連携があるのか、それとも自分でつなぎのコードを書くことになるのか。
  • コンプライアンス。 規制のかかる業務なら、その上に構築する 前に SOC 2、HIPAA、TCPA への対応を確認しましょう。

よくある質問

AI音声エージェントとは何ですか。 AI音声エージェントとは、実際に話し言葉で電話会話を成立させるソフトウェアです。自由な発話を理解し、言語モデルでそれについて推論し、自然な声で応答しながら、予約の登録やレコードの更新といったアクションを実行します。

AI音声エージェントはIVRとどう違いますか。 IVRは固定のメニューツリーで、ボタン操作かキーワードしか理解できません。AI音声エージェントは自然な話し言葉を理解し、筋書きにない依頼も1ターンで処理し、単に転送するのではなく解決します。

音声エージェントにとって許容できるレイテンシはどのくらいですか。 応答レイテンシは ~800ms 未満を目指しましょう。~1.2秒を超えると会話は機械的に感じられ、発信者はエージェントにかぶせて話し始めます。

AI音声エージェントは人間のオペレーターを置き換えられますか。 大量で繰り返しの多い60〜70%の通話を解決し、残りは完全な文脈とともに人へウォームトランスファーします。狙いはチームをなくすことではなく、人を複雑な業務に振り向けることです。

Emit FAQ JSON-LD (@type: FAQPage) 上記4つの質問と回答について、PAA/リッチリザルト枠を獲得するために。

採用ファネルにAI音声エージェントを置く

折り返しの遅さで候補者を失うのはもう終わりにしましょう。Finn は、応募者全員に数秒で電話をかけ、スクリーニングし、面接を自動で予約するAI音声エージェントです——自社の求人要件とカレンダーに接地しています。Finn の実際の動きを見る →

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat

創業者、Finn AI

Digvijayは Finn を開発しています。通話の内容を推論し、データを抽出し、システムをリアルタイムで更新する、エンタープライズ向けの音声オーケストレーション層です。音声AI、市場開拓(Go-to-Market)、そして自律型エージェントを大規模に提供するために必要なことについて執筆しています。

AI音声エージェント: 仕組みと構築方法 — Finn