この分野のベンダーはどこも同じ手法を使っています。厳選したデモ通話を録音し、Twitterに投稿し、自社のプラットフォームが当然の選択である理由を説明するブログ記事を公開する。本記事はそういう記事ではありません。
以下は購入側の視点による分解分析です。2026年においてAI電話が実際に何を意味するのか、主要4ベンダーが実際にどう比較されるのか(ベンダー自身が比較を書くのではなく)、スタックを分解したときにAI通話1分が本当にいくらかかるのか、法律が実際に何を求めているのか、そして契約前に尋ねるべき質問です。
2026年における「AI電話」の実際の意味
この言葉は意味の異なる3つのユースケースを包含しており、それらを混同すると予算を無駄にし、場合によっては法的責任を負うおそれがあります。
インバウンドの受付/時間外対応。 エージェントは、そのままなら留守番電話や待ち行列に回るはずの通話に応答し、FAQに答え、予約を取り、エスカレーションが必要な場合は転送します。規制上の負担:最小限。かかってきた電話に応答しているだけです。発信者は電話をかけた時点ですでに同意しています。
インバウンドIVRの置き換え。 「1を押してください/2を押してください」式のツリーをそのまま置き換えるものです。エージェントがルーティング、アカウント照会、一次解決を処理します。規制上のハードルは受付用途と同じく低いです。レガシーIVRを今も運用している企業にとってはROIがはるかに高くなります。AIボイスエージェントは通話の60〜80%をエンドツーエンドで解決するのに対し、従来型IVRは10〜30%です。(参照:AIボイスエージェント vs IVR:2026年エンタープライズ購入ガイド)
アウトバウンド発信。 エージェントが通話を発信します。予約リマインダー、リードへのフォローアップ、支払い催促、アンケート通話などです。TCPAのリスクが存在するのはここです。法的なハードルは大幅に高く、コンプライアンスに準拠したアウトバウンドをどの程度サポートできるかという点で、ベンダー間に実質的な差があります。
価格ページを1ページでも読む前に、この3つのうち実際にどれを購入しようとしているのかを把握してください。
ベンダー動向:Bland vs. Retell vs. Vapi vs. Finn
音声スタックをゼロから構築したくない企業向けに、2026年の市場では4つのプラットフォームが優勢です。以下、それぞれを正直に見ていきます。
Bland AI
Bland は早い段階でアウトバウンドのリードジェネレーション分野に地歩を築きました。その売り文句は、費用対効果の高い分あたり料金での高並列アウトバウンド、シンプルなAPI、そして素早くプロトタイプを作れる体験です。弱点としては、スケール時の本番稼働の信頼性が安定しないことがある(後述のレイテンシのセクションを参照)、プラットフォームが米国PSTNに大きく最適化されており国際展開への成熟度が低いこと、そしてTCPAに準拠した安全なアウトバウンドのためのコンプライアンスツールがドキュメントの記述以上に独自実装を必要とすることが挙げられます。最適な用途:同意記録を自社で管理でき、通話量が中程度(月間5万件未満)で、ガードレールを自前で構築するエンジニアリングリソースがあるアウトバウンドキャンペーン。
Retell AI
Retellはインバウンドのユースケースを狙っており、現時点でこの分野において最も完成度の高い、すぐに使える体験を提供していると言えます。低レイテンシのTTS、電話音声に対する堅実なSTT精度、そしてエンジニア以外でも実際に使えるワークフローエディタを備えています。制約としては、インフラ層での柔軟性が低いこと(BYOC — 自社キャリアの持ち込み — のサポートが限定的)、通話量が中程度を超えると料金が急激に上がること、そしてアウトバウンドのコンプライアンスツールがエンタープライズ級ではなく最低限の水準にとどまることです。最適な用途:分あたりコストよりも導入の容易さが重視される、中小企業およびミッドマーケットのインバウンド受付・予約対応のユースケース。
Vapi
Vapi はこの中で最も開発者向けのプラットフォームです。音声AIにおけるStripeのような存在だと考えてください。柔軟性は最大限で、STTプロバイダー(Deepgram、AssemblyAI、Google)、LLM(GPT-4o、Claude、Llama)、TTS(ElevenLabs、Cartesia、OpenAI TTS)を自分で選べます。エンジニアリングチームがあるなら、この柔軟性は実際に価値があります。ただし、その柔軟性がコストに与える影響もまた実際にあります(後述)。HIPAAの BAA が利用可能で、SOC 2は取得手続き中です。市場の変化に合わせてモデルを差し替える必要があるなら、Vapiのアーキテクチャならそれをきれいに行えます。(HIPAA用途におけるVapiの代替候補については、こちらで詳しく取り上げています。)
Finn (hirefinn.ai)
Finnはエンタープライズのコンタクトセンター自動化に特化して構築されており、インバウンドとアウトバウンドの両方を大規模に扱い、上記のプラットフォームよりも厳格なコンプライアンス体制を備えています。主な差別化要因は、後付けではない専用設計のTCPA/同意管理、通話コンテキスト全体を人間のエージェントに引き継ぎ発信者が同じ説明を繰り返さずに済むウォームトランスファーのアーキテクチャ、そしてエンタープライズ規模において席数課金や分単位のプラットフォーム料金のように通話量を増やすほど不利にならない料金モデルです。最適な用途:月間1万件以上の通話を扱い、コンプライアンスの深さ、基本的なWebhookを超えるCRM連携、そしてAPIキーを渡して終わりではなく導入を共同設計してくれるベンダーを必要とする企業。
分あたりの真のコスト:誰も見せてくれないスタック
どのベンダーも分あたりの価格を提示します。しかしその価格に何が含まれているのかを説明するベンダーはほとんどなく、大規模運用時には表示価格と実際の請求額の差が3〜5倍になることもあります。
本番環境のAI電話は、4つのコスト層に関わります。
1. 音声認識 (STT): Deepgram Nova-2は電話音声で約$0.0043/分です。AssemblyAIも同程度です。Google STT Chirpは約$0.016/分です。STTプロバイダーを選べるプラットフォームを使っている場合、STTの選択だけで4倍のコスト差が生じ得ます。
2. LLM推論: モデル呼び出しは変動要素です。現行のAPI価格でGPT-4oは、会話のやり取り1分あたりおよそ$0.005かかります(1ターンあたり約500トークン、平均で1分あたり4ターンと仮定)。Claude Sonnet 4.6も同程度です。GPT-4o-miniやClaude Haiku 4.5ならこれを$0.001/分まで下げられますが、複雑な通話フローでは応答品質が明らかに低下します。ほとんどのプラットフォームはこの部分を抽象化して分あたりの一括料金を課金するため、自社の通話タイプに合わせてモデル選択を最適化することができません。
3. 音声合成 (TTS): ElevenLabsの本番向けティアでは、合成音声1分あたり約$0.003です(Turbo v2)。Cartesia Sonicは約$0.002/分です。OpenAI TTSは約$0.0015/分ですが、電話音声での自然さのスコアは低くなります。「リアルな音声」を謳うベンダーは、汎用TTSに対して2〜3倍のプレミアムを課します。そのコストを払う前に、自社の発信者層が実際に音声品質を気にしているかどうかを把握してください。
4. テレフォニー/通信キャリア: これはほとんどの比較記事が省いている隠れコストです。SIPトランクの着信終端(アウトバウンドPSTN)は、キャリアと通話量によって$0.005〜$0.012/分かかります。それに上乗せされるプラットフォーム側のテレフォニー手数料は、0%(BYOC)から40%超(大手プラットフォームのバンドル番号)まで幅があります。月間10万分では、20%の通信キャリア手数料は無視できない金額になります。
本番運用規模(月間10万分)でのおおまかな総額の見積もり:
| レイヤー | 低コスト構成 | ミッドティア | プレミアム |
|---|---|---|---|
| STT | $0.004 | $0.008 | $0.016 |
| LLM | $0.001 | $0.005 | $0.015 |
| TTS | $0.002 | $0.003 | $0.006 |
| 通信事業者 | $0.006 | $0.009 | $0.012 |
| 合計/分 | $0.013 | $0.025 | $0.049 |
これをベンダーの表示価格と比較してください。バンドル型プラットフォームでは、多くの場合 $0.05〜$0.15/分 の範囲に収まります。その上乗せ分の一部は実際の価値(マネージドインフラ、コンプライアンスツール、サポートSLA)に対する対価です。一部は利益分です。どちらがどちらなのかを把握してください。(ベンダー横断の2026年価格比較の全体像はこちら: AI Voice Agent Pricing Comparison (2026)。)
それは合法か? TCPA、同意、アウトバウンド発信のルール
このセクションは米国連邦法を扱います。カリフォルニア州(CCPAの影響)、EU(GDPR)、インド(TRAI)で事業を行っている場合は、追加のルールが適用されます。これは法的助言ではありませんが、平易な言葉での枠組みを以下に示します。
電話消費者保護法(TCPA) は、アウトバウンドの通話およびテキストメッセージを規律する主要な連邦法です。2024年、FCCは「リードジェネレーターの抜け穴」を塞ぐ裁定を下しました(2025年1月発効)。これにより、20社の異なる発信者に振り分けられるフォームから包括的な同意を取得することはできなくなりました。同意は今や1対1でなければなりません。つまり、消費者はあなたの会社からの電話を受けることに特定して同意している必要があります。
AI音声エージェントにおける主要な要件:
-
テレマーケティングには事前の明示的な書面による同意が必要。 AIエージェントが販売、アップセル、またはプロモーションを行う場合は、たとえ無料オファーであっても、携帯電話に発信する前に書面による同意(デジタルのチェックボックスを含む)が必要です。以前の通話での口頭による同意は、自動化システムには不十分です。
-
AI開示ルール(FCC、2025年発効)。 アウトバウンド通話におけるAI生成音声はすべて、最初の数秒以内に発信者がAIであることを開示しなければなりません。「こんにちは、Acme CompanyのAIアシスタント、Ariaです」で十分です。通話がAIであることを隠すのはFCC違反であり、TCPAに基づく私的訴権のリスクも高まっています。
-
インバウンド通話にはTCPAのリスクがほとんどありません。 消費者があなたに電話をかけてきた場合、接触を開始したのは消費者です。インバウンドにおける主な要件は、録音する場合はそれを開示する必要があるという点です(州によって異なります。カリフォルニア州、フロリダ州、イリノイ州では録音に両当事者の同意が必要です)。
-
DNCスクラビング。 アウトバウンドのテレマーケティングキャンペーンを実施する前には、National Do Not Call Registry(全米電話勧誘拒否登録)と照合してスクラビングを行う必要があります。ほとんどのプラットフォームはDNC連携を提供していますが、それが自動なのか手動なのかを確認してください。
-
時間帯の制限。 TCPAは、受信者の現地タイムゾーンでの午前8時より前、午後9時より後の通話を禁止しています。AIシステムは発信先の市外局番を把握し、正しいタイムゾーンを適用する必要があります。単にUTCから変換するだけでは不十分です。
これがベンダー選定にとって意味すること: すべてのベンダーに対して、同意管理をどう扱っているか(同意のタイムスタンプと取得元を保存しているか)、DNCスクラビングが標準搭載されているか、アウトバウンドのダイヤラーがタイムゾーン制限を強制しているかを尋ねてください。多くのベンダーはできていません。(運用面での実装については Outbound Voice AI TCPA Playbook (2026) がより詳しく扱っています。)
自社構築か購入か: DIYチュートリアルが教えてくれないこと
YouTubeやGitHubには人気のチュートリアル群があります。「Twilio + OpenAI + ElevenLabs で20分でAI電話エージェントを構築する」といったものです。その一部は技術的に正確です。しかし、20分の後に何が起きるかを教えてくれるものは一つもありません。
それらが省いていること:
- エンドポインティング。 発信者が話し終えたタイミングを認識し、エージェントが応答できるようにすることです。エンドポインティングが不十分だと、エージェントが文の途中で割り込んだり、発話のたびに3秒長く待ちすぎたりします。どちらも壊れているように感じられます。本番環境のエンドポインティングには、ノイズ環境や通話種別ごとにカスタムのVAD(音声区間検出)のチューニングが必要です。
- 無音の処理。 4秒間の無音が発生したらどうしますか? エスカレーションしますか? 再度promptしますか? 何かで埋めますか? システムにはこれに対する明示的なロジックが必要です。
- DTMF。 発信者は通話中にIVRの挙動を期待して数字キーを押します。エージェントがトーン検出を扱い適切に応答しなければ、通話を失うことになります。
- 通話録音、保存、そしてPII。 音声はどこに行くのでしょうか? 誰がアクセスできるのでしょうか? ヘルスケアや金融サービスの分野にいるなら、「当社のクラウドに送られます」は受け入れられる回答ではありません。
- エラーからの復旧。 LLMが遅いときはどうなりますか? TTSが文の途中で失敗したときは? 通信事業者がSIPのレグを切断したときは? 本番システムにはこれらすべてに対するフォールバック経路が必要ですが、そのどれも20分のチュートリアルには登場しません。
自社構築と購入の損益分岐点は実在しますが、それはほとんどのブログ記事が示唆する通話量のしきい値にはありません。隠れたコストはインフラではなく、上記を構築し維持するためのエンジニアリング時間です。月間5万コール未満であれば、ほとんどの企業はマネージドプラットフォームを使う方が適しています。問題は、どれを選ぶかです。
レイテンシと信頼性: デモと本番のギャップ
デモ通話はいいところだけを選んだものです。本番システムは現実の条件下で稼働します。
AI電話通話における往復のレイテンシの連鎖は次の通りです: 音声のキャプチャ → STT → LLM → TTS → 音声の再生。各ステップがレイテンシを加算します。全体としての目標は、発話終了からエージェントの応答開始まで1.2秒未満です。それを超えると、発信者はシステムが壊れていると感じます。
ベンダーのダッシュボードに表示されるもの: 全通話の平均レイテンシ。多くの場合、理想的な条件下で測定された値です。
重要なのは: 実際の負荷、実際のキャリア音声、実世界の背景ノイズの下でのp95およびp99レイテンシです。平均レイテンシが600msでもp99が2.8秒のベンダーは、およそ100件に1件の通話で機能不全に感じられます。そして通話量が多ければ、それは相当な件数になります。
契約前に確認すべき質問:
- 公表されているp95およびp99のvoice-to-voiceレイテンシはどれくらいですか?
- ピーク負荷時にレイテンシはどう変化しますか(こちらの特定の地域において)?
- 稼働率のSLAはどうなっていますか。また、それを下回った場合の是正措置は何ですか?
- 当社が想定する同時接続数のレベルで負荷試験を実施したことはありますか?
信頼性はキャリアのレベルでも重要です。ほとんどのプラットフォームは単一のSIPトランクプロバイダーの上に構築されています。そのキャリアで障害が発生すれば(そして実際に発生します)、通話は失敗します。冗長化されたキャリアルーティングについて確認してください。
購入者向けチェックリスト: 契約前の12の質問
ベンダーとの商談やRFPで使ってください。明確に答えられないベンダーは、それ自体が判断材料になります。
- 本番環境において、PSTN通話からエンドツーエンドで測定したp95のvoice-to-voiceレイテンシはどれくらいですか?
- どのSTT、LLM、TTSプロバイダーがスタックを支えていますか。また、自社のものを持ち込むことはできますか?
- TCPA準拠のために、同意データはどのように取得・保存・監査されていますか?
- 自動のDNCスクラビングは提供していますか。また、リストはどの頻度で更新されますか?
- アウトバウンド通話におけるAIの開示にはどう対応していますか?
- 当社のLLMが遅い、または利用できない場合はどうなりますか。フォールバックの挙動は何ですか?
- コンテキスト引き継ぎ(トランスクリプト+インテント+CRMフィールドへの入力)を伴うウォームトランスファーに対応していますか?
- 稼働率のSLAはどうなっていますか。また、それに違反した場合の是正措置は何ですか?
- HIPAA BAA / SOC 2 Type IIは提供していますか。また、カバー範囲はどこまでですか?
- 当社が想定する通話量において、STT、LLM、TTS、テレフォニーを含めた1分あたりの総額コストはいくらですか?
- 同程度の通話量とユースケースのリファレンス顧客を紹介してもらえますか?
- 契約期間はどれくらいですか。また、解約条項はどうなっていますか?
10、11、12の回答を組み合わせれば、ベンダーのウェブサイトよりも多くのことがわかります。
内部リンク
- AI音声エージェント vs IVR: 2026年 エンタープライズ購入者ガイド — 解決率、移行フレームワーク
- AI音声エージェントの料金比較(2026年) — 出典付きの1分あたりコスト完全比較表
- HIPAA対応音声オペレーション向けVapi代替製品 — BAAの適用範囲、PHIのマスキング、監査ログのマトリクス
- アウトバウンド音声AIのTCPAプレイブック(2026年) — 運用面でのTCPA実装ガイド
- 音声AIのウォームトランスファー: コンテキスト引き継ぎを正しく行う方法 — エスカレーション時にコンテキストを引き継ぐ方法
FAQ
AIによる電話とロボコールの違いは何ですか? ロボコールは録音済みのメッセージを再生します。AIによる電話は、リアルタイムの会話型エージェントが動作し、聞き取り、動的に応答し、話の割り込みに対応し、アクション(予約の登録、アカウントの照会)を実行します。TCPAに基づく規制の枠組みは両方に適用されますが、ユーザー体験と機能は根本的に異なります。
既存顧客への架電にAIエージェントを使う場合、事前に書面での同意が必要ですか? 情報提供目的の通話(予約リマインダー、注文状況の連絡)であれば、既存の取引関係に基づく口頭または黙示の同意で通常は十分です。アップセルやプロモーションを含め、テレマーケティングと解釈され得るものについては、書面による事前の明示的同意が必要です。判断に迷う場合は、書面で同意を取得してください。
音声AIベンダーがTCPAに準拠しているかどうかは、どう判断すればよいですか? 次の点を具体的に質問してください。同意の取得日時と取得元を保存しているか。DNCリストの自動スクラビングを提供しているか。タイムゾーンごとの架電時間規制を強制しているか。アウトバウンド通話の冒頭数秒にAIであることの開示を挿入しているか。実際にコンプライアンス機能を備えたベンダーであれば、この4点すべてに具体的に回答できます。備えていないベンダーは、「ベストプラクティスに従っています」といった曖昧な回答をするでしょう。
AIによる電話エージェントの現実的な解決率はどの程度ですか? インテントの網羅範囲が適切に設計されたインバウンドのユースケース(予約受付、FAQ、アカウント状況の照会)では、本番環境で人へ転送せずに完全解決できる割合は通常60〜75%に達します。アウトバウンドのリード選別はばらつきがより大きく、法令に準拠したリストで40〜60%の完了率となり、業種やトークスクリプトの品質によって変動します。ベンダーの事例で85%を超える数値は、たいていの場合、都合のよいデータの抜き出しか、非常に限定的なユースケースを反映したものです。
FAQ JSON-LDに関する注記: 上記4つのQ&Aから
<script type="application/ld+json">のFAQスキーマブロックを出力し、リッチリザルトの対象となるようにします。
手探りなしでAIによる電話を運用する準備はできていますか?
Finnはエンタープライズ規模でインバウンドとアウトバウンドに対応します。同意管理、ウォームトランスファー時のコンテキスト引き継ぎ、CRM連携は後付けではなく標準で組み込まれています。プラットフォームを決める前に、御社の通話量とユースケースに実際に何が必要なのか、ぜひご相談ください。



