あなたが目にする「Whisper vs Deepgram」の記事は、どれもそのどちらかを売っている側が書いたものです。Deepgram 自身の比較記事は「300ms で90%超の精度」という一文から始まります。事実ではありますが、論点がずれています。電話に応答するリアルタイム音声エージェントに音声認識を組み込むなら、きれいなポッドキャスト音源での精度は、あなたのエージェントが人間らしく感じられるか壊れて感じられるかを決める数字ではありません。
私たち Finn はコンタクトセンター向けの音声エージェントを開発しています。両方のエンジンを本番投入してきました。ここに示すのは中立版です。8kHz の電話音声、現実的な遅延バジェット、そして誰も見積もらない運用コストに根ざした内容です。
本当の判断軸:ストリーミング STT は精度ランキングではなく遅延バジェットである
音声エージェントには一つの厳しい制約があります。電話口の人間は、人間が返すのとほぼ同じ間合いでの応答を期待します。相手が話し終えた瞬間から、おおむね 800ms から1.2秒です。この往復時間の全体で、STT の確定、LLM の推論、TTS の初回バイト、ネットワーク/SIP の伝送をすべてまかなう必要があります。STT がバジェット全部を使えるわけではありません。使えるのはせいぜい 300ms 程度です。
ですから問いは「どちらのエンジンの単語誤り率が低いか」ではありません。「残り三つの工程が収まるだけの速さで、使える文字起こしを返すのはどちらか」です。精度が2%高くても確定までの遅延が 400ms 増えるモデルは、音声エージェント用エンジンとしては劣る。それだけの話です。バッチ精度のベンチマークは、この用途にとって測る軸が違うのです。
ベンチマークの条件:電話品質の音声、WER、そしてクリーン音声のスコアが嘘をつく理由
公開されている WER の数値の多くは LibriSpeech か類似のデータセット由来です。朗読音声、16kHz、スタジオ品質。電話の通話はその正反対です。8kHz の狭帯域(あるいは G.711 μ-law)、コーデックのアーティファクト、背景雑音、話者の重なり、訛り、そして口座番号をもごもごと言う発信者。
同じモデルを電話音声で走らせ直すと、差は動きます。
- Whisper large-v3 はクリーンな 16kHz で WER 約5〜8%。ノイズの多い 8kHz の電話音声では WER 12〜18% になることが多く、無音や雑音に対して流暢だが誤ったテキストを幻覚します。文字起こしが LLM に流れ込む場合に危険な、既知の失敗モードです。
- Deepgram Nova-2/Nova-3 は電話音声とストリーミング向けに調整されており、同じ電話音声セットで WER 8〜13%。しかも劣化の仕方が穏やかで、単語をでっち上げるよりも落とす傾向があります。
教訓は 自分の音声でベンチマークを取る ことです。実際の録音通話を200件用意し、人手でラベル付けし、その上で両エンジンを採点してください。得られる順位は、この記事を含めどのベンダーのブログとも一致しないでしょう。一つだけ持ち帰るなら、これを持ち帰ってください。
遅延とエンドポインティング:初回トークン、確定、そして割り込み
重要な遅延の数値は三つあり、マーケティングに登場するのはそのうち一つだけです。
初回トークン遅延 — 部分的な文字起こしがどれだけ速く返り始めるか。Deepgram は中間結果を約 100〜200ms でストリーミングします。Whisper はバッチモデルであり、コミュニティ製のストリーミングラッパー(whisper-streaming、WhisperLive)は音声を分割して再デコードするため、部分結果は 500ms〜1秒超で届き、負荷が上がるとばらつきます。
確定遅延 — 発信者が話し終えてから、LLM に渡せる安定した最終文字起こしが得られるまでの時間。これを左右するのが エンドポインティング(発話の順番が終わったと判断する音声区間検出)です。Deepgram は調整可能なエンドポインティング(endpointing=300)を提供します。Whisper では自前の VAD(Silero、WebRTC VAD)を継ぎ足して自分で調整することになります。制御の幅は広がりますが、首を絞める縄も長くなります。
Barge-in(割り込み) — 発信者が文の途中でエージェントをさえぎったとき、発話を検出して約 100〜200ms 以内に TTS を停止しなければ、エージェントが相手にかぶせて話してしまいます。これはストリーミング部分結果と VAD の問題です。ネイティブにストリーミングするエンジンなら簡単ですが、バッチの Whisper ではひとつのプロジェクトになります。
エンドポインティングの調整は、スタック全体で最も効き目の大きい遅延のつまみです。攻めすぎれば発信者を単語の途中で切ってしまい、緩すぎれば毎ターンに 500ms の無音を足すことになります。パイプラインのどこに位置するかは低遅延ボイスエンジンの分解記事をご覧ください。
セルフホストの Whisper:GPU コスト、バッチ処理、そして誰も見積もらない運用負担
「Whisper は無料」は音声 AI で最も高くつく一文です。モデルの重みは無料です。コールセンター規模の同時接続でリアルタイムに動かすことは無料ではありません。
faster-whisper (CTranslate2) large-v3 をセルフホストした場合の実際の数字です。
- GPU:A10G または L4 で large-v3 を動かすと、遅延が悪化する前におおむね 同時8〜15本のリアルタイムストリーム をさばけます。100件の同時通話なら GPU が8〜12基必要です。オンデマンドのクラウド A10G は約 $1.00-1.30/hr、リザーブドならもう少し下がります。同時100ストリームを支えるための GPU 費用として、冗長構成を含めずに $7,000-10,000/month と見てください。
- バッチ処理のトレードオフ:バッチ化は GPU あたりのスループットを上げますが、遅延を 増やします。まさに守りたかったものです。リアルタイム音声ではバッチ化の余地に上限があるため、GPU 使用率は低いまま(多くの場合30〜50%)にとどまり、それは燃えていくお金です。
- 運用負担:モデルのロード、コールドスタートを避けるためのウォームプール、突発的な着信トラフィックへのオートスケール、VAD の調整、幻覚のフィルタリング、GPU ドライバーと CUDA の保守、そして通話中にノードが固まったときの24時間365日のオンコール。これは分単価の比較表には決して現れない、0.5〜1人月相当のプラットフォームエンジニアリングです。
均してみると、同時100通話でセルフホストする Whisper は 総額で $0.006-0.012/min に落ち着くことがよくあります。紙の上では競争力がありますが、それは信頼性を確保するためのエンジニアリング費用を払い終えて初めての話です。相応の通話量に届かないうちは、まず割に合いません。バッチ処理と遅延の計算は120ms 未満のハイブリッド ASR パイプラインで詳しく扱っています。
Deepgram とマネージド API:スケール時の分単価とリージョナルルーティング
マネージドの STT はトレードオフを反転させます。限界費用は高くなり、運用はほぼゼロになります。
- Deepgram Nova のストリーミング は $0.0077/min 前後で提示されています(従量課金の Nova、ストリーミング)。規模が出れば従量割引やコミット割引でさらに下がります。
- GPU も、ウォームプールも、CUDA も不要。 オートスケール、エンドポインティング、ストリーミングが手間ゼロで手に入ります。
- リージョナルルーティング は表示価格より重要です。メディアの終端がムンバイなのに STT のエンドポイントが us-east にあるなら、すべての部分結果 に大西洋横断の往復 200〜300ms を足したことになります。リージョナルエンドポイントを持つマネージドベンダー(あるいはメディアプレーンの近くに置くセルフホストのエンタープライズ構成)はそれを消し去ります。米国とインドの二市場にまたがる構成では決定的です。国境をまたぐ遅延のアーキテクチャをご覧ください。
率直な見立て:同時通話がおよそ50件未満のチームの大半では、エンジニアの人件費を勘定に入れた時点で総コストはマネージドが勝ちます。それを超えると、計算はセルフホストに傾き始めます。ただし プラットフォームチームがいれば の話です。
STT の選択が総往復遅延にどう波及するか
着信通話における代表的なターンごとのバジェットです。体感応答時間の目標は < 1000ms とします。
| 工程 | マネージド(Deepgram) | セルフホストの Whisper(素朴な構成) |
|---|---|---|
| SIP/メディア伝送 | 80ms | 80ms |
| STT の確定(エンドポイント後) | 250ms | 700ms |
| LLM の初回トークン | 350ms | 350ms |
| TTS の初回バイト | 150ms | 150ms |
| 体感応答時間 | ~830ms | ~1280ms |
LLM も TTS も同じです。STT の選択だけで、発信者の体験は「人間らしく感じる」という線の向こう側へ振れます。この 450ms が、人が話しかけるエージェントと、電話を切られるエージェントの差です。STT の遅延は費目のひとつではなく、下流のすべてに掛かる乗数です。だからこそ私たちはこれをベンチマークではなくバジェットとして扱います。パイプライン全体についてはさらにラッパーの先へで解説しています。
意思決定マトリクス:通話量、言語構成、遅延 SLA で選ぶ
- 同時 < 50 件、英語中心、厳しい SLA → マネージド(Deepgram または同等品)。手間を勘案したコストでは勝てませんし、ストリーミングとエンドポインティングは解決済みです。
- 大量(同時100件以上)、安定したトラフィック、社内にプラットフォームチームあり → セルフホストの Whisper(faster-whisper)が限界費用で勝ち始めます。人件費は正直に見積もってください。
- 多言語やコードスイッチングが多い → 自分たちの 言語で両方を試してください。Whisper の多言語カバー範囲は広いものの WER は言語によって大きくばらつき、マネージドのエンジンもばらつきます。決めつけず、計測すること。見えない多言語税をご覧ください。
- 規制対象・データ所在地の要件あり(医療、インドの DLT、EU) → セルフホスト、またはリージョナルなマネージド構成を、メディアが法的にどこにとどまる必要があるかで選びます。
- 幻覚に敏感(文字起こしがそれに基づいて動く LLM に流れる) → Whisper の無音時の幻覚と Deepgram の穏やかな劣化を天秤にかけ、いずれにせよガードレールを追加してください。音声 AI の幻覚を止めるための実践ガイドがそのまま当てはまります。
結論
Whisper vs Deepgram は精度の競争ではありません。遅延バジェットと運用負担についての判断です。マネージドは手間と立ち上げまでの速さで勝ち、セルフホストの Whisper が限界費用で勝つのは、本当に規模が出ていて、かつ背後にプラットフォームチームがいる場合だけです。いずれにせよ、自分の電話音声でベンチマークを取り、エンドポインティングを徹底的に調整し、往復全体を勘定に入れてください。文字起こしは、発信者に対する1秒の約束のうち最初の 300ms にすぎません。
よくある質問
2025年時点で Whisper は Deepgram より正確ですか。 クリーンな 16kHz 音声では Whisper large-v3 は非常に強力です。ノイズの多い 8kHz の電話音声、つまり音声エージェントが実際に聞く音声では、差は縮まるか逆転し、Whisper の無音時の幻覚は現実的なリスクになります。決める前に自分の録音通話でベンチマークを取ってください。
Whisper のセルフホストは実際いくらかかりますか。 無料ではありません。同時100本のリアルタイムストリームなら、GPU が8〜12基(約 $7-10k/month)に加えて 0.5〜1人月相当のプラットフォームエンジニアリングを見込んでください。総額ではおよそ $0.006-0.012/min。マネージドと張り合えるのは規模が出てからです。
Whisper はリアルタイムのストリーミングができますか。 ネイティブにはできません。バッチモデルだからです。コミュニティ製のラッパー(WhisperLive、faster-whisper + VAD)でストリーミングを足せますが、初回トークン遅延(500ms〜1秒超)とばらつきは、ネイティブにストリーミングする API より劣ります。割り込みとエンドポインティングは自分で作る課題になります。
コンタクトセンターの音声エージェントにはどちらが向いていますか。 同時通話がおよそ50件未満のチームの大半には、調整済みのエンドポインティングとリージョナルエンドポイントを備えたマネージドのストリーミング API(Deepgram または同等品)です。それを超え、プラットフォームチームがいるなら、セルフホストの Whisper がコストで勝ち始めます。判断を導くべきは WER ではなく SLA です。
遅延バジェットを守る音声エージェントを作る
Finn は、STT、エンドポインティング、リージョナルルーティングを1秒未満の往復に合わせて調整済みの、本番運用コンタクトセンター向け音声エージェントを提供します。GPU の計算にも、午前3時の呼び出しにも付き合わずに済みます。Finn が音声エージェントを遅延の線の内側に保つ方法を見る →




