Varje inlägg om "Whisper vs Deepgram" du kommer att läsa är skrivet av någon som säljer den ena av dem. Deepgrams egen jämförelse inleder med "över 90 % träffsäkerhet på 300 ms". Sant, och vid sidan av poängen. Om du kopplar in taligenkänning i en röstagent i realtid som svarar i telefon är träffsäkerheten på ett rent podcastklipp inte den siffra som avgör om din agent känns mänsklig eller känns trasig.
Vi bygger röstagenter för kundtjänst på Finn. Vi har kört båda motorerna i produktion. Här är den leverantörsneutrala versionen — den som utgår från 8 kHz telefoniljud, en verklig latensbudget och driftnotan som ingen prissätter.
Det verkliga beslutet: streamande STT är en latensbudget, inte en topplista över träffsäkerhet
En röstagent har ett hårt villkor: människan i telefonen förväntar sig ett svar ungefär i samma takt som en person skulle ge — säg 800 ms till 1,2 s från det ögonblick hon slutar prata. Hela den tur och retur-tiden måste täcka STT-finalisering, LLM-inferens, första TTS-byte och nätverks-/SIP-transport. STT får inte hela budgeten. Den får kanske 300 ms av den.
Frågan är alltså inte "vilken motor har lägst ordfelsfrekvens". Den är "vilken motor ger mig användbara transkript tillräckligt snabbt för att de tre andra stegen fortfarande ska få plats". En modell som är 2 % mer träffsäker men lägger på 400 ms finaliseringslatens är en sämre röstagentmotor, punkt slut. Batchbaserade träffsäkerhetsbenchmarks mäter fel axel för det här jobbet.
Benchmarkuppställning: ljud av telefonikvalitet, WER och varför resultat på rent ljud ljuger
De flesta publicerade WER-siffror kommer från LibriSpeech eller liknande — uppläst tal, 16 kHz, studiorent. Telefonsamtal är motsatsen: 8 kHz smalband (eller G.711 μ-law), kodekartefakter, bakgrundsbrus, överlappande tal, brytningar och uppringare som mumlar sitt kontonummer.
När du kör om samma modeller på telefoniljud förskjuts gapet:
- Whisper large-v3 på rena 16 kHz: ~5-8 % WER. På brusig 8 kHz-telefoni: ofta 12-18 % WER, och den hallucinerar flytande men felaktig text på tystnad och brus — ett känt felläge som är farligt när transkriptet matas in i en LLM.
- Deepgram Nova-2/Nova-3, trimmad för telefoniljud och streaming: 8-13 % WER på samma telefoniuppsättning, och den försämras mer graciöst — den tenderar att tappa ord snarare än att hitta på dem.
Lärdomen: benchmarka på ditt eget ljud. Ta 200 verkliga inspelade samtal, handmärk dem och betygsätt båda motorerna på det. Rangordningen du får kommer inte att stämma med någon leverantörsblogg, inklusive den här. Om du tar med dig en enda sak, ta med dig den.
Latens och endpointing: första token, finalisering och barge-in
Tre latenssiffror spelar roll, och bara en dyker upp i marknadsföringen.
Latens till första token — hur snabbt partiella transkript börjar strömma tillbaka. Deepgram streamar mellanresultat på ~100-200 ms. Whisper är en batchmodell; communityns streamingomslag (whisper-streaming, WhisperLive) styckar ljudet och avkodar om, vilket innebär att partiella resultat kommer på 500 ms-1 s eller mer och fluktuerar under belastning.
Finaliseringslatens — hur lång tid det tar efter att uppringaren slutat prata innan du får ett stabilt slutligt transkript att lämna över till LLM:en. Detta styrs av endpointing (röstaktivitetsdetektering som avgör att turen är över). Deepgram levererar justerbar endpointing (endpointing=300). Med Whisper skruvar du fast din egen VAD (Silero, WebRTC VAD) och trimmar den själv — mer kontroll, mer rep att hänga dig i.
Barge-in — när uppringaren avbryter agenten mitt i en mening måste du upptäcka talet och döda TTS på ~100-200 ms, annars pratar agenten över henne. Det är ett problem med streamande partiella resultat plus VAD. Motorer med inbyggd streaming gör det enkelt; batch-Whisper gör det till ett projekt.
Att trimma endpointing är den enskilt mest hävstångsstarka latensratten i hela stacken — sätt den för aggressivt och du klipper av uppringare mitt i ordet; för slappt och du lägger på 500 ms dödtid i varje tur. Se vår genomgång av röstmotorer med låg latens för var detta sitter i pipelinen.
Egen drift av Whisper: GPU-kostnad, batchning och driftbördan som ingen prissätter
"Whisper är gratis" är den dyraste meningen i röst-AI. Modellvikterna är gratis. Att köra dem i realtid med kundtjänstens samtidighet är det inte.
Verkliga siffror för en egendriven faster-whisper-installation (CTranslate2) med large-v3:
- GPU: en A10G eller L4 klarar ungefär 8-15 samtidiga realtidsströmmar på large-v3 innan latensen försämras. Vid 100 samtidiga samtal behöver du ~8-12 GPU:er. En A10G i molnet on demand kostar ~$1.00-1.30/hr; reserverad hamnar lägre. Räkna med $7,000-10,000/month i GPU för att hålla 100 samtidiga strömmar, före redundans.
- Batchningens avvägning: batchning lyfter genomströmningen per GPU men lägger på latens — precis det du skyddar. Realtidsröst sätter tak för hur mycket du kan batcha, så din GPU-utnyttjandegrad blir låg (ofta 30-50 %), och det är pengar som brinner.
- Driftbörda: modellinläsning, varma pooler för att undvika kallstart, autoskalning vid ryckig inkommande trafik, VAD-trimning, hallucinationsfiltrering, underhåll av GPU-drivrutiner/CUDA och jour dygnet runt när en nod hakar upp sig mitt i ett samtal. Det är 0,5-1 heltidstjänst i plattformsteknik som aldrig dyker upp i en jämförelse per minut.
Utslaget landar egendriven Whisper vid 100 samtidiga samtal ofta på $0.006-0.012/min allt inkluderat — konkurrenskraftigt på pappret, men först när du betalat ingenjörsarbetet som gör det tillförlitligt. Under seriösa volymer är det nästan aldrig värt det. Vår hybrida ASR-pipeline under 120 ms går på djupet i matematiken kring batchning mot latens.
Deepgram / hanterade API:er: kostnad per minut i skala och regional routning
Hanterad STT vänder på avvägningen: högre marginalkostnad, nästan noll drift.
- Deepgram Nova streaming listas kring $0.0077/min (Nova med betalning per användning, streaming), där volym- och åtagandeavdrag drar ner det i skala.
- Inga GPU:er, inga varma pooler, ingen CUDA. Du får autoskalning, endpointing och streaming utan ansträngning.
- Regional routning betyder mer än listpriset. Om ditt media termineras i Mumbai och din STT-endpoint ligger i us-east har du precis lagt på 200-300 ms transatlantisk tur och retur på varje partiellt resultat. Hanterade leverantörer med regionala endpoints (eller egendrivna företagsinstallationer nära ditt mediaplan) suddar bort det. För stackar med dubbla marknader USA-Indien är detta avgörande — se vår arkitektur för gränsöverskridande latens.
Den ärliga läsningen: för de flesta team under ~50 samtidiga samtal vinner hanterad drift på totalkostnad så snart du prissätter ingenjören. Över det börjar matematiken gynna egen drift — om du har plattformsteamet.
Hur valet av STT fortplantar sig i den totala tur och retur-latensen
Här är en representativ turbudget för ett inkommande samtal, med målet < 1000ms upplevd svarstid:
| Steg | Hanterad (Deepgram) | Egendriven Whisper (naiv) |
|---|---|---|
| SIP-/mediatransport | 80ms | 80ms |
| STT-finalisering (efter endpoint) | 250ms | 700ms |
| Första LLM-token | 350ms | 350ms |
| Första TTS-byte | 150ms | 150ms |
| Upplevt svar | ~830ms | ~1280ms |
Samma LLM, samma TTS. Enbart valet av STT svänger uppringarens upplevelse över gränsen för "känns mänsklig". Dessa 450 ms är skillnaden mellan en agent som människor pratar med och en de lägger på luren för. STT-latens är ingen post i kalkylen — den är en multiplikator på allt nedströms. Därför behandlar vi den som en budget, inte en benchmark. Mer om hela pipelinen i bortom omslaget.
Beslutsmatris: välj efter samtalsvolym, språkmix och latens-SLA
- < 50 samtidiga, engelsktungt, snävt SLA → Hanterad (Deepgram eller motsvarande). Du slår inte den ansträngningsjusterade kostnaden, och streaming/endpointing är löst.
- Hög volym (100+ samtidiga), stabil trafik, plattformsteam på plats → Egendriven Whisper (faster-whisper) börjar vinna på marginalkostnad. Budgetera heltidstjänsten ärligt.
- Tungt flerspråkigt / kodväxling → Testa båda på dina språk. Whispers flerspråkiga bredd är stark men WER varierar vilt mellan språk; hanterade motorer varierar också. Anta inte — mät. Se den dolda flerspråkighetsskatten.
- Reglerat / datahemvist (vård, indisk DLT, EU) → Egen drift eller en regional hanterad installation, vald utifrån var ditt media juridiskt måste stanna.
- Hallucinationskänsligt (transkriptet matar en LLM som agerar på det) → Väg Whispers tystnadshallucination mot Deepgrams graciösa försämring, och lägg till skyddsräcken oavsett. Vår handbok för att stoppa hallucinationer i röst-AI är direkt tillämplig.
Slutsatsen
Whisper mot Deepgram är ingen träffsäkerhetstävling — det är ett beslut om latensbudget och driftbörda. Hanterad drift vinner på ansträngning och tid till lansering; egendriven Whisper vinner på marginalkostnad bara i verklig skala och bara med ett plattformsteam bakom sig. Hur som helst: benchmarka på ditt eget telefoniljud, trimma endpointing hårt och räkna med hela tur och retur-tiden. Transkriptet är bara de första 300 ms av ett en-sekunds löfte till uppringaren.
Vanliga frågor
Är Whisper mer träffsäker än Deepgram 2025? På rent 16 kHz-ljud är Whisper large-v3 mycket stark. På brusig 8 kHz-telefoni — ljudet en röstagent faktiskt hör — krymper gapet eller vänder, och Whispers tystnadshallucination är en verklig risk. Benchmarka på dina egna inspelade samtal innan du bestämmer dig.
Vad kostar det egentligen att driva Whisper själv?
Inte gratis. Vid 100 samtidiga realtidsströmmar, räkna med 8-12 GPU:er ($7-10k/month) plus 0,5-1 heltidstjänst i plattformsteknik. Allt inkluderat landar det kring $0.006-0.012/min — konkurrenskraftigt mot hanterad drift bara i skala.
Klarar Whisper streaming i realtid? Inte inbyggt — det är en batchmodell. Communityomslag (WhisperLive, faster-whisper + VAD) lägger till streaming, men latensen till första token (500 ms-1 s eller mer) och fluktuationen är sämre än hos API:er med inbyggd streaming. Barge-in och endpointing blir ditt att bygga.
Vilken är bäst för en röstagent i kundtjänst? För de flesta team under ~50 samtidiga samtal: ett hanterat streaming-API (Deepgram eller motsvarande) med trimmad endpointing och en regional endpoint. Över det, med ett plattformsteam, börjar egendriven Whisper vinna på kostnad. Det är SLA:t, inte WER, som ska styra valet.
Bygg en röstagent som håller latensbudgeten
Finn levererar röstagenter för kundtjänst i produktion där STT, endpointing och regional routning redan är trimmade för tur och retur under en sekund — så du slipper GPU-matematiken och personsökaren klockan tre på natten. Se hur Finn håller röstagenter under latensgränsen →
Relaterat: Driftsättning av AI-agenter: köra röstagenter tillförlitligt
Relaterat: Samtalsspårning för AI-röstagenter: från attribution till intäkt




