Skip to main content

Whisper vs Deepgram 2025: STT voor spraakagenten

Een leveranciersneutrale benchmark uit 2025 van Whisper tegenover Deepgram voor spraakagenten in productie: streaminglatentie, telefonie-WER, endpointing…

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat
July 26, 2026
9 min read
Een messing weegschaal op een marmeren plaat draagt roze keramische trompetten en een groen gewicht vastgeknoopt met een perzikkleurig lint

Elk stuk over "Whisper vs Deepgram" dat je zult lezen is geschreven door iemand die er een van verkoopt. Deepgrams eigen vergelijking opent met "meer dan 90 % nauwkeurigheid in 300 ms". Klopt, en het doet er niet toe. Als je spraakherkenning aansluit op een realtime spraakagent die telefoongesprekken aanneemt, is de nauwkeurigheid op een schoon podcastfragment niet het getal dat bepaalt of je agent menselijk aanvoelt of kapot.

Bij Finn bouwen we spraakagenten voor contactcenters. We hebben beide engines in productie gebracht. Hier is de leveranciersneutrale versie — die gebaseerd is op telefonieaudio van 8 kHz, een echt latentiebudget en de beheersrekening die niemand meeprijst.

De echte keuze: streaming-STT is een latentiebudget, geen nauwkeurigheidsranglijst

Een spraakagent heeft één harde randvoorwaarde: de mens aan de telefoon verwacht antwoord ongeveer in hetzelfde tempo als een persoon zou geven — zeg 800 ms tot 1,2 s vanaf het moment dat die stopt met praten. Die hele heen-en-weertijd moet de STT-finalisering, de LLM-inferentie, de eerste TTS-byte en het netwerk-/SIP-transport dekken. STT krijgt niet het hele budget. Het krijgt er misschien 300 ms van.

De vraag is dus niet "welke engine heeft de laagste woordfoutratio". Het is "welke engine geeft me bruikbare transcripties snel genoeg zodat de andere drie fasen er nog in passen". Een model dat 2 % nauwkeuriger is maar 400 ms finaliseringslatentie toevoegt, is een slechtere spraakagent-engine, punt uit. Batchnauwkeurigheidsbenchmarks meten de verkeerde as voor dit werk.

Benchmarkopzet: audio van telefoniekwaliteit, WER en waarom scores op schone audio liegen

De meeste gepubliceerde WER-cijfers komen uit LibriSpeech of vergelijkbaar — voorgelezen spraak, 16 kHz, studioschoon. Telefoongesprekken zijn het tegenovergestelde: smalband van 8 kHz (of G.711 μ-law), codec-artefacten, achtergrondgeluid, door elkaar praten, accenten, en bellers die hun rekeningnummer mompelen.

Als je dezelfde modellen opnieuw op telefonieaudio draait, verschuift het gat:

  • Whisper large-v3 op schone 16 kHz: ~5-8 % WER. Op ruizige telefonie van 8 kHz: vaak 12-18 % WER, en het hallucineert vloeiende maar foute tekst op stilte en ruis — een bekende faalmodus die gevaarlijk is wanneer de transcriptie een LLM voedt.
  • Deepgram Nova-2/Nova-3, afgestemd op telefonieaudio en streaming: 8-13 % WER op dezelfde telefonieset, en het verslechtert gracieuzer — het laat eerder woorden vallen dan dat het ze verzint.

De les: benchmark op je eigen audio. Pak 200 echte opgenomen gesprekken, label ze met de hand en beoordeel beide engines daarop. De rangorde die je krijgt zal met geen enkele leveranciersblog overeenkomen, ook niet met deze. Als je één ding meeneemt, neem dan dat mee.

Latentie en endpointing: eerste token, finalisering en barge-in

Drie latentiegetallen doen ertoe, en slechts één duikt op in de marketing.

Latentie tot het eerste token — hoe snel gedeeltelijke transcripties beginnen terug te stromen. Deepgram streamt tussenresultaten in ~100-200 ms. Whisper is een batchmodel; de streamingwrappers uit de community (whisper-streaming, WhisperLive) hakken de audio in stukken en decoderen opnieuw, wat betekent dat deelresultaten binnenkomen in 500 ms-1 s of meer en onder belasting schommelen.

Finaliseringslatentie — hoe lang het duurt nadat de beller stopt met praten voordat je een stabiele definitieve transcriptie hebt die je aan de LLM kunt doorgeven. Dit wordt bepaald door endpointing (spraakactiviteitsdetectie die beslist dat de beurt voorbij is). Deepgram levert instelbare endpointing (endpointing=300). Bij Whisper schroef je je eigen VAD (Silero, WebRTC VAD) erop en stem je die zelf af — meer controle, meer touw.

Barge-in — wanneer de beller de agent halverwege een zin onderbreekt, moet je spraak detecteren en TTS binnen ~100-200 ms afkappen, anders praat de agent eroverheen. Dat is een probleem van streamende deelresultaten plus VAD. Engines met native streaming maken het makkelijk; batch-Whisper maakt er een project van.

Het afstemmen van endpointing is de latentieknop met de meeste hefboomwerking in de hele stack — te agressief ingesteld en je kapt bellers middenin een woord af; te los en je voegt 500 ms stilte toe aan elke beurt. Zie onze ontleding van spraakengines met lage latentie voor waar dit in de pipeline zit.

Zelfgehoste Whisper: GPU-kosten, batching en de beheerslast die niemand meeprijst

"Whisper is gratis" is de duurste zin in spraak-AI. De modelgewichten zijn gratis. Ze realtime draaien op de gelijktijdigheid van een callcenter is dat niet.

Echte cijfers voor een zelfgehoste faster-whisper-deployment (CTranslate2) met large-v3:

  • GPU: een A10G of L4 verwerkt ruwweg 8-15 gelijktijdige realtimestromen op large-v3 voordat de latentie inzakt. Bij 100 gelijktijdige gesprekken heb je ~8-12 GPU's nodig. Een on-demand cloud-A10G kost ~$1.00-1.30/hr; gereserveerd ligt lager. Reken op $7,000-10,000/month aan GPU om 100 gelijktijdige stromen aan te houden, vóór redundantie.
  • Afweging bij batching: batching verhoogt de doorvoer per GPU maar voegt latentie toe — precies datgene wat je beschermt. Realtime spraak beperkt hoeveel je kunt batchen, dus je GPU-benutting blijft laag (vaak 30-50 %), en dat is geld dat verbrandt.
  • Beheerslast: model laden, warme pools om koude start te vermijden, autoscaling bij grillig inkomend verkeer, VAD-afstemming, hallucinatiefiltering, onderhoud van GPU-drivers/CUDA en 24/7 piketdienst als een node midden in een gesprek vastloopt. Dat is 0,5-1 fte platform-engineering die nooit opduikt in een vergelijking per minuut.

Uitgesmeerd komt zelfgehoste Whisper bij 100 gelijktijdige gesprekken vaak uit op $0.006-0.012/min alles inbegrepen — concurrerend op papier, maar pas zodra je het engineeringwerk hebt betaald dat het betrouwbaar maakt. Onder serieuze volumes is het het bijna nooit waard. Onze hybride ASR-pipeline onder 120 ms behandelt de rekensom batching versus latentie in detail.

Deepgram / beheerde API's: kosten per minuut op schaal en regionale routering

Beheerde STT draait de afweging om: hogere marginale kosten, vrijwel geen beheer.

  • Deepgram Nova streaming staat op ongeveer $0.0077/min in de lijst (Nova met betalen naar gebruik, streaming), waarbij volume- en verbintenisskortingen dat op schaal omlaag trekken.
  • Geen GPU's, geen warme pools, geen CUDA. Je krijgt autoscaling, endpointing en streaming zonder inspanning.
  • Regionale routering telt zwaarder dan de catalogusprijs. Als je media in Mumbai eindigt en je STT-endpoint in us-east staat, heb je zojuist 200-300 ms transatlantische heen-en-weertijd toegevoegd aan elk deelresultaat. Beheerde leveranciers met regionale endpoints (of zelfgehoste enterprise-deployments dicht bij je mediavlak) wissen dat uit. Voor stacks met een dubbele markt VS-India is dit doorslaggevend — zie onze architectuur voor grensoverschrijdende latentie.

De eerlijke conclusie: voor de meeste teams onder ~50 gelijktijdige gesprekken wint beheerd op totale kosten zodra je de engineer meeprijst. Daarboven begint de rekensom zelf hosten te bevoordelen — als je het platformteam hebt.

Hoe de STT-keuze doorwerkt in de totale heen-en-weerlatentie

Hier is een representatief beurtbudget voor een inkomend gesprek, met als doel < 1000ms ervaren reactietijd:

FaseBeheerd (Deepgram)Zelfgehoste Whisper (naïef)
SIP-/mediatransport80ms80ms
STT-finalisering (na endpoint)250ms700ms
Eerste LLM-token350ms350ms
Eerste TTS-byte150ms150ms
Ervaren reactie~830ms~1280ms

Zelfde LLM, zelfde TTS. Alleen al de STT-keuze duwt de ervaring van de beller over de grens van "voelt menselijk". Die 450 ms is het verschil tussen een agent waar mensen mee praten en een waar ze op ophangen. STT-latentie is geen kostenpost — het is een vermenigvuldiger op alles stroomafwaarts. Daarom behandelen we het als een budget, niet als een benchmark. Meer over de volledige pipeline in voorbij de wrapper.

Beslismatrix: kies op gespreksvolume, talenmix en latentie-SLA

  • < 50 gelijktijdig, overwegend Engels, strakke SLA → Beheerd (Deepgram of vergelijkbaar). De voor inspanning gecorrigeerde kosten versla je niet, en streaming/endpointing is opgelost.
  • Hoog volume (100+ gelijktijdig), stabiel verkeer, platformteam in dienst → Zelfgehoste Whisper (faster-whisper) begint te winnen op marginale kosten. Begroot de fte eerlijk.
  • Zwaar meertalig / code-switching → Test beide op jouw talen. Whispers meertalige breedte is sterk maar de WER varieert enorm per taal; beheerde engines variëren ook. Neem niets aan — meet. Zie de verborgen meertaligheidsheffing.
  • Gereguleerd / dataresidentie (zorg, DLT in India, EU) → Zelfgehost of een regionale beheerde deployment, gekozen op basis van waar je media juridisch moet blijven.
  • Hallucinatiegevoelig (de transcriptie voedt een LLM die erop handelt) → Weeg Whispers stiltehallucinatie af tegen Deepgrams gracieuze degradatie, en voeg hoe dan ook vangrails toe. Ons draaiboek over hallucinaties in spraak-AI stoppen is direct van toepassing.

De kern van de zaak

Whisper vs Deepgram is geen nauwkeurigheidswedstrijd — het is een beslissing over latentiebudget en beheerslast. Beheerd wint op inspanning en tijd tot livegang; zelfgehoste Whisper wint op marginale kosten alleen op echte schaal en alleen met een platformteam erachter. Hoe dan ook: benchmark op je eigen telefonieaudio, stem endpointing stevig af en reken de volledige heen-en-weertijd mee. De transcriptie is slechts de eerste 300 ms van een belofte van één seconde aan de beller.

Veelgestelde vragen

Is Whisper in 2025 nauwkeuriger dan Deepgram? Op schone audio van 16 kHz is Whisper large-v3 zeer sterk. Op ruizige telefonie van 8 kHz — de audio die een spraakagent daadwerkelijk hoort — versmalt het gat of keert het om, en Whispers stiltehallucinatie is een reëel risico. Benchmark op je eigen opgenomen gesprekken voordat je beslist.

Wat kost het echt om Whisper zelf te hosten? Niet gratis. Bij 100 gelijktijdige realtimestromen reken je op 8-12 GPU's ($7-10k/month) plus 0,5-1 fte platform-engineering. Alles inbegrepen komt het rond $0.006-0.012/min uit — alleen op schaal concurrerend met beheerd.

Kan Whisper realtime streamen? Niet van nature — het is een batchmodel. Wrappers uit de community (WhisperLive, faster-whisper + VAD) voegen streaming toe, maar de latentie tot het eerste token (500 ms-1 s of meer) en de schommeling zijn slechter dan bij API's met native streaming. Barge-in en endpointing worden jouw bouwklus.

Wat is beter voor een spraakagent in een contactcenter? Voor de meeste teams onder ~50 gelijktijdige gesprekken: een beheerde streaming-API (Deepgram of vergelijkbaar) met afgestemde endpointing en een regionaal endpoint. Daarboven, met een platformteam, begint zelfgehoste Whisper te winnen op kosten. De SLA, niet de WER, hoort de keuze te bepalen.

Bouw een spraakagent die het latentiebudget haalt

Finn levert contactcenter-spraakagenten in productie met de STT, endpointing en regionale routering al afgestemd op de heen-en-weertijd onder één seconde — zo sla je het GPU-rekenwerk en de pieper om 3 uur 's nachts over. Zie hoe Finn spraakagenten onder de latentiegrens houdt →

Gerelateerd: AI-agenten uitrollen: spraakagenten betrouwbaar draaien

Gerelateerd: Call tracking voor AI-spraakagenten: van attributie naar omzet

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat

Oprichter, Finn AI

Digvijay bouwt Finn — de enterprise voice-orchestratielaag die door gesprekken heen redeneert, data extraheert en je systemen in realtime bijwerkt. Schrijft over voice AI, go-to-market en wat er nodig is om autonome agents op schaal uit te rollen.

Whisper vs Deepgram 2025: STT voor spraakagenten — Finn