Kostencalculator voor voice AI
Kies een speech-to-text-engine, een taalmodel, een stem en een telefonieprovider. Elk tarief hieronder komt uit de eigen gepubliceerde prijslijst van de provider, met de datum waarop het is geverifieerd. De uitsplitsing laat zien welke laag je rekening werkelijk aanjaagt — het is zelden de laag die men verwacht.
Where the money goes
Rates in this estimate
- Deepgram Nova-3 (streaming)verified 2026-07-26
- Claude Haiku 4.5verified 2026-07-26
- Deepgram Aura-1verified 2026-07-26
- Twilio inbound (US local)verified 2026-07-26
Hoe dit wordt berekend
Vier lagen, elk afgerekend in een andere eenheid. Speech-to-text en telefonie zijn al per minuut. Het taalmodel wordt geprijsd per miljoen tokens en text-to-speech per duizend tekens, dus beide vragen een omrekening vanuit minuten — en juist bij die twee omrekeningen gaan de meeste schattingen van voicekosten mis.
Twee van de vier lagen worden al per minuut afgerekend. De andere twee niet, en juist bij het omrekenen daarvan gaan kostenramingen voor voice meestal mis:
spokenWords/min = wordsPerMinute × agentTalkShare chars/min = spokenWords/min × charactersPerWord outTokens/min = spokenWords/min × tokensPerWord sttCost = sttRatePerMinute (full connected minute) llmInputCost = inputTokensPerMinute × rateIn / 1e6 llmOutputCost = outTokens/min × rateOut / 1e6 ttsCost = (chars/min / 1000) × ratePer1kChars telephonyCost = telephonyRatePerMinute (full connected minute) total/min = stt + llmInput + llmOutput + tts + telephony + platform
Speech-to-text en telefonie rekenen de volledige verbonden minuut — de agent betaalt net zo goed om te luisteren als om te spreken. Text-to-speech en gegenereerde tokens lopen alleen op terwijl de agent praat, wat bij een spreekaandeel van 50% neerkomt op zo'n 75 woorden per minuut.
Uitgewerkt voorbeeld
Een sobere stack — Deepgram Nova-3 voor transcriptie, Claude Haiku 4.5, Aura-1 als stem, inbound Twilio — komt uit op ongeveer $0,024 per verbonden minuut: grofweg 7 cent voor een gesprek van drie minuten, of $240 per maand bij 10.000 minuten. De verdeling: telefonie 35%, text-to-speech 26%, speech-to-text 20%, prompttokens 17% en gegenereerde tokens slechts 2%.
Zet er een frontier-model en een premiumstem in en hetzelfde gesprek kost ongeveer $0,062 per minuut — en de verhouding kantelt. Prompttokens worden met 32% de grootste post, text-to-speech 33%, telefonie zakt naar 23%. Welke laag de moeite van optimaliseren waard is, hangt volledig af van de stack die je daadwerkelijk draait, en daarom toont deze tool de verdeling in plaats van alleen een totaal.
Waarom prompttokens domineren en gegenereerde tokens niet
De contra-intuïtieve uitkomst in elke configuratie hierboven: de tokens die de agent genereert zijn vrijwel gratis, terwijl de tokens die hij leest echt geld kosten. Een minuut agentspraak is grofweg 100 outputtokens. De systeemprompt, de tooldefinities en het volledige gesprek tot dan toe worden bij elke beurt opnieuw meegestuurd, wat neerkomt op duizenden inputtokens per minuut. Door die verhouding drukt prompt caching de rekening veel sterker dan overstappen op een goedkoper model — en is een lange systeemprompt een terugkerende kostenpost, geen eenmalige.
Wat hier niet in zit
Huur van telefoonnummers, opname en opslag, observability, en de engineeringtijd om een stack met vier leveranciers samen te stellen en draaiend te houden. Een managed platform vouwt dat samen in één tarief per minuut — voer het in als platformkosten om appels met appels te vergelijken. De tarieven hier zijn gepubliceerde pay-as-you-go-prijzen; volume- en committed-use-afspraken verschuiven ze, meestal naar beneden.
Prijzen worden alleen in Amerikaanse dollars getoond, omdat elke hier gemodelleerde provider in dollars publiceert. Omrekenen zou betekenen dat we een wisselkoers verzinnen en die als kostenpost presenteren.
Last reviewed July 2026.
Veelgestelde vragen
- Hoeveel kost een voice-AI-agent per minuut?
- Tegen gepubliceerde tarieven komt een lean stack — Deepgram Nova-3, Claude Haiku 4.5, Aura-1 en inbound Twilio — uit op ruwweg $0.024 per connected minuut, oftewel ongeveer 7 cent voor een gesprek van drie minuten. Een premium stack met een frontier model en een high-end stem zit dichter bij $0.062 per minuut. Telefonie en text-to-speech kosten op een lean stack meestal meer dan het taalmodel, wat de meeste mensen verrast.
- Welke laag kost het meest?
- Dat hangt van de stack af, en dat is precies het punt van de uitsplitsing. Bij een goedkope configuratie is telefonie vaak de grootste post — rond de 35% — terwijl de gegenereerde tokens van het taalmodel amper 2% zijn. Stap over op een frontier model en een premium stem en de verhouding kantelt: de prompt-tokens van de LLM en TTS nemen dan elk ongeveer een derde. Optimaliseren van de laag die al 2% van je rekening is, is verspilde moeite.
- Waarom zijn prompt-tokens zoveel duurder dan gegenereerde tokens?
- Omdat de system prompt, de tooldefinities en het volledige gesprek tot dan toe bij elke beurt opnieuw worden meegestuurd, terwijl de agent alleen de woorden genereert die hij daadwerkelijk uitspreekt. Een minuut spraak is ongeveer 75 door de agent gesproken woorden — grofweg 100 outputtokens — tegenover duizenden inputtokens per minuut. Prompt caching is hier de knop die telt, niet het kiezen van een goedkoper model.
- Welke aannames worden hier gedaan?
- Dat spraak op ongeveer 150 woorden per minuut gaat, dat de agent de helft van het gesprek spreekt, dat een woord ruwweg 5,5 tekens en 1,35 tokens is, en dat er rond de 4.000 prompt-tokens per minuut gesprek worden verstuurd. Alle vijf zijn aanpasbaar onder "conversieaannames" — het cijfer voor prompt-tokens is het meest de moeite waard om te vervangen door een meting uit je eigen verkeer.
- Waarom staan de prijzen alleen in dollars?
- Omdat elke provider in dit model publiceert in Amerikaanse dollars. Omrekenen naar een andere valuta zou betekenen dat je een wisselkoers verzint en die als kostenpost presenteert, en dat is erger dan dollars tonen en jou laten omrekenen met een koers die je vertrouwt.
- Zijn dit de tarieven die ik daadwerkelijk ga betalen?
- Het zijn de gepubliceerde pay-as-you-go-tarieven, geverifieerd op de datum die naast elk tarief staat. Volumeafspraken, enterprise-contracten en jaarplannen verschuiven ze allemaal, meestal naar beneden. Tarieven die als tweedehands zijn gemarkeerd, komen uit berichtgeving van derden en niet van de prijspagina van de leverancier zelf — controleer die voordat je een aankoopbeslissing neemt.
- Is het platform dat de agent draait hierbij inbegrepen?
- Alleen als je er zelf een toevoegt. De vier componentlagen zijn wat een samengestelde stack kost aan pure infrastructuur. Managed platforms bundelen orkestratie, telefonie, monitoring en support in één tarief per minuut — voer dat in als platformkosten om appels met appels te vergelijken, en bedenk dat een zelf samengestelde stack ook engineeringtijd kost die dit model niet meerekent.
Put this calculator on your site
Free to embed on any site, commercial or not. No signup, no API key, nothing to break when we ship changes — the embed always runs the current version.
<iframe src="https://www.hirefinn.ai/embed/tools/voice-ai-cost-calculator" title="Kostencalculator voor voice AI" width="100%" height="1000" style="border:1px solid #E7DFD0;border-radius:12px;max-width:100%" loading="lazy"></iframe> <p style="font:14px/1.5 system-ui,sans-serif;margin:8px 0 0">Kostencalculator voor voice AI by <a href="https://www.hirefinn.ai/tools/voice-ai-cost-calculator">Finn</a></p>
The credit line sits outside the iframe on purpose: a link inside a frame belongs to the framed document and does nothing for the page hosting it. Keeping that line is the only thing we ask in return — remove it and the calculator still works.
Default frame height 1000px, responsive to full width.
Verder lezen
De wachtrij bemannen is één optie. Hem beantwoorden met AI is een andere.
Finn handelt inkomende en uitgaande gesprekken af tegen tarieven per minuut, zonder shrinkage en zonder occupancy-plafond waar je omheen moet plannen. Boek een demo, dan draaien we het op je eigen volume.