Kostnadskalkylator för röst-AI
Välj en speech-to-text-motor, en språkmodell, en röst och en telefonileverantör. Varje pris nedan kommer från leverantörens egen publicerade prislista, med datumet det verifierades. Uppdelningen visar vilket lager som faktiskt driver din nota — det är sällan det man tror.
Where the money goes
Rates in this estimate
- Deepgram Nova-3 (streaming)verified 2026-07-26
- Claude Haiku 4.5verified 2026-07-26
- Deepgram Aura-1verified 2026-07-26
- Twilio inbound (US local)verified 2026-07-26
Så räknas det ut
Fyra lager, vart och ett debiterat i en egen enhet. Speech-to-text och telefoni är redan per minut. Språkmodellen prissätts per miljon tokens och text-to-speech per tusen tecken, så båda kräver en omräkning från minuter — och det är i de två omräkningarna som de flesta kostnadsuppskattningar för röst går fel.
Två av de fyra lagren prissätts redan per minut. De andra två gör det inte, och det är i omräkningen av dem som kostnadsuppskattningar för röst oftast går fel:
spokenWords/min = wordsPerMinute × agentTalkShare chars/min = spokenWords/min × charactersPerWord outTokens/min = spokenWords/min × tokensPerWord sttCost = sttRatePerMinute (full connected minute) llmInputCost = inputTokensPerMinute × rateIn / 1e6 llmOutputCost = outTokens/min × rateOut / 1e6 ttsCost = (chars/min / 1000) × ratePer1kChars telephonyCost = telephonyRatePerMinute (full connected minute) total/min = stt + llmInput + llmOutput + tts + telephony + platform
Speech-to-text och telefoni debiterar för hela den uppkopplade minuten — agenten betalar för att lyssna lika väl som för att tala. Text-to-speech och genererade tokens tickar bara medan agenten pratar, vilket vid 50% talandel är ungefär 75 ord i minuten.
Räkneexempel
En slimmad stack — Deepgram Nova-3 för transkribering, Claude Haiku 4.5, Aura-1 som röst, inkommande Twilio — landar på ungefär $0,024 per uppkopplad minut: runt 7 cent för ett tre minuter långt samtal, eller $240 i månaden vid 10 000 minuter. Fördelningen är telefoni 35%, text-to-speech 26%, speech-to-text 20%, prompt-tokens 17% och genererade tokens bara 2%.
Byt in en frontier-modell och en premiumröst så kostar samma samtal ungefär $0,062 per minut — och formen vänder. Prompt-tokens blir största posten med 32%, text-to-speech 33%, telefoni faller till 23%. Vilket lager som är värt att optimera beror helt på vilken stack du faktiskt kör, och därför visar det här verktyget fördelningen i stället för bara en totalsumma.
Varför prompt-tokens dominerar och genererade tokens inte gör det
Det kontraintuitiva resultatet i alla konfigurationer ovan: de tokens agenten genererar är närmast gratis, medan de tokens den läser kostar riktiga pengar. En minut agenttal är ungefär 100 output-tokens. Systemprompten, verktygsdefinitionerna och hela samtalet så här långt skickas om vid varje tur, vilket blir tusentals input-tokens per minut. Den kvoten är skälet till att prompt-cachning påverkar notan långt mer än att byta till en billigare modell — och till att en lång systemprompt är en återkommande kostnad, inte en engångskostnad.
Vad detta inte omfattar
Hyra av telefonnummer, inspelning och lagring, observability, och ingenjörstiden för att sätta ihop och hålla igång en stack med fyra leverantörer. En managerad plattform lägger in det i en enda minutstaxa — lägg in den som plattformsavgift för att jämföra äpplen med äpplen. Priserna här är publicerade pay-as-you-go-priser; volym- och åtagandeavtal flyttar dem, oftast nedåt.
Priserna visas endast i US-dollar, eftersom alla leverantörer som modelleras här publicerar i dollar. Att räkna om skulle innebära att hitta på en växelkurs och presentera den som en kostnad.
Last reviewed July 2026.
Vanliga frågor
- Hur mycket kostar en röst-AI-agent per minut?
- Till publicerade priser landar en slimmad stack — Deepgram Nova-3, Claude Haiku 4.5, Aura-1 och inkommande Twilio — på ungefär $0.024 per uppkopplad minut, eller runt 7 cent för ett tre minuter långt samtal. En premiumstack med en frontier-modell och en högklassig röst ligger närmare $0.062 per minut. Telefoni och text-to-speech kostar oftast mer än språkmodellen i en slimmad stack, vilket överraskar de flesta.
- Vilket lager kostar mest?
- Det beror på stacken, och det är hela poängen med uppdelningen. I en billig konfiguration är telefoni ofta den enskilt största posten — omkring 35% — medan språkmodellens genererade tokens knappt utgör 2%. Byt till en frontier-modell och en premiumröst så vänder balansen: LLM:ens prompt-tokens och TTS tar ungefär en tredjedel var. Att optimera det lager som redan utgör 2% av notan är bortkastad möda.
- Varför är prompt-tokens så mycket dyrare än genererade tokens?
- För att systemprompten, verktygsdefinitionerna och hela konversationen så här långt skickas om vid varje enskild tur, medan agenten bara genererar de ord den faktiskt säger. En minut tal är ungefär 75 ord från agenten — grovt räknat 100 output-tokens — mot tusentals input-tokens per minut. Prompt caching är spaken som spelar roll här, inte att välja en billigare modell.
- Vilka antaganden görs här?
- Att tal håller omkring 150 ord per minut, att agenten talar under halva samtalet, att ett ord är ungefär 5,5 tecken och 1,35 tokens, och att omkring 4 000 prompt-tokens skickas per minut konversation. Alla fem går att ändra under "omräkningsantaganden" — siffran för prompt-tokens är den som är mest värd att byta ut mot en mätning från din egen trafik.
- Varför anges priserna bara i dollar?
- Eftersom alla leverantörer som modelleras här publicerar sina priser i amerikanska dollar. Att räkna om till en annan valuta skulle innebära att man hittar på en växelkurs och presenterar den som en kostnad, vilket är sämre än att visa dollar och låta dig räkna om med en kurs du litar på.
- Är det här de priser jag faktiskt kommer att betala?
- Det är de publicerade pay-as-you-go-priserna, verifierade det datum som anges bredvid var och en. Volymåtaganden, företagsavtal och årsplaner påverkar dem alla, oftast nedåt. Priser märkta som andrahandsuppgifter har hämtats från tredjepartsrapportering snarare än leverantörens egen prissida — bekräfta dem innan du fattar ett köpbeslut.
- Ingår plattformen som kör agenten?
- Bara om du lägger till en. De fyra komponentlagren är vad en sammansatt stack kostar i ren infrastruktur. Managed-plattformar paketerar orkestrering, telefoni, övervakning och support till ett enda minutpris — lägg in det som en plattformsavgift för att jämföra äpplen med äpplen, och kom ihåg att en egenbyggd stack också kräver utvecklingstid som den här modellen inte prissätter.
Put this calculator on your site
Free to embed on any site, commercial or not. No signup, no API key, nothing to break when we ship changes — the embed always runs the current version.
<iframe src="https://www.hirefinn.ai/embed/tools/voice-ai-cost-calculator" title="Kostnadskalkylator för röst-AI" width="100%" height="1000" style="border:1px solid #E7DFD0;border-radius:12px;max-width:100%" loading="lazy"></iframe> <p style="font:14px/1.5 system-ui,sans-serif;margin:8px 0 0">Kostnadskalkylator för röst-AI by <a href="https://www.hirefinn.ai/tools/voice-ai-cost-calculator">Finn</a></p>
The credit line sits outside the iframe on purpose: a link inside a frame belongs to the framed document and does nothing for the page hosting it. Keeping that line is the only thing we ask in return — remove it and the calculator still works.
Default frame height 1000px, responsive to full width.
Relaterad läsning
Att bemanna kön är ett alternativ. Att svara i den med AI är ett annat.
Finn hanterar inkommande och utgående samtal till minutpris, utan shrinkage och utan något occupancy-tak att planera runt. Boka en demo så kör vi det mot din egen volym.