Skip to main content

Kostnadskalkylator för röst-AI

Välj en speech-to-text-motor, en språkmodell, en röst och en telefonileverantör. Varje pris nedan kommer från leverantörens egen publicerade prislista, med datumet det verifierades. Uppdelningen visar vilket lager som faktiskt driver din nota — det är sällan det man tror.

Cost per minute
$0.0240
All layers combined
Cost per call
$0.072
At 3 minutes
Monthly
$240
10,000 minutes
Annual
$2,879
At the same volume

Where the money goes

Speech to text$0.00480 20.0%
Billed on the full connected minute
LLM — prompt tokens$0.00400 16.7%
4,000 tokens/min (system prompt, tools and history re-sent each turn)
LLM — generated tokens$0.00051 2.1%
101 tokens/min from 75 spoken words
Text to speech$0.00619 25.8%
413 characters/min
Telephony$0.00850 35.4%
Billed on the full connected minute

Rates in this estimate

Så räknas det ut

Fyra lager, vart och ett debiterat i en egen enhet. Speech-to-text och telefoni är redan per minut. Språkmodellen prissätts per miljon tokens och text-to-speech per tusen tecken, så båda kräver en omräkning från minuter — och det är i de två omräkningarna som de flesta kostnadsuppskattningar för röst går fel.

Två av de fyra lagren prissätts redan per minut. De andra två gör det inte, och det är i omräkningen av dem som kostnadsuppskattningar för röst oftast går fel:

spokenWords/min = wordsPerMinute × agentTalkShare
chars/min       = spokenWords/min × charactersPerWord
outTokens/min   = spokenWords/min × tokensPerWord

sttCost         = sttRatePerMinute                       (full connected minute)
llmInputCost    = inputTokensPerMinute × rateIn  / 1e6
llmOutputCost   = outTokens/min        × rateOut / 1e6
ttsCost         = (chars/min / 1000)   × ratePer1kChars
telephonyCost   = telephonyRatePerMinute                 (full connected minute)

total/min       = stt + llmInput + llmOutput + tts + telephony + platform

Speech-to-text och telefoni debiterar för hela den uppkopplade minuten — agenten betalar för att lyssna lika väl som för att tala. Text-to-speech och genererade tokens tickar bara medan agenten pratar, vilket vid 50% talandel är ungefär 75 ord i minuten.

Räkneexempel

En slimmad stack — Deepgram Nova-3 för transkribering, Claude Haiku 4.5, Aura-1 som röst, inkommande Twilio — landar på ungefär $0,024 per uppkopplad minut: runt 7 cent för ett tre minuter långt samtal, eller $240 i månaden vid 10 000 minuter. Fördelningen är telefoni 35%, text-to-speech 26%, speech-to-text 20%, prompt-tokens 17% och genererade tokens bara 2%.

Byt in en frontier-modell och en premiumröst så kostar samma samtal ungefär $0,062 per minut — och formen vänder. Prompt-tokens blir största posten med 32%, text-to-speech 33%, telefoni faller till 23%. Vilket lager som är värt att optimera beror helt på vilken stack du faktiskt kör, och därför visar det här verktyget fördelningen i stället för bara en totalsumma.

Varför prompt-tokens dominerar och genererade tokens inte gör det

Det kontraintuitiva resultatet i alla konfigurationer ovan: de tokens agenten genererar är närmast gratis, medan de tokens den läser kostar riktiga pengar. En minut agenttal är ungefär 100 output-tokens. Systemprompten, verktygsdefinitionerna och hela samtalet så här långt skickas om vid varje tur, vilket blir tusentals input-tokens per minut. Den kvoten är skälet till att prompt-cachning påverkar notan långt mer än att byta till en billigare modell — och till att en lång systemprompt är en återkommande kostnad, inte en engångskostnad.

Vad detta inte omfattar

Hyra av telefonnummer, inspelning och lagring, observability, och ingenjörstiden för att sätta ihop och hålla igång en stack med fyra leverantörer. En managerad plattform lägger in det i en enda minutstaxa — lägg in den som plattformsavgift för att jämföra äpplen med äpplen. Priserna här är publicerade pay-as-you-go-priser; volym- och åtagandeavtal flyttar dem, oftast nedåt.

Priserna visas endast i US-dollar, eftersom alla leverantörer som modelleras här publicerar i dollar. Att räkna om skulle innebära att hitta på en växelkurs och presentera den som en kostnad.

Last reviewed July 2026.

Vanliga frågor

Hur mycket kostar en röst-AI-agent per minut?
Till publicerade priser landar en slimmad stack — Deepgram Nova-3, Claude Haiku 4.5, Aura-1 och inkommande Twilio — på ungefär $0.024 per uppkopplad minut, eller runt 7 cent för ett tre minuter långt samtal. En premiumstack med en frontier-modell och en högklassig röst ligger närmare $0.062 per minut. Telefoni och text-to-speech kostar oftast mer än språkmodellen i en slimmad stack, vilket överraskar de flesta.
Vilket lager kostar mest?
Det beror på stacken, och det är hela poängen med uppdelningen. I en billig konfiguration är telefoni ofta den enskilt största posten — omkring 35% — medan språkmodellens genererade tokens knappt utgör 2%. Byt till en frontier-modell och en premiumröst så vänder balansen: LLM:ens prompt-tokens och TTS tar ungefär en tredjedel var. Att optimera det lager som redan utgör 2% av notan är bortkastad möda.
Varför är prompt-tokens så mycket dyrare än genererade tokens?
För att systemprompten, verktygsdefinitionerna och hela konversationen så här långt skickas om vid varje enskild tur, medan agenten bara genererar de ord den faktiskt säger. En minut tal är ungefär 75 ord från agenten — grovt räknat 100 output-tokens — mot tusentals input-tokens per minut. Prompt caching är spaken som spelar roll här, inte att välja en billigare modell.
Vilka antaganden görs här?
Att tal håller omkring 150 ord per minut, att agenten talar under halva samtalet, att ett ord är ungefär 5,5 tecken och 1,35 tokens, och att omkring 4 000 prompt-tokens skickas per minut konversation. Alla fem går att ändra under "omräkningsantaganden" — siffran för prompt-tokens är den som är mest värd att byta ut mot en mätning från din egen trafik.
Varför anges priserna bara i dollar?
Eftersom alla leverantörer som modelleras här publicerar sina priser i amerikanska dollar. Att räkna om till en annan valuta skulle innebära att man hittar på en växelkurs och presenterar den som en kostnad, vilket är sämre än att visa dollar och låta dig räkna om med en kurs du litar på.
Är det här de priser jag faktiskt kommer att betala?
Det är de publicerade pay-as-you-go-priserna, verifierade det datum som anges bredvid var och en. Volymåtaganden, företagsavtal och årsplaner påverkar dem alla, oftast nedåt. Priser märkta som andrahandsuppgifter har hämtats från tredjepartsrapportering snarare än leverantörens egen prissida — bekräfta dem innan du fattar ett köpbeslut.
Ingår plattformen som kör agenten?
Bara om du lägger till en. De fyra komponentlagren är vad en sammansatt stack kostar i ren infrastruktur. Managed-plattformar paketerar orkestrering, telefoni, övervakning och support till ett enda minutpris — lägg in det som en plattformsavgift för att jämföra äpplen med äpplen, och kom ihåg att en egenbyggd stack också kräver utvecklingstid som den här modellen inte prissätter.

Put this calculator on your site

Free to embed on any site, commercial or not. No signup, no API key, nothing to break when we ship changes — the embed always runs the current version.

<iframe src="https://www.hirefinn.ai/embed/tools/voice-ai-cost-calculator" title="Kostnadskalkylator för röst-AI" width="100%" height="1000" style="border:1px solid #E7DFD0;border-radius:12px;max-width:100%" loading="lazy"></iframe>
<p style="font:14px/1.5 system-ui,sans-serif;margin:8px 0 0">Kostnadskalkylator för röst-AI by <a href="https://www.hirefinn.ai/tools/voice-ai-cost-calculator">Finn</a></p>

The credit line sits outside the iframe on purpose: a link inside a frame belongs to the framed document and does nothing for the page hosting it. Keeping that line is the only thing we ask in return — remove it and the calculator still works.

Default frame height 1000px, responsive to full width.