Skip to main content

Calcolatore dei costi della voice AI

Scegli un motore speech-to-text, un modello linguistico, una voce e un provider di telefonia. Ogni tariffa qui sotto proviene dal listino pubblicato dal provider stesso, con la data di verifica. La ripartizione mostra quale layer determina davvero il tuo conto — raramente è quello che si immagina.

Cost per minute
$0.0240
All layers combined
Cost per call
$0.072
At 3 minutes
Monthly
$240
10,000 minutes
Annual
$2,879
At the same volume

Where the money goes

Speech to text$0.00480 20.0%
Billed on the full connected minute
LLM — prompt tokens$0.00400 16.7%
4,000 tokens/min (system prompt, tools and history re-sent each turn)
LLM — generated tokens$0.00051 2.1%
101 tokens/min from 75 spoken words
Text to speech$0.00619 25.8%
413 characters/min
Telephony$0.00850 35.4%
Billed on the full connected minute

Rates in this estimate

Come viene calcolato

Quattro layer, ciascuno fatturato in un'unità diversa. Speech-to-text e telefonia sono già al minuto. Il modello linguistico è tariffato per milione di token e il text-to-speech per mille caratteri, quindi entrambi richiedono una conversione dai minuti — ed è proprio in queste due conversioni che la maggior parte delle stime di costo vocale sbaglia.

Due dei quattro livelli sono già tariffati al minuto. Gli altri due no, ed è proprio nella conversione che le stime di costo del voice AI di solito sbagliano:

spokenWords/min = wordsPerMinute × agentTalkShare
chars/min       = spokenWords/min × charactersPerWord
outTokens/min   = spokenWords/min × tokensPerWord

sttCost         = sttRatePerMinute                       (full connected minute)
llmInputCost    = inputTokensPerMinute × rateIn  / 1e6
llmOutputCost   = outTokens/min        × rateOut / 1e6
ttsCost         = (chars/min / 1000)   × ratePer1kChars
telephonyCost   = telephonyRatePerMinute                 (full connected minute)

total/min       = stt + llmInput + llmOutput + tts + telephony + platform

Speech-to-text e telefonia fatturano l'intero minuto di connessione: l'agente paga sia per ascoltare sia per parlare. Text-to-speech e token generati maturano solo mentre l'agente parla, il che con una quota di conversazione del 50% equivale a circa 75 parole al minuto.

Esempio pratico

Uno stack essenziale — Deepgram Nova-3 per la trascrizione, Claude Haiku 4.5, Aura-1 per la voce, Twilio in inbound — arriva a circa $0.024 per minuto di connessione: circa 7 centesimi per una chiamata di tre minuti, oppure $240 al mese con 10.000 minuti. La ripartizione è: telefonia 35%, text-to-speech 26%, speech-to-text 20%, token di prompt 17%, e token generati appena 2%.

Sostituisci con un modello di frontiera e una voce premium e la stessa chiamata costa circa $0.062 al minuto — e la struttura si ribalta. I token di prompt diventano la voce più pesante con il 32%, il text-to-speech il 33%, la telefonia scende al 23%. Quale livello convenga ottimizzare dipende interamente dallo stack che usi davvero, ed è per questo che questo strumento mostra la ripartizione e non solo un totale.

Perché i token di prompt dominano e i token generati no

Il risultato controintuitivo in tutte le configurazioni qui sopra: i token che l'agente genera sono quasi gratis, mentre i token che legge costano davvero. Un minuto di parlato dell'agente equivale a circa 100 token di output. Il system prompt, le definizioni dei tool e l'intera conversazione fino a quel momento vengono rinviati a ogni turno, il che significa migliaia di token di input al minuto. È per questo rapporto che il prompt caching incide sulla bolletta molto più che passare a un modello più economico — e per cui un system prompt lungo è un costo ricorrente, non una spesa una tantum.

Cosa non è incluso

Il noleggio del numero di telefono, la registrazione e l'archiviazione, l'observability e il tempo di sviluppo per assemblare e mantenere in funzione uno stack con quattro fornitori. Una piattaforma gestita raccoglie tutto questo in un'unica tariffa al minuto: inseriscila come costo di piattaforma per confrontare cose omogenee. Le tariffe qui riportate sono i prezzi pay-as-you-go pubblicati; volumi e accordi di utilizzo impegnato le modificano, di norma al ribasso.

I prezzi sono indicati solo in dollari USA, perché ogni provider modellato qui pubblica in dollari. Convertirli significherebbe inventare un tasso di cambio e presentarlo come un costo.

Last reviewed July 2026.

Domande frequenti

Quanto costa al minuto un agente voice AI?
Alle tariffe pubblicate, uno stack essenziale — Deepgram Nova-3, Claude Haiku 4.5, Aura-1 e Twilio in inbound — arriva a circa $0.024 per minuto connesso, ovvero circa 7 centesimi per una chiamata di tre minuti. Uno stack premium con un modello di frontiera e una voce di fascia alta si avvicina a $0.062 al minuto. Su uno stack essenziale la telefonia e il text-to-speech costano di solito più del modello linguistico, il che sorprende quasi tutti.
Quale layer costa di più?
Dipende dallo stack, ed è esattamente il senso della ripartizione. In una configurazione economica la telefonia è spesso la voce singola più alta — intorno al 35% — mentre i token generati dal modello linguistico sono appena il 2%. Passa a un modello di frontiera e a una voce premium e l'equilibrio si ribalta: i prompt token dell'LLM e il TTS si prendono circa un terzo ciascuno. Ottimizzare il layer che è già il 2% del tuo conto è fatica sprecata.
Perché i prompt token costano molto più dei token generati?
Perché il system prompt, le definizioni dei tool e l'intera conversazione fino a quel punto vengono rinviati a ogni singolo turno, mentre l'agente genera solo le parole che pronuncia davvero. Un minuto di parlato equivale a circa 75 parole pronunciate dall'agente — all'incirca 100 output token — contro migliaia di input token al minuto. Qui la leva che conta è il prompt caching, non scegliere un modello più economico.
Quali assunzioni fa questo strumento?
Che il parlato viaggi a circa 150 parole al minuto, che l'agente parli per metà della chiamata, che una parola equivalga a circa 5,5 caratteri e 1,35 token, e che vengano inviati circa 4.000 prompt token per minuto di conversazione. Tutte e cinque sono modificabili sotto "assunzioni di conversione" — il valore dei prompt token è quello che più conviene sostituire con una misurazione sul tuo traffico reale.
Perché i prezzi sono solo in dollari?
Perché ogni provider modellato qui pubblica i prezzi in dollari USA. Convertirli in un'altra valuta significherebbe inventare un tasso di cambio e presentarlo come un costo, il che è peggio che mostrare i dollari e lasciare che sia tu a convertirli con un tasso di cui ti fidi.
Sono queste le tariffe che pagherò davvero?
Sono le tariffe pay-as-you-go pubblicate, verificate alla data indicata accanto a ciascuna. Impegni di volume, accordi enterprise e piani annuali le modificano tutti, di norma al ribasso. Le tariffe contrassegnate come di seconda mano provengono da fonti terze e non dal listino del fornitore: verificale prima di prendere una decisione d'acquisto.
Include anche la piattaforma che esegue l'agente?
Solo se ne aggiungi una. I quattro livelli che compongono lo stack sono ciò che uno stack assemblato costa in pura infrastruttura. Le piattaforme gestite racchiudono orchestrazione, telefonia, monitoraggio e supporto in un'unica tariffa al minuto: inseriscila come costo di piattaforma per confrontare cose omogenee, e ricorda che uno stack assemblato in proprio comporta anche tempo di sviluppo che questo modello non calcola.

Put this calculator on your site

Free to embed on any site, commercial or not. No signup, no API key, nothing to break when we ship changes — the embed always runs the current version.

<iframe src="https://www.hirefinn.ai/embed/tools/voice-ai-cost-calculator" title="Calcolatore dei costi della voice AI" width="100%" height="1000" style="border:1px solid #E7DFD0;border-radius:12px;max-width:100%" loading="lazy"></iframe>
<p style="font:14px/1.5 system-ui,sans-serif;margin:8px 0 0">Calcolatore dei costi della voice AI by <a href="https://www.hirefinn.ai/tools/voice-ai-cost-calculator">Finn</a></p>

The credit line sits outside the iframe on purpose: a link inside a frame belongs to the framed document and does nothing for the page hosting it. Keeping that line is the only thing we ask in return — remove it and the calculator still works.

Default frame height 1000px, responsive to full width.