Skip to main content

Calculadora de custo de voice AI

Escolha um motor de speech-to-text, um modelo de linguagem, uma voz e um provedor de telefonia. Cada tarifa abaixo vem da própria tabela de preços publicada do provedor, com a data em que foi verificada. O detalhamento mostra qual camada realmente puxa sua conta — raramente é a que as pessoas imaginam.

Cost per minute
$0.0240
All layers combined
Cost per call
$0.072
At 3 minutes
Monthly
$240
10,000 minutes
Annual
$2,879
At the same volume

Where the money goes

Speech to text$0.00480 20.0%
Billed on the full connected minute
LLM — prompt tokens$0.00400 16.7%
4,000 tokens/min (system prompt, tools and history re-sent each turn)
LLM — generated tokens$0.00051 2.1%
101 tokens/min from 75 spoken words
Text to speech$0.00619 25.8%
413 characters/min
Telephony$0.00850 35.4%
Billed on the full connected minute

Rates in this estimate

Como isso é calculado

Quatro camadas, cada uma cobrada em uma unidade diferente. Speech-to-text e telefonia já são por minuto. O modelo de linguagem é cobrado por milhão de tokens e o text-to-speech por mil caracteres, então ambos exigem conversão a partir de minutos — e são essas duas conversões que fazem a maioria das estimativas de custo de voz dar errado.

Duas das quatro camadas já são cobradas por minuto. As outras duas não são, e converter essas duas é onde as estimativas de custo de voz costumam errar:

spokenWords/min = wordsPerMinute × agentTalkShare
chars/min       = spokenWords/min × charactersPerWord
outTokens/min   = spokenWords/min × tokensPerWord

sttCost         = sttRatePerMinute                       (full connected minute)
llmInputCost    = inputTokensPerMinute × rateIn  / 1e6
llmOutputCost   = outTokens/min        × rateOut / 1e6
ttsCost         = (chars/min / 1000)   × ratePer1kChars
telephonyCost   = telephonyRatePerMinute                 (full connected minute)

total/min       = stt + llmInput + llmOutput + tts + telephony + platform

Speech-to-text e telefonia cobram o minuto conectado inteiro — o agente paga para ouvir tanto quanto para falar. Text-to-speech e tokens gerados só correm enquanto o agente está falando, o que, com uma participação de fala de 50%, dá cerca de 75 palavras por minuto.

Exemplo prático

Uma stack enxuta — Deepgram Nova-3 para transcrição, Claude Haiku 4.5, Aura-1 para a voz, Twilio de entrada — sai por cerca de $0.024 por minuto conectado: mais ou menos 7 centavos por uma chamada de três minutos, ou $240 por mês a 10.000 minutos. A divisão é telefonia 35%, text-to-speech 26%, speech-to-text 20%, tokens de prompt 17% e tokens gerados apenas 2%.

Troque por um modelo de fronteira e uma voz premium e a mesma chamada sai por cerca de $0.062 por minuto — e a forma se inverte. Os tokens de prompt passam a ser a maior linha, com 32%, text-to-speech 33%, telefonia cai para 23%. Qual camada vale otimizar depende inteiramente da stack que você realmente roda, e é por isso que esta ferramenta mostra a divisão em vez de só um total.

Por que os tokens de prompt dominam e os tokens gerados não

O resultado contraintuitivo em todas as configurações acima: os tokens que o agente gera são quase de graça, enquanto os tokens que ele custam dinheiro de verdade. Um minuto de fala do agente equivale a cerca de 100 tokens de saída. O system prompt, as definições de ferramentas e toda a conversa até ali são reenviados a cada turno, o que dá milhares de tokens de entrada por minuto. Essa proporção é a razão pela qual o cache de prompt mexe muito mais na conta do que trocar para um modelo mais barato — e por que um system prompt longo é um custo recorrente, não único.

O que isto não inclui

Aluguel de número de telefone, gravação e armazenamento, observabilidade e o tempo de engenharia para montar e manter uma stack de quatro fornecedores rodando. Uma plataforma gerenciada junta tudo isso em uma única tarifa por minuto — insira-a como taxa de plataforma para comparar igual com igual. As tarifas aqui são preços pay-as-you-go publicados; acordos de volume e de uso comprometido as alteram, em geral para baixo.

Os preços aparecem apenas em dólares americanos, porque todos os provedores modelados aqui publicam em dólares. Converter significaria inventar uma taxa de câmbio e apresentá-la como custo.

Last reviewed July 2026.

Perguntas frequentes

Quanto custa por minuto um agente de voice AI?
Às tarifas publicadas, um stack enxuto — Deepgram Nova-3, Claude Haiku 4.5, Aura-1 e Twilio de entrada — sai por cerca de $0.024 por minuto conectado, ou aproximadamente 7 centavos por uma ligação de três minutos. Um stack premium com um modelo de fronteira e uma voz de alto nível fica mais perto de $0.062 por minuto. Telefonia e text-to-speech costumam custar mais que o modelo de linguagem num stack enxuto, o que surpreende a maioria das pessoas.
Qual camada custa mais?
Depende do stack, e é justamente esse o ponto do detalhamento. Numa configuração barata, a telefonia é muitas vezes a maior linha isolada — cerca de 35% — enquanto os tokens gerados pelo modelo de linguagem mal chegam a 2%. Passe para um modelo de fronteira e uma voz premium e o equilíbrio se inverte: os tokens de prompt do LLM e o TTS ficam cada um com cerca de um terço. Otimizar a camada que já representa 2% da sua conta é esforço desperdiçado.
Por que os tokens de prompt são muito mais caros que os tokens gerados?
Porque o system prompt, as definições de ferramentas e toda a conversa até ali são reenviados a cada turno, enquanto o agente só gera as palavras que de fato fala. Um minuto de fala equivale a cerca de 75 palavras ditas pelo agente — algo como 100 tokens de saída — contra milhares de tokens de entrada por minuto. O prompt caching é a alavanca que importa aqui, não escolher um modelo mais barato.
Que premissas isso assume?
Que a fala corre a cerca de 150 palavras por minuto, que o agente fala metade da ligação, que uma palavra tem cerca de 5,5 caracteres e 1,35 token, e que cerca de 4.000 tokens de prompt são enviados por minuto de conversa. Todas as cinco são editáveis em "premissas de conversão" — a dos tokens de prompt é a que mais vale substituir por uma medição do seu próprio tráfego.
Por que os preços estão apenas em dólares?
Porque todos os provedores modelados aqui publicam os preços em dólares americanos. Converter para outra moeda significaria inventar uma taxa de câmbio e apresentá-la como custo, o que é pior do que mostrar dólares e deixar que você converta com uma taxa em que confia.
Essas são as tarifas que vou pagar de fato?
São as tarifas pay-as-you-go publicadas, verificadas na data indicada ao lado de cada uma. Compromissos de volume, contratos enterprise e planos anuais alteram todas elas, geralmente para baixo. As tarifas marcadas como de segunda mão vieram de reportagens de terceiros, não da página de preços do próprio fornecedor — confirme essas antes de tomar uma decisão de compra.
Isso inclui a plataforma que roda o agente?
Só se você adicionar uma. As quatro camadas de componentes são o que uma stack montada custa em infraestrutura bruta. Plataformas gerenciadas agrupam orquestração, telefonia, monitoramento e suporte em uma única tarifa por minuto — insira isso como taxa de plataforma para comparar em igualdade de condições, e lembre-se de que uma stack montada por você também carrega tempo de engenharia que este modelo não precifica.

Put this calculator on your site

Free to embed on any site, commercial or not. No signup, no API key, nothing to break when we ship changes — the embed always runs the current version.

<iframe src="https://www.hirefinn.ai/embed/tools/voice-ai-cost-calculator" title="Calculadora de custo de voice AI" width="100%" height="1000" style="border:1px solid #E7DFD0;border-radius:12px;max-width:100%" loading="lazy"></iframe>
<p style="font:14px/1.5 system-ui,sans-serif;margin:8px 0 0">Calculadora de custo de voice AI by <a href="https://www.hirefinn.ai/tools/voice-ai-cost-calculator">Finn</a></p>

The credit line sits outside the iframe on purpose: a link inside a frame belongs to the framed document and does nothing for the page hosting it. Keeping that line is the only thing we ask in return — remove it and the calculator still works.

Default frame height 1000px, responsive to full width.