Calculadora de custo de voice AI
Escolha um motor de speech-to-text, um modelo de linguagem, uma voz e um provedor de telefonia. Cada tarifa abaixo vem da própria tabela de preços publicada do provedor, com a data em que foi verificada. O detalhamento mostra qual camada realmente puxa sua conta — raramente é a que as pessoas imaginam.
Where the money goes
Rates in this estimate
- Deepgram Nova-3 (streaming)verified 2026-07-26
- Claude Haiku 4.5verified 2026-07-26
- Deepgram Aura-1verified 2026-07-26
- Twilio inbound (US local)verified 2026-07-26
Como isso é calculado
Quatro camadas, cada uma cobrada em uma unidade diferente. Speech-to-text e telefonia já são por minuto. O modelo de linguagem é cobrado por milhão de tokens e o text-to-speech por mil caracteres, então ambos exigem conversão a partir de minutos — e são essas duas conversões que fazem a maioria das estimativas de custo de voz dar errado.
Duas das quatro camadas já são cobradas por minuto. As outras duas não são, e converter essas duas é onde as estimativas de custo de voz costumam errar:
spokenWords/min = wordsPerMinute × agentTalkShare chars/min = spokenWords/min × charactersPerWord outTokens/min = spokenWords/min × tokensPerWord sttCost = sttRatePerMinute (full connected minute) llmInputCost = inputTokensPerMinute × rateIn / 1e6 llmOutputCost = outTokens/min × rateOut / 1e6 ttsCost = (chars/min / 1000) × ratePer1kChars telephonyCost = telephonyRatePerMinute (full connected minute) total/min = stt + llmInput + llmOutput + tts + telephony + platform
Speech-to-text e telefonia cobram o minuto conectado inteiro — o agente paga para ouvir tanto quanto para falar. Text-to-speech e tokens gerados só correm enquanto o agente está falando, o que, com uma participação de fala de 50%, dá cerca de 75 palavras por minuto.
Exemplo prático
Uma stack enxuta — Deepgram Nova-3 para transcrição, Claude Haiku 4.5, Aura-1 para a voz, Twilio de entrada — sai por cerca de $0.024 por minuto conectado: mais ou menos 7 centavos por uma chamada de três minutos, ou $240 por mês a 10.000 minutos. A divisão é telefonia 35%, text-to-speech 26%, speech-to-text 20%, tokens de prompt 17% e tokens gerados apenas 2%.
Troque por um modelo de fronteira e uma voz premium e a mesma chamada sai por cerca de $0.062 por minuto — e a forma se inverte. Os tokens de prompt passam a ser a maior linha, com 32%, text-to-speech 33%, telefonia cai para 23%. Qual camada vale otimizar depende inteiramente da stack que você realmente roda, e é por isso que esta ferramenta mostra a divisão em vez de só um total.
Por que os tokens de prompt dominam e os tokens gerados não
O resultado contraintuitivo em todas as configurações acima: os tokens que o agente gera são quase de graça, enquanto os tokens que ele lê custam dinheiro de verdade. Um minuto de fala do agente equivale a cerca de 100 tokens de saída. O system prompt, as definições de ferramentas e toda a conversa até ali são reenviados a cada turno, o que dá milhares de tokens de entrada por minuto. Essa proporção é a razão pela qual o cache de prompt mexe muito mais na conta do que trocar para um modelo mais barato — e por que um system prompt longo é um custo recorrente, não único.
O que isto não inclui
Aluguel de número de telefone, gravação e armazenamento, observabilidade e o tempo de engenharia para montar e manter uma stack de quatro fornecedores rodando. Uma plataforma gerenciada junta tudo isso em uma única tarifa por minuto — insira-a como taxa de plataforma para comparar igual com igual. As tarifas aqui são preços pay-as-you-go publicados; acordos de volume e de uso comprometido as alteram, em geral para baixo.
Os preços aparecem apenas em dólares americanos, porque todos os provedores modelados aqui publicam em dólares. Converter significaria inventar uma taxa de câmbio e apresentá-la como custo.
Last reviewed July 2026.
Perguntas frequentes
- Quanto custa por minuto um agente de voice AI?
- Às tarifas publicadas, um stack enxuto — Deepgram Nova-3, Claude Haiku 4.5, Aura-1 e Twilio de entrada — sai por cerca de $0.024 por minuto conectado, ou aproximadamente 7 centavos por uma ligação de três minutos. Um stack premium com um modelo de fronteira e uma voz de alto nível fica mais perto de $0.062 por minuto. Telefonia e text-to-speech costumam custar mais que o modelo de linguagem num stack enxuto, o que surpreende a maioria das pessoas.
- Qual camada custa mais?
- Depende do stack, e é justamente esse o ponto do detalhamento. Numa configuração barata, a telefonia é muitas vezes a maior linha isolada — cerca de 35% — enquanto os tokens gerados pelo modelo de linguagem mal chegam a 2%. Passe para um modelo de fronteira e uma voz premium e o equilíbrio se inverte: os tokens de prompt do LLM e o TTS ficam cada um com cerca de um terço. Otimizar a camada que já representa 2% da sua conta é esforço desperdiçado.
- Por que os tokens de prompt são muito mais caros que os tokens gerados?
- Porque o system prompt, as definições de ferramentas e toda a conversa até ali são reenviados a cada turno, enquanto o agente só gera as palavras que de fato fala. Um minuto de fala equivale a cerca de 75 palavras ditas pelo agente — algo como 100 tokens de saída — contra milhares de tokens de entrada por minuto. O prompt caching é a alavanca que importa aqui, não escolher um modelo mais barato.
- Que premissas isso assume?
- Que a fala corre a cerca de 150 palavras por minuto, que o agente fala metade da ligação, que uma palavra tem cerca de 5,5 caracteres e 1,35 token, e que cerca de 4.000 tokens de prompt são enviados por minuto de conversa. Todas as cinco são editáveis em "premissas de conversão" — a dos tokens de prompt é a que mais vale substituir por uma medição do seu próprio tráfego.
- Por que os preços estão apenas em dólares?
- Porque todos os provedores modelados aqui publicam os preços em dólares americanos. Converter para outra moeda significaria inventar uma taxa de câmbio e apresentá-la como custo, o que é pior do que mostrar dólares e deixar que você converta com uma taxa em que confia.
- Essas são as tarifas que vou pagar de fato?
- São as tarifas pay-as-you-go publicadas, verificadas na data indicada ao lado de cada uma. Compromissos de volume, contratos enterprise e planos anuais alteram todas elas, geralmente para baixo. As tarifas marcadas como de segunda mão vieram de reportagens de terceiros, não da página de preços do próprio fornecedor — confirme essas antes de tomar uma decisão de compra.
- Isso inclui a plataforma que roda o agente?
- Só se você adicionar uma. As quatro camadas de componentes são o que uma stack montada custa em infraestrutura bruta. Plataformas gerenciadas agrupam orquestração, telefonia, monitoramento e suporte em uma única tarifa por minuto — insira isso como taxa de plataforma para comparar em igualdade de condições, e lembre-se de que uma stack montada por você também carrega tempo de engenharia que este modelo não precifica.
Put this calculator on your site
Free to embed on any site, commercial or not. No signup, no API key, nothing to break when we ship changes — the embed always runs the current version.
<iframe src="https://www.hirefinn.ai/embed/tools/voice-ai-cost-calculator" title="Calculadora de custo de voice AI" width="100%" height="1000" style="border:1px solid #E7DFD0;border-radius:12px;max-width:100%" loading="lazy"></iframe> <p style="font:14px/1.5 system-ui,sans-serif;margin:8px 0 0">Calculadora de custo de voice AI by <a href="https://www.hirefinn.ai/tools/voice-ai-cost-calculator">Finn</a></p>
The credit line sits outside the iframe on purpose: a link inside a frame belongs to the framed document and does nothing for the page hosting it. Keeping that line is the only thing we ask in return — remove it and the calculator still works.
Default frame height 1000px, responsive to full width.
Leitura relacionada
Dimensionar a equipe para a fila é uma opção. Atendê-la com IA é outra.
Finn atende chamadas receptivas e ativas com tarifas por minuto, sem shrinkage e sem teto de occupancy para planejar. Agende uma demonstração e rodamos o cálculo com o seu próprio volume.