Calculadora de latência de voz com IA
Defina cada etapa do pipeline e veja o intervalo que o interlocutor realmente percebe: do momento em que ele para de falar até o momento em que ouve uma resposta. A decomposição separa o que os seus fornecedores controlam do que você controla — e o maior item é quase sempre o segundo tipo.
Callers will talk over the agent and assume the line dropped.
Target is 800ms or better. Natural human turn gaps sit near 200ms.
Where the time goes
Fix this first
Endpointing silence is 39% of your budget at 600ms. The vendor pipeline — transcription, model and voice together — accounts for 920ms of the 1520ms total. Endpointing is a setting, not a vendor limit: dropping it is usually the cheapest win available, at the cost of occasionally cutting a caller off mid-pause.
Como isso é calculado
O intervalo percebido é a soma de cada etapa entre o fim da fala e o primeiro áudio: o silêncio que você aguarda antes de decidir que o interlocutor terminou, a finalização da transcrição, o primeiro token do modelo, o primeiro byte da voz, dois saltos de rede e o caminho da telefonia.
perceived gap = endpointing silence ← your setting
+ STT finalisation
+ LLM time to first token
+ TTS time to first byte
+ network RTT × 2 ← your region choice
+ telephony / jitter bufferPor que geralmente não é o modelo
Em uma configuração típica, o limiar de silêncio do endpointing é o maior item isolado — cerca de 600ms de um orçamento de aproximadamente 1.500ms, ou 40% de tudo o que o cliente espera. Não é um limite do fornecedor. É um número na sua configuração que decide por quanto tempo o sistema escuta o silêncio antes de concluir que o cliente terminou de falar, e as equipes passam semanas comparando modelos enquanto ele permanece num padrão que ninguém escolheu.
Encurtá-lo é o ganho mais barato disponível, e é um trade-off real, não algo de graça: corte demais e você interrompe quem faz uma pausa no meio da frase. A escolha de região é a outra alavanca nas suas mãos — a ida e volta na rede é contada duas vezes, então uma implantação entre regiões pode somar 400ms antes de qualquer fornecedor ter feito algo errado.
Como é o cenário bom
As pausas naturais de troca de turno entre humanos ficam perto de 200ms. Abaixo de 500ms, um agente parece imediato; abaixo de 800ms, soa como uma pausa normal. Passando de cerca de 1,2 segundo, os clientes começam a se repetir ou a falar por cima do agente, porque o silêncio soa como linha caída, não como reflexão. Um modelo de raciocínio a 1,4 segundo até o primeiro token consome o orçamento inteiro sozinho — e é por isso que esses modelos pertencem ao pós-chamada, resumindo e decidindo, e não ao turno ao vivo.
Os números por etapa aqui são faixas típicas publicadas ou observadas, não garantias. A latência real varia conforme região, carga, payload e condições de rede — meça a sua e use isto como um orçamento para projetar.
Last reviewed July 2026.
Perguntas frequentes
- Qual é uma boa latência para um agente de voz com IA?
- Abaixo de 800ms é confortável e abaixo de 500ms parece imediato — as pausas naturais de troca de turno entre humanos ficam em torno de 200ms. Passando de cerca de 1,2 segundo, os interlocutores começam a se repetir ou a falar por cima do agente, porque o silêncio soa como queda de ligação e não como pensamento.
- Por que meu agente de voz está lento se todo fornecedor promete baixa latência?
- Porque os números do fornecedor são só parte do orçamento. Numa configuração típica, o limiar de silêncio do endpointing — o tempo que você espera para ter certeza de que o interlocutor parou de falar — é o maior contribuinte isolado, muitas vezes 40% do total. É um ajuste do seu lado, não um limite do fornecedor, e nenhuma troca de modelo vai resolver isso.
- Como reduzo a latência do agente de voz?
- Por ordem de retorno: encurte o limiar de endpointing, implante na mesma região dos seus provedores, encurte o system prompt, faça streaming do texto para a fala em vez de esperar a resposta completa e só então considere um modelo mais rápido. Os dois primeiros são de graça e normalmente valem mais que todo o resto somado.
- O que é endpointing?
- Decidir quando o interlocutor terminou de falar. Espere demais e cada resposta parece arrastada; corte cedo demais e você interrompe quem faz uma pausa no meio da frase. É um trade-off legítimo, não um bug — mas é um trade-off que a maioria das equipes nunca faz de forma consciente, deixando o padrão de fábrica no lugar e culpando o modelo.
- Faz sentido usar um modelo de raciocínio para voz?
- Raramente no caminho crítico. Um modelo que leva 1,4 segundo até o primeiro token estoura o orçamento inteiro sozinho. Modelos de raciocínio se encaixam melhor depois da chamada — resumindo, extraindo, decidindo próximas ações — enquanto o turno ao vivo roda em algo feito para tempo até o primeiro token.
Put this calculator on your site
Free to embed on any site, commercial or not. No signup, no API key, nothing to break when we ship changes — the embed always runs the current version.
<iframe src="https://www.hirefinn.ai/embed/tools/voice-latency-calculator" title="Calculadora de latência de voz com IA" width="100%" height="900" style="border:1px solid #E7DFD0;border-radius:12px;max-width:100%" loading="lazy"></iframe> <p style="font:14px/1.5 system-ui,sans-serif;margin:8px 0 0">Calculadora de latência de voz com IA by <a href="https://www.hirefinn.ai/tools/voice-latency-calculator">Finn</a></p>
The credit line sits outside the iframe on purpose: a link inside a frame belongs to the framed document and does nothing for the page hosting it. Keeping that line is the only thing we ask in return — remove it and the calculator still works.
Default frame height 900px, responsive to full width.
Leitura relacionada
Dimensionar a equipe para a fila é uma opção. Atendê-la com IA é outra.
Finn atende chamadas receptivas e ativas com tarifas por minuto, sem shrinkage e sem teto de occupancy para planejar. Agende uma demonstração e rodamos o cálculo com o seu próprio volume.