Skip to main content

Benchmarks de latência em voice AI: o que significa sub-second

Todo fornecedor de voice AI anuncia um número de latência. A Vapi diz 500ms. A Retell diz 800ms.

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat
July 26, 2026
5 min read
Um cronômetro dourado em branco sob arcos ondulados verdes e âmbar, ao lado de uma escada cor de pêssego sob a luz do sol

Todo fornecedor de voice AI anuncia um número de latência. A Vapi diz ~500ms. A Retell diz ~800ms. A Synthflow aponta para um blog da Deepgram com ~300ms de STT. O detalhe: nenhum desses números descreve o que a pessoa do outro lado da linha realmente ouve.

Passamos seis semanas rodando um ambiente de teste aberto contra cinco plataformas de voz em produção — Retell, Vapi, Synthflow, Deepgram Voice Agent e Finn — em rotas US-East, EU-West e Índia. Este post publica os números de P50/P90/P99, uma metodologia que você mesmo pode repetir e as partes do pipeline que os fornecedores discretamente deixam de fora dos gráficos de marketing.

Por que "latência" é o número errado

Quando um fornecedor divulga latency: 500ms, quase sempre está falando do TTFB — o tempo entre o fim da fala do usuário e o primeiro byte de áudio emitido pelo TTS. É um número útil para engenharia. Não é o que o usuário percebe.

O que o usuário percebe é o atraso na troca de turno: o silêncio entre o momento em que ele para de falar e o momento em que ele ouve o agente falando. Esse número inclui:

  • Atraso de endpointing — quanto tempo o VAD espera antes de decidir que você terminou (normalmente 200–600ms de silêncio deliberado).
  • Buffer de jitter de rede na perna SIP/WebRTC (40–120ms).
  • Do primeiro byte do TTS ao TTS reproduzível — o primeiro chunk precisa ser grande o bastante para uma reprodução resistente a jitter.
  • Recuperação de barge-in quando o usuário interrompe no meio da resposta.

Uma plataforma que publica 500ms de TTFB, mas usa 600ms de endpointing, produz um atraso percebido de troca de turno acima de 1.2s. Outro fornecedor que anuncia 800ms, porém com endpointing semântico agressivo de 150ms, parece bem mais rápido na ligação. Números de marketing e números percebidos por humanos não estão no mesmo eixo.

Regra prática vinda da pesquisa de CX: abaixo de 800ms, a troca de turno percebida soa conversacional. Entre 800 e 1200ms, soa "IA, mas tolerável". Acima de 1.2s, quem liga começa a falar por cima do agente.

Anatomia de uma requisição de voice AI

Este é o pipeline completo de um único turno, com o orçamento mediano que medimos nas cinco plataformas em 2026:

EtapaO que aconteceMediana (ms)P90 (ms)
Ingresso SIP/WebRTCO frame de áudio chega ao media server2060
VAD + endpointingDetectar o fim da fala do usuário280520
Finalização do STTForçar o fechamento da transcrição parcial90180
TTFT do LLMPrimeiro token do modelo320780
Repasse LLM → TTSFronteira de frase + início do stream40120
Primeiro byte do TTSPrimeiro chunk de áudio emitido180410
TTS → reproduzívelBuffer suficiente para iniciar com segurança60140
Buffer de jitter de saídaSuavização do lado da operadora50110
Total percebidoFim da fala → primeiro áudio ouvido~1040~2320

As duas etapas em que os fornecedores mais competem — TTFT do LLM e primeiro byte do TTS — representam apenas ~48% do orçamento mediano. Endpointing e acúmulo de jitter dominam a cauda.

A tabela de benchmarks de 2026 — medida, não anunciada

Todos os números abaixo são atraso percebido de troca de turno, com quem liga em US-East → região padrão do fornecedor, registrados ao longo de 500 turnos por plataforma em um roteiro fixo de 8 turnos de agendamento. Hardware: Mac mini M4, com ponte PSTN por um número da Twilio Programmable Voice, gravações analisadas com nosso script aberto (link no repositório abaixo). Metodologia completa na próxima seção.

PlataformaAnunciadoP50 medidoP90 medidoP99 medidoRecuperação de barge-in
Retell~800ms118017402680410ms
Vapi (padrão)~500ms102016202510380ms
Vapi (STT/LLM customizados)88014102240360ms
Synthflow~600ms124019803120520ms
Deepgram Voice Agent~300ms STT94014802390290ms
Finn82012901980240ms

Conclusões que a maioria dos benchmarks de fornecedores enterra:

  1. O P90 de cada plataforma é cerca de 1.5–2× o seu P50. Se você só olha médias, os 10% piores das suas ligações parecem outro produto.
  2. O P99 sempre passa de 2 segundos. É na latência de cauda que os usuários desligam.
  3. A recuperação de barge-in — a rapidez com que o agente se cala ao ser interrompido — varia em 2×. Esse único número gera mais reclamações de "ligação ruim" do que o TTFB.

Como reproduzir esses números

O ambiente de teste é propositalmente sem graça. Nada de gerador de carga proprietário nem de SIP sintético — um número de telefone real ligando para um agente real, com uma montagem de marcação de tempo por loopback de microfone.

Perguntas frequentes

O que latência sub-second significa de fato?
Depende do que está sendo medido. Tempo de inferência do modelo, tempo até o primeiro áudio e latência boca-a-ouvido são três números diferentes, e só o último é o que quem liga experimenta.

Qual número de latência devo cobrar de um fornecedor?
Boca-a-ouvido em uma ligação real por uma operadora real, medido na cauda e não na média. Uma boa média com um p95 ruim significa que uma ligação em cada vinte fica inutilizável.

Por que a latência piorou em produção em relação aos testes?
Normalmente é o caminho de rede. Uma demo em conexão local pula a perna da operadora e o salto de região que as ligações em produção pagam.

Relacionado: Voice.ai vs. voice AI: o que você realmente precisa

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat

Fundador, Finn AI

Digvijay está construindo a Finn — a camada de orquestração de voz corporativa que raciocina durante as chamadas, extrai dados e atualiza seus sistemas em tempo real. Escreve sobre voice AI, go-to-market e o que é preciso para colocar agentes autônomos em produção em escala.