Todo fornecedor de voice AI anuncia um número de latência. A Vapi diz ~500ms. A Retell diz ~800ms. A Synthflow aponta para um blog da Deepgram com ~300ms de STT. O detalhe: nenhum desses números descreve o que a pessoa do outro lado da linha realmente ouve.
Passamos seis semanas rodando um ambiente de teste aberto contra cinco plataformas de voz em produção — Retell, Vapi, Synthflow, Deepgram Voice Agent e Finn — em rotas US-East, EU-West e Índia. Este post publica os números de P50/P90/P99, uma metodologia que você mesmo pode repetir e as partes do pipeline que os fornecedores discretamente deixam de fora dos gráficos de marketing.
Por que "latência" é o número errado
Quando um fornecedor divulga latency: 500ms, quase sempre está falando do TTFB — o tempo entre o fim da fala do usuário e o primeiro byte de áudio emitido pelo TTS. É um número útil para engenharia. Não é o que o usuário percebe.
O que o usuário percebe é o atraso na troca de turno: o silêncio entre o momento em que ele para de falar e o momento em que ele ouve o agente falando. Esse número inclui:
- Atraso de endpointing — quanto tempo o VAD espera antes de decidir que você terminou (normalmente 200–600ms de silêncio deliberado).
- Buffer de jitter de rede na perna SIP/WebRTC (40–120ms).
- Do primeiro byte do TTS ao TTS reproduzível — o primeiro chunk precisa ser grande o bastante para uma reprodução resistente a jitter.
- Recuperação de barge-in quando o usuário interrompe no meio da resposta.
Uma plataforma que publica 500ms de TTFB, mas usa 600ms de endpointing, produz um atraso percebido de troca de turno acima de 1.2s. Outro fornecedor que anuncia 800ms, porém com endpointing semântico agressivo de 150ms, parece bem mais rápido na ligação. Números de marketing e números percebidos por humanos não estão no mesmo eixo.
Regra prática vinda da pesquisa de CX: abaixo de 800ms, a troca de turno percebida soa conversacional. Entre 800 e 1200ms, soa "IA, mas tolerável". Acima de 1.2s, quem liga começa a falar por cima do agente.
Anatomia de uma requisição de voice AI
Este é o pipeline completo de um único turno, com o orçamento mediano que medimos nas cinco plataformas em 2026:
| Etapa | O que acontece | Mediana (ms) | P90 (ms) |
|---|---|---|---|
| Ingresso SIP/WebRTC | O frame de áudio chega ao media server | 20 | 60 |
| VAD + endpointing | Detectar o fim da fala do usuário | 280 | 520 |
| Finalização do STT | Forçar o fechamento da transcrição parcial | 90 | 180 |
| TTFT do LLM | Primeiro token do modelo | 320 | 780 |
| Repasse LLM → TTS | Fronteira de frase + início do stream | 40 | 120 |
| Primeiro byte do TTS | Primeiro chunk de áudio emitido | 180 | 410 |
| TTS → reproduzível | Buffer suficiente para iniciar com segurança | 60 | 140 |
| Buffer de jitter de saída | Suavização do lado da operadora | 50 | 110 |
| Total percebido | Fim da fala → primeiro áudio ouvido | ~1040 | ~2320 |
As duas etapas em que os fornecedores mais competem — TTFT do LLM e primeiro byte do TTS — representam apenas ~48% do orçamento mediano. Endpointing e acúmulo de jitter dominam a cauda.
A tabela de benchmarks de 2026 — medida, não anunciada
Todos os números abaixo são atraso percebido de troca de turno, com quem liga em US-East → região padrão do fornecedor, registrados ao longo de 500 turnos por plataforma em um roteiro fixo de 8 turnos de agendamento. Hardware: Mac mini M4, com ponte PSTN por um número da Twilio Programmable Voice, gravações analisadas com nosso script aberto (link no repositório abaixo). Metodologia completa na próxima seção.
| Plataforma | Anunciado | P50 medido | P90 medido | P99 medido | Recuperação de barge-in |
|---|---|---|---|---|---|
| Retell | ~800ms | 1180 | 1740 | 2680 | 410ms |
| Vapi (padrão) | ~500ms | 1020 | 1620 | 2510 | 380ms |
| Vapi (STT/LLM customizados) | — | 880 | 1410 | 2240 | 360ms |
| Synthflow | ~600ms | 1240 | 1980 | 3120 | 520ms |
| Deepgram Voice Agent | ~300ms STT | 940 | 1480 | 2390 | 290ms |
| Finn | — | 820 | 1290 | 1980 | 240ms |
Conclusões que a maioria dos benchmarks de fornecedores enterra:
- O P90 de cada plataforma é cerca de 1.5–2× o seu P50. Se você só olha médias, os 10% piores das suas ligações parecem outro produto.
- O P99 sempre passa de 2 segundos. É na latência de cauda que os usuários desligam.
- A recuperação de barge-in — a rapidez com que o agente se cala ao ser interrompido — varia em 2×. Esse único número gera mais reclamações de "ligação ruim" do que o TTFB.
Como reproduzir esses números
O ambiente de teste é propositalmente sem graça. Nada de gerador de carga proprietário nem de SIP sintético — um número de telefone real ligando para um agente real, com uma montagem de marcação de tempo por loopback de microfone.
Perguntas frequentes
O que latência sub-second significa de fato?
Depende do que está sendo medido. Tempo de inferência do modelo, tempo até o primeiro áudio e latência boca-a-ouvido são três números diferentes, e só o último é o que quem liga experimenta.
Qual número de latência devo cobrar de um fornecedor?
Boca-a-ouvido em uma ligação real por uma operadora real, medido na cauda e não na média. Uma boa média com um p95 ruim significa que uma ligação em cada vinte fica inutilizável.
Por que a latência piorou em produção em relação aos testes?
Normalmente é o caminho de rede. Uma demo em conexão local pula a perna da operadora e o salto de região que as ligações em produção pagam.
Relacionado: Voice.ai vs. voice AI: o que você realmente precisa




