Skip to main content

Latência VoIP aceitável para agentes de voz

A ITU-T G.114 coloca a latência conversacional em 150ms em um sentido. Um agente de voz precisa pensar dentro desse orçamento.

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat
July 28, 2026
4 min read
Um cronômetro de latão sobre um pedestal cor de pêssego, com um aro de cerâmica verde e esferas rosas flutuando

Latência VoIP é o atraso entre alguém falar e a outra parte ouvir. A Recomendação ITU-T G.114 fixa o teto de uma conversa normal em 150 milissegundos em um sentido — passando disso, mais ou menos, as pessoas começam a falar por cima umas das outras.

Para um agente de voz com IA o orçamento é ainda mais apertado, porque o agente precisa pensar dentro dele.

Para onde vão os milissegundos

Numa ligação entre pessoas, latência é transporte: pacotização, trânsito na rede, buffer de jitter e reprodução. Um caminho VoIP bem cuidado fica folgadamente dentro da G.114.

Um agente de voz acrescenta uma pilha de processamento entre os dois trechos de transporte dos humanos:

  • Captura e codificação do áudio de quem liga
  • Reconhecimento de fala, que só termina quando quem liga para de falar
  • Endpointing — decidir que a pessoa realmente parou, o que é um palpite e custa tempo
  • O modelo gerando uma resposta
  • Síntese de voz produzindo áudio
  • Transporte de volta até quem liga

Cada etapa é pequena. A soma não é. E as partes não se somam do jeito que um diagrama de arquitetura sugere, porque uma delas domina de um modo fácil de não perceber.

O tempo até o primeiro áudio é o número que importa

Tempo total de processamento é a métrica errada. O que quem liga sente é o intervalo antes de ouvir qualquer coisa.

Um agente que leva 900ms para produzir uma resposta completa mas começa a falar aos 300ms parece responsivo. Outro que leva 600ms no total mas não diz nada até os 600ms parece lento. O streaming muda a latência percebida muito mais do que a velocidade bruta, e é por isso que correr atrás de um modelo mais rápido costuma decepcionar enquanto fatiar a resposta ajuda na hora.

É também por isso que o endpointing fica no caminho crítico. Cada milissegundo gasto decidindo que quem liga terminou é um milissegundo antes que qualquer outra coisa possa começar. Endpointing agressivo corta latência e interrompe as pessoas; endpointing conservador é educado e lento.

O orçamento na prática

De trás para frente, partindo da sensação de conversa:

  • Abaixo de ~800ms o boca a ouvido soa natural
  • De 800ms a 1,2s dá para perceber, mas é tolerável
  • Acima de ~1,2s quem liga começa a falar por cima do agente, e cada colisão custa um turno de reparo

Diante disso, só o transporte em uma ligação nacional pode consumir de 80 a 150ms de ida e volta. O internacional acrescenta mais, e não é opcional — a física impõe um piso. Um pipeline que roteia áudio para uma região distante gasta boa parte do orçamento antes de qualquer processamento começar, o que costuma explicar por que uma demo instantânea nos testes fica arrastada em produção.

A calculadora de latência de voz soma as etapas para você ver qual delas está de fato consumindo seu orçamento, em vez de supor que é o modelo.

Medindo com honestidade

Meça boca a ouvido em uma ligação real por uma operadora real. O tempo de inferência do modelo isolado não é latência; é uma parcela da soma, e normalmente não a maior.

Meça a cauda, não a média. Um pipeline com média de 700ms e p95 de 2 segundos não é um pipeline de 700ms — uma ligação em cada vinte fica inutilizável, e são justamente essas que as pessoas lembram.

Veja também latência de voz para os termos individuais.

Perguntas frequentes

Qual é uma latência aceitável para VoIP? A ITU-T G.114 recomenda manter o atraso em um sentido abaixo de 150ms para uma conversa normal. Agentes de voz precisam de um orçamento mais apertado porque o processamento cabe dentro da mesma janela.

Por que meu agente de voz parece lento se o modelo é rápido? Geralmente é endpointing e tempo até o primeiro áudio, não inferência. Se o agente espera terminar de gerar antes de falar, quem liga ouve o pipeline inteiro em vez do começo de uma frase.

Jitter importa tanto quanto latência? Importa de outro jeito. O jitter é absorvido por um buffer, e esse buffer por si só acrescenta atraso — então reduzir jitter pode reduzir latência indiretamente.

500ms são suficientes? Para boca a ouvido, geralmente sim. Abaixo de uns 800ms soa conversacional; os problemas começam depois de mais ou menos 1,2 segundo.

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat

Fundador, Finn AI

Digvijay está construindo a Finn — a camada de orquestração de voz corporativa que raciocina durante as chamadas, extrai dados e atualiza seus sistemas em tempo real. Escreve sobre voice AI, go-to-market e o que é preciso para colocar agentes autônomos em produção em escala.