La latencia VoIP es el retardo entre que alguien habla y la otra parte lo escucha. La Recomendación ITU-T G.114 fija el techo para una conversación normal en 150 milisegundos en un sentido: a partir de ahí, aproximadamente, la gente empieza a pisarse al hablar.
Para un agente de voz con IA el presupuesto es aún más ajustado, porque el agente tiene que pensar dentro de él.
Adónde van los milisegundos
En una llamada entre personas, la latencia es transporte: paquetización, tránsito por la red, búfer de jitter y reproducción. Una ruta VoIP bien gestionada se mantiene holgadamente dentro de G.114.
Un agente de voz añade una pila de procesamiento entre el transporte de las dos personas:
- Captura y codificación del audio de quien llama
- Reconocimiento de voz, que no puede terminar hasta que quien llama deja de hablar
- Detección de fin de turno: decidir que ha dejado de hablar, lo cual es una suposición y tiene un coste
- El modelo generando una respuesta
- Síntesis de voz produciendo audio
- Transporte de vuelta hacia quien llama
Cada paso es pequeño. La suma no lo es. Y las partes no se suman como sugiere un diagrama de arquitectura, porque una de ellas domina de un modo que es fácil pasar por alto.
El tiempo hasta el primer audio es la cifra que importa
El tiempo total de procesamiento es la métrica equivocada. Lo que experimenta quien llama es el silencio previo a escuchar cualquier cosa.
Un agente que tarda 900ms en producir una respuesta completa pero empieza a hablar a los 300ms se percibe como ágil. Otro que tarda 600ms en total pero no dice nada hasta los 600ms se percibe como lento. El streaming cambia la latencia percibida mucho más que la velocidad bruta, y por eso perseguir un modelo más rápido suele decepcionar mientras que trocear la respuesta ayuda de inmediato.
Esta es también la razón por la que la detección de fin de turno está en la ruta crítica. Cada milisegundo dedicado a decidir que quien llama ha terminado es un milisegundo antes de que pueda empezar cualquier otra cosa. Una detección agresiva recorta latencia e interrumpe a la gente; una detección conservadora es educada y lenta.
El presupuesto en la práctica
Partiendo de lo que se siente conversacional y yendo hacia atrás:
- Por debajo de ~800ms el trayecto boca-oído se percibe como natural
- De 800ms a 1,2s se nota, pero es tolerable
- Más allá de ~1,2s quien llama empieza a pisar al agente, y cada colisión cuesta un turno de reparación
Frente a eso, solo el transporte en una llamada nacional puede consumir de 80 a 150ms de ida y vuelta. Las llamadas internacionales añaden más, y no es opcional: la física impone un mínimo. Un pipeline que enruta el audio a una región lejana gasta buena parte del presupuesto antes de que empiece cualquier procesamiento, que es el motivo habitual de que una demo instantánea en pruebas se sienta pesada en producción.
La calculadora de latencia de voz suma las etapas para que veas cuál se está gastando realmente tu presupuesto, en lugar de dar por supuesto que es el modelo.
Medirlo con honestidad
Mide boca-oído en una llamada real sobre un operador real. El tiempo de inferencia del modelo aislado no es latencia; es un sumando más, y normalmente no el mayor.
Mide la cola, no la media. Un pipeline con una media de 700ms y un p95 de 2 segundos no es un pipeline de 700ms: una llamada de cada veinte es inservible, y esas son las llamadas que la gente recuerda.
Consulta también latencia de voz para los términos concretos.
Preguntas frecuentes
¿Cuál es una latencia aceptable para VoIP? La ITU-T G.114 recomienda mantener el retardo en un sentido por debajo de 150ms para una conversación normal. Los agentes de voz necesitan un presupuesto más ajustado porque el procesamiento se sitúa dentro de esa misma ventana.
¿Por qué mi agente de voz parece lento si el modelo es rápido? Normalmente por la detección de fin de turno y el tiempo hasta el primer audio, más que por la inferencia. Si el agente espera a terminar de generar antes de hablar, quien llama escucha el pipeline entero en lugar del comienzo de una frase.
¿Importa el jitter tanto como la latencia? Importa de otra manera. El jitter lo absorbe un búfer, y ese búfer añade retardo por sí mismo, así que reducir el jitter puede reducir la latencia de forma indirecta.
¿Bastan 500ms? Para boca-oído, normalmente sí. Por debajo de unos 800ms se percibe como conversacional; los problemas empiezan pasados aproximadamente 1,2 segundos.




