Skip to main content

Calculadora de latencia de voz con IA

Ajusta cada etapa del pipeline y mira la pausa que el interlocutor percibe realmente: desde que deja de hablar hasta que oye una respuesta. El desglose separa lo que controlan tus proveedores de lo que controlas tú — y el elemento mayor casi siempre es del segundo tipo.

Perceived response gap
1520ms

Callers will talk over the agent and assume the line dropped.

Target is 800ms or better. Natural human turn gaps sit near 200ms.

Where the time goes

Endpointing silenceyours to tune600ms 39%
How long the system waits to be sure the caller has finished. Yours to tune, and usually the biggest single item.
Speech to text150ms 10%
End of speech to a final transcript. Streaming engines have most of it already.
LLM first token400ms 26%
Time to first token. Prompt length and reasoning depth both push this up.
Text to speech150ms 10%
First token to first audio byte. Streaming TTS starts speaking before the sentence is complete.
Network round tripsyours to tune120ms 8%
Two hops at the round-trip time you entered. Region choice moves this more than anything else.
Telephony and jitter buffer100ms 7%
Carrier path and buffering. Largely fixed unless you change carrier or codec.

Fix this first

Endpointing silence is 39% of your budget at 600ms. The vendor pipeline — transcription, model and voice together — accounts for 920ms of the 1520ms total. Endpointing is a setting, not a vendor limit: dropping it is usually the cheapest win available, at the cost of occasionally cutting a caller off mid-pause.

Cómo se calcula

La brecha percibida es la suma de todas las etapas entre el fin del habla y el primer audio: el silencio que esperas antes de decidir que quien llama ha terminado, la finalización de la transcripción, el primer token del modelo, el primer byte de la voz, dos saltos de red y la ruta de telefonía.

perceived gap = endpointing silence      ← your setting
              + STT finalisation
              + LLM time to first token
              + TTS time to first byte
              + network RTT × 2           ← your region choice
              + telephony / jitter buffer

Por qué normalmente no es el modelo

En una configuración típica, el umbral de silencio del endpointing es el elemento más grande de todos: unos 600ms de un presupuesto de aproximadamente 1.500ms, es decir, el 40% de todo lo que el interlocutor espera. No es un límite del proveedor. Es un número en tu configuración que decide cuánto tiempo escucha el sistema el silencio antes de concluir que la persona ha terminado de hablar, y hay equipos que se pasan semanas comparando modelos mientras ese valor sigue en un ajuste por defecto que nadie eligió.

Acortarlo es la mejora más barata disponible, y es una verdadera concesión, no algo gratis: si lo recortas demasiado, interrumpes a quien haga una pausa a mitad de frase. La elección de región es la otra palanca que está en tus manos: el viaje de ida y vuelta por la red se cuenta dos veces, así que un despliegue en otra región puede añadir 400ms antes de que ningún proveedor haya hecho nada mal.

Qué es un buen resultado

Las pausas naturales al alternar turnos entre personas rondan los 200ms. Por debajo de 500ms, un agente se percibe como inmediato; por debajo de 800ms se lee como una pausa normal. Pasado alrededor de 1,2 segundos, quien llama empieza a repetirse o a hablar por encima del agente, porque el silencio se interpreta como una línea cortada y no como reflexión. Un modelo de razonamiento con 1,4 segundos hasta el primer token se lleva el presupuesto entero él solo, y por eso ese tipo de modelos van después de la llamada, resumiendo y decidiendo, no en el turno en vivo.

Las cifras por etapa que aparecen aquí son rangos típicos publicados u observados, no garantías. La latencia real varía según la región, la carga, el tamaño del payload y las condiciones de red: mide la tuya y usa esto como un presupuesto con el que diseñar.

Last reviewed July 2026.

Preguntas frecuentes

¿Qué latencia es buena para un agente de voz con IA?
Por debajo de 800 ms resulta cómodo y por debajo de 500 ms resulta inmediato: las pausas naturales de los turnos de habla humanos rondan los 200 ms. Pasado alrededor de 1,2 segundos, quienes llaman empiezan a repetirse o a hablar por encima del agente, porque el silencio se interpreta como una llamada caída y no como una pausa para pensar.
¿Por qué mi agente de voz es lento si todos los proveedores dicen tener baja latencia?
Porque las cifras del proveedor son solo una parte del presupuesto. En una configuración típica, el umbral de silencio del endpointing —el tiempo que esperas para asegurarte de que quien llama ha dejado de hablar— es el mayor contribuyente individual, a menudo el 40% del total. Es un ajuste de tu lado, no un límite del proveedor, y por mucho que cambies de modelo no lo vas a arreglar.
¿Cómo reduzco la latencia de un agente de voz?
Por orden de rendimiento: acorta el umbral de endpointing, despliega en la misma región que tus proveedores, acorta el system prompt, transmite el texto a la síntesis de voz en streaming en lugar de esperar a una respuesta completa y solo entonces plantéate un modelo más rápido. Las dos primeras son gratis y suelen valer más que todas las demás juntas.
¿Qué es el endpointing?
Decidir cuándo ha terminado de hablar quien llama. Espera demasiado y cada respuesta se siente lenta; corta demasiado pronto e interrumpes a cualquiera que haga una pausa a mitad de frase. Es una disyuntiva real, no un fallo, pero es una disyuntiva que la mayoría de los equipos nunca asume de forma consciente: dejan el valor por defecto y culpan al modelo.
¿Tiene sentido un modelo de razonamiento para voz?
Rara vez en la ruta crítica. Un modelo que tarda 1,4 segundos en dar el primer token se lleva por delante todo el presupuesto. Los modelos de razonamiento encajan mejor después de la llamada —resumir, extraer, decidir los siguientes pasos—, mientras que el turno en vivo se ejecuta sobre algo diseñado para el tiempo hasta el primer token.

Put this calculator on your site

Free to embed on any site, commercial or not. No signup, no API key, nothing to break when we ship changes — the embed always runs the current version.

<iframe src="https://www.hirefinn.ai/embed/tools/voice-latency-calculator" title="Calculadora de latencia de voz con IA" width="100%" height="900" style="border:1px solid #E7DFD0;border-radius:12px;max-width:100%" loading="lazy"></iframe>
<p style="font:14px/1.5 system-ui,sans-serif;margin:8px 0 0">Calculadora de latencia de voz con IA by <a href="https://www.hirefinn.ai/tools/voice-latency-calculator">Finn</a></p>

The credit line sits outside the iframe on purpose: a link inside a frame belongs to the framed document and does nothing for the page hosting it. Keeping that line is the only thing we ask in return — remove it and the calculator still works.

Default frame height 900px, responsive to full width.