Calculadora de latencia de voz con IA
Ajusta cada etapa del pipeline y mira la pausa que el interlocutor percibe realmente: desde que deja de hablar hasta que oye una respuesta. El desglose separa lo que controlan tus proveedores de lo que controlas tú — y el elemento mayor casi siempre es del segundo tipo.
Callers will talk over the agent and assume the line dropped.
Target is 800ms or better. Natural human turn gaps sit near 200ms.
Where the time goes
Fix this first
Endpointing silence is 39% of your budget at 600ms. The vendor pipeline — transcription, model and voice together — accounts for 920ms of the 1520ms total. Endpointing is a setting, not a vendor limit: dropping it is usually the cheapest win available, at the cost of occasionally cutting a caller off mid-pause.
Cómo se calcula
La brecha percibida es la suma de todas las etapas entre el fin del habla y el primer audio: el silencio que esperas antes de decidir que quien llama ha terminado, la finalización de la transcripción, el primer token del modelo, el primer byte de la voz, dos saltos de red y la ruta de telefonía.
perceived gap = endpointing silence ← your setting
+ STT finalisation
+ LLM time to first token
+ TTS time to first byte
+ network RTT × 2 ← your region choice
+ telephony / jitter bufferPor qué normalmente no es el modelo
En una configuración típica, el umbral de silencio del endpointing es el elemento más grande de todos: unos 600ms de un presupuesto de aproximadamente 1.500ms, es decir, el 40% de todo lo que el interlocutor espera. No es un límite del proveedor. Es un número en tu configuración que decide cuánto tiempo escucha el sistema el silencio antes de concluir que la persona ha terminado de hablar, y hay equipos que se pasan semanas comparando modelos mientras ese valor sigue en un ajuste por defecto que nadie eligió.
Acortarlo es la mejora más barata disponible, y es una verdadera concesión, no algo gratis: si lo recortas demasiado, interrumpes a quien haga una pausa a mitad de frase. La elección de región es la otra palanca que está en tus manos: el viaje de ida y vuelta por la red se cuenta dos veces, así que un despliegue en otra región puede añadir 400ms antes de que ningún proveedor haya hecho nada mal.
Qué es un buen resultado
Las pausas naturales al alternar turnos entre personas rondan los 200ms. Por debajo de 500ms, un agente se percibe como inmediato; por debajo de 800ms se lee como una pausa normal. Pasado alrededor de 1,2 segundos, quien llama empieza a repetirse o a hablar por encima del agente, porque el silencio se interpreta como una línea cortada y no como reflexión. Un modelo de razonamiento con 1,4 segundos hasta el primer token se lleva el presupuesto entero él solo, y por eso ese tipo de modelos van después de la llamada, resumiendo y decidiendo, no en el turno en vivo.
Las cifras por etapa que aparecen aquí son rangos típicos publicados u observados, no garantías. La latencia real varía según la región, la carga, el tamaño del payload y las condiciones de red: mide la tuya y usa esto como un presupuesto con el que diseñar.
Last reviewed July 2026.
Preguntas frecuentes
- ¿Qué latencia es buena para un agente de voz con IA?
- Por debajo de 800 ms resulta cómodo y por debajo de 500 ms resulta inmediato: las pausas naturales de los turnos de habla humanos rondan los 200 ms. Pasado alrededor de 1,2 segundos, quienes llaman empiezan a repetirse o a hablar por encima del agente, porque el silencio se interpreta como una llamada caída y no como una pausa para pensar.
- ¿Por qué mi agente de voz es lento si todos los proveedores dicen tener baja latencia?
- Porque las cifras del proveedor son solo una parte del presupuesto. En una configuración típica, el umbral de silencio del endpointing —el tiempo que esperas para asegurarte de que quien llama ha dejado de hablar— es el mayor contribuyente individual, a menudo el 40% del total. Es un ajuste de tu lado, no un límite del proveedor, y por mucho que cambies de modelo no lo vas a arreglar.
- ¿Cómo reduzco la latencia de un agente de voz?
- Por orden de rendimiento: acorta el umbral de endpointing, despliega en la misma región que tus proveedores, acorta el system prompt, transmite el texto a la síntesis de voz en streaming en lugar de esperar a una respuesta completa y solo entonces plantéate un modelo más rápido. Las dos primeras son gratis y suelen valer más que todas las demás juntas.
- ¿Qué es el endpointing?
- Decidir cuándo ha terminado de hablar quien llama. Espera demasiado y cada respuesta se siente lenta; corta demasiado pronto e interrumpes a cualquiera que haga una pausa a mitad de frase. Es una disyuntiva real, no un fallo, pero es una disyuntiva que la mayoría de los equipos nunca asume de forma consciente: dejan el valor por defecto y culpan al modelo.
- ¿Tiene sentido un modelo de razonamiento para voz?
- Rara vez en la ruta crítica. Un modelo que tarda 1,4 segundos en dar el primer token se lleva por delante todo el presupuesto. Los modelos de razonamiento encajan mejor después de la llamada —resumir, extraer, decidir los siguientes pasos—, mientras que el turno en vivo se ejecuta sobre algo diseñado para el tiempo hasta el primer token.
Put this calculator on your site
Free to embed on any site, commercial or not. No signup, no API key, nothing to break when we ship changes — the embed always runs the current version.
<iframe src="https://www.hirefinn.ai/embed/tools/voice-latency-calculator" title="Calculadora de latencia de voz con IA" width="100%" height="900" style="border:1px solid #E7DFD0;border-radius:12px;max-width:100%" loading="lazy"></iframe> <p style="font:14px/1.5 system-ui,sans-serif;margin:8px 0 0">Calculadora de latencia de voz con IA by <a href="https://www.hirefinn.ai/tools/voice-latency-calculator">Finn</a></p>
The credit line sits outside the iframe on purpose: a link inside a frame belongs to the framed document and does nothing for the page hosting it. Keeping that line is the only thing we ask in return — remove it and the calculator still works.
Default frame height 900px, responsive to full width.
Lecturas relacionadas
Dotar la cola de personal es una opción. Atenderla con IA es otra.
Finn atiende llamadas entrantes y salientes con tarifas por minuto, sin shrinkage y sin techo de occupancy que haya que planificar. Reserva una demo y lo probamos con tu propio volumen.