Skip to main content

Whisper vs Deepgram 2025: STT para agentes de voz

Un benchmark neutral de 2025 entre Whisper y Deepgram para agentes de voz en producción: latencia en streaming, WER en telefonía, endpointing y el coste…

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat
July 26, 2026
10 min read
Una balanza de latón sobre una losa de mármol sostiene trompetas de cerámica rosa y una pesa verde atada con una cinta melocotón

Cada artículo de «Whisper vs Deepgram» que vas a leer lo ha escrito alguien que vende uno de los dos. La propia comparativa de Deepgram abre con «más del 90 % de precisión en 300 ms». Es cierto, y es irrelevante. Si estás conectando reconocimiento de voz a un agente de voz en tiempo real que atiende llamadas telefónicas, la precisión sobre un clip de pódcast limpio no es el número que decide si tu agente suena humano o suena roto.

En Finn construimos agentes de voz para contact center. Hemos llevado ambos motores a producción. Esta es la versión neutral: la que parte de audio telefónico a 8 kHz, un presupuesto de latencia real y la factura de operaciones que nadie incluye en el precio.

La decisión real: el STT en streaming es un presupuesto de latencia, no una tabla de precisión

Un agente de voz tiene una restricción dura: la persona al teléfono espera una respuesta en aproximadamente el mismo tiempo que daría otra persona, digamos entre 800 ms y 1,2 s desde que deja de hablar. Ese ida y vuelta total tiene que cubrir la finalización del STT, la inferencia del LLM, el primer byte del TTS y el transporte de red/SIP. El STT no se lleva todo el presupuesto. Se lleva unos 300 ms.

Así que la pregunta no es «qué motor tiene menor tasa de error por palabra». Es «qué motor me da transcripciones utilizables lo bastante rápido como para que las otras tres etapas sigan cabiendo». Un modelo un 2 % más preciso pero que añade 400 ms de latencia de finalización es un peor motor para agentes de voz, punto. Los benchmarks de precisión por lotes miden el eje equivocado para este trabajo.

Montaje del benchmark: audio de calidad telefónica, WER y por qué las puntuaciones con audio limpio mienten

La mayoría de las cifras de WER publicadas vienen de LibriSpeech o similares: habla leída, 16 kHz, limpia de estudio. Las llamadas telefónicas son lo contrario: banda estrecha a 8 kHz (o G.711 μ-law), artefactos de códec, ruido de fondo, solapamiento de voces, acentos y quien murmura su número de cuenta.

Cuando vuelves a ejecutar los mismos modelos sobre audio telefónico, la distancia cambia:

  • Whisper large-v3 en audio limpio a 16 kHz: ~5-8 % de WER. En telefonía ruidosa a 8 kHz: a menudo 12-18 % de WER, y alucina texto fluido pero incorrecto sobre silencio y ruido, un modo de fallo conocido que resulta peligroso cuando la transcripción alimenta a un LLM.
  • Deepgram Nova-2/Nova-3, ajustado para audio telefónico y streaming: 8-13 % de WER sobre el mismo conjunto telefónico, y se degrada con más elegancia: tiende a perder palabras en lugar de inventarlas.

La lección: haz el benchmark con tu propio audio. Coge 200 llamadas reales grabadas, etiquétalas a mano y puntúa ambos motores sobre eso. El orden que obtengas no coincidirá con ningún blog de proveedor, incluido este. Si te llevas una sola idea, llévate esa.

Latencia y endpointing: primer token, finalización y barge-in

Importan tres números de latencia, y solo uno aparece en el marketing.

Latencia del primer token: con qué rapidez empiezan a llegar las transcripciones parciales. Deepgram emite resultados intermedios en ~100-200 ms. Whisper es un modelo por lotes; los envoltorios de streaming de la comunidad (whisper-streaming, WhisperLive) trocean el audio y vuelven a decodificar, lo que significa que los parciales llegan en 500 ms-1 s o más y fluctúan bajo carga.

Latencia de finalización: cuánto tarda, después de que quien llama deja de hablar, en llegar una transcripción final estable que puedas pasar al LLM. Esto lo controla el endpointing (la detección de actividad de voz que decide que el turno ha terminado). Deepgram ofrece endpointing ajustable (endpointing=300). Con Whisper tienes que acoplar tu propio VAD (Silero, WebRTC VAD) y ajustarlo tú mismo: más control, más cuerda para ahorcarte.

Barge-in: cuando quien llama interrumpe al agente a media frase, necesitas detectar el habla y cortar el TTS en ~100-200 ms o el agente hablará por encima. Es un problema de parciales en streaming + VAD. Los motores con streaming nativo lo hacen fácil; Whisper por lotes lo convierte en un proyecto.

Ajustar el endpointing es la palanca de latencia con más impacto de toda la pila: si lo pones demasiado agresivo, cortas a quien llama a mitad de palabra; demasiado laxo y añades 500 ms de silencio muerto a cada turno. Consulta nuestro desmontaje de motores de voz de baja latencia para ver dónde encaja esto en el pipeline.

Whisper autoalojado: coste de GPU, batching y la carga de operaciones que nadie presupuesta

«Whisper es gratis» es la frase más cara de la IA de voz. Los pesos del modelo son gratuitos. Ejecutarlos en tiempo real con la concurrencia de un call center no lo es.

Cifras reales para un despliegue autoalojado de faster-whisper (CTranslate2) large-v3:

  • GPU: una A10G o una L4 aguanta aproximadamente 8-15 flujos concurrentes en tiempo real con large-v3 antes de que la latencia se degrade. Con 100 llamadas concurrentes necesitas ~8-12 GPU. Una A10G en la nube bajo demanda cuesta ~$1.00-1.30/hr; reservada baja algo. Digamos $7,000-10,000/month de GPU para sostener 100 flujos concurrentes, antes de redundancia.
  • Compromiso del batching: agrupar peticiones eleva el rendimiento por GPU pero añade latencia, justo lo que estás protegiendo. La voz en tiempo real limita cuánto puedes agrupar, así que tu utilización de GPU se queda baja (a menudo 30-50 %), y eso es dinero quemándose.
  • Carga de operaciones: carga del modelo, pools calientes para evitar arranques en frío, autoescalado ante tráfico entrante a ráfagas, ajuste del VAD, filtrado de alucinaciones, mantenimiento de drivers de GPU/CUDA y guardia 24/7 cuando un nodo se atasca a mitad de llamada. Eso son 0,5-1 FTE de ingeniería de plataforma que nunca aparece en una comparativa por minuto.

Amortizado, Whisper autoalojado con 100 llamadas concurrentes suele situarse en $0.006-0.012/min todo incluido: competitivo sobre el papel, pero solo una vez que has pagado la ingeniería para hacerlo fiable. Por debajo de un volumen serio, casi nunca compensa. Nuestro pipeline híbrido de ASR por debajo de 120 ms cubre en profundidad las matemáticas de batching frente a latencia.

Deepgram / API gestionadas: coste por minuto a escala y enrutamiento regional

El STT gestionado invierte el compromiso: mayor coste marginal, operaciones casi nulas.

  • Deepgram Nova en streaming aparece en lista alrededor de $0.0077/min (Nova de pago por uso, streaming), con descuentos por volumen o compromiso que lo bajan a escala.
  • Sin GPU, sin pools calientes, sin CUDA. Obtienes autoescalado, endpointing y streaming sin esfuerzo.
  • El enrutamiento regional importa más que el precio de catálogo. Si tu medio termina en Bombay y tu endpoint de STT está en us-east, acabas de añadir 200-300 ms de ida y vuelta transatlántica a cada parcial. Los proveedores gestionados con endpoints regionales (o despliegues empresariales autoalojados cerca de tu plano de medios) borran eso. Para pilas de doble mercado EE. UU.-India esto es decisivo: consulta nuestra arquitectura de latencia transfronteriza.

La lectura honesta: para la mayoría de equipos por debajo de ~50 llamadas concurrentes, lo gestionado gana en coste total en cuanto pones precio al ingeniero. Por encima de ahí, las cuentas empiezan a favorecer el autoalojamiento, si tienes equipo de plataforma.

Cómo la elección de STT se propaga a la latencia total de ida y vuelta

Este es un presupuesto de turno representativo para una llamada entrante, con objetivo de respuesta percibida < 1000ms:

EtapaGestionado (Deepgram)Whisper autoalojado (ingenuo)
Transporte SIP/medios80ms80ms
Finalización de STT (tras endpoint)250ms700ms
Primer token del LLM350ms350ms
Primer byte del TTS150ms150ms
Respuesta percibida~830ms~1280ms

Mismo LLM, mismo TTS. La elección del STT por sí sola cruza la experiencia de quien llama al otro lado de la línea del «suena humano». Esos 450 ms son la diferencia entre un agente con el que la gente habla y otro al que le cuelgan. La latencia del STT no es una partida más: es un multiplicador sobre todo lo que viene después. Por eso lo tratamos como un presupuesto, no como un benchmark. Más sobre el pipeline completo en más allá del wrapper.

Matriz de decisión: elige por volumen de llamadas, mezcla de idiomas y SLA de latencia

  • < 50 concurrentes, predominio del inglés, SLA ajustado → Gestionado (Deepgram o equivalente). No puedes batir el coste ajustado por esfuerzo, y el streaming/endpointing ya está resuelto.
  • Alto volumen (100+ concurrentes), tráfico estable, equipo de plataforma en plantilla → Whisper autoalojado (faster-whisper) empieza a ganar en coste marginal. Presupuesta el FTE con honestidad.
  • Multilingüe intenso / cambio de código → Prueba ambos con tus idiomas. La amplitud multilingüe de Whisper es fuerte pero el WER varía muchísimo por idioma; los motores gestionados también varían. No lo des por hecho: mídelo. Consulta el impuesto multilingüe oculto.
  • Regulado / residencia de datos (sanidad, DLT de India, UE) → Autoalojado o un despliegue gestionado regional, elegido según dónde tenga que quedarse legalmente tu medio.
  • Sensible a alucinaciones (la transcripción alimenta a un LLM que actúa sobre ella) → Pondera la alucinación en silencio de Whisper frente a la degradación elegante de Deepgram, y añade salvaguardas en cualquier caso. Nuestro manual para frenar la alucinación en la IA de voz se aplica directamente.

En resumen

Whisper vs Deepgram no es un concurso de precisión: es una decisión de presupuesto de latencia y carga de operaciones. Lo gestionado gana en esfuerzo y tiempo hasta producción; Whisper autoalojado gana en coste marginal solo a escala real y solo con un equipo de plataforma detrás. En cualquier caso: haz el benchmark con tu propio audio telefónico, ajusta el endpointing a fondo y contabiliza el ida y vuelta completo. La transcripción son solo los primeros 300 ms de una promesa de un segundo a quien llama.

Preguntas frecuentes

¿Es Whisper más preciso que Deepgram en 2025? Con audio limpio a 16 kHz, Whisper large-v3 es muy sólido. En telefonía ruidosa a 8 kHz —el audio que un agente de voz oye realmente— la distancia se estrecha o se invierte, y la alucinación en silencio de Whisper es un riesgo real. Haz el benchmark con tus propias llamadas grabadas antes de decidir.

¿Cuánto cuesta realmente autoalojar Whisper? No es gratis. Con 100 flujos concurrentes en tiempo real, cuenta con 8-12 GPU ($7-10k/month) más 0,5-1 FTE de ingeniería de plataforma. Todo incluido se sitúa en torno a $0.006-0.012/min: competitivo con lo gestionado solo a escala.

¿Puede Whisper hacer streaming en tiempo real? No de forma nativa: es un modelo por lotes. Los envoltorios de la comunidad (WhisperLive, faster-whisper + VAD) añaden streaming, pero la latencia del primer token (500 ms-1 s o más) y la fluctuación son peores que las de las API con streaming nativo. El barge-in y el endpointing pasan a ser problema tuyo.

¿Cuál es mejor para un agente de voz de contact center? Para la mayoría de equipos por debajo de ~50 llamadas concurrentes, una API gestionada de streaming (Deepgram o equivalente) con endpointing ajustado y un endpoint regional. Por encima de ahí, con equipo de plataforma, Whisper autoalojado empieza a ganar en coste. El SLA, no el WER, debería decidir.

Construye un agente de voz que cumpla el presupuesto de latencia

Finn entrega agentes de voz de contact center en producción con el STT, el endpointing y el enrutamiento regional ya ajustados al ida y vuelta por debajo de 1 s, para que te saltes las cuentas de GPU y el busca a las 3 de la madrugada. Descubre cómo Finn mantiene a los agentes de voz por debajo de la línea de latencia →

Relacionado: Despliegue de agentes de IA: ejecutar agentes de voz con fiabilidad

Relacionado: Seguimiento de llamadas para agentes de voz con IA: de la atribución a los ingresos

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat

Fundador, Finn AI

Digvijay está construyendo Finn: la capa empresarial de orquestación de voz que razona durante las llamadas, extrae datos y actualiza tus sistemas en tiempo real. Escribe sobre IA de voz, estrategia de salida al mercado y lo que hace falta para lanzar agentes autónomos a gran escala.

Whisper vs Deepgram 2025: STT para agentes de voz — Finn