Skip to main content

Calculadora de costes de IA de voz

Elige un motor de speech-to-text, un modelo de lenguaje, una voz y un proveedor de telefonía. Cada tarifa de abajo procede del pricing publicado por el propio proveedor, con la fecha en que se verificó. El desglose muestra qué capa impulsa realmente tu factura: rara vez es la que la gente supone.

Cost per minute
$0.0240
All layers combined
Cost per call
$0.072
At 3 minutes
Monthly
$240
10,000 minutes
Annual
$2,879
At the same volume

Where the money goes

Speech to text$0.00480 20.0%
Billed on the full connected minute
LLM — prompt tokens$0.00400 16.7%
4,000 tokens/min (system prompt, tools and history re-sent each turn)
LLM — generated tokens$0.00051 2.1%
101 tokens/min from 75 spoken words
Text to speech$0.00619 25.8%
413 characters/min
Telephony$0.00850 35.4%
Billed on the full connected minute

Rates in this estimate

Cómo se calcula

Cuatro capas, cada una facturada en una unidad distinta. El speech-to-text y la telefonía ya van por minuto. El modelo de lenguaje se cobra por millón de tokens y el text-to-speech por cada mil caracteres, así que ambos necesitan una conversión desde minutos, y esas dos conversiones son donde se tuercen la mayoría de las estimaciones de coste de voz.

Dos de las cuatro capas ya se cobran por minuto. Las otras dos no, y convertirlas es donde suelen fallar las estimaciones de coste de voz:

spokenWords/min = wordsPerMinute × agentTalkShare
chars/min       = spokenWords/min × charactersPerWord
outTokens/min   = spokenWords/min × tokensPerWord

sttCost         = sttRatePerMinute                       (full connected minute)
llmInputCost    = inputTokensPerMinute × rateIn  / 1e6
llmOutputCost   = outTokens/min        × rateOut / 1e6
ttsCost         = (chars/min / 1000)   × ratePer1kChars
telephonyCost   = telephonyRatePerMinute                 (full connected minute)

total/min       = stt + llmInput + llmOutput + tts + telephony + platform

El speech-to-text y la telefonía facturan el minuto conectado completo — el agente paga por escuchar además de por hablar. El text-to-speech y los tokens generados solo se acumulan mientras el agente habla, lo que con un 50% de cuota de habla equivale a unas 75 palabras por minuto.

Ejemplo práctico

Un stack ligero — Deepgram Nova-3 para transcripción, Claude Haiku 4.5, Aura-1 para la voz, Twilio entrante — sale a unos $0.024 por minuto conectado: alrededor de 7 centavos por una llamada de tres minutos, o $240 al mes con 10.000 minutos. El reparto es telefonía 35%, text-to-speech 26%, speech-to-text 20%, tokens de prompt 17% y tokens generados apenas 2%.

Cambia a un modelo frontier y una voz premium y la misma llamada cuesta unos $0.062 por minuto — y la forma se invierte. Los tokens de prompt pasan a ser la partida mayor con un 32%, el text-to-speech un 33%, la telefonía baja al 23%. Qué capa merece la pena optimizar depende por completo del stack que realmente ejecutes, y por eso esta herramienta muestra el reparto en lugar de solo un total.

Por qué dominan los tokens de prompt y no los generados

El resultado contraintuitivo en todas las configuraciones anteriores: los tokens que el agente genera son casi gratis, mientras que los que lee cuestan dinero de verdad. Un minuto de habla del agente son unos 100 tokens de salida. El system prompt, las definiciones de herramientas y toda la conversación hasta ese punto se reenvían en cada turno, lo que supone miles de tokens de entrada por minuto. Esa proporción explica por qué el prompt caching mueve la factura mucho más que cambiar a un modelo más barato — y por qué un system prompt largo es un coste recurrente, no puntual.

Qué no incluye esto

El alquiler del número de teléfono, la grabación y el almacenamiento, la observabilidad y el tiempo de ingeniería para montar y mantener en marcha un stack de cuatro proveedores. Una plataforma gestionada agrupa todo eso en una única tarifa por minuto — introdúcela como cuota de plataforma para comparar lo mismo con lo mismo. Las tarifas aquí son precios de pago por uso publicados; los acuerdos por volumen y de uso comprometido las mueven, en general a la baja.

Los precios se muestran solo en dólares estadounidenses, porque todos los proveedores modelados aquí publican en dólares. Convertirlos supondría inventar un tipo de cambio y presentarlo como un coste.

Last reviewed July 2026.

Preguntas frecuentes

¿Cuánto cuesta por minuto un agente de IA de voz?
A tarifas publicadas, un stack ligero —Deepgram Nova-3, Claude Haiku 4.5, Aura-1 y Twilio entrante— sale a unos $0.024 por minuto conectado, o unos 7 céntimos por una llamada de tres minutos. Un stack premium con un modelo frontier y una voz de gama alta se acerca a $0.062 por minuto. La telefonía y el text-to-speech suelen costar más que el modelo de lenguaje en un stack ligero, lo que sorprende a la mayoría.
¿Qué capa cuesta más?
Depende del stack, y ese es justo el sentido del desglose. En una configuración barata, la telefonía es a menudo la mayor partida —en torno al 35%— mientras que los tokens generados por el modelo de lenguaje apenas llegan al 2%. Pasa a un modelo frontier y una voz premium y el equilibrio se invierte: los tokens de prompt del LLM y el TTS se llevan alrededor de un tercio cada uno. Optimizar la capa que ya es el 2% de tu factura es esfuerzo desperdiciado.
¿Por qué los tokens de prompt son mucho más caros que los tokens generados?
Porque el system prompt, las definiciones de herramientas y toda la conversación hasta ese momento se reenvían en cada turno, mientras que el agente solo genera las palabras que efectivamente dice. Un minuto de habla son unas 75 palabras dichas por el agente —unos 100 tokens de salida— frente a miles de tokens de entrada por minuto. El prompt caching es la palanca que importa aquí, no elegir un modelo más barato.
¿Qué supuestos usa esto?
Que el habla va a unas 150 palabras por minuto, que el agente habla durante la mitad de la llamada, que una palabra son unos 5,5 caracteres y 1,35 tokens, y que se envían unos 4.000 tokens de prompt por minuto de conversación. Los cinco son editables en «supuestos de conversión»: la cifra de tokens de prompt es la que más conviene sustituir por una medición de tu propio tráfico.
¿Por qué los precios están solo en dólares?
Porque todos los proveedores modelados aquí publican sus precios en dólares estadounidenses. Convertir a otra moneda supondría inventar un tipo de cambio y presentarlo como un coste, lo cual es peor que mostrar dólares y dejar que tú conviertas con un tipo en el que confíes.
¿Son estas las tarifas que pagaré realmente?
Son las tarifas de pago por uso publicadas, verificadas en la fecha que aparece junto a cada una. Los compromisos de volumen, los acuerdos empresariales y los planes anuales las modifican, normalmente a la baja. Las tarifas marcadas como de segunda mano se obtuvieron de informes de terceros y no de la página de precios del propio proveedor: confírmalas antes de tomar una decisión de compra.
¿Incluye esto la plataforma que ejecuta el agente?
Solo si añades una. Las cuatro capas de componentes son lo que cuesta un stack ensamblado en infraestructura pura. Las plataformas gestionadas agrupan orquestación, telefonía, monitorización y soporte en una única tarifa por minuto: introduce esa cifra como tarifa de plataforma para comparar en igualdad de condiciones, y recuerda que un stack ensamblado por ti también conlleva tiempo de ingeniería que este modelo no cuantifica.

Put this calculator on your site

Free to embed on any site, commercial or not. No signup, no API key, nothing to break when we ship changes — the embed always runs the current version.

<iframe src="https://www.hirefinn.ai/embed/tools/voice-ai-cost-calculator" title="Calculadora de costes de IA de voz" width="100%" height="1000" style="border:1px solid #E7DFD0;border-radius:12px;max-width:100%" loading="lazy"></iframe>
<p style="font:14px/1.5 system-ui,sans-serif;margin:8px 0 0">Calculadora de costes de IA de voz by <a href="https://www.hirefinn.ai/tools/voice-ai-cost-calculator">Finn</a></p>

The credit line sits outside the iframe on purpose: a link inside a frame belongs to the framed document and does nothing for the page hosting it. Keeping that line is the only thing we ask in return — remove it and the calculator still works.

Default frame height 1000px, responsive to full width.