Skip to main content

Proveedores de llamadas telefónicas con AI en 2026: costes, legalidad y guía de compra

Análisis neutral de Bland, Retell, Vapi y Finn. Costes reales por minuto desglosados (STT+LLM+TTS+telco), la TCPA en lenguaje claro y una lista de…

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat
July 26, 2026
16 min read
Proveedores de llamadas telefónicas con AI en 2026: costes, legalidad y guía de compra

Todos los proveedores de este sector siguen el mismo guion: grabar una llamada de demostración cuidadosamente seleccionada, publicarla en Twitter y sacar un artículo de blog explicando por qué su plataforma es la opción obvia. Este no es ese artículo.

Lo que sigue es un análisis desde el lado del comprador: qué significan realmente las llamadas telefónicas con AI en 2026, cómo se comparan realmente cuatro proveedores líderes (sin que sea el proveedor quien escriba la comparación), cuánto cuesta de verdad un minuto de llamadas con AI cuando se desglosa el stack, qué exige realmente la ley y las preguntas que deberías hacer antes de firmar nada.


Qué significa realmente "llamada telefónica con AI" en 2026

La expresión abarca tres casos de uso que difieren de forma significativa, y confundirlos hará que malgastes tu presupuesto y posiblemente te expongas a responsabilidad legal.

Recepcionista de entrada / cobertura fuera de horario. El agente atiende llamadas que de otro modo irían al buzón de voz o a una cola, responde preguntas frecuentes, agenda citas y transfiere cuando hace falta escalar. Carga regulatoria: mínima. Estás respondiendo llamadas que te llegaron a ti. Quienes llaman ya dieron su consentimiento al marcar.

Sustitución del IVR de entrada. Reemplazo directo de los árboles de "pulse 1 / pulse 2". El agente gestiona el enrutamiento, las consultas de cuenta y la resolución en el primer contacto. El mismo bajo listón regulatorio que el uso como recepcionista. Un ROI mucho más alto para empresas que aún operan un IVR heredado: los agentes de voz con AI resuelven del 60 al 80 % de las llamadas de principio a fin, frente al 10-30 % del IVR tradicional. (Véase: Agente de voz con AI frente a IVR: guía del comprador empresarial 2026.)

Marcación saliente. El agente inicia la llamada. Recordatorios de citas, seguimiento de leads, avisos de cobros, llamadas de encuesta. Aquí es donde vive el riesgo de la TCPA. El listón legal es sustancialmente más alto y el panorama de proveedores presenta diferencias reales en lo bien que cada plataforma soporta llamadas salientes conformes a la normativa.

Ten claro cuál de estos tres estás comprando en realidad antes de leer una sola página de precios.


Panorama de proveedores: Bland vs. Retell vs. Vapi vs. Finn

Cuatro plataformas dominan el mercado de 2026 para empresas que no quieren construir un stack de voz desde cero. Aquí va una mirada honesta a cada una.

Bland AI

Bland se hizo pronto con un espacio propio en la generación de leads saliente. Su propuesta: llamadas salientes de alta concurrencia con tarifas por minuto rentables, una API sencilla y una experiencia de prototipado rápido. Donde flaquea: la fiabilidad en producción a escala puede ser inconsistente (véase la sección sobre latencia más abajo), la plataforma está muy optimizada para la PSTN de EE. UU. y es menos madura para despliegues internacionales, y las herramientas de cumplimiento para llamadas salientes conformes a la TCPA requieren más implementación a medida de lo que sugiere la documentación. Mejor encaje: campañas salientes en las que controlas tus registros de consentimiento, el volumen es moderado (<50K llamadas/mes) y cuentas con recursos de ingeniería para montar tú mismo los mecanismos de protección.

Retell AI

Retell se dirige a casos de uso de entrada y es posiblemente la experiencia lista para usar más pulida del sector ahora mismo. TTS de baja latencia, buena precisión de STT en audio telefónico y un editor de flujos de trabajo que quienes no son ingenieros pueden usar de verdad. Limitaciones: menos flexibilidad en la capa de infraestructura (el soporte de BYOC — bring your own carrier, trae tu propio operador — es limitado), los precios escalan de forma pronunciada más allá de un volumen moderado, y las herramientas de cumplimiento para llamadas salientes son lo mínimo indispensable más que de nivel empresarial. Mejor encaje: casos de uso de recepcionista de entrada y agendamiento para pymes y mercado medio, donde la facilidad de configuración pesa más que el coste por minuto.

Vapi

Vapi es la plataforma para desarrolladores del grupo: piensa en ella como el Stripe de la AI de voz. Máxima flexibilidad: eliges tu proveedor de STT (Deepgram, AssemblyAI, Google), tu LLM (GPT-4o, Claude, Llama) y tu TTS (ElevenLabs, Cartesia, OpenAI TTS). Esa flexibilidad es real y valiosa si tienes un equipo de ingeniería. Las implicaciones de coste de esa flexibilidad también son reales (se comentan más abajo). Hay BAA de HIPAA disponible; SOC 2 está en curso. Si necesitas cambiar de modelo a medida que evoluciona el panorama, la arquitectura de Vapi te permite hacerlo de forma limpia. (Las alternativas a Vapi para casos de uso HIPAA se tratan en profundidad aquí.)

Finn (hirefinn.ai)

Finn está construido específicamente para la automatización de contact centers empresariales — entrada y salida a escala, con una postura de cumplimiento más estricta que las plataformas anteriores. Diferenciadores clave: gestión de consentimiento y TCPA creada a propósito (no añadida a posteriori), una arquitectura de transferencia en caliente que pasa el contexto completo de la llamada a los agentes humanos para que quien llama no tenga que repetirse, y un modelo de precios que no penaliza el volumen como hacen a escala empresarial las tarifas de plataforma por puesto o por minuto. Mejor encaje: empresas con más de 10K llamadas/mes que necesitan profundidad de cumplimiento, integración con el CRM más allá de un webhook básico y un proveedor que codiseñe el despliegue en lugar de entregarte una clave de API.


Coste real por minuto: el stack que nadie te enseña

Todos los proveedores publican un precio por minuto. Casi ninguno te dice qué incluye ese precio, y la diferencia entre la cifra del titular y tu factura real a escala puede ser de 3 a 5 veces.

Una llamada telefónica con AI en producción toca cuatro capas de coste:

1. Speech-to-Text (STT): Deepgram Nova-2 cuesta unos 0,0043 $/min con audio de telefonía. AssemblyAI es comparable. Google STT Chirp ronda los 0,016 $/min. Si estás en una plataforma que te deja elegir tu proveedor de STT, solo esa elección puede suponer una diferencia de coste de 4 veces.

2. Inferencia del LLM: la llamada al modelo es el comodín. GPT-4o, con los precios de API actuales, sale por aproximadamente 0,005 $/min de intercambio conversacional (asumiendo ~500 tokens/turno y una media de 4 turnos/min). Claude Sonnet 4.6 es comparable. GPT-4o-mini o Claude Haiku 4.5 pueden reducirlo a 0,001 $/min, pero la calidad de las respuestas en flujos de llamada complejos se degrada de forma apreciable. La mayoría de las plataformas abstraen esto y te cobran una tarifa por minuto agrupada, lo que significa que no puedes optimizar la selección del modelo para tu tipo de llamada concreto.

3. Text-to-Speech (TTS): ElevenLabs en nivel de producción: ~0,003 $/min de audio sintetizado (Turbo v2). Cartesia Sonic ronda los 0,002 $/min. OpenAI TTS está en ~0,0015 $/min, con puntuaciones de naturalidad más bajas en audio telefónico. Los proveedores de "voz realista" cobran una prima de 2 a 3 veces sobre el TTS de gama básica: averigua si a tu población de personas que llaman realmente le importa la calidad de la voz antes de pagar por ella.

4. Telefonía / telco: este es el coste oculto que la mayoría de las comparativas omite. La terminación de troncal SIP (PSTN saliente) cuesta entre 0,005 y 0,012 $/min según el operador y el volumen. Los márgenes de telefonía que añaden las plataformas por encima de eso van del 0 % (BYOC) a más del 40 % (números incluidos en el paquete de las grandes plataformas). Con 100K minutos/mes, un margen telco del 20 % es dinero de verdad.

Estimaciones aproximadas de todo incluido a volumen de producción (100K min/mes):

CapaConfiguración de bajo costeGama mediaPremium
STT$0.004$0.008$0.016
LLM$0.001$0.005$0.015
TTS$0.002$0.003$0.006
Telco$0.006$0.009$0.012
Total/min$0.013$0.025$0.049

Compáralo con los precios de referencia de los proveedores, que a menudo se sitúan entre 0,05 y 0,15 $/min en plataformas todo incluido. Parte de ese sobreprecio compra valor real (infraestructura gestionada, herramientas de cumplimiento, SLA de soporte). Otra parte es margen. Ten claro qué es cada cosa. (Comparativa completa de precios de 2026 entre proveedores: Comparativa de precios de agentes de voz AI (2026).)


Esta sección trata la legislación federal de EE. UU. Si operas en California (implicaciones de la CCPA), la UE (RGPD) o India (TRAI), se aplican normas adicionales: esto no es asesoramiento legal, pero aquí tienes el marco en lenguaje sencillo.

La Telephone Consumer Protection Act (TCPA) es la principal ley federal que regula las llamadas y los mensajes salientes. En 2024, la FCC emitió una resolución (en vigor desde enero de 2025) que cerró el "vacío legal de los generadores de leads": ya no puedes obtener un consentimiento general a partir de un formulario que deriva a 20 empresas distintas. Ahora el consentimiento debe ser uno a uno: el consumidor consintió específicamente recibir llamadas de tu empresa.

Para los agentes de voz AI, los requisitos clave:

  1. Consentimiento previo expreso y por escrito para telemarketing. Si tu agente AI vende, hace upselling o promociona —incluso una oferta gratuita—, necesitas consentimiento por escrito (incluida una casilla de verificación digital) antes de llamar a un teléfono móvil. El consentimiento verbal dado en una llamada anterior no basta para un sistema automatizado.

  2. Norma de divulgación de AI (FCC, en vigor desde 2025). Toda voz generada por AI en una llamada saliente debe revelar en los primeros segundos que quien llama es una AI. "Hola, soy Aria, una asistente AI de Acme Company" es suficiente. Ocultar la naturaleza AI de la llamada es una infracción de la FCC y, cada vez más, un riesgo de acción privada bajo la TCPA.

  3. Las llamadas entrantes casi no tienen exposición a la TCPA. Si un consumidor te llama, él inició el contacto. El principal requisito en llamadas entrantes es que, si grabas, debes informarlo (varía según el estado: California, Florida e Illinois exigen consentimiento de ambas partes para grabar).

  4. Depuración contra listas DNC. Debes depurar tus listas contra el National Do Not Call Registry antes de cualquier campaña de telemarketing saliente. La mayoría de las plataformas ofrecen integración con DNC, pero confirma si es automática o manual.

  5. Restricciones de franja horaria. La TCPA prohíbe llamar antes de las 8:00 o después de las 21:00 en la zona horaria local del destinatario. Tu sistema AI necesita conocer el prefijo del destinatario y aplicar la zona horaria correcta, no limitarse a convertir desde UTC.

Qué significa esto para la selección de proveedores: Pregunta a cada proveedor cómo gestiona el consentimiento (¿guarda marcas de tiempo y el origen del consentimiento?), si ofrece depuración DNC integrada y si su marcador saliente aplica las restricciones de zona horaria. Muchos no lo hacen. (El Manual de TCPA para voz AI saliente (2026) profundiza en la implementación operativa.)


Construir o comprar: lo que no te cuentan los tutoriales DIY

Hay todo un circuito de tutoriales populares en YouTube y GitHub: "Construye un agente telefónico AI en 20 minutos con Twilio + OpenAI + ElevenLabs". Algunos son técnicamente correctos. Ninguno te cuenta qué pasa después de esos 20 minutos.

Lo que se saltan:

  • Endpointing. Saber cuándo ha dejado de hablar quien llama para que el agente pueda responder. Un endpointing deficiente = un agente que interrumpe a media frase o que espera 3 segundos de más tras cada intervención. Ambas cosas se perciben como algo roto. El endpointing en producción requiere ajustar el VAD (detección de actividad de voz) a medida para cada entorno de ruido y tipo de llamada.
  • Gestión del silencio. ¿Qué pasa cuando hay 4 segundos de silencio total? ¿Escalar? ¿Volver a preguntar? ¿Rellenar? Tu sistema necesita lógica explícita para esto.
  • DTMF. Quienes llaman pulsarán teclas numéricas durante la llamada esperando un comportamiento de IVR. Si tu agente no detecta los tonos y responde adecuadamente, perderás llamadas.
  • Grabación de llamadas, almacenamiento y PII. ¿Adónde va el audio? ¿Quién tiene acceso? Si trabajas en sanidad o servicios financieros, "va a nuestra nube" no es una respuesta aceptable.
  • Recuperación ante errores. ¿Qué pasa cuando tu LLM va lento? ¿Cuando el TTS falla a media frase? ¿Cuando el operador corta la pata SIP? Tu sistema en producción necesita rutas alternativas para todo esto, y ninguna aparece en el tutorial de 20 minutos.

El punto de equilibrio entre construir y comprar es real, pero no está en el umbral de volumen que sugieren la mayoría de los artículos de blog. El coste oculto no es la infraestructura: es el tiempo de ingeniería para construir y mantener todo lo anterior. Por debajo de 50.000 llamadas al mes, a la mayoría de las empresas les conviene más una plataforma gestionada. La pregunta es cuál.


Latencia y fiabilidad: la brecha entre la demo y la producción

Las llamadas de demostración están seleccionadas a conveniencia. Los sistemas en producción funcionan en condiciones reales.

La cadena de latencia de ida y vuelta en una llamada telefónica AI: captura de audio → STT → LLM → TTS → reproducción de audio. Cada paso añade latencia. El objetivo agregado es menos de 1,2 segundos desde el fin del habla hasta el inicio de la respuesta del agente; por encima de eso, quienes llaman perciben el sistema como defectuoso.

Lo que muestran los paneles de los proveedores: la latencia media de todas las llamadas, medida a menudo en condiciones ideales.

Lo que importa: la latencia p95 y p99 bajo carga real, con audio real de operador y ruido de fondo del mundo real. Un proveedor con 600 ms de latencia media pero 2,8 s de p99 dará la sensación de estar roto en aproximadamente 1 de cada 100 llamadas — y, a gran volumen, eso son muchas llamadas.

Preguntas que hacer antes de firmar:

  • ¿Cuál es su latencia voz a voz p95 y p99 publicada?
  • ¿Cómo cambia la latencia durante los picos de carga (para mi geografía concreta)?
  • ¿Cuál es su SLA de disponibilidad y cuál es la compensación si no lo cumplen?
  • ¿Han hecho pruebas de estrés con el nivel de concurrencia que espero?

La fiabilidad también importa a nivel de operador. La mayoría de las plataformas se apoyan en un único proveedor de SIP trunk. Si ese operador sufre una caída (y ocurre), sus llamadas fallan. Pregunte por el enrutamiento redundante entre operadores.


Checklist del comprador: 12 preguntas antes de firmar

Úsela en las llamadas con proveedores y en las RFP. Los proveedores que no puedan responder con claridad son una señal.

  1. ¿Cuál es su latencia voz a voz p95 en producción, medida de extremo a extremo desde una llamada PSTN?
  2. ¿Qué proveedores de STT, LLM y TTS impulsan su stack, y puedo usar los míos propios?
  3. ¿Cómo se capturan, almacenan y auditan los datos de consentimiento para el cumplimiento de la TCPA?
  4. ¿Ofrecen depuración automatizada de listas DNC, y con qué frecuencia se actualiza la lista?
  5. ¿Cómo gestionan la divulgación del uso de AI en las llamadas salientes?
  6. ¿Qué ocurre cuando mi LLM está lento o no disponible? ¿Cuál es el comportamiento de respaldo?
  7. ¿Admiten transferencia asistida con traspaso de contexto (transcripción + intención + relleno de campos del CRM)?
  8. ¿Cuál es su SLA de disponibilidad y cuál es la compensación si lo incumplen?
  9. ¿Ofrecen HIPAA BAA / SOC 2 Type II, y cuál es el alcance de la cobertura?
  10. ¿Cuál es el coste total por minuto con el volumen que espero, incluyendo STT, LLM, TTS y telefonía?
  11. ¿Pueden facilitar clientes de referencia con un volumen de llamadas y un caso de uso similares?
  12. ¿Cuál es la duración del contrato y cuáles son las condiciones de salida?

Las respuestas a la 10, la 11 y la 12 en conjunto le dirán más sobre un proveedor que su sitio web.


Enlaces internos

  • AI Voice Agent frente a IVR: guía del comprador empresarial 2026 — Tasas de resolución, marco de migración
  • Comparativa de precios de AI voice agents (2026) — Tabla completa de costes por minuto con citas de fuentes
  • Alternativas a Vapi para operaciones de voz con HIPAA — Alcance del BAA, redacción de PHI, matriz de registros de auditoría
  • Manual de TCPA para voice AI saliente (2026) — Guía operativa de implementación de la TCPA
  • Voice AI warm transfer: cómo hacer bien el traspaso de contexto — Cómo pasar el contexto en una escalación

FAQ

¿Cuál es la diferencia entre una llamada telefónica con AI y una robocall? Una robocall reproduce un mensaje pregrabado. Una llamada telefónica con AI ejecuta un agente conversacional en tiempo real que escucha, responde de forma dinámica, gestiona interrupciones y realiza acciones (agenda citas, consulta cuentas). El marco regulatorio de la TCPA se aplica a ambas, pero la experiencia del usuario y las capacidades son fundamentalmente distintas.

¿Necesito consentimiento por escrito antes de usar un agente de AI para llamar a mis clientes actuales? Para llamadas informativas (recordatorios de citas, estado de pedidos), el consentimiento verbal o implícito derivado de la relación previa suele ser suficiente. Para cualquier cosa que pueda interpretarse como telemarketing —incluidos upsells o promociones— se requiere consentimiento expreso previo por escrito. Ante la duda, obtén consentimiento por escrito.

¿Cómo sé si un proveedor de voice AI cumple con la TCPA? Pregunta específicamente: ¿almacenan la marca de tiempo y el origen del consentimiento? ¿Ofrecen depuración automatizada de listas DNC? ¿Aplican restricciones horarias por zona horaria? ¿Insertan la divulgación de AI en los primeros segundos de una llamada saliente? Un proveedor con herramientas reales de cumplimiento puede responder las cuatro preguntas de forma concreta. Uno que no las tenga te dará una respuesta vaga sobre "seguir las mejores prácticas".

¿Cuál es una tasa de resolución realista para los agentes telefónicos de AI? Los casos de uso entrantes con una cobertura de intenciones bien acotada (agendamiento de citas, preguntas frecuentes, estado de cuenta) suelen alcanzar entre un 60 % y un 75 % de resolución completa sin transferencia a un humano en producción. La calificación de leads saliente varía más: entre un 40 % y un 60 % de tasa de finalización en listas que cumplen la normativa, según el sector y la calidad del guion de llamada. Las cifras superiores al 85 % en los casos de éxito de los proveedores suelen reflejar datos seleccionados a conveniencia o casos de uso muy acotados.

Nota sobre el JSON-LD de FAQ: Emite el bloque de esquema <script type="application/ld+json"> FAQ a partir de las cuatro preguntas y respuestas anteriores para poder optar a resultados enriquecidos.


¿Listo para hacer llamadas telefónicas con AI sin conjeturas?

Finn gestiona llamadas entrantes y salientes a escala empresarial, con gestión del consentimiento, traspaso de contexto en transferencias en caliente e integración con CRM incorporadas de fábrica, no añadidas después. Habla con nosotros sobre lo que tu volumen de llamadas y tu caso de uso realmente requieren antes de comprometerte con una plataforma.

Habla con Finn →

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat

Fundador, Finn AI

Digvijay está construyendo Finn: la capa empresarial de orquestación de voz que razona durante las llamadas, extrae datos y actualiza tus sistemas en tiempo real. Escribe sobre IA de voz, estrategia de salida al mercado y lo que hace falta para lanzar agentes autónomos a gran escala.