Skip to main content

Capacidad y escala

Cuántas llamadas simultáneas, y cómo crecer.

10 min read

La respuesta corta: miles de llamadas simultáneas, decenas de miles de llamadas al día, cientos de miles al mes. La plataforma está diseñada para escalar horizontalmente. Esta página explica qué significan esas cifras en la práctica, los límites de cada plan y cómo crecer sin sorpresas.

No optimices para escalar antes de tiempo. La mayoría de las cuentas ejecutan menos de 100 llamadas simultáneas en producción. Incluso los clientes de mercado medio rara vez llegan a 500 simultáneas. Si no sabes cuál será tu pico, empieza, mide y escala más adelante. Los planes son fáciles de mejorar.


Límites de un vistazo

PlanMáx. llamadas simultáneas (por Finn)Máx. llamadas simultáneas (toda la cuenta)Máx. llamadas por díaMáx. llamadas por mes
Starter551,00010,000
Growth5020025,000250,000
Scale5001,000100,0002,000,000
EnterprisePersonalizadoPersonalizado (5,000+)PersonalizadoPersonalizado

Los límites por Finn existen porque un solo Finn equivale a un único punto de contacto en la mente de tu audiencia. Más allá de unos cientos de llamadas simultáneas desde una misma identidad, se generan patrones de volumen poco realistas. Usa varios Finns o grupos de números para escalar por encima del límite por Finn.


Qué significa realmente "llamadas simultáneas"

Cuando la plataforma indica "200 llamadas simultáneas", se refiere a 200 conversaciones activas al mismo tiempo. Cada llamada usa de forma dedicada:

  • Una instancia de inferencia del LLM (procesa la conversación)
  • Una instancia de streaming de TTS (genera el audio de voz)
  • Una instancia de STT (transcribe el habla del interlocutor)
  • Un canal de telefonía (la conexión telefónica real)

La plataforma escala cada uno de estos elementos de forma independiente. No tienes que preocuparte por el aprovisionamiento: funciona sin más.


Cómo estimar tu carga máxima

Algunos cálculos aproximados:

Campañas de salida

peak concurrent calls ≈ (calls per hour) × (avg duration in minutes) / 60

Ejemplo: 1.000 llamadas por hacer, duración media de 2 minutos, repartidas en 4 horas = 250 llamadas/hora × 2/60 = ~8 concurrentes en pico.

Entrada

peak concurrent calls ≈ (calls per hour at peak time) × (avg duration in minutes) / 60

Ejemplo: una clínica recibe 30 llamadas/hora en el pico del mediodía, duración media de 4 minutos = 30 × 4/60 = 2 concurrentes en pico.

A la mayoría de las empresas les sorprende lo bajo que es su pico real de concurrencia. Incluso un Finn recepcionista con mucha actividad rara vez necesita más de 10-20 concurrentes.

Cuándo los despliegues paralelos elevan las cifras

Los despliegues paralelos (Enterprise) son distintos: maximizan de forma explícita la marcación concurrente para completar rápido una lista grande.

Ejemplo: 50.000 contactos, llamada media de 90 segundos, completar en 4 horas = 50.000 llamadas / (4 × 3600/90) = ~313 concurrentes de media; picos del doble = ~625 concurrentes.

Para los despliegues paralelos necesitas capacidad de plan Y capacidad de grupo de números. Un solo número no puede soportar físicamente más de ~50 llamadas de salida simultáneas (límites del operador).


Grupos de números y capacidad concurrente

En llamadas de salida de alta concurrencia, el factor limitante suele ser los números de teléfono, no la capacidad de la plataforma.

Límites por número

RegiónMáx. de llamadas de salida concurrentes por número
EE. UU./Canadá~50
Reino Unido~30
UE (mayoría)~20
India~10
Otrosvaría (a menudo ~5-15)

Estos límites los impone el operador, no la plataforma. Superarlos hace que el operador de destino rechace las llamadas.

Regla práctica para dimensionar el grupo

pool size ≈ peak concurrent calls / per-number limit × 1.5 (safety margin)

Ejemplo: si planificas 500 llamadas de salida concurrentes en EE. UU. = 500/50 × 1,5 = 15 números en el grupo.

Compra más números de los que creas necesitar. Los números son baratos ($1-$5/mes); las llamadas fallidas por grupos infradimensionados salen caras (respuestas perdidas + daño de marca por errores de "no se puede contactar con este número").


Latencia y calidad a escala

El objetivo de latencia de la plataforma es <800 ms desde el fin del habla del usuario hasta el inicio de la respuesta de Finn. Se mantiene tanto si ejecutas 1 llamada como 1.000 concurrentes: el sistema está diseñado para escalar horizontalmente, no solo en rendimiento sino en calidad por llamada.

Qué puede degradar la calidad a escala:

CausaEfectoSolución
Llamadas entre regiones (p. ej. un Finn en EE. UU. llamando a números de la UE)+100-300 ms de latencia por el salto de redConfigurar cuentas regionales (Enterprise) o asumir la latencia
Nivel de voz premium bajo cargaMisma latencia objetivo, pero mayor variación en TTSLas voces estándar son más consistentes bajo carga
Base de conocimiento con más de 500 MB de contenidoRecuperación algo más lentaReduce la base de conocimiento a archivos más pequeños y específicos
Tráfico en ráfagas (de 0 a 100 llamadas simultáneas en segundos)Pico de latencia por arranque en frío en las primeras llamadasPrecalienta con llamadas de prueba pequeñas programadas antes del pico real

Límites de frecuencia

Además de los límites de llamadas simultáneas, la plataforma aplica límites de frecuencia de solicitudes en:

AcciónLímite (predeterminado)Excepciones por plan
Solicitudes de API (por clave)100 solicitudes/minHasta 1.000/min en Scale, ilimitadas en Enterprise
Entregas de webhooks (por endpoint)50 solicitudes/sHasta 500/s en Scale
Importaciones masivas de audiencia100.000 contactos por cargaMás en Scale+
Llamadas de prueba (por Finn)30/horaIgual en todos los planes
Nuevos despliegues lanzados10/hora50/hora en Scale+

Las respuestas limitadas por frecuencia devuelven 429 Too Many Requests con una cabecera Retry-After que indica cuándo reintentar.


Multirregión y residencia de datos

Para casos de uso sensibles a la latencia o requisitos de cumplimiento, puedes elegir en qué región se ejecuta tu cuenta.

RegiónDónde residen tus datosIdeal para
EE. UU. (predeterminado)Virginia (us-east-1)Norteamérica, LATAM
UEFráncfort (eu-central-1)UE/Reino Unido, GDPR estricto
IndiaBombay (ap-south-1)India, Asia meridional, Oriente Medio
Asia-PacíficoSingapur (Enterprise)Sudeste Asiático, Australia, Nueva Zelanda

Elige la región al crear la cuenta. No se puede cambiar después sin migrar los datos. Si tu objetivo son clientes de la UE, elige UE durante el registro.

Los datos nunca salen de la región elegida. Grabaciones, transcripciones, registros de audiencia, análisis posterior a la llamada: todo permanece en la región.


Capacidad de ráfaga

A veces necesitas un pico puntual por encima de los límites de tu plan (campañas electorales, lanzamiento de producto, respuesta ante fenómenos meteorológicos).

  • Ráfaga preautorizada: contacta con soporte 48 h antes indicando el pico previsto. Nosotros aprovisionamos la capacidad y tú solo pagas por el uso real que exceda tu nivel.
  • Ráfaga flexible: la plataforma permite hasta un 20 % por encima del límite de llamadas simultáneas de tu plan durante picos cortos (menos de 15 minutos). Úsala con moderación; las ráfagas sostenidas se limitan.

Cuando alcanzas un límite

Si superas el límite de llamadas simultáneas, las nuevas llamadas salientes se ponen en cola en lugar de fallar. La cola se vacía a medida que finalizan las llamadas activas.

En entrantes, superar el límite significa que las nuevas llamadas reciben un tono de "ocupado" o pasan al buzón de voz de reserva (configurable por número).

En ambos casos, el panel muestra un banner de advertencia amarillo. Si aparece más que ocasionalmente, mejora tu plan.


Referencias de rendimiento en producción

Cifras reales de clientes que operan a escala (anonimizadas):

Perfil del clienteLlamadas diariasPico de simultáneasDuración mediaPlan
Grupo de clínicas sanitarias (5 sedes)800123,5 minGrowth
Refuerzo de SDR en ventas B2B3.500802,1 minGrowth
Recepción de siniestros de seguros1.200257 minGrowth
Cobro de deudas (mercado medio)18.0003001,8 minScale
Campaña electoral (puntual)250.0002.0000,9 minEnterprise burst
Barrido de renovación de suscripciones45.000/día6001,5 minScale

Si tus cifras previstas están en estos rangos o por debajo, la plataforma las gestiona sin problema. Por encima de la fila superior, contacta con ventas para planificar la capacidad.


Cómo escalar de forma segura

Etapa 1 — Piloto (1-50 llamadas/día)

  • Un solo Finn, un solo despliegue.
  • Ejecuta con la prueba del plan Starter o Growth.
  • Mide: tasa de éxito, tasa de finalización, coste por resultado.

Etapa 2 — Lanzamiento en producción (50-1.000 llamadas/día)

  • Misma configuración de Finn; añade monitorización.
  • Establece límites de gasto por despliegue.
  • Registra el identificador de llamada y configura la supresión automática.

Etapa 3 — Escalado (1.000-10.000 llamadas/día)

  • Añade un pool de números (5-15 números).
  • Considera la segmentación multi-Finn (distintos Finn para distintos segmentos de audiencia).
  • Configura alertas de Slack para fallos de despliegue.
  • Pasa al plan Scale.

Etapa 4 — Gran escala (más de 10.000 llamadas/día)

  • Despliegues en paralelo.
  • Pools de números más grandes (más de 50).
  • Stream de webhooks para analítica en tiempo real en tus propios sistemas.
  • Plan Enterprise con CSM dedicado + SLA.

Etapa 5 — Escala masiva (más de 100.000 llamadas/día)

  • Infraestructura dedicada (Enterprise).
  • Multirregión para optimizar la latencia.
  • Límites de tasa personalizados, integraciones personalizadas.
  • Línea directa con ingeniería para planificar picos.

Preguntas frecuentes

P: ¿Cuál es el límite técnico real de llamadas simultáneas? R: No es una cifra publicada. Hemos hecho pruebas de estrés por encima de 50.000 simultáneas. En la práctica, el límite que alcanzarás será el de tu plan o el tamaño de tu grupo de números, no la capacidad de la plataforma.

P: Si supero el límite de mi plan, ¿se actualiza automáticamente? R: No: eso sería una receta para facturas sorpresa. La plataforma pone las llamadas en cola o las rechaza y muestra un aviso. Tú actualizas manualmente cuando quieras.

P: ¿Las llamadas cuestan más en horas punta? R: No. El precio es plano por minuto, independientemente de cuándo se produzca la llamada.

P: ¿Puedo ejecutar distintos Finn con distintos volúmenes de simultaneidad? R: Sí. Cada Finn tiene su propio límite individual, y el límite de la cuenta se comparte entre todos los Finn. Puedes ejecutar a la vez un cualificador con 100 simultáneas y un recepcionista con 20 sin problema.

P: ¿Con qué rapidez puedo escalar un nuevo despliegue? R: La mayoría de los despliegues alcanzan su simultaneidad objetivo entre 2 y 5 minutos después del lanzamiento. Las subidas muy grandes (más de 1.000 simultáneas en menos de 1 minuto) requieren coordinación previa con soporte.


Siguiente

Was this page helpful?

Still stuck or have feedback?

Email [email protected] or use the chat bubble in the bottom-right corner — it's a Finn that knows the Academy cold.