Capacidade e Escala
Quantas chamadas simultâneas — e como crescer.
A resposta curta: milhares de chamadas simultâneas, dezenas de milhares de chamadas por dia, centenas de milhares por mês. A plataforma foi projetada para escalar horizontalmente. Esta página mostra o que esses números significam na prática, os limites de cada plano e como crescer sem surpresas.
Não otimize para escala antes da hora. A maioria das contas roda menos de 100 chamadas simultâneas em produção. Mesmo clientes de médio porte raramente chegam a 500 simultâneas. Se você não sabe qual será seu pico — comece, meça e escale depois. Os planos são fáceis de atualizar.
Limites em resumo
| Plano | Máx. de chamadas simultâneas (por Finn) | Máx. de chamadas simultâneas (na conta toda) | Máx. de chamadas por dia | Máx. de chamadas por mês |
|---|---|---|---|---|
| Starter | 5 | 5 | 1.000 | 10.000 |
| Growth | 50 | 200 | 25.000 | 250.000 |
| Scale | 500 | 1.000 | 100.000 | 2.000.000 |
| Enterprise | Personalizado | Personalizado (5.000+) | Personalizado | Personalizado |
Os limites por Finn existem porque um único Finn = um único ponto de contato na mente do seu público. Acima de algumas centenas de discagens simultâneas a partir de uma mesma identidade, você cria padrões de volume de chamadas irreais. Use vários Finns ou pools de números para escalar além do limite por Finn.
O que "chamadas simultâneas" significa de fato
Quando a plataforma diz "200 chamadas simultâneas", isso significa 200 conversas ativas acontecendo ao mesmo tempo. Cada chamada usa uma instância dedicada de:
- Inferência de LLM (processando a conversa)
- Streaming de TTS (gerando o áudio da voz)
- STT (transcrevendo a fala do interlocutor)
- Canal de telefonia (a conexão telefônica em si)
A plataforma escala cada um desses componentes de forma independente. Você não precisa se preocupar com provisionamento — simplesmente funciona.
Como estimar seu pico de carga
Alguns cálculos aproximados:
Campanhas outbound
peak concurrent calls ≈ (calls per hour) × (avg duration in minutes) / 60
Exemplo: 1.000 chamadas a fazer, duração média de 2 minutos, executadas em 4 horas = 250 chamadas/hora × 2/60 = ~8 de pico simultâneo.
Inbound
peak concurrent calls ≈ (calls per hour at peak time) × (avg duration in minutes) / 60
Exemplo: uma clínica recebe 30 chamadas/hora no pico do almoço, duração média de 4 minutos = 30 × 4/60 = 2 de pico simultâneo.
A maioria das empresas se surpreende com o quão baixo é seu pico real de simultaneidade. Mesmo um Finn recepcionista movimentado raramente precisa de mais de 10-20 chamadas simultâneas.
Quando implantações paralelas elevam os números
Implantações paralelas (Enterprise) são diferentes — elas maximizam explicitamente a discagem simultânea para concluir uma lista grande rapidamente.
Exemplo: 50.000 contatos, chamada média de 90 segundos, concluir em 4 horas = 50.000 chamadas / (4 × 3600/90) = ~313 simultâneas em média; picos de 2x isso = ~625 simultâneas.
Para implantações paralelas, você precisa de capacidade de plano E de capacidade do pool de números. Números individuais não conseguem fisicamente suportar mais de ~50 chamadas outbound simultâneas (limites da operadora).
Pools de números e capacidade simultânea
Para outbound de alta simultaneidade, o fator limitante costuma ser os números de telefone — não a capacidade da plataforma.
Limites por número
| Região | Máximo de chamadas outbound simultâneas por número |
|---|---|
| EUA/Canadá | ~50 |
| Reino Unido | ~30 |
| UE (maioria) | ~20 |
| Índia | ~10 |
| Outros | varia (geralmente ~5-15) |
Esses limites são impostos pela operadora, não pela plataforma. Excedê-los faz com que as chamadas sejam rejeitadas pela operadora de destino.
Regra prática de dimensionamento do pool
pool size ≈ peak concurrent calls / per-number limit × 1.5 (safety margin)
Exemplo: planejando 500 chamadas outbound simultâneas nos EUA = 500/50 × 1,5 = 15 números no pool.
Compre mais números do que você acha que precisa. Números são baratos (US$ 1-US$ 5/mês); chamadas falhas por pools subdimensionados são caras (atendimentos perdidos + dano à marca por erros de "este número não pode ser contatado").
Latência e qualidade em escala
A meta de latência da plataforma é <800ms entre o fim da fala do usuário e o início da resposta do Finn. Isso vale tanto para 1 chamada quanto para 1.000 chamadas simultâneas — o sistema foi projetado para escalar horizontalmente, não só em throughput, mas também em qualidade por chamada.
O que pode degradar a qualidade em escala:
| Causa | Efeito | Correção |
|---|---|---|
| Chamadas entre regiões (ex.: Finn nos EUA ligando para números da UE) | +100-300ms de latência por causa do salto de rede | Configure contas regionais (Enterprise) ou aceite a latência |
| Camada de voz premium sob carga | Mesma latência-alvo, mas maior variação de TTS | Vozes padrão são mais consistentes sob carga |
| Base de conhecimento com mais de 500 MB de conteúdo | Recuperação um pouco mais lenta | Reduza a KB para arquivos menores e focados |
| Tráfego em picos (0 → 100 simultâneas em segundos) | Pico de latência de inicialização a frio nas primeiras chamadas | Faça um pré-aquecimento com pequenas chamadas de teste agendadas antes do pico real |
Limites de taxa
Além dos limites de chamadas simultâneas, a plataforma aplica limites de taxa de requisição a:
| Ação | Limite (padrão) | Exceções por plano |
|---|---|---|
| Requisições de API (por chave) | 100 req/min | Até 1.000/min no Scale, ilimitado no Enterprise |
| Entregas de webhook (por endpoint) | 50 req/s | Até 500/s no Scale |
| Importações em massa de audiência | 100.000 contatos por upload | Mais no Scale+ |
| Chamadas de teste (por Finn) | 30/hora | Igual em todos os planos |
| Novas implantações iniciadas | 10/hora | 50/hora no Scale+ |
Respostas limitadas por taxa retornam 429 Too Many Requests com um cabeçalho Retry-After indicando quando tentar novamente.
Multirregião e residência de dados
Para casos de uso sensíveis à latência ou requisitos de conformidade, você pode escolher em qual região sua conta é executada.
| Região | Onde seus dados ficam | Melhor para |
|---|---|---|
| EUA (padrão) | Virgínia (us-east-1) | América do Norte, LATAM |
| UE | Frankfurt (eu-central-1) | UE/Reino Unido, GDPR rigoroso |
| Índia | Mumbai (ap-south-1) | Índia, Sul da Ásia, Oriente Médio |
| Ásia-Pacífico | Singapura (Enterprise) | Sudeste Asiático, Austrália, Nova Zelândia |
Escolha a região na criação da conta. Não pode ser alterada depois sem migração de dados. Se o público-alvo forem clientes da UE, escolha UE no cadastro.
Os dados nunca saem da região escolhida. Gravações, transcrições, registros de audiência, análise pós-chamada — tudo permanece na região.
Capacidade de pico
Às vezes é preciso um pico pontual acima dos limites do plano (campanhas eleitorais, lançamento de produto, resposta a eventos climáticos).
- Pico pré-autorizado — entre em contato com o suporte 48h antes informando o pico esperado. Provisionamos a capacidade e você paga apenas pelo uso efetivo acima do seu nível.
- Pico flexível — a plataforma permite até 20% acima do limite de chamadas simultâneas do seu plano em picos curtos (menos de 15 minutos). Use com moderação; picos prolongados sofrem limitação.
Quando você atinge um limite
Se exceder o limite de chamadas simultâneas, as novas chamadas de saída entram em fila em vez de falhar. A fila é esvaziada conforme as chamadas ativas terminam.
Para chamadas de entrada, exceder o limite faz com que novas chamadas recebam um tom de "ocupado no momento" ou caiam no correio de voz de fallback (configurável por número).
Nos dois casos, o painel exibe um banner de aviso amarelo. Se ele aparecer com frequência, faça upgrade do plano.
Benchmarks de desempenho em produção
Números reais de clientes operando em escala (anonimizados):
| Perfil do cliente | Chamadas diárias | Pico de simultâneas | Duração média | Plano |
|---|---|---|---|---|
| Grupo de clínicas de saúde (5 unidades) | 800 | 12 | 3,5 min | Growth |
| Reforço de SDR em vendas B2B | 3.500 | 80 | 2,1 min | Growth |
| Recepção de sinistros de seguros | 1.200 | 25 | 7 min | Growth |
| Cobrança de dívidas (mid-market) | 18.000 | 300 | 1,8 min | Scale |
| Ação eleitoral (pontual) | 250.000 | 2.000 | 0,9 min | Enterprise burst |
| Campanha de renovação de assinaturas | 45.000/dia | 600 | 1,5 min | Scale |
Se os números projetados estiverem nessas faixas ou abaixo, a plataforma os suporta sem problemas. Acima da primeira linha, entre em contato com a equipe de vendas para planejamento de capacidade.
Como escalar com segurança
Estágio 1 — Piloto (1-50 chamadas/dia)
- Um único Finn, uma única implantação.
- Execute no teste do plano Starter ou Growth.
- Meça: taxa de sucesso, taxa de conclusão, custo por resultado.
Estágio 2 — Lançamento em produção (50-1.000 chamadas/dia)
- Mesma configuração do Finn; adicione monitoramento.
- Defina limites de gastos por implantação.
- Registre o identificador de chamadas e configure a supressão automática.
Estágio 3 — Escala (1.000-10.000 chamadas/dia)
- Adicione um pool de números (5-15 números).
- Considere a segmentação multi-Finn (Finns diferentes para segmentos de público diferentes).
- Configure alertas no Slack para falhas de implantação.
- Migre para o plano Scale.
Estágio 4 — Alta escala (10.000+ chamadas/dia)
- Implantações paralelas.
- Pools de números maiores (50+).
- Stream de webhook para análises em tempo real nos seus próprios sistemas.
- Plano Enterprise com CSM dedicado + SLA.
Etapa 5 — Escala massiva (mais de 100.000 chamadas/dia)
- Infraestrutura dedicada (Enterprise).
- Multirregião para otimização de latência.
- Limites de taxa personalizados, integrações personalizadas.
- Linha direta com a engenharia para planejamento de picos.
Perguntas frequentes
P: Qual é o limite técnico real de chamadas simultâneas? R: Não é um número publicado. Fizemos testes de estresse acima de 50.000 simultâneas. Na prática, o limite que você vai atingir é o nível do seu plano ou o tamanho do seu pool de números, não a capacidade da plataforma.
P: Se eu exceder o limite do meu plano, ele faz upgrade automático? R: Não — isso seria receita para faturas surpresa. A plataforma coloca as chamadas em fila ou as rejeita e exibe um aviso. Você faz o upgrade manualmente quando estiver pronto.
P: As chamadas custam mais em horários de pico? R: Não. O preço é fixo por minuto, independentemente de quando a chamada acontece.
P: Posso executar Finns diferentes com volumes simultâneos diferentes? R: Sim. Cada Finn tem seu próprio limite individual, e o limite geral da conta é compartilhado entre todos os Finns. Você pode executar um qualificador com 100 simultâneas e um recepcionista com 20 simultâneas ao mesmo tempo, sem problemas.
P: Com que rapidez posso escalar uma nova implantação? R: A maioria das implantações atinge o volume simultâneo desejado em 2 a 5 minutos após o lançamento. Escaladas muito grandes (mais de 1.000 simultâneas em menos de 1 minuto) exigem coordenação prévia com o suporte.
Próximos passos
- Números de telefone → Pools de números — como configurar pools para escala.
- Faturamento → — quanto custa cada nível de plano.
- Campanhas e implantações → Implantações paralelas — para saída com alta simultaneidade.
Was this page helpful?
Still stuck or have feedback?
Email [email protected] or use the chat bubble in the bottom-right corner — it's a Finn that knows the Academy cold.