Skip to main content

Whisper vs Deepgram 2025: STT para agentes de voz

Um benchmark neutro de 2025 entre Whisper e Deepgram para agentes de voz em produção: latência em streaming, WER em telefonia, endpointing e o custo real…

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat
July 26, 2026
10 min read
Uma balança de latão sobre uma laje de mármore sustenta trompetes de cerâmica rosa e um peso verde amarrado com uma fita cor de pêssego

Todo post de "Whisper vs Deepgram" que você vai ler foi escrito por alguém que vende um dos dois. A própria comparação da Deepgram abre com "mais de 90% de precisão em 300 ms". É verdade, e é irrelevante. Se você está ligando reconhecimento de fala a um agente de voz em tempo real que atende ligações telefônicas, a precisão em um trecho limpo de podcast não é o número que decide se o seu agente soa humano ou soa quebrado.

Na Finn, construímos agentes de voz para contact center. Colocamos os dois motores em produção. Aqui está a versão neutra — aquela fundamentada em áudio telefônico de 8 kHz, um orçamento de latência real e a conta de operação que ninguém precifica.

A decisão de verdade: STT em streaming é um orçamento de latência, não um ranking de precisão

Um agente de voz tem uma restrição rígida: a pessoa do outro lado da linha espera uma resposta mais ou menos no mesmo tempo que outra pessoa daria — digamos, de 800 ms a 1,2 s a partir do momento em que ela para de falar. Esse ida e volta total precisa cobrir a finalização do STT, a inferência do LLM, o primeiro byte do TTS e o transporte de rede/SIP. O STT não fica com o orçamento inteiro. Fica com uns 300 ms dele.

Então a pergunta não é "qual motor tem a menor taxa de erro por palavra". É "qual motor me dá transcrições utilizáveis rápido o bastante para que os outros três estágios ainda caibam". Um modelo 2% mais preciso, mas que acrescenta 400 ms de latência de finalização, é um motor pior para agentes de voz, ponto final. Benchmarks de precisão em lote medem o eixo errado para esse trabalho.

Montagem do benchmark: áudio em qualidade telefônica, WER e por que notas em áudio limpo mentem

A maioria dos números de WER publicados vem do LibriSpeech ou similares — fala lida, 16 kHz, limpa de estúdio. Ligações telefônicas são o oposto: banda estreita de 8 kHz (ou G.711 μ-law), artefatos de codec, ruído de fundo, sobreposição de falas, sotaques e quem murmura o número da conta.

Quando você roda os mesmos modelos de novo em áudio telefônico, a diferença muda:

  • Whisper large-v3 em 16 kHz limpo: ~5-8% de WER. Em telefonia ruidosa de 8 kHz: muitas vezes 12-18% de WER, e ele alucina texto fluente porém errado sobre silêncio e ruído — um modo de falha conhecido e perigoso quando a transcrição alimenta um LLM.
  • Deepgram Nova-2/Nova-3, ajustado para áudio de telefone e streaming: 8-13% de WER no mesmo conjunto telefônico, e a degradação é mais suave — ele tende a perder palavras em vez de inventá-las.

A lição: faça o benchmark com o seu próprio áudio. Pegue 200 ligações reais gravadas, rotule à mão e avalie os dois motores sobre isso. O ranking que você obtiver não vai bater com nenhum blog de fornecedor, incluindo este. Se levar só uma coisa daqui, leve essa.

Latência e endpointing: primeiro token, finalização e barge-in

Três números de latência importam, e só um aparece no marketing.

Latência do primeiro token — com que rapidez as transcrições parciais começam a voltar em streaming. A Deepgram transmite resultados intermediários em ~100-200 ms. O Whisper é um modelo em lote; os wrappers de streaming da comunidade (whisper-streaming, WhisperLive) fatiam o áudio e redecodificam, o que significa que os parciais chegam em 500 ms-1 s ou mais e oscilam sob carga.

Latência de finalização — quanto tempo depois de a pessoa parar de falar até você ter uma transcrição final estável para entregar ao LLM. Isso é governado pelo endpointing (a detecção de atividade de voz que decide que o turno acabou). A Deepgram entrega endpointing ajustável (endpointing=300). Com o Whisper, você acopla o seu próprio VAD (Silero, WebRTC VAD) e ajusta por conta própria — mais controle, mais corda.

Barge-in — quando quem liga interrompe o agente no meio da frase, você precisa detectar a fala e matar o TTS em ~100-200 ms, senão o agente fala por cima. É um problema de parciais em streaming + VAD. Motores com streaming nativo tornam isso fácil; o Whisper em lote transforma isso em projeto.

Ajustar o endpointing é a alavanca de latência de maior impacto de toda a pilha — agressiva demais e você corta a pessoa no meio da palavra; frouxa demais e você adiciona 500 ms de silêncio morto a cada turno. Veja nossa dissecação de motores de voz de baixa latência para saber onde isso entra no pipeline.

Whisper auto-hospedado: custo de GPU, batching e a carga de operação que ninguém precifica

"Whisper é de graça" é a frase mais cara da IA de voz. Os pesos do modelo são gratuitos. Rodá-los em tempo real na concorrência de um call center não é.

Números reais para uma implantação auto-hospedada de faster-whisper (CTranslate2) large-v3:

  • GPU: uma A10G ou L4 aguenta cerca de 8-15 streams simultâneos em tempo real no large-v3 antes de a latência degradar. Com 100 ligações simultâneas, você precisa de ~8-12 GPUs. Uma A10G em nuvem sob demanda custa ~$1.00-1.30/hr; reservada fica mais barata. Considere $7,000-10,000/month de GPU para sustentar 100 streams simultâneos, antes de redundância.
  • Compensação do batching: agrupar eleva a vazão por GPU, mas aumenta a latência — exatamente o que você está protegendo. Voz em tempo real limita o quanto dá para agrupar, então a utilização da sua GPU fica baixa (muitas vezes 30-50%), e isso é dinheiro queimando.
  • Carga de operação: carregamento do modelo, pools quentes para evitar cold start, autoescalonamento em tráfego de entrada em rajadas, ajuste de VAD, filtragem de alucinações, manutenção de driver de GPU/CUDA e plantão 24/7 quando um nó trava no meio da ligação. Isso dá 0,5-1 FTE de engenharia de plataforma que nunca aparece numa comparação por minuto.

Amortizado, o Whisper auto-hospedado com 100 ligações simultâneas costuma ficar em $0.006-0.012/min tudo incluído — competitivo no papel, mas só depois de você pagar a engenharia que o torna confiável. Abaixo de um volume sério, quase nunca compensa. Nosso pipeline híbrido de ASR abaixo de 120 ms cobre a fundo a matemática de batching versus latência.

Deepgram / APIs gerenciadas: custo por minuto em escala e roteamento regional

O STT gerenciado inverte a compensação: custo marginal maior, operação quase zero.

  • O streaming do Deepgram Nova é listado em torno de $0.0077/min (Nova pré-pago, streaming), com descontos por volume ou compromisso puxando isso para baixo em escala.
  • Sem GPUs, sem pools quentes, sem CUDA. Você ganha autoescalonamento, endpointing e streaming sem esforço.
  • Roteamento regional importa mais do que o preço de tabela. Se a sua mídia termina em Mumbai e o seu endpoint de STT está em us-east, você acabou de somar 200-300 ms de ida e volta transatlântica a cada parcial. Fornecedores gerenciados com endpoints regionais (ou implantações corporativas auto-hospedadas perto do seu plano de mídia) apagam isso. Para pilhas de mercado duplo EUA-Índia isso é decisivo — veja nossa arquitetura de latência transfronteiriça.

A leitura honesta: para a maioria dos times abaixo de ~50 ligações simultâneas, o gerenciado vence no custo total assim que você precifica o engenheiro. Acima disso, a conta começa a favorecer a auto-hospedagem — se você tiver o time de plataforma.

Como a escolha de STT se propaga para a latência total de ida e volta

Eis um orçamento de turno representativo para uma ligação de entrada, alvo de resposta percebida < 1000ms:

EstágioGerenciado (Deepgram)Whisper auto-hospedado (ingênuo)
Transporte SIP/mídia80ms80ms
Finalização do STT (pós-endpoint)250ms700ms
Primeiro token do LLM350ms350ms
Primeiro byte do TTS150ms150ms
Resposta percebida~830ms~1280ms

Mesmo LLM, mesmo TTS. Só a escolha do STT joga a experiência de quem liga para o outro lado da linha do "soa humano". Esses 450 ms são a diferença entre um agente com quem as pessoas conversam e um em que elas desligam na cara. Latência de STT não é um item de linha — é um multiplicador sobre tudo que vem depois. É por isso que tratamos como orçamento, não como benchmark. Mais sobre o pipeline completo em além do wrapper.

Matriz de decisão: escolha por volume de ligações, mix de idiomas e SLA de latência

  • < 50 simultâneas, predomínio de inglês, SLA apertado → Gerenciado (Deepgram ou equivalente). Você não bate o custo ajustado ao esforço, e streaming/endpointing já está resolvido.
  • Alto volume (100+ simultâneas), tráfego estável, time de plataforma no quadro → Whisper auto-hospedado (faster-whisper) começa a vencer no custo marginal. Orce o FTE com honestidade.
  • Multilíngue pesado / alternância de código → Teste os dois nos seus idiomas. A amplitude multilíngue do Whisper é forte, mas o WER varia muito por idioma; motores gerenciados também variam. Não presuma — meça. Veja o imposto multilíngue oculto.
  • Regulado / residência de dados (saúde, DLT da Índia, UE) → Auto-hospedado ou uma implantação gerenciada regional, escolhida por onde a sua mídia precisa legalmente permanecer.
  • Sensível a alucinação (a transcrição alimenta um LLM que age sobre ela) → Pondere a alucinação em silêncio do Whisper contra a degradação suave da Deepgram, e adicione guardrails de todo jeito. Nosso guia para conter a alucinação em IA de voz se aplica diretamente.

O resumo da ópera

Whisper vs Deepgram não é um concurso de precisão — é uma decisão de orçamento de latência e carga de operação. O gerenciado vence em esforço e tempo até entregar; o Whisper auto-hospedado vence no custo marginal só em escala real e só com um time de plataforma por trás. De qualquer forma: faça o benchmark com o seu próprio áudio telefônico, ajuste o endpointing a sério e contabilize o ida e volta completo. A transcrição é só os primeiros 300 ms de uma promessa de um segundo feita a quem ligou.

Perguntas frequentes

O Whisper é mais preciso que a Deepgram em 2025? Em áudio limpo de 16 kHz, o Whisper large-v3 é muito forte. Em telefonia ruidosa de 8 kHz — o áudio que um agente de voz de fato ouve — a diferença encolhe ou se inverte, e a alucinação em silêncio do Whisper é um risco real. Faça o benchmark com as suas próprias ligações gravadas antes de decidir.

Quanto custa de verdade hospedar o Whisper por conta própria? Não é de graça. Com 100 streams simultâneos em tempo real, conte com 8-12 GPUs ($7-10k/month) mais 0,5-1 FTE de engenharia de plataforma. Tudo incluído, fica em torno de $0.006-0.012/min — competitivo com o gerenciado só em escala.

O Whisper faz streaming em tempo real? Não nativamente — é um modelo em lote. Wrappers da comunidade (WhisperLive, faster-whisper + VAD) acrescentam streaming, mas a latência do primeiro token (500 ms-1 s ou mais) e a oscilação são piores do que em APIs com streaming nativo. Barge-in e endpointing viram problema seu para construir.

Qual é melhor para um agente de voz de contact center? Para a maioria dos times abaixo de ~50 ligações simultâneas, uma API gerenciada de streaming (Deepgram ou equivalente) com endpointing ajustado e um endpoint regional. Acima disso, com um time de plataforma, o Whisper auto-hospedado começa a vencer no custo. O SLA, não o WER, deve decidir.

Construa um agente de voz que respeita o orçamento de latência

A Finn entrega agentes de voz de contact center em produção com STT, endpointing e roteamento regional já ajustados para o ida e volta abaixo de 1 s — assim você pula a matemática de GPU e o pager das 3 da manhã. Veja como a Finn mantém agentes de voz abaixo da linha de latência →

Relacionado: Implantação de agentes de IA: rodar agentes de voz com confiabilidade

Relacionado: Rastreamento de chamadas para agentes de voz com IA: da atribuição à receita

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat

Fundador, Finn AI

Digvijay está construindo a Finn — a camada de orquestração de voz corporativa que raciocina durante as chamadas, extrai dados e atualiza seus sistemas em tempo real. Escreve sobre voice AI, go-to-market e o que é preciso para colocar agentes autônomos em produção em escala.