Se você está construindo um agente de voz, a transcrição é a primeira peça de dominó. Erre nela e todas as etapas seguintes — seu LLM, sua lógica, seu text-to-speech — herdam lixo. A Google Speech-to-Text API é uma das opções mais testadas em produção para transformar áudio em texto, mas a documentação de referência parece um manual de compliance e toda "análise" é escrita por um concorrente vendendo o próprio modelo.
Esta é a versão sem viés de fornecedor. Vamos ver o que a API realmente faz, quanto custa em 2026, como colocar código funcionando e — a parte que ninguém conta — onde o speech-to-text puro deixa de ser suficiente para um agente telefônico em tempo real.
O que é a Google Speech-to-Text API?
O Google Speech-to-Text (STT) é uma API na nuvem que converte áudio em texto usando os modelos de reconhecimento automático de fala (ASR) do Google. Ela expõe três modos de reconhecimento, e escolher o certo é a maior decisão de arquitetura que você vai tomar:
- Síncrono — envie um trecho curto de áudio (≤ 60 segundos), bloqueie e receba a transcrição completa em uma única resposta. É o mais simples de programar; inútil para chamadas ao vivo.
- Assíncrono / em lote (
LongRunningRecognize) — envie áudio longo (até cerca de 480 minutos) para o Cloud Storage e consulte o resultado por polling. É o certo para pipelines de gravação de chamadas, caixa postal e transcrição de podcasts. - Streaming (
StreamingRecognize) — um stream gRPC bidirecional no qual você envia blocos de áudio e recebe resultados parciais e finais enquanto a pessoa fala. É desse modo que depende a sobrevivência de qualquer agente de voz em tempo real.
Do lado dos modelos, a família Chirp (os modelos universais de fala do Google, chirp e chirp_2 na API v2) é o padrão de 2026 em precisão e cobertura multilíngue. Os modelos mais antigos latest_long / latest_short e os ajustados para telefonia continuam existindo na v1 e importam quando você precisa de um recurso específico (como certos aprimoramentos de telefonia) que um modelo mais novo ainda não entregou. Sempre case o modelo com o áudio: passar áudio de telefonia mono em 8 kHz por um modelo ajustado para áudio de estúdio em 16 kHz é um dano de precisão autoinfligido.
Preços da API Google STT em 2026
A cobrança é por minuto de áudio processado, faturada em incrementos arredondados, com faixas que variam por modelo e por recurso. Em vez de citar números que envelhecem rápido, veja como raciocinar sobre a conta — e onde ela dói em escala.
Confira antes de se comprometer: sempre faça as contas com a página de preços do Cloud Speech-to-Text ao vivo. Os números abaixo descrevem a estrutura da cobrança em 2026, não uma cotação fechada.
- Camada gratuita: historicamente o Google ofereceu uma cota mensal gratuita (na ordem de uns 60 minutos) — suficiente para prototipar, longe de suficiente para operar.
- Modelos padrão vs. aprimorados/premium: modelos mais novos ou aprimorados são cobrados a uma taxa por minuto maior do que o reconhecimento padrão legado. Modelos da classe Chirp ficam na ponta premium.
- Recursos se somam: diarização de falantes, confiança por palavra e algumas opções de modelo podem alterar a taxa efetiva ou adicionar processamento.
- Desconto por logging: aceitar o registro de dados (deixar o Google usar seu áudio para melhorar os modelos) historicamente liberava uma taxa menor. Avalie as implicações de governança de dados antes de trocar dados de transcrição por desconto — em cargas de trabalho reguladas essa troca costuma ser inviável.
O custo oculto em escala é o arredondamento + o streaming sempre aberto. Jobs em lote arredondam por requisição. O streaming cobra pelo tempo em que o stream fica aberto — incluindo o silêncio enquanto seu agente está pensando ou falando, se você deixar o microfone ligado. Com 10.000 chamadas simultâneas, alguns segundos desperdiçados de stream aberto por turno viram dinheiro de verdade. Feche o stream no fim da fala; não o mantenha aberto pela chamada inteira.
Guia rápido: autenticar + transcrever áudio
Dois caminhos de entrada. Autentique-se primeiro: crie uma conta de serviço no Google Cloud, conceda a ela o papel de Speech-to-Text, baixe a chave JSON e aponte GOOGLE_APPLICATION_CREDENTIALS para ela.
Perguntas frequentes
O que a Google Speech-to-Text API faz?
Converte áudio em texto, com variantes de modelo para diferentes tipos de áudio e suporte a reconhecimento em lote e em streaming.
Como é a cobrança?
Por duração do áudio, com taxas diferentes por modelo e por recurso. Recursos como diarização e modelos aprimorados custam acima da taxa base, então consulte a página de preços atual em vez de um resumo.
Preciso de um projeto no Google Cloud para usar?
Sim — a autenticação é feita por credenciais do Google Cloud, então um projeto e uma conta de faturamento vêm antes da primeira requisição.




