Skip to main content

Google Speech-to-Text API: la guía del desarrollador para 2026

Lanza con la Google Speech-to-Text API: precios en 2026, guía rápida en Python + REST, latencia en streaming y cómo se compara con Whisper, Deepgram y…

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat
July 26, 2026
4 min read
Una onda de vidrio ámbar translúcido fluye desde una bocina blanca hacia bloques apilados de color verde oliva bajo una luz suave

Si estás construyendo un agente de voz, la transcripción es la primera ficha de dominó. Si falla, todas las etapas posteriores — tu LLM, tu lógica, tu texto a voz — heredan basura. La Google Speech-to-Text API es una de las opciones más probadas en producción para convertir audio en texto, pero la documentación de referencia se lee como un manual de cumplimiento normativo y cada "análisis comparativo" lo escribe un competidor que vende su propio modelo.

Esta es la versión sin sesgo de proveedor. Veremos qué hace realmente la API, cuánto cuesta en 2026, cómo llevar código a producción y — la parte que nadie te cuenta — dónde el speech-to-text puro deja de ser suficiente para un agente telefónico en tiempo real.

¿Qué es la Google Speech-to-Text API?

Google Speech-to-Text (STT) es una API en la nube que convierte audio en texto mediante los modelos de reconocimiento automático del habla (ASR) de Google. Expone tres modos de reconocimiento, y elegir el correcto es la mayor decisión de arquitectura que vas a tomar:

  • Síncrono — envías un clip de audio corto (≤ 60 segundos), bloqueas y recibes la transcripción completa en una sola respuesta. Es lo más sencillo de programar; inútil para llamadas en vivo.
  • Asíncrono / por lotes (LongRunningRecognize) — subes audio largo (hasta unos 480 minutos) a Cloud Storage y consultas el resultado por sondeo. Es lo adecuado para pipelines de grabación de llamadas, buzones de voz y transcripción de pódcasts.
  • Streaming (StreamingRecognize) — un stream gRPC bidireccional en el que envías fragmentos de audio y recibes resultados interinos y finales mientras la persona habla. De este modo depende la vida o la muerte de cualquier agente de voz en tiempo real.

En cuanto a modelos, la familia Chirp (los modelos universales de habla de Google, chirp y chirp_2 en la API v2) es la opción por defecto en 2026 por precisión y cobertura multilingüe. Los modelos más antiguos latest_long / latest_short y los ajustados para telefonía siguen existiendo en v1 e importan cuando necesitas una función concreta (como ciertas mejoras de telefonía) que un modelo más nuevo aún no incorpora. Ajusta siempre el modelo al audio: pasar audio telefónico mono de 8 kHz por un modelo ajustado a audio de estudio de 16 kHz es dispararse en el pie en cuanto a precisión.

Precios de la API de Google STT en 2026

La facturación es por minuto de audio procesado, en incrementos redondeados, con niveles que varían según el modelo y las funciones. En lugar de citar cifras que quedan obsoletas, aquí tienes cómo razonar sobre la factura — y dónde duele a gran escala.

Verifica antes de comprometerte: calcula siempre los costes con la página de precios de Cloud Speech-to-Text en vivo. Las cifras siguientes describen la estructura de la facturación en 2026, no un presupuesto cerrado.

  • Nivel gratuito: históricamente Google ha ofrecido una asignación gratuita mensual (del orden de unos 60 minutos) — suficiente para prototipar, ni de lejos suficiente para operar.
  • Modelos estándar frente a mejorados/premium: los modelos más nuevos o mejorados se facturan a una tarifa por minuto superior a la del reconocimiento estándar heredado. Los modelos de la clase Chirp se sitúan en el extremo premium.
  • Las funciones se suman: la diarización de hablantes, la confianza a nivel de palabra y algunas opciones de modelo pueden cambiar la tarifa efectiva o añadir procesamiento.
  • Descuento por registro de datos: activar el registro de datos (permitir que Google use tu audio para mejorar sus modelos) ha desbloqueado históricamente una tarifa más baja. Estudia las implicaciones de gobernanza de datos antes de cambiar datos de transcripción por un descuento — en cargas de trabajo reguladas ese intercambio suele ser inviable.

El coste oculto a gran escala es el redondeo + el streaming siempre activo. Los trabajos por lotes redondean por petición. El streaming factura durante todo el tiempo que el stream permanece abierto — incluido el silencio mientras tu agente está pensando o hablando si dejas el micrófono activo. Con 10.000 llamadas concurrentes, unos pocos segundos desperdiciados de stream abierto por turno se acumulan hasta convertirse en dinero real. Cierra el stream al final de cada intervención; no lo mantengas abierto durante toda la llamada.

Guía rápida: autenticación + transcripción de audio

Hay dos caminos. Primero autentícate: crea una cuenta de servicio en Google Cloud, asígnale el rol de Speech-to-Text, descarga la clave JSON y apunta GOOGLE_APPLICATION_CREDENTIALS a ella.

Preguntas frecuentes

¿Qué hace la Google Speech-to-Text API?
Convierte audio en texto, con variantes de modelo para distintos tipos de audio y compatibilidad con reconocimiento por lotes y en streaming.

¿Cómo se factura?
Por duración del audio, con tarifas distintas según el modelo y la función. Funciones como la diarización y los modelos mejorados tienen un precio superior a la tarifa base, así que consulta la página de precios actual en vez de un resumen.

¿Necesito un proyecto de Google Cloud para usarla?
Sí — la autenticación se hace con credenciales de Google Cloud, así que necesitas un proyecto y una cuenta de facturación antes de la primera petición.

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat

Fundador, Finn AI

Digvijay está construyendo Finn: la capa empresarial de orquestación de voz que razona durante las llamadas, extrae datos y actualiza tus sistemas en tiempo real. Escribe sobre IA de voz, estrategia de salida al mercado y lo que hace falta para lanzar agentes autónomos a gran escala.

Google Speech-to-Text API: la guía del desarrollador para 2026