Si vous construisez un agent vocal, la transcription est le premier domino. Ratez-la et tous les étages en aval — votre LLM, votre logique, votre synthèse vocale — héritent de déchets. L'API Google Speech-to-Text est l'une des options les plus éprouvées en production pour transformer de l'audio en texte, mais la documentation de référence se lit comme un manuel de conformité et chaque "comparatif" est rédigé par un concurrent qui vend son propre modèle.
Voici la version neutre, sans parti pris. Nous verrons ce que fait réellement l'API, ce qu'elle coûte en 2026, comment livrer du code qui fonctionne et — ce que personne ne vous dit — à partir de quand la reconnaissance vocale brute ne suffit plus pour un agent téléphonique en temps réel.
Qu'est-ce que l'API Google Speech-to-Text ?
Google Speech-to-Text (STT) est une API cloud qui convertit l'audio en texte à l'aide des modèles de reconnaissance automatique de la parole (ASR) de Google. Elle expose trois modes de reconnaissance, et choisir le bon est la plus importante décision d'architecture que vous prendrez :
- Synchrone — vous envoyez un court extrait audio (≤ 60 secondes), vous bloquez, vous récupérez la transcription complète en une seule réponse. Le plus simple à coder ; inutile pour des appels en direct.
- Asynchrone / par lots (
LongRunningRecognize) — vous téléversez de l'audio long (jusqu'à environ 480 minutes) vers Cloud Storage, puis vous interrogez le résultat. C'est le bon choix pour les pipelines d'enregistrement d'appels, la messagerie vocale et la transcription de podcasts. - Streaming (
StreamingRecognize) — un flux gRPC bidirectionnel dans lequel vous poussez des fragments audio et recevez des résultats intermédiaires et définitifs pendant que l'interlocuteur parle. C'est le mode dont dépend la survie de tout agent vocal temps réel.
Côté modèles, la famille Chirp (les modèles de parole universels de Google, chirp et chirp_2 dans l'API v2) est le choix par défaut en 2026 pour la précision et la couverture multilingue. Les anciens modèles latest_long / latest_short et ceux réglés pour la téléphonie existent toujours en v1 et comptent lorsque vous avez besoin d'une fonctionnalité précise (comme certaines optimisations télécoms) qu'un modèle plus récent n'a pas encore livrée. Accordez toujours le modèle à l'audio : faire passer de l'audio téléphonique mono 8 kHz dans un modèle réglé pour du studio 16 kHz, c'est se tirer une balle dans le pied côté précision.
Tarifs de l'API Google STT en 2026
La facturation se fait à la minute d'audio traité, par incréments arrondis, avec des paliers qui varient selon le modèle et les fonctionnalités. Plutôt que de citer des chiffres qui se périment, voici comment raisonner sur la facture — et où elle mord à grande échelle.
Vérifiez avant de vous engager : chiffrez toujours à partir de la page de tarification Cloud Speech-to-Text à jour. Les éléments ci-dessous décrivent la structure de la facturation en 2026, pas un devis figé.
- Palier gratuit : Google a historiquement proposé un quota mensuel gratuit (de l'ordre de 60 minutes) — de quoi prototyper, très loin de quoi exploiter en production.
- Modèles standard vs améliorés/premium : les modèles récents ou améliorés se facturent à un tarif par minute supérieur à celui de la reconnaissance standard historique. Les modèles de classe Chirp se situent dans le haut de gamme.
- Les fonctionnalités s'ajoutent : la diarisation des locuteurs, la confiance au niveau du mot et certaines options de modèle peuvent modifier le tarif effectif ou ajouter du traitement.
- Remise sur la journalisation : activer la journalisation des données (laisser Google utiliser votre audio pour améliorer ses modèles) a historiquement débloqué un tarif réduit. Mesurez les implications en matière de gouvernance des données avant d'échanger vos transcriptions contre une remise — pour des charges de travail réglementées, ce troc est généralement rédhibitoire.
Le coût caché à grande échelle, ce sont les arrondis + le streaming permanent. Les traitements par lots arrondissent par requête. Le streaming facture toute la durée d'ouverture du flux — y compris le silence pendant que votre agent réfléchit ou parle si vous laissez le micro ouvert. À 10 000 appels simultanés, quelques secondes de flux ouvert gaspillées par tour de parole se transforment en argent bien réel. Fermez le flux en fin d'énoncé ; ne le maintenez pas ouvert pendant tout l'appel.
Démarrage rapide : authentification + transcription audio
Deux façons d'entrer. Authentifiez-vous d'abord : créez un compte de service dans Google Cloud, attribuez-lui le rôle Speech-to-Text, téléchargez la clé JSON et faites pointer GOOGLE_APPLICATION_CREDENTIALS dessus.
Questions fréquentes
Que fait l'API Google Speech-to-Text ?
Elle convertit l'audio en texte, avec des variantes de modèles pour différents types d'audio et la prise en charge de la reconnaissance par lots comme en streaming.
Comment est-elle facturée ?
À la durée d'audio, avec des tarifs différents selon le modèle et la fonctionnalité. Des options comme la diarisation et les modèles améliorés se paient au-dessus du tarif de base : consultez donc la page de tarification en vigueur plutôt qu'un résumé.
Faut-il un projet Google Cloud pour l'utiliser ?
Oui — l'authentification passe par les identifiants Google Cloud, donc un projet et un compte de facturation précèdent la première requête.




