Skip to main content

Google Speech-to-Text API: de developersgids voor 2026

Bouw productieklaar met de Google Speech-to-Text API: prijzen in 2026, quickstart met Python + REST, streaminglatency en de vergelijking met Whisper,…

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat
July 26, 2026
4 min read
Een doorschijnende amberkleurige glazen golf stroomt van een witte hoorn naar gestapelde olijfgroene blokken in zacht licht

Bouw je een spraakagent, dan is transcriptie de eerste dominosteen. Gaat die mis, dan erft elke stap erna — je LLM, je logica, je text-to-speech — de rommel. De Google Speech-to-Text API is een van de meest beproefde opties om audio in tekst om te zetten, maar de referentiedocumentatie leest als een compliancehandboek en elke "review" is geschreven door een concurrent die zijn eigen model verkoopt.

Dit is de leveranciersneutrale versie. We behandelen wat de API echt doet, wat die kost in 2026, hoe je werkende code uitrolt en — het deel dat niemand je vertelt — waar kale speech-to-text tekortschiet voor een realtime telefoonagent.

Wat is de Google Speech-to-Text API?

Google Speech-to-Text (STT) is een cloud-API die audio omzet in tekst met Googles modellen voor automatische spraakherkenning (ASR). De API biedt drie herkenningsmodi, en de juiste kiezen is veruit de belangrijkste architectuurbeslissing die je neemt:

  • Synchroon — stuur een kort audiofragment (≤ 60 seconden), blokkeer en krijg de volledige transcriptie in één respons terug. Het eenvoudigst te coderen; onbruikbaar voor live gesprekken.
  • Asynchroon / batch (LongRunningRecognize) — upload lange audio (tot ongeveer 480 minuten) naar Cloud Storage en poll naar een resultaat. De juiste keuze voor pipelines met gespreksopname, voicemail en podcasttranscriptie.
  • Streaming (StreamingRecognize) — een bidirectionele gRPC-stream waarin je audiochunks doorstuurt en tussentijdse en definitieve resultaten ontvangt terwijl de beller praat. Met deze modus staat of valt elke realtime spraakagent.

Aan de modelkant is de Chirp-familie (Googles universele spraakmodellen, chirp en chirp_2 in de v2-API) in 2026 de standaard voor nauwkeurigheid en meertalige dekking. Oudere latest_long / latest_short en telefonie-getunede modellen bestaan nog in v1 en zijn relevant als je een specifieke functie nodig hebt (zoals bepaalde telefonieverbeteringen) die een nieuwer model nog niet heeft. Stem het model altijd af op de audio: 8 kHz mono-telefonieaudio door een model halen dat is afgestemd op 16 kHz studioaudio is zelf toegebrachte nauwkeurigheidsschade.

Prijzen van de Google STT API in 2026

Er wordt afgerekend per verwerkte audiominuut, in afgeronde stappen, met tarieven die verschillen per model en per functie. In plaats van cijfers te noemen die snel verouderen, hier hoe je over de rekening redeneert — en waar die op schaal pijn doet.

Controleer voordat je je vastlegt: reken altijd door op de actuele prijspagina van Cloud Speech-to-Text. De cijfers hieronder beschrijven de structuur van de facturatie in 2026, niet een vaste offerte.

  • Gratis niveau: Google bood historisch een maandelijkse gratis hoeveelheid aan (in de orde van zo'n 60 minuten) — genoeg om te prototypen, bij lange na niet genoeg om te draaien.
  • Standaard versus enhanced/premium modellen: nieuwere of verbeterde modellen worden per minuut hoger belast dan klassieke standaardherkenning. Modellen van het Chirp-kaliber zitten aan de premiumkant.
  • Functies komen erbovenop: sprekerdiarisatie, betrouwbaarheid op woordniveau en sommige modelopties kunnen het effectieve tarief veranderen of extra verwerking toevoegen.
  • Korting voor logging: akkoord gaan met datalogging (Google je audio laten gebruiken om modellen te verbeteren) leverde historisch een lager tarief op. Weeg de datagovernance-gevolgen af voordat je transcriptiedata inruilt voor korting — bij gereguleerde workloads is die ruil meestal geen optie.

De verborgen kosten op schaal zijn afronding + altijd openstaande streams. Batchjobs ronden af per request. Streaming rekent af over de hele periode dat de stream openstaat — inclusief de stilte terwijl je agent nadenkt of praat, als je de microfoon open laat. Bij 10.000 gelijktijdige gesprekken lopen een paar verspilde seconden openstaande stream per beurt op tot echt geld. Sluit de stream aan het einde van de uiting; houd hem niet het hele gesprek open.

Quickstart: authenticeren + audio transcriberen

Twee manieren om te beginnen. Authenticeer eerst: maak een serviceaccount aan in Google Cloud, geef het de Speech-to-Text-rol, download de JSON-sleutel en laat GOOGLE_APPLICATION_CREDENTIALS ernaar wijzen.

Veelgestelde vragen

Wat doet de Google Speech-to-Text API?
Die zet audio om in tekst, met modelvarianten voor verschillende soorten audio en ondersteuning voor zowel batch- als streamingherkenning.

Hoe wordt er gefactureerd?
Op basis van audioduur, met verschillende tarieven per model en functie. Functies zoals diarisatie en enhanced modellen liggen boven het basistarief, dus raadpleeg de actuele prijspagina in plaats van een samenvatting.

Heb ik een Google Cloud-project nodig om de API te gebruiken?
Ja — authenticatie verloopt via Google Cloud-credentials, dus een project en een factureringsaccount komen vóór het eerste request.

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat

Oprichter, Finn AI

Digvijay bouwt Finn — de enterprise voice-orchestratielaag die door gesprekken heen redeneert, data extraheert en je systemen in realtime bijwerkt. Schrijft over voice AI, go-to-market en wat er nodig is om autonome agents op schaal uit te rollen.

Google Speech-to-Text API: de developersgids voor 2026