Spraaktechnologie
Speech-to-textSTT
Ook wel genoemd: automatic speech recognition · ASR · spraakherkenning
Speech-to-text (STT), ook wel automatic speech recognition (ASR) genoemd, transcribeert gesproken audio naar tekst. In een voice-agent is STT de eerste stap — het zet de spraak van de beller om in tekst waarop het taalmodel kan reageren, terwijl ze praten.
Realtime STT moet accenten, achtergrondgeluid, dooreenpraten en code-switching tussen talen aankunnen. De nauwkeurigheid en snelheid bepalen het plafond voor het hele gesprek: als de agent verkeerd verstaat, klopt alles daarna niet meer.
Bekijk het in het product
Gerelateerde termen
Automatic speech recognitionDe formele naam voor de technologie die spraak omzet in tekst. ASR en speech-to-text (STT) verwijzen naar hetzelfde.Text-to-speechTechnologie die geschreven tekst omzet in natuurlijk gesproken audio. TTS geeft een AI-voiceagent zijn stem.Natural language understandingHet deel van AI dat uitzoekt wat een persoon bedoelt — de intentie en de belangrijkste details — op basis van natuurlijke taal, niet alleen de letterlijke woorden.EndpointingDetecteren wanneer de beller is uitgesproken, zodat de agent weet dat het zijn beurt is om te reageren. Slechte endpointing veroorzaakt ongemakkelijke pauzes of onderbrekingen.
Zie Speech-to-text in een echt gesprek.
Plan een demo van 30 minuten en zie Finn inbound- en outbound-gesprekken van begin tot eind afhandelen — geen stack om samen te stellen.
Try Finn for free