Sprachtechnologie
Automatic Speech RecognitionASR
Auch genannt: Spracherkennung
Automatic Speech Recognition (ASR) ist die Technologie, die gesprochene Sprache in Text umwandelt. ASR und Speech-to-Text (STT) sind dieselbe Fähigkeit — ASR ist der wissenschaftliche/technische Begriff, STT der Produktbegriff.
Die ASR-Qualität wird anhand der Word Error Rate (WER) gemessen. Für Sprachagenten ist Streaming-ASR (schrittweises Transkribieren während des Sprechens) wichtiger als Batch-Genauigkeit, weil es schnelles Turn-Taking ermöglicht.
Verwandte Begriffe
Speech-to-TextTechnologie, die gesprochenes Audio in Echtzeit in Text transkribiert. Über STT versteht ein Sprachagent, was der Anrufer sagt.Natural Language UnderstandingDer Teil der KI, der ermittelt, was eine Person meint — ihre Absicht und die wichtigsten Details — aus natürlicher Sprache, nicht nur aus den wörtlichen Worten.EndpointingDas Erkennen, wann der Anrufer zu Ende gesprochen hat, damit der Agent weiß, dass er nun antworten darf. Schlechtes Endpointing führt zu unangenehmen Pausen oder Unterbrechungen.
Sehen Sie Automatic Speech Recognition in einem echten Anruf.
Buchen Sie eine 30-minütige Demo und sehen Sie, wie Finn eingehende und ausgehende Anrufe durchgehend bearbeitet — ohne Stack zusammenzustellen.
Try Finn for free