Skip to main content

音声技術

音声認識(音声のテキスト化)STT

別名: 自動音声認識 · ASR · 音声認識(voice recognition)

音声認識(STT)は、自動音声認識(ASR)とも呼ばれ、話し言葉の音声をテキストに書き起こします。音声エージェントにおいてSTTは最初のステップであり、発信者が話すそばから、その発話を言語モデルが処理できるテキストに変換します。

リアルタイムのSTTは、アクセント、背景雑音、混線、言語間のコードスイッチングに対応しなければなりません。その精度と速度が会話全体の上限を決めます。エージェントが聞き間違えれば、その後の処理はすべて誤りになります。

製品で見る

音声認識(音声のテキスト化)を実際の通話で見る。

30分のデモを予約して、Finnがインバウンドとアウトバウンドの通話を最初から最後まで処理する様子をご覧ください——組み立てるべきスタックは不要です。