Skip to main content

Tecnologia vocale

Speech-to-textSTT

Detto anche: riconoscimento vocale automatico · ASR · riconoscimento della voce

Lo speech-to-text (STT), chiamato anche riconoscimento vocale automatico (ASR), trascrive l'audio parlato in testo. In un agente vocale lo STT è il primo passaggio — trasforma il parlato dell'interlocutore in testo su cui il modello linguistico può agire, mentre la persona parla.

Lo STT in tempo reale deve gestire accenti, rumore di fondo, sovrapposizioni di voci e il passaggio da una lingua all'altra. La sua accuratezza e velocità fissano il limite massimo dell'intera conversazione: se l'agente capisce male, tutto ciò che segue è sbagliato.

Vedilo nel prodotto

Vedi Speech-to-text in una chiamata reale.

Prenota una demo di 30 minuti e guarda Finn gestire chiamate in entrata e in uscita end to end — nessuno stack da assemblare.