Tecnologia vocale
Riconoscimento vocale automaticoASR
Detto anche: riconoscimento del parlato
Il riconoscimento vocale automatico (ASR) è la tecnologia che converte il linguaggio parlato in testo. ASR e speech-to-text (STT) sono la stessa capacità — ASR è il termine accademico/ingegneristico, STT quello di prodotto.
La qualità dell'ASR si misura con il word error rate (WER). Per gli agenti vocali, l'ASR in streaming (che trascrive in modo incrementale mentre la persona parla) conta più dell'accuratezza in batch, perché consente turni di parola rapidi.
Termini correlati
Speech-to-textTecnologia che trascrive l'audio parlato in testo in tempo reale. Lo STT è il modo in cui un agente vocale comprende ciò che dice l'interlocutore.Comprensione del linguaggio naturaleLa parte dell'AI che capisce cosa intende una persona — il suo intento e i dettagli chiave — a partire dal linguaggio naturale, non solo dalle parole letterali.EndpointingRilevare quando l'interlocutore ha finito di parlare così che l'agente sappia che è il suo turno di rispondere. Un endpointing errato causa pause imbarazzanti o interruzioni.
Vedi Riconoscimento vocale automatico in una chiamata reale.
Prenota una demo di 30 minuti e guarda Finn gestire chiamate in entrata e in uscita end to end — nessuno stack da assemblare.
Try Finn for free