Tecnología de voz
Reconocimiento automático del hablaASR
También llamado: reconocimiento del habla
El reconocimiento automático del habla (ASR) es la tecnología que convierte el lenguaje hablado en texto. ASR y voz a texto (STT) son la misma capacidad: ASR es el término académico/de ingeniería y STT el término de producto.
La calidad del ASR se mide por la tasa de error de palabras (WER). Para los agentes de voz, el ASR en streaming (transcribir de forma incremental mientras la persona habla) importa más que la precisión por lotes, porque permite una alternancia de turnos rápida.
Términos relacionados
Voz a textoTecnología que transcribe audio hablado a texto en tiempo real. STT es cómo un agente de voz entiende lo que dice quien llama.Comprensión del lenguaje naturalLa parte de la IA que descifra lo que una persona quiere decir —su intención y los detalles clave— a partir del lenguaje natural, no solo de las palabras literales.EndpointingDetectar cuándo quien llama ha terminado de hablar para que el agente sepa que es su turno de responder. Un mal endpointing provoca pausas incómodas o interrupciones.
Ve Reconocimiento automático del habla en una llamada real.
Reserva una demo de 30 minutos y observa a Finn gestionar llamadas entrantes y salientes de principio a fin, sin ningún stack que montar.
Try Finn for free