El reconocimiento de voz (speech-to-text) transcribe audio hablado en texto escrito, analizando las ondas sonoras para identificar fonemas, palabras y, en sistemas más avanzados, hasta la puntuación y el tono de la conversación.
Dónde se usa
Es la tecnología detrás de los asistentes de voz, la transcripción automática de reuniones y videos, y los sistemas de dictado por voz, y su precisión mejoró notablemente con la llegada de modelos de deep learning entrenados sobre enormes volúmenes de audio transcrito.
