La síntesis de voz, o text-to-speech (TTS), genera audio hablado a partir de texto escrito. Los sistemas modernos, basados en deep learning, logran una entonación, ritmo y naturalidad muy superiores a los sistemas más antiguos, que sonaban claramente robóticos y monótonos.
Sus aplicaciones
Se usa en asistentes virtuales, herramientas de accesibilidad para personas con discapacidad visual, doblaje y narración automática de contenido, y cada vez más en la clonación de voces específicas a partir de pocas muestras de audio.
