Las LSTM incorporan una estructura interna con “compuertas” que regulan explícitamente qué información conservar, qué olvidar y qué agregar a la memoria de la red en cada paso, resolviendo en gran medida la dificultad de las RNN tradicionales para recordar información de muchos pasos atrás en una secuencia larga.
Su lugar histórico
Durante casi dos décadas fueron el estándar dominante para tareas de procesamiento de secuencias, como traducción automática y reconocimiento de voz, hasta que el Transformer las desplazó en la mayoría de las aplicaciones de lenguaje a gran escala, aunque siguen siendo útiles en problemas de series de tiempo más acotados.
