Secuencias: RNN y LSTM
Recurrencia, memoria y el gradiente que se desvanece
El lenguaje, la música y la bolsa de valores llegan en orden. Una red recurrente lee paso a paso y lleva consigo un estado: una memoria que se reescribe.
Intuición
Una red recurrente (RNN) aplica la misma transformación en cada instante, pero recibe también su propio estado anterior: . Ese estado es un resumen comprimido de todo lo visto. Desplegada en el tiempo, una RNN es una red muy profunda con pesos compartidos.
El problema: para aprender que algo visto hace 30 pasos importa ahora, el gradiente debe viajar 30 multiplicaciones hacia atrás. Si cada factor es menor que uno, se desvanece; si es mayor, explota. Hochreiter lo analizó en 1991 y Bengio, Simard y Frasconi en 1994.
La LSTM (Hochreiter y Schmidhuber, 1997) resuelve esto con una celda que se actualiza sumando, no multiplicando, y con compuertas que deciden qué olvidar, qué escribir y qué leer. El laboratorio pone una RNN simple y una LSTM a competir en una tarea de memoria pura.
Mecanismo
LSTM: la compuerta de olvido , la de entrada y la de salida son sigmoides de . La celda evoluciona como : cuando , el gradiente fluye casi intacto por el «carrusel de error constante».
Entrenamiento: retropropagación a través del tiempo (BPTT), que despliega la red pasos y aplica la regla de la cadena. En el laboratorio ambas redes se entrenan en vivo con BPTT escrito a mano sobre la tarea «repite el bit que viste hace pasos».
Variantes: GRU (Cho et al., 2014) fusiona compuertas; seq2seq (Sutskever et al., 2014) usa un codificador y un decodificador; la atención de Bahdanau et al. (2014) deja que el decodificador mire todos los estados del codificador, el germen del Transformer.
Laboratorio
RNN contra LSTM: ¿quién recuerda?
Ambas redes aprenden en vivo a repetir un bit visto hace k pasos. Aumenta k y observa cómo la RNN simple colapsa mientras las compuertas de la LSTM aprenden a proteger la memoria.
Historia
- 1986
Jordan propone redes con conexiones recurrentes desde la salida.
Jordan (1986), ICS Report 8604, UC San Diego
- 1990
Elman publica «Finding Structure in Time»: una RNN descubre categorías gramaticales.
Elman (1990), Cognitive Science 14
- 1994
Bengio, Simard y Frasconi muestran la dificultad de aprender dependencias largas con gradiente.
Bengio, Simard & Frasconi (1994), IEEE Trans. Neural Networks 5(2)
- 1997
Hochreiter y Schmidhuber introducen la LSTM.
Hochreiter & Schmidhuber (1997), Neural Computation 9(8)
- 2014
Seq2seq y la atención de Bahdanau transforman la traducción automática.
Sutskever, Vinyals & Le (2014), NeurIPS; Bahdanau, Cho & Bengio (2015), ICLR
- 2016
Google Neural Machine Translation reemplaza su sistema estadístico por LSTM profundas.
Wu et al. (2016), arXiv:1609.08144
Límites
Secuenciales por naturaleza: no se paralelizan en el tiempo durante el entrenamiento, lo que frenó su escalado frente al Transformer.
Aun con LSTM, la memoria efectiva es limitada a cientos de pasos.
Los modelos de espacio de estados modernos (S4, Mamba) retoman la recurrencia con matemática que sí escala.
¿Qué es tener memoria: guardar el pasado o saber qué olvidar?
La lección de la LSTM es que recordar bien exige olvidar activamente. Funes el memorioso, el personaje de Borges, lo recordaba todo y por eso no podía pensar: «pensar es olvidar diferencias, es generalizar, abstraer».
Husserl describía la conciencia del tiempo con la retención: el pasado inmediato no desaparece, persiste modificado en el presente. ¿Es el estado oculto de una RNN una retención, o solo un registro?