Saltar al contenido
Nóesis
Todas las familias
F04Redes que aprendendesde 1943

Redes neuronales

Perceptrón, perceptrón multicapa y retropropagación

Muchas unidades simples, cada una sumando señales y decidiendo si dispara. Nada es inteligente por separado; la competencia emerge del ajuste de millones de pesos.

1943
año fundacional
1
laboratorio
3
ecuaciones
7
hitos citados
Ir al laboratorio en vivo
Lámina F04semitono de dos tintas · en vivo
§1

Intuición

Pensar es ajustar millones de conexiones.

Una neurona artificial es una votación ponderada: multiplica cada entrada por un peso, suma, y pasa el resultado por una función no lineal. Un perceptrón solo puede trazar una recta; por eso no resuelve el XOR, el ejemplo que Minsky y Papert usaron en 1969 para enfriar el entusiasmo.

Apilar capas cambia todo. Cada capa oculta dobla y estira el espacio, de modo que lo que era enredado —dos espirales entrelazadas— se vuelve separable por una recta en la última capa. El teorema de aproximación universal (Cybenko, 1989) garantiza que una sola capa oculta suficientemente ancha puede aproximar cualquier función continua; la práctica muestra que la profundidad lo hace con muchas menos neuronas.

El problema es encontrar los pesos. La retropropagación responde con cálculo: mide el error en la salida y reparte la culpa hacia atrás, capa por capa, usando la regla de la cadena. Luego, cada peso se mueve un poco en la dirección que reduce el error.

§2

Mecanismo

Capa: h=ϕ(Wx+b)h = \phi(Wx + b), con ϕ\phi una no linealidad (tanh, ReLU). La red completa es una composición f=fL∘⋯∘f1f = f_L \circ \dots \circ f_1. La pérdida L\mathcal{L} (entropía cruzada para clasificar) se minimiza por descenso de gradiente estocástico: θ←θ−η ∇θL\theta \leftarrow \theta - \eta\,\nabla_\theta \mathcal{L}.

La retropropagación es diferenciación automática en modo reverso (Linnainmaa, 1970): el gradiente de cada capa se obtiene a partir del gradiente de la siguiente, δ(l)=(W(l+1)⊤δ(l+1))⊙ϕ′(z(l))\delta^{(l)} = (W^{(l+1)\top}\delta^{(l+1)}) \odot \phi'(z^{(l)}), con un costo comparable al de una pasada hacia adelante.

En el laboratorio, una red real con capas y neuronas configurables se entrena en tu navegador con retropropagación escrita a mano (sin librerías) y optimizador Adam (Kingma y Ba, 2014). El mapa de color es la salida de la red evaluada en cada punto del plano, recalculada en cada cuadro.

Ec. 04.1Neurona de McCulloch-Pitts / Rosenblatt
y=ϕ(∑iwixi+b)y = \phi\Big(\sum_i w_i x_i + b\Big)
Ec. 04.2Retropropagación
∂L∂W(l)=δ(l) h(l−1)⊤,δ(l)=(W(l+1)⊤δ(l+1))⊙ϕ′(z(l))\frac{\partial \mathcal{L}}{\partial W^{(l)}} = \delta^{(l)}\, h^{(l-1)\top}, \qquad \delta^{(l)} = \big(W^{(l+1)\top}\delta^{(l+1)}\big)\odot \phi'(z^{(l)})
Ec. 04.3Entropía cruzada binaria
L=−1N∑i[yilog⁡y^i+(1−yi)log⁡(1−y^i)]\mathcal{L} = -\frac{1}{N}\sum_i \big[y_i\log \hat y_i + (1-y_i)\log(1-\hat y_i)\big]
§3

Laboratorio

Lab 04.1 calculado en tu navegadorDetectando…

Entrena una red en vivo

Elige datos (XOR, círculo, espirales), capas, activación y tasa de aprendizaje. Observa la frontera deformarse, los pesos cambiar de signo y la pérdida caer.

§4

Historia

  1. 1943

    McCulloch y Pitts modelan la neurona como una unidad lógica de umbral.

    McCulloch & Pitts (1943), Bull. Math. Biophysics 5

  2. 1958

    Rosenblatt presenta el perceptrón y su regla de aprendizaje; el Mark I Perceptron se construye en Cornell.

    Rosenblatt (1958), Psychological Review 65(6)

  3. 1969

    Minsky y Papert demuestran los límites del perceptrón de una capa. Comienza un largo invierno conexionista.

    Minsky & Papert (1969), Perceptrons, MIT Press

  4. 1986

    Rumelhart, Hinton y Williams popularizan la retropropagación para entrenar redes multicapa.

    Rumelhart, Hinton & Williams (1986), Nature 323

  5. 1989

    Cybenko prueba la aproximación universal con una capa oculta sigmoidal.

    Cybenko (1989), Math. Control Signals Systems 2

  6. 2012

    AlexNet gana ImageNet con GPUs, ReLU y dropout: empieza la era del aprendizaje profundo.

    Krizhevsky, Sutskever & Hinton (2012), NeurIPS

  7. 2018

    Bengio, Hinton y LeCun reciben el premio Turing por el aprendizaje profundo.

    ACM A.M. Turing Award 2018

§5

Límites

1

Necesitan muchos datos y cómputo; aprenden de forma lenta comparada con un niño.

2

Son opacas: millones de pesos sin significado individual (ver Interpretabilidad).

3

Generalizan mal fuera de la distribución de entrenamiento y pueden engañarse con ejemplos adversarios (Szegedy et al., 2013).

4

La retropropagación no parece biológicamente plausible tal cual: el cerebro no transporta gradientes exactos hacia atrás.

§6 · Pregunta filosófica

Si una red resuelve el problema, ¿dónde está el conocimiento?

En la IA simbólica el conocimiento está escrito en reglas legibles. En una red está distribuido en pesos: ningún número aislado significa nada. Paul Smolensky llamó a esto el nivel subsimbólico.

Fodor y Pylyshyn objetaron en 1988 que el pensamiento es sistemático —quien entiende «Juan ama a María» entiende «María ama a Juan»— y que eso exige estructura simbólica. ¿Aprenden las redes profundas esa sistematicidad o la imitan?

Familias conectadas