Saltar al contenido
Nóesis
Todas las familias
F05Redes que aprendendesde 1980

Visión: redes convolucionales

Convoluciones, filtros, mapas de activación

Una imagen tiene estructura local y la misma forma puede aparecer en cualquier lugar. Las CNN convierten esas dos obviedades en arquitectura.

1980
año fundacional
2
laboratorios
3
ecuaciones
7
hitos citados
Ir al laboratorio en vivo
Lámina F05semitono de dos tintas · en vivo
§1

Intuición

Pensar es ajustar millones de conexiones.

Un borde vertical es un borde vertical esté arriba o abajo de la foto. En vez de aprender un detector distinto para cada posición, una convolución desliza un único filtro pequeño —digamos, de 3×33\times3— por toda la imagen. El resultado es un mapa de activación que dice dónde aparece ese patrón.

Apiladas, las capas componen: bordes → esquinas y texturas → partes (ojos, ruedas) → objetos. Es la jerarquía que Hubel y Wiesel encontraron en la corteza visual del gato con células «simples» y «complejas», y que Fukushima trasladó al Neocognitrón en 1980.

El pooling resume regiones (por ejemplo, el máximo de cada ventana de 2×22\times2), dando cierta tolerancia a desplazamientos y reduciendo el tamaño a cada paso.

§2

Mecanismo

Una convolución discreta calcula (I∗K)(i,j)=∑m,nI(i+m,j+n) K(m,n)(I * K)(i,j) = \sum_{m,n} I(i+m, j+n)\,K(m,n) (técnicamente, una correlación cruzada). Compartir pesos reduce los parámetros de O(pıˊxeles2)O(\text{píxeles}^2) a O(k2⋅canales)O(k^2 \cdot \text{canales}) e impone equivariancia a traslaciones: desplazar la entrada desplaza la salida.

Cada capa tiene decenas o cientos de filtros; sus mapas forman los canales de la capa siguiente. Las redes residuales (He et al., 2015) añaden atajos x+F(x)x + F(x) que permiten entrenar cientos de capas.

En el laboratorio, las convoluciones, ReLU y max-pooling se calculan píxel a píxel sobre tu dibujo o sobre una imagen sintética. Puedes editar a mano los nueve pesos del filtro y ver cómo cambia el mapa.

Ec. 05.1Convolución 3×3 (correlación cruzada)
(I∗K)(i,j)=∑m=−11∑n=−11I(i+m, j+n) K(m,n)(I * K)(i,j) = \sum_{m=-1}^{1}\sum_{n=-1}^{1} I(i+m,\,j+n)\,K(m,n)
Ec. 05.2Filtro de Sobel horizontal
KSobel,x=(−101−202−101)K_{\text{Sobel},x} = \begin{pmatrix}-1&0&1\\-2&0&2\\-1&0&1\end{pmatrix}
Ec. 05.3Bloque residual (ResNet)
y=x+F(x; W)y = x + \mathcal{F}(x;\,W)
§3

Laboratorio

Lab 05.1 calculado en tu navegadorDetectando…

Laboratorio de convoluciones

Dibuja con el ratón o el dedo. Aplica bordes, desenfoque, realce o un filtro propio, y sigue la cadena convolución → ReLU → max-pool.

Lab 05.2 calculado en tu navegadorDetectando…

CNN vs equivariante a rotación

Gira un patrón y compara la respuesta de un filtro CNN ordinario con un filtro del grupo cíclico C8. La equivariancia preserva la estructura bajo rotación.

§4

Historia

  1. 1962

    Hubel y Wiesel describen campos receptivos jerárquicos en la corteza visual del gato (premio Nobel 1981).

    Hubel & Wiesel (1962), J. Physiology 160

  2. 1980

    Fukushima propone el Neocognitrón, con capas de convolución y submuestreo.

    Fukushima (1980), Biological Cybernetics 36

  3. 1989

    LeCun y colegas entrenan una CNN con retropropagación para leer códigos postales.

    LeCun et al. (1989), Neural Computation 1(4)

  4. 1998

    LeNet-5 lee cheques bancarios en producción.

    LeCun, Bottou, Bengio & Haffner (1998), Proc. IEEE 86(11)

  5. 2012

    AlexNet reduce el error top-5 de ImageNet del 26% al 15,3%.

    Krizhevsky, Sutskever & Hinton (2012), NeurIPS

  6. 2015

    ResNet entrena 152 capas con conexiones residuales y supera el error humano estimado en ImageNet.

    He, Zhang, Ren & Sun (2016), CVPR

  7. 2020

    Vision Transformer: parches de imagen como tokens; la atención compite con la convolución.

    Dosovitskiy et al. (2021), ICLR

§5

Límites

1

Sesgo hacia la textura: las CNN entrenadas en ImageNet clasifican más por textura que por forma (Geirhos et al., 2019).

2

La equivariancia a traslaciones no incluye rotaciones ni escalas.

3

Pequeñas perturbaciones imperceptibles pueden cambiar la clase predicha.

§6 · Pregunta filosófica

¿Ver es reconocer patrones o construir un mundo?

Una CNN asigna etiquetas a píxeles. Pero la visión humana, desde Helmholtz, se describe como inferencia inconsciente: el cerebro construye la hipótesis más probable del mundo tridimensional que causó la imagen.

Merleau-Ponty insistía en que percibir es ya estar dirigido a las cosas con un cuerpo. ¿Puede haber visión sin un cuerpo que se mueve y actúa, o una CNN solo clasifica sin ver?

Familias conectadas