Visión: redes convolucionales
Convoluciones, filtros, mapas de activación
Una imagen tiene estructura local y la misma forma puede aparecer en cualquier lugar. Las CNN convierten esas dos obviedades en arquitectura.
Intuición
Un borde vertical es un borde vertical esté arriba o abajo de la foto. En vez de aprender un detector distinto para cada posición, una convolución desliza un único filtro pequeño —digamos, de — por toda la imagen. El resultado es un mapa de activación que dice dónde aparece ese patrón.
Apiladas, las capas componen: bordes → esquinas y texturas → partes (ojos, ruedas) → objetos. Es la jerarquía que Hubel y Wiesel encontraron en la corteza visual del gato con células «simples» y «complejas», y que Fukushima trasladó al Neocognitrón en 1980.
El pooling resume regiones (por ejemplo, el máximo de cada ventana de ), dando cierta tolerancia a desplazamientos y reduciendo el tamaño a cada paso.
Mecanismo
Una convolución discreta calcula (técnicamente, una correlación cruzada). Compartir pesos reduce los parámetros de a e impone equivariancia a traslaciones: desplazar la entrada desplaza la salida.
Cada capa tiene decenas o cientos de filtros; sus mapas forman los canales de la capa siguiente. Las redes residuales (He et al., 2015) añaden atajos que permiten entrenar cientos de capas.
En el laboratorio, las convoluciones, ReLU y max-pooling se calculan píxel a píxel sobre tu dibujo o sobre una imagen sintética. Puedes editar a mano los nueve pesos del filtro y ver cómo cambia el mapa.
Laboratorio
Laboratorio de convoluciones
Dibuja con el ratón o el dedo. Aplica bordes, desenfoque, realce o un filtro propio, y sigue la cadena convolución → ReLU → max-pool.
CNN vs equivariante a rotación
Gira un patrón y compara la respuesta de un filtro CNN ordinario con un filtro del grupo cíclico C8. La equivariancia preserva la estructura bajo rotación.
Historia
- 1962
Hubel y Wiesel describen campos receptivos jerárquicos en la corteza visual del gato (premio Nobel 1981).
Hubel & Wiesel (1962), J. Physiology 160
- 1980
Fukushima propone el Neocognitrón, con capas de convolución y submuestreo.
Fukushima (1980), Biological Cybernetics 36
- 1989
LeCun y colegas entrenan una CNN con retropropagación para leer códigos postales.
LeCun et al. (1989), Neural Computation 1(4)
- 1998
LeNet-5 lee cheques bancarios en producción.
LeCun, Bottou, Bengio & Haffner (1998), Proc. IEEE 86(11)
- 2012
AlexNet reduce el error top-5 de ImageNet del 26% al 15,3%.
Krizhevsky, Sutskever & Hinton (2012), NeurIPS
- 2015
ResNet entrena 152 capas con conexiones residuales y supera el error humano estimado en ImageNet.
He, Zhang, Ren & Sun (2016), CVPR
- 2020
Vision Transformer: parches de imagen como tokens; la atención compite con la convolución.
Dosovitskiy et al. (2021), ICLR
Límites
Sesgo hacia la textura: las CNN entrenadas en ImageNet clasifican más por textura que por forma (Geirhos et al., 2019).
La equivariancia a traslaciones no incluye rotaciones ni escalas.
Pequeñas perturbaciones imperceptibles pueden cambiar la clase predicha.
¿Ver es reconocer patrones o construir un mundo?
Una CNN asigna etiquetas a píxeles. Pero la visión humana, desde Helmholtz, se describe como inferencia inconsciente: el cerebro construye la hipótesis más probable del mundo tridimensional que causó la imagen.
Merleau-Ponty insistía en que percibir es ya estar dirigido a las cosas con un cuerpo. ¿Puede haber visión sin un cuerpo que se mueve y actúa, o una CNN solo clasifica sin ver?