Redes neuronales
Perceptrón, perceptrón multicapa y retropropagación
Muchas unidades simples, cada una sumando señales y decidiendo si dispara. Nada es inteligente por separado; la competencia emerge del ajuste de millones de pesos.
Intuición
Una neurona artificial es una votación ponderada: multiplica cada entrada por un peso, suma, y pasa el resultado por una función no lineal. Un perceptrón solo puede trazar una recta; por eso no resuelve el XOR, el ejemplo que Minsky y Papert usaron en 1969 para enfriar el entusiasmo.
Apilar capas cambia todo. Cada capa oculta dobla y estira el espacio, de modo que lo que era enredado —dos espirales entrelazadas— se vuelve separable por una recta en la última capa. El teorema de aproximación universal (Cybenko, 1989) garantiza que una sola capa oculta suficientemente ancha puede aproximar cualquier función continua; la práctica muestra que la profundidad lo hace con muchas menos neuronas.
El problema es encontrar los pesos. La retropropagación responde con cálculo: mide el error en la salida y reparte la culpa hacia atrás, capa por capa, usando la regla de la cadena. Luego, cada peso se mueve un poco en la dirección que reduce el error.
Mecanismo
Capa: , con una no linealidad (tanh, ReLU). La red completa es una composición . La pérdida (entropía cruzada para clasificar) se minimiza por descenso de gradiente estocástico: .
La retropropagación es diferenciación automática en modo reverso (Linnainmaa, 1970): el gradiente de cada capa se obtiene a partir del gradiente de la siguiente, , con un costo comparable al de una pasada hacia adelante.
En el laboratorio, una red real con capas y neuronas configurables se entrena en tu navegador con retropropagación escrita a mano (sin librerías) y optimizador Adam (Kingma y Ba, 2014). El mapa de color es la salida de la red evaluada en cada punto del plano, recalculada en cada cuadro.
Laboratorio
Entrena una red en vivo
Elige datos (XOR, círculo, espirales), capas, activación y tasa de aprendizaje. Observa la frontera deformarse, los pesos cambiar de signo y la pérdida caer.
Historia
- 1943
McCulloch y Pitts modelan la neurona como una unidad lógica de umbral.
McCulloch & Pitts (1943), Bull. Math. Biophysics 5
- 1958
Rosenblatt presenta el perceptrón y su regla de aprendizaje; el Mark I Perceptron se construye en Cornell.
Rosenblatt (1958), Psychological Review 65(6)
- 1969
Minsky y Papert demuestran los límites del perceptrón de una capa. Comienza un largo invierno conexionista.
Minsky & Papert (1969), Perceptrons, MIT Press
- 1986
Rumelhart, Hinton y Williams popularizan la retropropagación para entrenar redes multicapa.
Rumelhart, Hinton & Williams (1986), Nature 323
- 1989
Cybenko prueba la aproximación universal con una capa oculta sigmoidal.
Cybenko (1989), Math. Control Signals Systems 2
- 2012
AlexNet gana ImageNet con GPUs, ReLU y dropout: empieza la era del aprendizaje profundo.
Krizhevsky, Sutskever & Hinton (2012), NeurIPS
- 2018
Bengio, Hinton y LeCun reciben el premio Turing por el aprendizaje profundo.
ACM A.M. Turing Award 2018
Límites
Necesitan muchos datos y cómputo; aprenden de forma lenta comparada con un niño.
Son opacas: millones de pesos sin significado individual (ver Interpretabilidad).
Generalizan mal fuera de la distribución de entrenamiento y pueden engañarse con ejemplos adversarios (Szegedy et al., 2013).
La retropropagación no parece biológicamente plausible tal cual: el cerebro no transporta gradientes exactos hacia atrás.
Si una red resuelve el problema, ¿dónde está el conocimiento?
En la IA simbólica el conocimiento está escrito en reglas legibles. En una red está distribuido en pesos: ningún número aislado significa nada. Paul Smolensky llamó a esto el nivel subsimbólico.
Fodor y Pylyshyn objetaron en 1988 que el pensamiento es sistemático —quien entiende «Juan ama a María» entiende «María ama a Juan»— y que eso exige estructura simbólica. ¿Aprenden las redes profundas esa sistematicidad o la imitan?