Cómo funcionan las redes neuronales: guía sin matemáticas imposibles
Las redes neuronales artificiales son el motor detrás de ChatGPT, los coches autónomos y el reconocimiento facial. Entender cómo funcionan no requiere un doctorado — requiere la metáfora correcta.
La neurona artificial: una función con pesos
Una neurona artificial recibe varias entradas numéricas, las multiplica por unos pesos (su "importancia"), suma el resultado y aplica una función de activación que decide si la neurona "se enciende" o no. Eso es todo. La magia está en que esos pesos se aprenden automáticamente a partir de ejemplos.
Capas: entrada, ocultas y salida
Una red neuronal se organiza en capas. La capa de entrada recibe los datos (píxeles de una imagen, palabras de un texto). Las capas ocultas transforman esos datos progresivamente. La capa de salida da la respuesta: "es un gato", "el sentimiento es positivo", "el precio estimado es 250.000€".
Cuantas más capas ocultas, más "profunda" es la red — de ahí el nombre deep learning.
El aprendizaje: backpropagation
El entrenamiento funciona así: la red hace una predicción, se compara con la respuesta correcta, se calcula el error, y ese error se propaga hacia atrás por la red ajustando ligeramente cada peso. Se repite millones de veces. Con suficientes ejemplos y ajustes, los pesos convergen a valores que producen buenas predicciones.
Funciones de activación: el interruptor
Sin una función de activación no lineal, apilar capas lineales produce una sola capa lineal — no hay ganancia. Las más usadas son ReLU (devuelve 0 si la entrada es negativa, la entrada si es positiva) y Sigmoid (aplasta la salida entre 0 y 1). ReLU domina en capas ocultas; Sigmoid y Softmax en la salida.
Preguntas frecuentes
¿Cuántas neuronas necesita una red?
Depende del problema. Para clasificar imágenes de 28x28 píxeles (MNIST) bastan cientos. Para GPT-4, son billones de parámetros. Más neuronas = más capacidad pero más riesgo de sobreajuste y más coste computacional.
¿Qué diferencia hay entre una red neuronal y un modelo de lenguaje?
Un modelo de lenguaje como GPT es una red neuronal con arquitectura Transformer, especializada en procesar secuencias de texto. Es una subcategoría, no algo distinto.