JOSÉ LUIS DíAZ CHARRASQUIEL
Team PlatziNoventa años de historia detrás de la IA
Por Zea Paula Cuervo Martinez
Noventa años de historia detrás de la IA
Resumen
La historia de la inteligencia artificial tardó casi noventa años en construirse, y conocerla te da algo valioso: la capacidad de distinguir una demostración llamativa de un avance que realmente dura. No la inventó una sola persona ni apareció de golpe con ChatGPT. Se armó ladrillo por ladrillo, con aportes de la matemática, la fisiología, la lingüística y hasta la filosofía.
¿Cómo empezó la idea de calcular sin comprender?
El cimiento aparece en 1936, cuando Alan Turing describió una máquina teórica que ejecutaba instrucciones simples [00:32]. No era una computadora física, era una idea. Su pregunta era qué significa exactamente calcular con un procedimiento mecánico.
Imagina una máquina que recibe símbolos y una lista precisa de instrucciones para transformarlos. Si cada paso está bien definido, ejecuta todo el proceso sin entender qué significan esos símbolos para un humano. Ejecutar correctamente no es lo mismo que comprender, y esa idea vuelve una y otra vez en toda la historia.
¿Qué es la máquina de Turing? Es un modelo teórico de 1936 que sigue instrucciones paso a paso para transformar símbolos. Demuestra que una máquina puede calcular sin entender el significado de lo que procesa.
¿Por qué el cerebro inspiró las primeras neuronas artificiales?
Otra línea partió del cerebro. En 1943, McCulloch y Pitts modelaron matemáticamente una neurona con entradas y una respuesta [01:14]. Catorce años después, Rosenblatt tomó esa idea y creó el perceptrón [01:24].
El perceptrón recibía varias entradas con pesos distintos, las sumaba y producía una respuesta. Cuando se equivocaba, ajustaba los pesos según el error. Piensa en lanzar dardos con los ojos vendados: después de cada tiro alguien te dice "un poco a la izquierda", y tú ajustas. Eso es aprender corrigiendo parámetros con ejemplos, en vez de recibir todas las reglas ya terminadas.
En 1956, en Dartmouth, el campo recibió su nombre [01:54]. McCarthy, Minsky, Rochester y Shannon propusieron un estudio de dos meses con diez investigadores. Su conjetura era que el aprendizaje y la inteligencia podían describirse con suficiente precisión para simularse en una máquina.
¿Qué fueron los inviernos de la IA y por qué llegaron?
Aquí aparece un patrón que se repite: primero una idea prometedora genera expectativas enormes, y después la realidad decepciona. La traducción automática lo mostró [02:26].
En 1954 un experimento tradujo frases del ruso al inglés y todos creyeron que el problema quedaría resuelto en pocos años. Doce años más tarde, un informe concluyó que las máquinas traducían peor, más lento y más caro que las personas. La financiación cayó, y esos periodos de recortes se llamaron los inviernos de la IA.
¿Por qué falló la IA clásica? Intentaba escribir a mano cada regla con instrucciones del tipo "si ocurre esta condición, aplica esta conclusión". Funcionaba en problemas pequeños, pero ante una situación nueva el sistema se quedaba mudo.
La causa profunda era esa rigidez. Un especialista programaba a mano cada regla, y bastaba una situación que nadie había escrito para que todo se detuviera.
¿Qué cambió con el machine learning y el deep learning?
La salida fue cambiar la forma de construir el comportamiento. En vez de explicarle al sistema qué hacer, se le dan datos [03:18]. A eso se le llama machine learning, o aprendizaje automático.
En lugar de escribir a mano cada característica de un gato, le das miles de imágenes etiquetadas y el modelo encuentra las regularidades solo. El perceptrón ya insinuaba esto. En 1986, Rumelhart, Hinton y Williams popularizaron la retropropagación [03:38], que propaga el error hacia atrás por una red y ajusta sus conexiones. Pero faltaban datos y potencia.
El desbloqueo llegó en 2012 con AlexNet [03:52]. Krizhevsky, Sutskever y Hinton entrenaron una red profunda usando GPUs, esas tarjetas gráficas que procesan miles de operaciones en paralelo. Los resultados marcaron un abismo:
- AlexNet logró una tasa de error de 15.3% en una competición de imágenes.
- La segunda mejor propuesta alcanzó 26.2%.
- La receta combinaba redes profundas, muchos datos y cómputo paralelo.
Esa distancia fue lo que convenció al campo. El deep learning significa usar redes con muchas capas, donde cada capa aprende algo más abstracto: bordes primero y formas complejas después.
¿Qué es el Transformer y cómo llegamos a GPT?
En 2017 llegó el Transformer, con el artículo Attention Is All You Need [04:29]. Su truco es la atención, que relaciona partes distantes de una frase.
En la frase "el perro que perseguía al gato era negro", la palabra negro se conecta con perro aunque estén lejos. Eso, entrenado en paralelo, permitió los grandes modelos de lenguaje.
¿Qué significa GPT? Generative Pre-trained Transformer. Es un modelo de lenguaje basado en la arquitectura Transformer de 2017, y ChatGPT llegó al público en 2022.
Pero recuerda a Turing [04:58]: generar una respuesta convincente no comprueba que sea verdad. Un modelo genera texto prediciendo la siguiente palabra, y ahí queda la pregunta abierta: ¿cómo sale de eso algo coherente? ¿Qué parte de esta historia te sorprendió más? Cuéntame en los comentarios.