Por qué la IA no apareció de golpe — solo cambió de filosofía.
La pregunta de todos
«¿Por qué de repente parece que la IA ha aparecido de la nada?»
Spoiler: llevaba décadas cocinándose. Lo que cambió no fue la potencia, sino la idea: dejamos de programarle las reglas a la máquina y empezamos a dejar que las descubriera sola.
I
El Pasado
Heurísticas y sistemas expertos
¿Qué había antes?
Mandaba la IA simbólica: el humano escribía las reglas a mano.
iÁrboles de decisión gigantes — millones de if / else encadenados.
iiHeurísticas: atajos lógicos que un experto programa para resolver algo de forma óptima… pero rígida.
Una heurística, en vivo
El árbol de reglas del Parchís
Arrastra los nodos para ordenarlos. Pulsa Run en cada escenario: el árbol decide bien… hasta el caso que nadie programó.
El heurístico, en códigosi comer_rival: comer()si no, si casa y dado==5: sacar()si no, si puedo_mover: mover()# ¿y si no puedo mover?# → no hay regla. peta.
Escenario:
El token recorre el árbol iluminando el nodo activo.
Ejemplo · Deep Blue, 1997
Cómo "pensaba" al ajedrez
A cada tipo de pieza le daban un valor fijo en puntos: peón = 1, caballo y alfil = 3, torre = 5, reina = 9.
Para elegir jugada, probaba cada movimiento posible, sumaba los puntos del material que le quedaría después, y se quedaba con la de mayor total. Nada de "entender": solo sumar y comparar números.
♙+1
♘+3
♗+3
♖+5
♕+9
Material: 0
El contador simula esa suma de material. Por eso, si una jugada brillante pierde puntos a corto plazo, la descarta: no "ve" la celada, solo compara totales.
¿Por qué no era inteligente?
01Cero generalización. Lo que el programador no previó en el código, lo rompe.
02Falta de contexto. No "entiende": calcula sobre reglas fijas.
03Mantenimiento imposible. Digitalizar el saber humano a base de reglas crea monstruos de código inmanejables.
Funciona… hasta que sales del guion
II
El Giro
De programar reglas a aprender patrones
La intuición de Hassabis
Demis Hassabis (CEO de DeepMind) apostó por lo contrario: en vez de decirle a la máquina cómo resolver el problema, darle las herramientas para que descubra las reglas sola.
Esa vía es el Aprendizaje por Refuerzo Profundo (Deep RL).
2017 · El paper que lo cambió todo
«Attention is all you need»
Ese año, un equipo de investigadores de Google (Vaswani, Shazeer, Parmar y compañía) publicó el paper que introdujo los Transformers y el mecanismo de atención: la base de todos los LLMs de hoy.
En paralelo, Hassabis y DeepMind avanzaban por el carril del aprendizaje por refuerzo con AlphaGo (2016) y AlphaZero. Dos hilos que acabarían confluyendo.
↑ Una red neuronal: nodos (neuronas) en capas. Cada conexión tiene un peso — un número que mide cuánto influye una neurona en la siguiente. Entrenar es ajustar esos pesos hasta que la red acierta.
La arquitectura
Cómo es un Transformer
El paper define dos bloques: un Encoder que entiende la entrada y un Decoder que genera la salida. El corazón de ambos es la atención.
Encoder ×N
Input Embedding
+ Positional Encoding
Multi-Head Attention
Add & Norm
Feed Forward
Add & Norm
Decoder ×N
Output Embedding
+ Positional Encoding
Masked Multi-Head Attention
Add & Norm
Cross-Attention ← Encoder
Add & Norm
Feed Forward
Add & Norm
↓ Linear + Softmax → probabilidades de la siguiente palabra
El corazón del Transformer
¿Qué es la atención?
Permite que cada palabra "mire" a las demás y decida cuáles son relevantes para entenderla — sin importar lo lejos que estén en la frase.
Pulsa una palabra para ver en cuáles se fija. (Cuanto más gruesa la línea, más atención.)
El hito · AlphaZero
Aprender jugando contra sí mismo
Sin partidas humanas. Solo las reglas básicas… y a jugar contra sí mismo millones de veces.
0 partidas
8%
Empieza moviendo casi al azar. Cada iteración aprende de sus propios errores.
Pero hay una trampa: seguir mejorando cuesta cada vez más. El coste de entrenar modelos crece de forma exponencial.
≈ 3 M$AlphaGo 2016
≈ 5 M$GPT-3 2020
≈ 100 M$GPT-4 2023
≈ 1.000 M$+Frontera 2025+
Estimaciones públicas — órdenes de magnitud, no cifras exactas.
III
El Presente
Anatomía de un LLM
En el fondo, una sola tarea
Un LLM está entrenado para predecir la siguiente palabra. Suena simple; la magia está en cómo lo hace.
Tres conceptos para aterrizarlo →
Concepto 1 · Embeddings
Las palabras se vuelven geometría
La máquina no entiende palabras, entiende números. Cada palabra se traduce a un vector: [0.23, -0.45, 0.89, …]. Lo brillante: las afines quedan cerca.
Métrica de vecindad:
Pulsa una palabra: se resaltan sus 3 vecinas según la métrica elegida (cambia la métrica y vuelve a pulsar para ver cómo varían).
La distancia de Hamming no aparece aquí: se usa con vectores binarios, no con estos continuos.
Concepto 2 · Parámetros
Los "botones" de la red
Imagina millones de tuberías. Los parámetros son las válvulas que controlan cuánta información pasa de una neurona a otra.
Entrenar = ajustar esas válvulas hasta acertar. 70B parámetros = 70.000 millones de válvulas afinadas.
Concepto 3 · Inferencia por bloques
El viaje de un token
Tu prompt se convierte en vectores y atraviesa capas. Cada una mira algo distinto. Al final, los pesos eligen la palabra más probable.
Prompt:El gato se subió al…
Embeddings
texto → vectores
Sintaxis
gramática
Contexto
¿de qué habla?
Significado
intención
Salida
probabilidades
tejado
61%
árbol
22%
sofá
11%
coche
6%
La gran idea
No busca. No aplica reglas. Genera.
El LLM produce la respuesta una palabra cada vez, eligiendo siempre la siguiente más probable según lo aprendido.
La "inteligencia" emerge de repetir eso miles de millones de veces sobre patrones aprendidos. Ahí está la diferencia con las heurísticas.
Para debatir en clase
Preguntas abiertas
?¿Esto es inteligencia… o estadística extraordinariamente sofisticada?
?Si solo predice la siguiente palabra, ¿puede de verdad "entender", o solo lo aparenta muy bien?
?Una máquina que supera a los humanos sin que nadie le enseñe: ¿de quién es ese conocimiento, y quién responde de sus decisiones?