N
Novaire
← Índice
Clase 05 · Extra · Nivel avanzado

Más allá de
la atención

Qué ha cambiado desde 2017 — y por qué.

El paper de 2017 fue solo el principio

La atención original ("Attention is all you need") fue revolucionaria, pero arrastra dos límites serios. Casi toda la investigación reciente gira en torno a resolverlos.

Esta clase es un mapa de esas soluciones: desde pequeños trucos hasta arquitecturas que se alejan del Transformer.
I
Los límites

El problema

Límite 1 · Coste cuadrático

Cada palabra mira a todas

En la atención, cada token se compara con todos los demás. Con N tokens, eso son N × N comparaciones: si doblas el texto, el coste se cuadruplica.

Tokens (N):

N = 4 → comparaciones ≈ 16

Por eso un contexto de 1 millón de tokens se vuelve carísimo: el cuello de botella es la atención.

Límite 1 (continuación) · La memoria que crece

Recordar todo lo dicho

Para generar cada palabra, el modelo guarda en memoria las claves y valores de todos los tokens anteriores — la caché KV.

Cuanto más largo el contexto, más crece esa caché. En conversaciones muy largas puede ocupar más memoria que el propio modelo.

Límite 2 · Lost in the middle

Se pierde lo del medio

Aunque quepa todo, el modelo no atiende por igual: se fija mucho en el principio y el final del contexto, y "pierde" lo que está en el medio (una curva en forma de U).

Coloca un dato clave en el contexto y mira cómo varía cuánto lo recuerda:

Recuerdo del dato: 96% · Al principio: lo recuerda casi perfecto.

II
Abaratar sin romper

Las soluciones

Comprimir la caché KV

MHA → MQA → GQA → MLA

La gran familia de trucos: en vez de que cada "cabeza" de atención guarde su propia clave/valor, compartirlas o comprimirlas. Pulsa cada modo:

Caché KV (relativa): 100%

MHA · cada cabeza tiene su propia clave/valor. Máxima calidad, máxima memoria.

A nivel de hardware · FlashAttention

La misma atención, mejor calculada

No cambia las matemáticas (es exacta, no una aproximación). Cambia cómo usa la memoria de la GPU: calcula por bloques en la memoria rápida y evita ir y volver mil veces a la lenta.

SRAM · rápida y pequeña← FlashAttention trabaja aquí, por bloques
HBM · lenta y grande← la atención clásica la satura de idas y vueltas
Resultado: mucho más rápido y permite contextos más largos, sin perder ni una pizca de precisión.
Mirar menos · Ventana y dispersión

¿Y si no miramos a todos?

Si cada token solo atiende a una ventana de vecinos (sliding window) o a un subconjunto elegido (atención dispersa), el coste deja de ser cuadrático.

Completa · O(N²)
Ventana
Dispersa

El riesgo: si recortas mal, pierdes información relevante que estaba lejos. La investigación actual (p. ej. DeepSeek Sparse Attention) elige qué mirar de forma inteligente.

III
Cambiar de motor

Más allá del Transformer

Atención lineal

Reescribir la fórmula

Otra vía: reformular la atención matemáticamente para que el coste crezca en línea recta con la longitud, no al cuadrado.

Familias como RWKV o Gated DeltaNet persiguen esto: rendimiento parecido al Transformer, pero escalando mucho mejor en textos largos.

SSM · Mamba

Un estado, no una memoria infinita

Los modelos de espacio de estados (Mamba, Gu & Dao, 2023) no guardan todos los tokens: mantienen un estado fijo que se va actualizando, como un resumen vivo. Coste lineal y memoria constante.

Atención

Guarda cada token → la caché crece y crece.

Mamba (SSM)
estado

Un resumen de tamaño fijo que se actualiza.

El truco tiene precio: al comprimir todo en un estado, puede perder algo de recall exacto que la atención sí conserva.

La tendencia 2025–2026

Lo mejor de los dos mundos

La apuesta actual son los híbridos: muchas capas Mamba (baratas, para el grueso) intercaladas con unas pocas capas de atención (para el recall preciso), a menudo con MoE encima.

El mapa, de un vistazo

De un truco a otro motor

Es investigación viva: lo que hoy es frontera puede ser estándar (o quedar obsoleto) en meses.
Fin de la Clase 05

La atención fue el inicio,
no el final.

o clic para avanzar 1 / 1