N
Novaire
← Índice
Clase 03 · Formación IA · Nivel avanzado

Las Tripas
del Modelo

Para perfiles de ingeniería: arquitectura, compresión y despliegue.

Bajamos al motor

Hasta ahora vimos qué hace un LLM. Ahora: cómo se mide, cómo se comprime para que quepa en tu hardware, y por qué unos modelos pueden usar herramientas y otros no.

Esta clase es para quien va a desplegar o elegir modelos, no solo a usarlos.
I
Tamaño y memoria

Parámetros y cuantización

El dilema de los miles de millones

Los parámetros son las conexiones internas. Más parámetros = más capacidad de abstracción… pero más memoria para ejecutarlo.

70B = 70 mil millones de parámetros. La regla rápida: parámetros × bytes por número = memoria base para correr inferencia.
Antes de comprimir, entendamos qué comprimimos

¿Qué es un tensor?

Palabra técnica para algo simple: una rejilla de números. Una lista es un tensor de 1 dimensión; una tabla, de 2; un cubo, de 3…

0.23
-0.45
0.89
0.12
-0.07
0.51
-0.33
0.78
0.04
-0.62
0.19
-0.28
0.66
0.37
-0.91
0.05
Los pesos de un modelo son exactamente esto: tensores gigantes de números — miles de millones de casillas. 70B = 70.000 millones de ellas. Por eso un formato llamado safetensors = "una forma segura de guardar esos tensores".
Cuantización

Comprimir la precisión

Los modelos se entrenan en FP16/BF16: cada parámetro ocupa 2 bytes. Un 70B necesitaría +140 GB de VRAM solo para cargar.

La cuantización mapea esos números a menos bits (8, 4, 2), permitiendo correr modelos enormes en hardware de consumo perdiendo un mínimo de precisión.

Piénsalo como redondear: 0.6827319 (FP16) → 0.68 (INT8) → 0.7 (INT4). Menos bits = pasos más gruesos = ocupa mucho menos, a cambio de algo de imprecisión.

Nota: VRAM = la memoria de la tarjeta gráfica (GPU). Es el recurso caro y limitado que decide qué modelos puedes cargar.

El efecto, en directo

VRAM estimada (modelo 70B): 140 GB
Pérdida de precisión cognitiva: 0.0%

Pulsa para ver cuánta VRAM ahorras y qué desviación asumes en cada nivel.

II
Arquitectura

MoE y tooling

Mixture of Experts

No enciendas todo el modelo

En vez de activar los 70B de parámetros en cada token, MoE divide la red en "expertos". Un router decide qué 2 despiertan para cada token.

Router: en espera
Matemáticas
Programación
Lingüística
Lógica

Razonamiento de un modelo gigante, con coste de inferencia de uno pequeño.

Function Calling

¿Por qué unos sí y otros no?

Usar herramientas (web, código, APIs) exige un entrenamiento específico para que el modelo pause su texto y emita un JSON estricto que el sistema pueda ejecutar.

[Esperando ejecución…]
III
Distribución

Formatos y Hugging Face

El "GitHub" del Machine Learning

Hugging Face es la infraestructura abierta donde la comunidad comparte modelos, datasets y pesos entrenados.

Al descargar para inferencia, te cruzarás con extensiones que determinan cómo tu backend habla con los tensores →

Las extensiones que verás

.ggufGGUF — optimizado para CPU e inferencia local híbrida (CPU+GPU). Todo en un binario único con los metadatos de tokenización incluidos: evita desajustes y caídas.
.safetensorsSafetensors — reemplazo seguro del viejo pickle. Tensores puros sin código ejecutable: elimina inyección maliciosa al cargar y permite lectura directa en memoria.
AWQ · GPTQAWQ / GPTQ — empaquetados para aceleración nativa en pipelines de GPU NVIDIA.
Para tu exposición

Por qué .gguf cambió la local

Antes, el tokenizador y los pesos iban separados. Versión equivocada del tokenizador → el modelo escupía basura (gibberish).

.gguf encapsula metadatos y tensores en un único sitio y habilita el VRAM-offloading: repartir capas entre CPU y GPU.
Fin de la Clase 03

Del concepto
al despliegue.

o clic para avanzar 1 / 1