Hasta ahora vimos qué hace un LLM. Ahora: cómo se mide, cómo se comprime para que quepa en tu hardware, y por qué unos modelos pueden usar herramientas y otros no.
Los parámetros son las conexiones internas. Más parámetros = más capacidad de abstracción… pero más memoria para ejecutarlo.
70B = 70 mil millones de parámetros. La regla rápida: parámetros × bytes por número = memoria base para correr inferencia.Palabra técnica para algo simple: una rejilla de números. Una lista es un tensor de 1 dimensión; una tabla, de 2; un cubo, de 3…
70B = 70.000 millones de ellas. Por eso un formato llamado safetensors = "una forma segura de guardar esos tensores".Los modelos se entrenan en FP16/BF16: cada parámetro ocupa 2 bytes. Un 70B necesitaría +140 GB de VRAM solo para cargar.
La cuantización mapea esos números a menos bits (8, 4, 2), permitiendo correr modelos enormes en hardware de consumo perdiendo un mínimo de precisión.
0.6827319 (FP16) → 0.68 (INT8) → 0.7 (INT4). Menos bits = pasos más gruesos = ocupa mucho menos, a cambio de algo de imprecisión.Nota: VRAM = la memoria de la tarjeta gráfica (GPU). Es el recurso caro y limitado que decide qué modelos puedes cargar.
Pulsa para ver cuánta VRAM ahorras y qué desviación asumes en cada nivel.
En vez de activar los 70B de parámetros en cada token, MoE divide la red en "expertos". Un router decide qué 2 despiertan para cada token.
Razonamiento de un modelo gigante, con coste de inferencia de uno pequeño.
Usar herramientas (web, código, APIs) exige un entrenamiento específico para que el modelo pause su texto y emita un JSON estricto que el sistema pueda ejecutar.
Hugging Face es la infraestructura abierta donde la comunidad comparte modelos, datasets y pesos entrenados.
Al descargar para inferencia, te cruzarás con extensiones que determinan cómo tu backend habla con los tensores →
pickle. Tensores puros sin código ejecutable: elimina inyección maliciosa al cargar y permite lectura directa en memoria..gguf cambió la localAntes, el tokenizador y los pesos iban separados. Versión equivocada del tokenizador → el modelo escupía basura (gibberish).
.gguf encapsula metadatos y tensores en un único sitio y habilita el VRAM-offloading: repartir capas entre CPU y GPU.