N
Novaire
← Índice
Práctica · Producción

Seguridad
y sandboxes

Cuando le das poder real a un agente, los riesgos se vuelven reales.

La seguridad de la IA es un problema de arquitectura

Un chatbot que solo responde es bastante inofensivo. Pero un agente con herramientas —que lee, ejecuta y actúa— puede hacer daño real si algo lo manipula.

La buena noticia: no se gana con "filtros mágicos", sino diseñando bien el sistema alrededor del modelo.

I
A qué te enfrentas

Las amenazas

La amenaza nº1 · Inyección de prompts

Instrucciones escondidas en los datos

El agente no siempre distingue datos de instrucciones. Si lee una web, un email o un PR con órdenes ocultas, puede obedecerlas. Mira la misma reseña con dos ojos:

Cuándo es de verdad peligroso

La trifecta letal

El riesgo grave aparece cuando se juntan tres patas. Actívalas y míralo:

Activa las tres patas…
Ya no es teoría

De truco de chatbot a vector de ataque

Con agentes, una sola inyección puede secuestrar la planificación, ejecutar herramientas con permisos y propagarse a sistemas conectados. Encabeza el OWASP Top 10 de aplicaciones agénticas de 2026.

Casos reales: una inyección oculta en la descripción de un PR logró ejecución de código con GitHub Copilot (CVE-2025-53773); "EchoLeak" exfiltró datos de empresa en Microsoft 365 Copilot sin un solo clic.

II
Aprendido a base de sustos

Por qué nacieron los sandboxes

Agentes con demasiado poder

Las llaves del reino

El patrón es siempre el mismo: un agente con acceso directo a producción y sin barreras. La solución no es "que se porte bien" — es limitar lo que puede tocar.
III
Diseñar para el desastre

Las defensas

La idea clave · Blast radius

¿Hasta dónde llega un fallo?

Asume que tarde o temprano algo saldrá mal. La pregunta no es "¿pasará?", sino "cuando pase, hasta dónde llega el daño?". Cambia los permisos:

Defensa en profundidad

Capas, no una bala de plata

CAPA DE MODELO
Entrenamiento en seguridad, resistencia a jailbreaks, filtrado básico.
CAPA DE APLICACIÓN
Validar la entrada, verificar la salida, ejecución en sandbox y confirmación humana en lo crítico.
CAPA DE CONTEXTO
Permisos por dato, trazabilidad del origen y autenticación de confianza cero.

El aislamiento va por grados: microVMs (lo más fuerte) → gVisor → contenedores. Anthropic reporta que el sandboxing reduce los avisos de permiso un 84%.

El humano en el bucle

Aprobar lo raro, automatizar lo seguro

No se trata de vigilar cada acción —eso mata la automatización—, sino de pedir aprobación humana donde más importa: lo irreversible y lo costoso.

La idea para llevarse

Asume la brecha, contén el daño

La inyección de prompts, como las estafas en la web, probablemente nunca se resuelva del todo. Las buenas defensas reducen los ataques, no los eliminan.

Por eso: mínimos permisos, sandbox por defecto, humano en lo irreversible, todo registrado, y que cuando algo falle falle de forma segura. Estamos donde estaba la seguridad web en 2004 — al principio del camino.
Fin · Seguridad y sandboxes

No confíes en que
se porte bien. Acótalo.

o clic para avanzar 1 / 1