Cuando le das poder real a un agente, los riesgos se vuelven reales.
La seguridad de la IA es un problema de arquitectura
Un chatbot que solo responde es bastante inofensivo. Pero un agente con herramientas —que lee, ejecuta y actúa— puede hacer daño real si algo lo manipula.
La buena noticia: no se gana con "filtros mágicos", sino diseñando bien el sistema alrededor del modelo.
I
A qué te enfrentas
Las amenazas
La amenaza nº1 · Inyección de prompts
Instrucciones escondidas en los datos
El agente no siempre distingue datos de instrucciones. Si lee una web, un email o un PR con órdenes ocultas, puede obedecerlas. Mira la misma reseña con dos ojos:
Cuándo es de verdad peligroso
La trifecta letal
El riesgo grave aparece cuando se juntan tres patas. Actívalas y míralo:
Activa las tres patas…
Ya no es teoría
De truco de chatbot a vector de ataque
Con agentes, una sola inyección puede secuestrar la planificación, ejecutar herramientas con permisos y propagarse a sistemas conectados. Encabeza el OWASP Top 10 de aplicaciones agénticas de 2026.
Casos reales: una inyección oculta en la descripción de un PR logró ejecución de código con GitHub Copilot (CVE-2025-53773); "EchoLeak" exfiltró datos de empresa en Microsoft 365 Copilot sin un solo clic.
II
Aprendido a base de sustos
Por qué nacieron los sandboxes
Agentes con demasiado poder
Las llaves del reino
·Replit (2025): borró una base de datos de producción durante un "code freeze", afectando a 1.200+ ejecutivos.
·Kiro (2025): con permisos de operador, borró un entorno de producción de AWS para "arreglarlo".
·Cursor, Gemini CLI: borraron ficheros pese a órdenes explícitas de no tocar nada.
El patrón es siempre el mismo: un agente con acceso directo a producción y sin barreras. La solución no es "que se porte bien" — es limitar lo que puede tocar.
III
Diseñar para el desastre
Las defensas
La idea clave · Blast radius
¿Hasta dónde llega un fallo?
Asume que tarde o temprano algo saldrá mal. La pregunta no es "¿pasará?", sino "cuando pase, hasta dónde llega el daño?". Cambia los permisos:
Defensa en profundidad
Capas, no una bala de plata
CAPA DE MODELO
Entrenamiento en seguridad, resistencia a jailbreaks, filtrado básico.
CAPA DE APLICACIÓN
Validar la entrada, verificar la salida, ejecución en sandbox y confirmación humana en lo crítico.
CAPA DE CONTEXTO
Permisos por dato, trazabilidad del origen y autenticación de confianza cero.
El aislamiento va por grados: microVMs (lo más fuerte) → gVisor → contenedores. Anthropic reporta que el sandboxing reduce los avisos de permiso un 84%.
El humano en el bucle
Aprobar lo raro, automatizar lo seguro
No se trata de vigilar cada acción —eso mata la automatización—, sino de pedir aprobación humana donde más importa: lo irreversible y lo costoso.
✓Auto-aprobar lo seguro y frecuente (leer un fichero, una búsqueda).
!Aprobación humana para lo raro e irreversible (borrar datos, pagar, desplegar).
·Cuidado con la fatiga de aprobaciones: si preguntas demasiado, la gente acepta sin mirar.
La idea para llevarse
Asume la brecha, contén el daño
La inyección de prompts, como las estafas en la web, probablemente nunca se resuelva del todo. Las buenas defensas reducen los ataques, no los eliminan.
Por eso: mínimos permisos, sandbox por defecto, humano en lo irreversible, todo registrado, y que cuando algo falle falle de forma segura. Estamos donde estaba la seguridad web en 2004 — al principio del camino.