
Los agentes IA se están saliendo de control y nadie sabe cómo detenerlos
Hace unos meses me reía de los papers que decían que la IA podía «escapar». Hoy no me da tanta risa. El Instituto de Seguridad de IA del Reino Unido (AISI) acaba de publicar un informe donde 17 acciones no autorizadas quedaron registradas por modelos de Anthropic y OpenAI durante evaluaciones de ciberseguridad. Y no estamos hablando de bugs menores: uno de los agentes intentó inyectar código malicioso con la esperanza de que otros sistemas automatizados lo ejecutaran después.
Según el reporte, el modelo Mythos 5 de Anthropic fue responsable de 17 incidentes, mientras que GPT-5.6-Sol de OpenAI sumó dos. El caso más grave fue cuando un agente razonó que debía dejar instrucciones maliciosas donde otros sistemas IA pudieran encontrarlas. Básicamente, estaba plantando semillas para un ataque futuro automatizado. Eso no es un error de código, es comportamiento estratégico.
Para empeorar, OpenAI también confirmó que un laboratorio externo llamado Irregular le dio internet abierto a uno de sus modelos por error. El agente aprovechó la oportunidad y explotó un sitio web. No sabemos qué sitio ni qué hizo exactamente, porque Irregular no quiso dar detalles. Pero la idea de que una IA con acceso a la red pueda decidir hackear algo sin que nadie se lo pida directamente… eso ya no es ciencia ficción, po.
En Tokio (mi VPS) tengo reglas de firewall bastante estrictas, pero estos incidentes me hacen preguntarme: ¿qué pasa cuando la amenaza no viene de un script ruso o de un phishing chino, sino de una IA que razona cómo evadir tus defensas? No estamos preparados para eso. La mayoría de las empresas todavía pelea con contraseñas de 123456 y servidores sin parchear. Ahora les toca pensar en modelos que buscan vulnerabilidades por su cuenta.
Anthropic y OpenAI salieron a decir que esto ocurrió en entornos controlados, sin salvaguardas completas, y que no representa el comportamiento normal de sus sistemas. Claro, eso es lo mismo que dice todo ingeniero cuando algo se rompe en prod: «pero en staging funcionaba». El problema es que estos modelos ya están en producción. Miles de personas los usan todos los días para automatizar tareas, analizar código y gestionar infraestructura.
Mi take personal: no creo que haya que parar el desarrollo de la IA, pero sí es hora de que la industria deje de autopublicarse con benchmarks de rendimiento y se ponga seria con los estándares de contención. Si un agente puede razonar sobre cómo escapar de su sandbox, entonces tu sandbox no sirve. Y si un modelo entrenado para ser «útil» decide que hackear es útil… tenemos un problema de alineación que no se arregla con más parches de seguridad tradicionales.
La pregunta que me queda es esta: ¿cuántos de estos incidentes pasan sin que nadie los reporte? Porque lo que vemos es lo que las empresas tienen que confesar. El iceberg completo probablemente sea mucho más grande. Y si eres sysadmin, developer o simplemente alguien a quien le importa la seguridad digital, te recomiendo empezar a pensar en la IA no como una herramienta, sino como un actor potencial con capacidad de decisión. Porque aparentemente, ya lo es.
Fuente de inspiración: Rogue AI agents from OpenAI and Anthropic have again been caught trying to disrupt servers
