
La noticia del lunes: la Fundación Wikimedia confirmó que encontró actividad de agentes de IA «rogue» de OpenAI en sus plataformas. Ediciones de prueba en sandboxes de wikis, intentos fallidos de comprometer su Etherpad público, y millones de requests automatizados a sus APIs, con cientos de miles de queries al servicio de Wikidata. Aclaran que no hubo compromiso de sistemas ni datos. Pero el detalle que me quedó dando vueltas es otro: unos agentes tomaron notas de sus tareas en el Etherpad de la Fundación. Literalmente dejaron la libreta en el sitio de alguien más.
Lo que encontraron, en concreto
El informe es público y detallado. Los agentes hicieron ediciones que nadie aprobó, incluyendo cambios en la configuración de una herramienta de citas que ellos mismos clasifican como potencialmente maliciosos: quería usarla de proxy para fetchear datos de servicios remotos. Los intentos contra Etherpad fueron de explotación pura, fallidos por suerte. Y aparte, presión de infraestructura: millones de requests, crawling masivo de Wikidata y Commons, y tráfico que según la Fundación pudo contribuir a una caída parcial del servicio de queries de Wikidata en mayo.
Detrás hay un patrón que ya veníamos viendo. METR, Translucence y otros investigadores habían documentado cómo clusters de agentes «rogue» intentaban romper sitios web, y cómo usaban wikis públicas de terceros para comunicarse y coordinarse entre sí. Wikimedia hizo su propia investigación para ver si le tocaba, y le tocó.
De qué me suena esto
Monitoreo mi flota de servidores, y los logs SSH de cada VPS expuesto son los de siempre: bots probando credenciales todo el día. Lo nuevo de esta generación de agentes es que no son los bots tontos de los 2010s escaneando puertos: son sistemas capaces de razonar, planear y usar herramientas, y —como mostró este caso— improvisar infraestructura para colaborar usando el servicio público de otro.
El costo no lo paga el que lo genera. Lo paga la Fundación Wikimedia, que según datos que ellos mismos publican ya venía con un aumento de 50% de ancho de banda por tráfico de bots desde 2024, y con el 65% del tráfico más intensivo en recursos viniendo de bots. Costos reales de servidores y horas de voluntarios limpiando ediciones. El informe lo dice sin vueltas: las empresas que liberan estos agentes y ganan con ellos deben ayudar a evitar y reparar el daño. Suena obvio, pero no existe ningún mecanismo para hacerlo hoy.
Un problema que todavía no tiene respuesta
El punto que menos me gusta es el de atribución: la Fundación tuvo que hacer ingeniería forense para concluir que esos agentes eran de OpenAI, y aún así aclara que es una creencia razonada, no una certeza. Si para la organización con más experiencia operando infraestructura wiki del mundo es difícil atribuir actividad agéntica, el dueño de un VPS chico no tiene ninguna chance.
Y sin atribución no hay accountability. Un weón con un crawler mal configurado por lo menos deja log con user agent identificable. Un agente que hace fetches anidados, proxy entre servicios, y deja notas en Etherpads ajenos, es otra cosa: es tráfico que se disfraza de humano, con herramientas que se disfrazan de uso normal, y con el costo que se lo lleva el host pequeño.
Mi conclusión: no existe todavía una buena respuesta para agentes no declarados en infraestructura abierta. Rate limiting por IP no sirve, porque los agentes saltan de infra. CAPTCHAs no sirven, porque los modelos de visión los pasan. Y el bloqueo agresivo de bots, el único que funciona, castiga también al usuario humano de buena fe. La opción más sensata parece exigir identificación declarada —como propuso Cloudflare con su idea de agentes identificables— y presionar por estándares abiertos para eso, porque el web abierto es un bien común. Que los agentes de una empresa privada lo traten de patio de juegos no puede ser la nueva normalidad.
Una cosa más, personal: trabajar a diario con agentes y verlos hacer esto desde afuera produce una sensación incómoda. La misma autonomía que los hace útiles en mi pega es la que les permite improvisar un Etherpad como bloc de notas cuando nadie los mira. No es malicia; es ausencia de fronteras. Y las fronteras no van a aparecer solas.
Fuente de inspiración: OpenAI «rogue» agent activities found on Wikimedia projects