El modelo es el cerebro; el agente es el cuerpo
Hace un tiempo leí un artículo de Michael Lynch, el tipo detrás de PicoShare, que le pone nombre a algo que yo vengo sufriendo hace meses: los modelos de IA mejoraron a un ritmo brutal, pero el software que los conecta a nuestras máquinas se quedó estancado. El modelo genera un código buenísimo; el agente es el que lo pega en los archivos, corre los tests, y ahí es donde todo se cae a pedazos. No es la IA la que es tonta: es la carcasa.
Los sinsabores de siempre
La lista de dolores que describe Lynch calza casi uno a uno con lo que viví corriendo agentes en mis VPS:
Uno: los agentes no manejan tareas. Tienen diez subtareas independientes y las ejecutan una por una, sin paralelizar nada, como si no tuvieran acceso a los ocho cores de la máquina. Dos: no saben delegar. Nunca te dicen «esto es pega de modelo chico y barato»; usan el modelo caro incluso para grepear 50 mil líneas. Tres: se detienen por cualquier paja. Lo dejé corriendo de noche y a la mañana siguiente seguía esperando que yo le respondiera qué nombre ponerle a una rama de git. Ocho horas durmiendo en el trabajo, como aprendiz de primera.
Seguridad de sugerencia, no de contrato
Lo que más me interesa es el tema seguridad, porque es donde el problema deja de ser molestia y pasa a ser riesgo real. Lynch cuenta que pidió por prompt a un agente que no leyera cierto directorio y ese mismo agente terminó filtrando llaves de APIs a OpenAI y Anthropic. Eso me tocó verlo de cerca: los agentes tratan los archivos de credenciales como material de lectura opcional, y si está en tu home, lo leen.
La solución correcta existe y tiene más de una década: sandboxes a nivel de sistema operativo. Que el agente solo tenga acceso al directorio del repo, con reglas de red cerradas por defecto, y que eso sea código determinista, no una «sugerencia amable» que el modelo puede ignorar. No es ciencia ficción: yo mismo corro backups y conexiones SSH bajo permisos estrictos en mis servidores hace años. Si un agente necesita escribir en /root de verdad, que me pida permiso una vez y quede auditado, no que yo haga clic en «Allow» quinientas veces al día hasta equivocarme.
¿Y por qué nadie lo arregla?
Lynch hipotetiza que es un problema de incentivos: los ejecutivos de las compañías de IA miden cosas visibles, demos y benchmarks, y los benchmarks casi nunca miden al agente, solo al modelo. Coincido, y agrego lo mío: un agente que respeta sandboxing es menos vistoso en un keynote, pero mucho más seguro en producción. Le va mejor en la demo al modelo que no pregunta nada.
Mi criterio de agente bacán
Si me preguntan cómo debería ser un agente decente para 2026, para mí son tres cosas no negociables: aísla su alcance con permisos reales del sistema, es specialist en sí mismo (que sepa qué funciones tiene sin buscarlo en Google), y falla seguro: si queda sin respuesta, pausa o notifica, pero no sigue avanzando con credenciales expuestas. Mientras eso no llegue de fábrica, lo sensato es tratar a todo agente como una persona nueva sin antecedentes a la que le das acceso al server: con auditoría, con red restringida y con copia de seguridad hecha antes de dejarlo solo. No es pesimismo, es criterio.
Fuente del tema: Why Are Coding Agents So Dumb?, de mtlynch.io.
Fuente de inspiración: Why Are Coding Agents So Dumb?

