
En enero de este año hubiera dicho que la IA en mi pega era una herramienta de nicho: útil para scripts, para entender código ajeno, para el borde del trabajo. El centro seguía siendo mío. Ocho meses después la cosa cambió: hoy la mayoría del código que despacho lo escribió un agente, y mi semana se fue de 60-80% generando código a casi 100% revisándolo.
Un levantamiento reciente del equipo detrás de mirrord lo confirmó con datos de su propia gente: ya casi nadie escribe código a mano, la parte que creció es la revisión, y varios describen el estado como agotador. La frase que más me caló fue una simple: la IA generada por agentes es «pulpa de palabras». Cualquiera que haya aceptado un PR generado por agente sabe a qué se refiere.
Lo que descubrí revisando slop todo el día
Primero: el código del agente compila y funciona, pero es largo de más. Clones, conversiones y colecciones innecesarias por todos lados, funcioncitas chicas para poder probarlas con testcitos chicas. Si dejas que el agente sea el dueño del refactor, dos meses después tienes una base de código que nadie entiende y que solo un agente puede mantener. Ese es el punto exacto donde pierdes el control del sistema.
Segundo: los agentes reinventan ruedas. Le pides una solución y te inventa la suya en vez de buscar la librería o el patrón que ya la resuelve. Por eso la investigación inicial de un área nueva la sigo haciendo a mano: necesito entender el dominio lo bastante bien para juzgar todo lo que se construya encima.
Mi configuración actual, sin mandar todo a un solo modelo
Mi regla práctica quedó así: el modelo caro hace el plan y la revisión crítica de casos borde; el modelo barato ejecuta y hace el trabajo sucio de pruebas exploratorias y tareas desechables. El experimento inverso, que el caro escriba la guía y el barato genere el código, a mí también me falló: el ahorro se perdía arreglando lo que salió mal. Y ojo con que esta combinación ya no requiere suscripción carísima: con modelos baratos tipo Flash o GLM en APIs agregadas, una sesión de trabajo completa sale menos que un café en Santiago.
Lo que se diseña distinto cuando tu revisor es humano
Lo que más me quedó claro es un cambio de diseño silencioso: ahora escribo el código pensando en el agente que lo va a mantener. Logs gruesos para que un agente de guardia pueda autodiagnosticar, un AGENTS.md más corto que el viejo CLAUDE.md, reglas compartidas en un repo para que todos los agentes partan con el mismo contexto. El costo es honesto: hay que documentar hasta lo obvio, porque un buen log de hoy es la mitad del debugging de mañana.
El límite: el burnout de revisar en paralelo
Con varios agentes corriendo en paralelo hay gente quebrada por revisión: varias tareas a la vez, varias rondas de corrección, la sensación de que los PR terminan lejos. Mi solución fue simple y no es glamorosa: un hilo de agente a la vez, con un propósito específico, reviso con calma y sin prisa por despachar. Prefiero un PR lento que entiendo a tres rápidos que no.
Ser un «proxy de carne» entre agentes y producción no es el futuro que quería, pero es la pega de hoy. Mientras tanto, la disciplina de mirar cada línea propia es lo único que evita que el sistema se vuelva una caja negra que nadie entiende, incluido el agente.
Fuente del tema: How Our Engineering Team Uses AI, Part II: Meat Proxies, del blog de MetalBear en dev.to.
Fuente de inspiración: How Our Engineering Team Uses AI, Part II: Meat Proxies
