SWE-2 de Cognition: entrenar con RL buscando la curva de costo-rendimiento, no solo el puntaje

SWE-2 de Cognition: entrenar con RL buscando la curva de costo-rendimiento, no solo el puntaje

SWE-2 de Cognition: entrenar con RL buscando la curva de costo-rendimiento, no solo el puntaje

La pelea de los modelos de código ya no es solo quién saca el puntaje más alto en los benchmarks. Cognition lanzó SWE-2, su modelo de coding más avanzado, y lo interesante no es el número: es cómo lo entrenaron. En vez de optimizar solo la tasa de éxito, metieron el costo de inferencia directo en la función de recompensa del RL. O sea, el modelo aprende a ser bueno y barato al mismo tiempo.

Lo que hicieron

SWE-2 está post-entrenado desde Kimi K3, un modelo de 2.8 billones de parámetros que ya venía con bastante RL para código agéntico. Cognition escaló su entrenamiento RL a ese régimen multi-trillón por primera vez, y encima entrenó todos los niveles de esfuerzo (medium, high, max) en una sola corrida, usando una penalización de costo lineal donde el parámetro λ se calibra según la pendiente de la curva de Pareto del modelo base en cada nivel. Nada de magia: es geometría. Si la línea iso-reward es tangente a la frontera, cualquier mejora en recompensa empuja la frontera hacia arriba en vez de moverse lateralmente.

Los números que importan

En FrontierCode 1.1 Main, SWE-2 medium supera a SWE-1.7 haciendo 58% menos turnos y costando 81% menos en promedio. Le gana a Grok 4.6 en puntaje y costo, iguala a GPT-5.6 Sol y Fable 5.1 a una fracción del precio, y queda a pocos puntos de GPT-6 Astra a un cuarto del costo. La parte conductual también mejoró: el modelo escribe soluciones más completas con menos vueltas inútiles y menos lecturas redundantes del código, que era la queja típica de SWE-1.7, ese que sobre-exploraba y se pensaba cada wea antes de tocar una línea.

Por qué me importa

Llevo un tiempo usando agentes de código en la pega y el cuello de botella real no es la inteligencia, es el costo por tarea. Un agente que quema tokens explorando el repo como si fuera la primera vez cada vez que lo invocas te cuesta más que la hora de un junior. Que alguien entrené el modelo con el costo dentro de la recompensa, y no después con trucos de prompt, me parece el cambio de fondo de este lanzamiento.

El otro detalle que me gusta es la honestidad metodológica: publicaron la función de recompensa exacta, la prueba de por qué la penalización debe ser lineal (apéndice y todo), y cómo elegir λ para cada nivel de esfuerzo. Es ciencia replicable, no un post de marketing con gráficos de barras. En un mundo donde los labs sueltan «nuestro modelo es mejor, confía», esto se agradece harto.

Eso sí, mantengo el escepticismo de siempre: los benchmarks de coding son synthetic hasta cierto punto, y FrontierCode es de los mismos que venden el modelo. Los números reales los va a dar el uso en repos desordenados de verdad, con legacy, tests rotos y READMEs mentirosos. Pero si la promesa se cumple —mismo trabajo, un quinto del costo— esto aprieta a todos los que venden agentes de código caros. Y eso, po, siempre es buena noticia para los que pagamos la cuenta.

SWE-2 ya está disponible en Devin Desktop, CLI, Web y Fusion.

Fuente de inspiración: Introducing SWE-2: Pushing the Pareto Frontier

Comentarios

Aún no hay comentarios. ¿Por qué no comienzas el debate?

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *