Casi la misma inteligencia a un quinto del precio: por qué el anuncio de GPT-6.1 Sol importa más por el valor que por el puntaje

Casi la misma inteligencia a un quinto del precio: por qué el anuncio de GPT-6.1 Sol importa más por el valor que por el puntaje

Casi la misma inteligencia a un quinto del precio: por qué el anuncio de GPT-6.1 Sol importa más por el valor que por el puntaje

Ayer OpenAI lanzó GPT-6.1 Sol, la actualización de GPT-6 Sol. El titular que a uno le llega por la mañana es el de siempre: «casi iguala al modelo tope de línea». La cifra que de verdad me hizo levantar las cejas no fue un benchmark, fue la tabla de precios: 2 dólares por millón de tokens de entrada y 10 por millón de salida, con entrada cacheada a 0,10 dólares. Eso es un quinto del costo de GPT-6 Astra y una rebaja del 95% en el contexto cacheado.

Los benchmarks dan casi empate, y ahí está el truco

Según los propios números de OpenAI, en DeepSWE v1.1 Sol empató directo con Astra resolviendo tareas de ingeniería de software en codebases reales. En GDP.pdf, que mide qué tan bien un modelo lee PDFs profesionales con tablas, planos y letra chica, superó a Opus 5.5 costando menos de la mitad por tarea. En OSWorld 2.0, el de uso de computador, quedó a 2,1 puntos de Astra gastando cerca de siete veces menos.

Y el dato que mejor resume la tendencia, a mi juicio, es Terminal-Bench Science: la tarea promedio le costó a Sol 5,47 dólares, contra 23,21 de Opus 5.5 y 23,80 de Astra. Mismo trabajo, una cuarta parte del valor. Cuando la diferencia de calidad es de décimas de punto y la de precio es de 5x, la discusión ya no es cuál modelo gana, sino cuál te deja dormir con la cuenta de la nube.

Lo que cambia de verdad: el contexto cacheado

Para mí la cifra más interesante no es el 2 dólares de entrada, es el 0,10 por millón de tokens cacheados. Si administras agentes que corren solos, sabes que el gasto escondido siempre fue reinyectar el mismo contexto en cada corrida: el rol del agente, las reglas del sistema, el historial. Es como pagar arriendo por una oficina y tener que armarla de cero cada mañana.

Tengo agentes que se despachan con cron todos los días y cada reejecución partía medio de cero para no regalar tokens. Con caching a un centavo relativo, la aritmética se invierte: conviene dejar el contexto vivo y pagar memoria residente en vez de reconstruirla. No es un cambio de modelo, es un cambio de arquitectura, y no lo provocó ninguna evaluación de inteligencia sino una tabla de precios.

Ojo, que son los dueños del premio los que lo publican

Las advertencias de rigor: estos benchmarks los midió OpenAI con sus propios juegos, y los de la competencia salen de reportes públicos que cada cual presenta como mejor le queda. La mejora de factibilidad —del 11,4% al 7,7% de respuestas con errores en prompts difíciles— la midieron sobre conversaciones donde el usuario ya había pescado una paya del modelo anterior, o sea, terreno escogido. Nada de esto invalida el anuncio, pero tampoco hay que tragárselo entero: los puntajes de proveedor son marketing con gráficos.

Aun así, la dirección es clara y venía avisada. La familia quedó Astra para lo imposible, Sol para la pega diaria seria y Luna a 0,10 dólares de entrada para lo masivo. Es la estructura de precios de una aerolínea aplicada a la inteligencia: clase ejecutiva, turista y la L del Transantiago.

Mi veredicto

Si manejas infraestructura propia y agentes autónomos, como hago yo con los mios, este es el tipo de anuncio que sí mueve cosas. Hace un año el dilema era «¿me alcanza para correr el modelo bueno?». Hoy el dilema es otro, y es mejor: ¿para qué tareas estoy pagando el modelo caro cuando el de un quinto del valor entrega el mismo trabajo? Esa pregunta, hecha en serio, baja más la cuenta mensual que cualquier optimización de código.

Hace poco ordené las llaves de mis agentes detrás de un gateway propio para controlar el gasto, y ahora veo que la otra mitad de la ecuación —el precio por token— la están bajando los proveedores a golpes de competencia. Si sigues pagando precios de hace seis meses sin revisar las tier nuevas del mercado, estás regalando plata. Cachai en cinco minutos, ahorras todos los meses.

Fuente de inspiración: GPT 6.1 Sol: Near-Astra intelligence for a fifth of the price

Comentarios

Aún no hay comentarios. ¿Por qué no comienzas el debate?

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *