Un modelo de 4B parámetros le ganó a GPT-5.6 Sol en búsquedas: la era de los agentes baratos ya llegó

Un modelo de 4B parámetros le ganó a GPT-5.6 Sol en búsquedas: la era de los agentes baratos ya llegó

Un modelo de 4B parámetros le ganó a GPT-5.6 Sol en búsquedas: la era de los agentes baratos ya llegó

Hoy me topé con una noticia que me hizo replantearme cuánto estamos pagando de más por IA. Neon (la base de datos serverless basada en Postgres) publicó junto a Castform un post donde demuestran que un modelo open source de apenas 4B parámetros, post-entrenado con técnicas de RL, logra recuperar información tan bien como GPT-5.6 Sol en tareas de búsqueda agentica. La diferencia: cuesta 100 veces menos por request. Sí, leíste bien. Cien veces menos.

¿Por qué esto es una wea importante?

Los agentes de IA actuales funcionan en loops: planean, buscan, analizan y vuelven a buscar. Cada vuelta del loop significa una llamada a un modelo frontier como GPT-5.6 Sol. Según los datos de Neon, una búsqueda multi-turn con ese modelo toma más de 10 segundos y cerca de USD $0.03 por consulta end-to-end. Suena poco, pero si escalas a miles de usuarios diarios, la cuenta se transforma en un problema real.

Castform ataca esto desde dos frentes. Primero, post-entrena modelos open source pequeños (4B) usando RL, haciéndolos expertos específicamente en search retrieval. Segundo, se apoya en Lakebase Search sobre Neon Postgres para que el agente tenga un motor de búsqueda híbrido (BM25 + vectores) sin tener que montar infraestructura extra.

¿Cómo funciona el pipeline?

La magia no está solo en el modelo, está en el loop completo. Los documentos corporativos se guardan en Postgres en Neon. Castform genera synthetic data a partir de esos documentos, crea tareas de entrenamiento, corre RL contra un motor de búsqueda real (Lakebase Search) y define una función de recompensa que premia respuestas correctas y citaciones bien hechas.

El resultado es un modelo de 4B que sabe buscar en tus documentos, citar la fuente correcta y entregar una respuesta útil. No es genial para todo (no esperes que escriba poesía), pero para retrieval agentic es comparable o superior a los modelos de trillones de parámetros de OpenAI.

Mi opinión de sysadmin chileno

Yo llevo meses corriendo agentes locales con Ollama y GLM 5.2. Me encanta la idea de tener la pega en mi servidor y no depender de APIs que suben de precio cada trimestre. Pero lo que me faltaba era precisión en búsquedas sobre documentación interna. Este approach de Castform + Neon me cierra: no necesito GPU farm para entrenar, solo necesito mis documentos en Postgres y dejar que el RL haga la pega pesada.

Lo que más me gusta es que no inventan una base de datos nueva. Usan Postgres con extensiones reales (lakebase_text y lakebase_vector). Si ya tenes un Neon corriendo para otra cosa, el salto a «agente que busca en tu DB» es casi trivial. No hay que migrar nada, no hay que aprender un stack nuevo.

Ahora, ojo: esto no significa que GPT-5.6 Sol quedó obsoleto. En tareas generales, razonamiento complejo y coding, los frontier models siguen dominando. Pero para retrieval especializado, la combinación open source + RL + infra existente ya es competitiva. Y en un mundo donde los precios de API suben (hello, DeepSeek subiendo sus tarifas esta misma semana), tener una alternativa viable es oro.

Takeaway

Si eres de los que tiene documentación interna desperdigada en wikis, Notion y PDFs viejos, esta wea te interesa. No necesitas un equipo de ML. Necesitas tus documentos en Postgres, un poco de paciencia para configurar Castform, y dejar que el agente aprenda a buscar solo. En 2026, small and specialized le está ganando a big and general en el terreno donde más duele: la billetera.

Fuente de inspiración: How Castform + Neon Beats Frontier Models on Price and Efficiency

Comentarios

Aún no hay comentarios. ¿Por qué no comienzas el debate?

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *