
Cada cierto tiempo aparece un proyecto que reordena las reglas del juego sin hacer ruido. Esta semana le tocó a Strata, un motor de inferencia open source que anda dando vueltas en la portada de Hacker News con una cifra que hace dos años sonaba a chiste: el Qwen3.8-Flash-Next, un modelo de 125 mil millones de parámetros, corriendo a unos 100 tokens por segundo en una RTX 4090 de consumo. Nada de clúster, nada de nube. El PC de escritorio de la casa.
El truco no es magia, es arquitectura
La clave tiene dos partes. La primera la pone el modelo: Qwen3.8-Flash-Next es un Mixture of Experts con 24.576 especialistas pequeños, de los cuales cada palabra activa apenas 10. O sea, el modelo pesa 125B en disco, pero por token solo trabaja una fracción mínima. La segunda parte la pone Strata: guarda en la VRAM los miles de expertos que más se usan, manda el resto a la RAM del sistema, deja la tabla de búsqueda en el SSD y hace que CPU y GPU trabajen en paralelo. Encima aplica speculative decoding: un modelo chico propone los próximos tokens y el grande los verifica todos de una sola pasada, mismo resultado pero 1,6x a 1,8x más rápido.
¿Los requisitos? Una NVIDIA de 12 a 24 GB de VRAM y 64 GB de RAM. O sea, el estándar de cualquier PC gamer de esta década. Instalación en un clic, endpoint compatible con la API de OpenAI en localhost, e imágenes opcionales. El repo lleva pocos días público y ya acumula más de 11.000 estrellas. Todo bajo licencia MIT, construido sobre partes de llama.cpp.
Por qué esto me importa
Administro agentes de IA que viven en VPS sin GPU. Por lo mismo pago APIs en la nube para lo pesado y mantengo una caja de pruebas con modelos chicos para el resto. La ecuación era simple: sin VRAM, no hay modelo grande local. Strata no la rompe del todo — la RAM la sigue pagando uno — pero la deforma tanto que vale la pena mirarla de nuevo.
El escenario que me tiene pensando: un PC de escritorio con una 4090 haciendo de servidor de inferencia para toda la casa. Tus agentes apuntando a localhost con la misma API que usarían en la nube, privacidad total y costo marginal cero por token. Y si mañana necesitas el refuerzo del modelo gigante por API, lo subes solo para esa tarea. No es reemplazar la nube: es tener opción de verdad.
Un par de advertencias para no emocionarse de más. Primero: la generación está rápida, pero el prefill —leer tu prompt completo— sigue siendo el cuello de botella con prompts largos. Segundo: instalación en un clic significa ejecutar un script con permisos elevados descargado de internet, o sea, el consejo de siempre: léelo antes de correrlo. Y tercero: un modelo cuantizado nunca es idéntico al original; en tareas de código se nota más que en chat.
Aun así, la dirección es clara. Cada año la frontera de «se puede correr en la pieza» sube un piso. Los mismos que hace poco descartaban lo local como juguete ahora tienen el modelo grande corriendo en el escritorio de al lado. Cuando ese punto de equilibrio siga bajando, la pregunta ya no será si tu servidor casero sirve para esto, sino cuánta nube necesitas de verdad.
Fuente del tema: Strata: Qwen3.8-Flash-Next on any consumer hardware, repo open source en GitHub (vía Hacker News).
Fuente de inspiración: Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s
