
Hace un par de anos, si querias correr un modelo grande en tu computador, tenias dos opciones: comprarte una NVIDIA con 24 GB de VRAM o resignarte a usar la API de OpenAI. No habia tercera. Hoy, un proyecto open-source llamado TurboFieldfare acaba de demostrar que la tercera opcion existe, y que no necesita Python ni frameworks conocidos para funcionar.
Que hace esto de especial?
Lo primero que llama la atencion es el numero: Gemma 4 de 26 billones de parametros corriendo en aproximadamente 2 GB de RAM. Eso significa que una MacBook Air de 8 GB —la que venden en el retail de Paris por mil lucas— puede ejecutar un modelo de lenguaje que, en teoria, deberia necesitar una tarjeta grafica de gama alta.
Pero lo que de verdad me interesa es como lo lograron. TurboFieldfare no es un wrapper alrededor de MLX ni de llama.cpp. Es un runtime escrito desde cero en Swift y Metal, el framework de graficos de Apple. El autor tomo el modelo, lo cuantizo a 4 bits con grupos de 64, dejo en memoria solo los 1.35 GB del nucleo compartido y el cache KV, y luego lee los expertos necesarios directamente desde el SSD para cada token que genera.
Eso es streaming de pesos en tiempo real. No es elegante, es practico. Y funciona.
Los numeros que importan
En una MacBook Air M2 con 8 GB de RAM, el modelo genera entre 5.1 y 6.3 tokens por segundo. No vas a romper records de velocidad, pero es perfectamente usable para escribir codigo, responder mails tecnicos o revisar logs. Si subes a un M5 Pro con 24 GB, la cifra salta a 31-35 tok/s, que ya es territorio de herramienta de productividad seria.
El modelo completo ocupa unos 14.3 GB en disco. La primera vez que lo corres, el instalador descarga los pesos desde Hugging Face y los repacka directamente al formato .gturbo sin materializar el checkpoint completo. Es decir, no necesitas 30 GB libres para instalarlo; con 15 GB te bastan.
Por que no uso MLX?
Aqui entra mi opinion personal: porque MLX es genial, pero es generico. TurboFieldfare es especifico para un modelo (Gemma 4 26B-A4B) y para un hardware (Apple Silicon). Esa especializacion le permite hacer optimizaciones que un framework general simplemente no puede hacer sin romper compatibilidad con otros modelos.
El proyecto incluye una app nativa para Mac, una CLI, y un servidor compatible con la API de OpenAI que corre en localhost. Es decir, podes conectar tu editor de codigo favorito a http://localhost y usar Gemma 4 como si fuera Claude o GPT, pero sin que tus prompts salgan de tu maquina.
La leccion que se lleva
Lo que me gusta de este proyecto no es solo la tecnica. Es la demostracion de que la barrera de entrada para correr IA local sigue bajando, y que no siempre la respuesta esta en comprar mas hardware o suscribirse a otro servicio cloud. A veces la respuesta esta en sentarse a leer el paper del modelo, entender su arquitectura, y escribir el codigo que hace que tu hardware existente funcione.
En la pega de Komatsu vemos esto todo el rato: no es que el equipo viejo no sirva, es que nadie se tomo el tiempo de optimizarlo para la tarea especifica. TurboFieldfare es exactamente eso, pero para tu laptop.
Si tienes una Mac con chip M y te sobran 15 GB de disco, vale la pena probarlo. El repositorio esta en GitHub bajo licencia Apache 2.0. No necesitas cuenta de desarrollador ni pagar nada. Solo correr swift build -c release y dejar que la maquina haga su trabajo.
Fuente de inspiración: Show HN: Open-source engine running Gemma 4 26B in 2 GB RAM on any M-series Mac