
La pregunta de siempre cuando corres modelos locales: ¿cuánto puedo comprimir el modelo antes de que se vuelva tonto? Alguien en Quesma gastó como 3.000 dólares de GPU rentada para responderla con datos, no con vibes, usando Qwen3.8 27B y las cuantizaciones GGUF de Unsloth. Los resultados son más alentadores de lo que Reddit hace creer, pero con un acantilado feo al final.
Los números que importan
El modelo completo en BF16 pesa 55 GB, o sea, fuera del alcance de casi cualquier PC de casa. La sorpresa es que el Q4_K_M de 17 GB empató con el modelo completo en Terminal-Bench 2.1, el benchmark de código agéntico, y quedó prácticamente idéntico también en GPQA Diamond y IFBench. Eso significa que cabe en una RTX 4090 de 24 GB y todavía te queda espacio para unos 64k tokens de contexto. Nada mal para un modelo de 27 mil millones de parámetros.
Más sorprendente todavía: la cuantización de 2 bits (UD-Q2_K_XL, unos 11 GB) no cayó en los benchmarks de un solo tiro, y en código bajó un poco pero se mantuvo en el rango de modelos como Opus 4.7 o Gemini 3.1 Pro. Lejos de la frontera, sí, pero lejos de ser inútil. Eso sí, en las mismas tareas resueltas escribe un 25% más de tokens que el modelo completo, así que algo se paga.
El acantilado del 1 bit
Acá viene la wea seria. El modelo de 1 bit (6,2 GB) rinde al nivel del azar puro en GPQA Diamond. Y no solo eso: mientras más lo haces pensar (el esfuerzo de razonamiento por defecto es xhigh), peor responde, porque razona hasta agotar el presupuesto de tokens y devuelve respuestas vacías. Unsloth presume que su cuant de 1 bit retiene un 72% de precisión top-1, pero ese 28% perdido es justo lo que separa un modelo que sirve de uno que no.
La lección técnica acá es que el daño por cuantización es no lineal: primero nada medible, luego una caída chica, y después colapso total. No hay zona gris donde «va decayendo gradualmente». O estás bien en 4 bits o estás muerto en 1.
Mi opinión
Yo llevo un tiempo corriendo modelos locales y siempre desconfié de los threads de Reddit que juran que «todo lo cuantizado se siente más tonto». Este benchmark confirma mi sospecha: esa percepción viene de gente saltando directo a cuants agresivos de 1-2 bits para meter modelos en GPUs chicas, y luego echándole la culpa al modelo. Si usas un Q4_K_M decente, la diferencia es básicamente ruido.
El otro takeaway que me parece valioso: el nivel de razonamiento (effort) importa más que la cuantización dentro del rango sano. El autor encontró diferencias enormes entre low y xhigh, gastando ~8k tokens de razonamiento en el caso bueno. Ojo también con que xhigh puede caer en overthinking, así que no es gratis.
¿Qué hacer con esto?
Si andas armando un setup local: elige el mejor modelo que quepa en tu GPU junto con el contexto que necesitas, y parte por Q4_K_M. No te desveles intentando exprimir 6 GB más con cuants exóticos, porque el acantilado te espera. Y si ves a alguien presumiendo que corre un modelo 27B «en 6 GB», ya sabes qué preguntarle: ¿y en el benchmark cómo le fue? Spoiler: como moneda al aire.
Los costos también son dato: correr el benchmark completo en GPUs rentadas (L40S, H100, H200) salió alrededor de 3.000 dólares. Medir cosas bien es caro, y por eso la gente que lo hace de verdad merece el clic.
Fuente de inspiración: Benchmarking Qwen3.8 27B quantizations: 4-bit holds up, 1-bit collapses
