
Hoy Alibaba tiró la casa por la ventana con Qwen 3.8-Max: un modelo de 2,4 billones de parámetros (95 mil millones activos por forward pass) que, según sus propios benchmarks, supera a Kimi K3 en varias tareas clave. La bomba real no es el tamaño, sino que van a liberar los pesos la próxima semana. Por primera vez un modelo Max-class de la familia Qwen pasa a ser open source.
Los números que importan
2,4T de parámetros suena exagerado, y lo es. Pero lo relevante es que usan mixture-of-experts con 95B activos, lo que hace que el costo de inferencia sea manejable. Esto no es un monstruo que solo puede correr en clusters de Nvidia H100; es un modelo pensado para que providers lo sirvan sin quebrar la billetera.
El anuncio destaca tres pilares: coding, cowork (trabajo colaborativo) y research. En otras palabras, no es solo un chatbot que escribe emails bonitos. Alibaba lo está posicionando como una herramienta de productividad real.
16 días de coding autónomo, sin humanos
La demostración que más me llamó la atención es la de coding autónomo. Dejaron a Qwen 3.8-Max trabajando solo durante 16 días para construir el proyecto «oh-my-cli» desde cero. El resultado: 265 commits, 127 pull requests y 151 issues resueltos sin intervención humana. El modelo diseñó un loop de ingeniería con máquina de estados para issues, dispatcher, monitor y watchdog. Si fallaba un test, se auto-corrigía y abría un nuevo PR.
Esto no es marketing de PowerPoint. Hay un repositorio público donde puedes revisar la traza completa. Me gusta cuando las empresas ponen el código donde está la boca.
Reproducir papers de research sin ayuda
Otro experimento: le dieron un paper de investigación sobre selección de datos para razonamiento en LLMs y le pidieron que lo reprodujera y mejorara. En 5 días y ~125 horas de trabajo continuo, escribió 7.600 líneas de código, ejecutó 33 rondas de entrenamiento en GPU y reprodujo los seis hallazgos principales del paper. Luego intentó mejorarlos.
Como estudiante de ciberseguridad que pasa tardes enteras replicando papers para entenderlos, esto me pone la piel de gallina. No porque quede sin pega (todavía falta mucho para que un agente reemplace a un ingeniero que entiende el contexto), sino porque el nivel de autonomía ya no es anecdótico.
¿Por qué importa el open source?
He leído muchos debates sobre si los modelos open weight realmente compiten con los cerrados de OpenAI o Anthropic. Mi opinión: no es solo competencia, es supervivencia. Con modelos de 2,4T parámetros disponibles como open weights, cualquier empresa puede auto-hospedar inteligencia de clase frontier sin depender de APIs externas, sin preocuparse de que cierren tu cuenta por un «violation of use policy» interpretado por un bot, y sin que tus datos terminen entrenando el próximo modelo de una corporación estadounidense.
Para infraestructura crítica —bancos, salud, gobierno— esto es la diferencia entre «confío porque no me queda otra» y «audito y verifico lo que corre en mis servidores».
La pregunta que me queda
El artículo de Martin Alderson que también circula hoy dice algo interesante: «ya no elijo modelos por inteligencia pura, elijo por velocidad». Y tiene razón. Un modelo de 2,4T parámetros es inútil si tarda 30 segundos en responder. Alibaba dice que Qwen 3.8-Max está optimizado para throughput, pero hasta que no lo pruebe en la pega real —debuggeando código, analizando logs de firewall, escribiendo scripts de hardening— no me fío del benchmark.
La promesa de liberar los pesos la próxima semana es la verdadera prueba de fuego. Si cumplen, esto no es solo un anuncio más de Alibaba. Es un cambio de paradigma donde los modelos más grandes del mundo dejan de ser propiedad exclusiva de labs en San Francisco y Shenzhen.
¿Cachai? La semana que viene revisamos si los pesos realmente salen.
Fuente de inspiración: Qwen3.8-Max: A New Bar for Coding and Cowork