
La GPU ya no es el cuello de botella
\n\n
Hoy Cerebras y OpenAI anunciaron GPT-5.6 Sol Ultrafast: una nueva modalidad de la API de OpenAI que promete hasta 750 tokens de salida por segundo sin tocar la calidad del modelo. La gracia es que no corre en las GPUs tradicionales, sino en los chips wafer-scale de Cerebras. Eso es lo que cambia la conversación.
\n\n
Si eres de los que usan agentes de IA para tareas que toman horas, estos números te importan. En el benchmark Humanity’s Last Exam — 2.500 preguntas de nivel doctoral en quÃmica, economÃa y literatura — Ultrafast respondió todo en 11 horas y 11 minutos. Claude Fable 5 necesitó 78 horas y 27 minutos. Es casi 7 veces más rápido con la misma precisión. No es una mejora marginal: es un cambio de categorÃa.
\n\n
Y no es solo ese test. Según los datos que publicaron, Sol Ultrafast es 11 veces más rápido que Fable 5 y 5 veces más rápido que Opus 4.8 en modo Fast. En GDP-Val, que mide trabajo de conocimiento con valor económico real, entregó una aceleración de 5,6x sin degradar resultados. Eso significa que tareas como informes legales, modelos financieros o análisis de incidentes en producción pueden pasar de «espera toda la tarde» a «téngalo ahora».
\n\n
¿Cómo lo hacen?
\n\n
La clave está en el Cerebras Wafer-Scale Engine. En las GPUs, el problema de inferencia en modelos grandes es el ancho de banda de memoria: los pesos se mueven una y otra vez entre la memoria del chip y el almacenamiento externo. Cerebras hace lo contrario: mete 44 GB de SRAM en un chip del tamaño de una oblea, los pesos se quedan ahà y los tokens fluyen por las capas sin interrupciones. El modelo no viaja, los datos sÃ.
\n\n
Ese enfoque escala con el tamaño del modelo, asà que no es un truco de benchmark. Es arquitectura. Y eso me hace pensar que estamos viendo el primer caso serio en que el hardware especializado para IA deja de ser un experimento de laboratorio y empieza a mover el mercado desde la API de OpenAI.
\n\n
¿Y para la pega?
\n\n
En mi caso, que ando entre infraestructura y ciberseguridad, lo primero que se me viene a la cabeza es la respuesta a incidentes: detectar un ataque, contenerlo y entender qué pasó antes de que el daño se propague. Si un agente puede hacer eso en segundos en vez de minutos, la diferencia no es productividad: es si te roban o no.
\n\n
También me gusta que no sea solo velocidad. Muchas veces te venden «más rápido» y en la letra chica pierde calidad. Acá el punto es que no hay compromiso: mismo modelo, misma precisión, menos tiempo. Eso es lo que de verdad cambia el juego.
\n\n
Ahora, la contra: está en preview limitado y el acceso se expande «a medida que crece la capacidad». O sea, por ahora es un club selecto. Pero si esto se normaliza, las GPUs como las conocemos van a tener que justificar su precio de otra manera.
Fuente de inspiración: Accelerating GPT-5.6 Sol Ultrafast with OpenAI
