
AMD acaba de comprar el futuro de la inferencia
Hoy AMD anunció la adquisición de Taalas, una startup de Toronto que hace algo que suena a ciencia ficción: graba los pesos de un modelo de IA directamente en el silicio del chip. No es un acelerador que corre el modelo. El modelo es el chip.
Esto cambia varias reglas del juego de una sola vez.
Adiós a la VRAM como cuello de botella
Cuando corres un LLM en una GPU tradicional, los pesos del modelo viajan de la VRAM a las unidades de cómputo en cada inferencia. Ese tránsito consume ancho de banda, energÃa y tiempo. Lo que hace Taalas es distinto: los pesos están fÃsicamente cableados en los transistores. No hay movimiento de datos entre memoria y cómputo porque la memoria es el cómputo.
El resultado: inferencia a velocidades que ninguna GPU puede tocar, con un consumo de energÃa ridÃculamente bajo. Estamos hablando de órdenes de magnitud de diferencia, no de porcentajes.
¿Y si el modelo cambia?
Esa es la pregunta obvia. Un chip Taalas está casado con un modelo especÃfico. Si sale GPT-6 o Claude 6, tu chip no sirve. Pero AMD no es tonta: la jugada acá no es venderte un chip por modelo, sino integrar esta tecnologÃa en sus FPGAs y ASICs para datacenters. Imagina un chip que puede «reprogramar» sus pesos en minutos en vez de fabricarse desde cero.
La patente y el equipo de Taalas valen más que cualquier chip individual que hayan fabricado.
El timing no es casualidad
Esto llega justo cuando:
- OpenAI anunció su primer chip custom fabricado por Broadcom
- Anthropic está en conversaciones con Samsung para lo mismo
- Nvidia domina el 80%+ del mercado de inferencia con las H100/H200/B200
AMD necesita un diferenciador real, no solo «somos más baratos que Nvidia». Taalas es ese diferenciador. Si logran integrar inferencia etched-in-silicon en sus próximos Instinct MI400 o MI500, le sacan varios cuerpos de ventaja a cualquiera que dependa de HBM y VRAM.
Lo que me preocupa
Soy ingeniero de sistemas, no inversor de Wall Street. Lo que me interesa es qué significa esto para los que corremos modelos en nuestras propias máquinas.
Si esta tecnologÃa se queda solo en datacenters enterprise, es otra ficha más en el monopolio del cloud. Pero si AMD logra meterla en hardware de consumo —un Ryzen con un motor de inferencia etched-in-silicon para modelos pequeños tipo Phi o Gemma— ahà se arma la fiesta. Imagina correr un modelo de 7B parámetros a 200 tokens por segundo en tu laptop, sin GPU dedicada, consumiendo 5 watts.
Eso es lo que Taalas promete en papel. Falta ver si AMD lo ejecuta bien o lo entierra en burocracia corporativa como tantas otras adquisiciones.
El dato que nadie está mirando
Taalas es de Toronto, no de Silicon Valley. El ecosistema canadiense de hardware de IA está callado pero sólido: Tenstorrent (Kingston), Untether AI (Toronto), y ahora Taalas. AMD no compró humo, compró un equipo que viene del Vector Institute y de la Universidad de Toronto —la misma gente que nos dio a Geoffrey Hinton y la retropropagación.
El monto de la adquisición no se reveló, pero considerando que Taalas tenÃa menos de 3 años y ya tenÃa prototipos funcionales, apuesto a que no fue barato.
En fin: AMD movió ficha. Ahora la pelota está del lado de Nvidia, Intel y las startups chinas que también están explorando compute-in-memory. El 2027 va a ser interesante.
Fuente de inspiración: AMD acquires Taalas to boost inference performance by etching models in silicon