AMD adquiere Taalas para añadir silicio específico para modelos a su pila de inferencia de IA
El fabricante de chips de Toronto recaudó 219 millones de dólares para integrar por hardware modelos de IA en silicio; AMD no dio a conocer el precio y planea combinar la tecnología con Instinct GPUs.
By Ryan Merket · Published
Primary source: X
Why it matters
AMD is buying the design flow and engineering team needed to make model-specific inference chips, giving it an owned specialized engine to pair with Instinct GPUs as inference splits into distinct prompt and token-generation workloads.

AMD acordó el jueves adquirir Taalas, la fabricante de chips de inferencia de IA con sede en Toronto cofundada por el ex CEO de Tenstorrent Ljubisa Bajic, dando a AMD el control de una arquitectura especializada diseñada para ejecutar modelos de IA individuales a alta velocidad y con menor consumo de energía que los aceleradores de propósito general.
AMD no divulgó el precio de compra ni una fecha esperada de cierre. La transacción sigue sujeta a la aprobación regulatoria y otras condiciones de cierre habituales, según el anuncio de AMD del 6 de agosto.
Lisa Su (@LisaSu) describió a Taalas (@taalas_inc) como un equipo que trabaja en la vanguardia de la inferencia de IA en una publicación en X. AMD dijo que Taalas se unirá a la organización de inteligencia artificial dirigida por Vamsi Boppana y que AMD tiene la intención de integrar la tecnología de Taalas en su hoja de ruta de aceleradores y en sistemas construidos alrededor de Instinct GPUs.
Bajic fundó Taalas en 2023 con Drago Ignjatovic y Lejla Bajic después de haber fundado anteriormente el desarrollador de chips de IA Tenstorrent. Los tres fundadores habían trabajado en AMD, Nvidia y Tenstorrent en CPUs, GPUs y procesadores de IA, según el anuncio de financiamiento de Taalas de 2024. La adquisición devuelve a Bajic a AMD con un equipo formado por ingenieros que ya conocen la organización de hardware de la compañía.
"Fundamos Taalas para replantear la inferencia de IA desde cero construyendo el hardware alrededor del modelo", dijo Bajic en el anuncio de AMD. Añadió que AMD le dará al equipo de Toronto mayores recursos de ingeniería y alcance global.
Un modelo implementado directamente en silicio
Taalas lleva la especialización más allá de los aceleradores de IA convencionales. Su diseño coloca los pesos de un modelo y el flujo de datos directamente en silicio, eliminando la mayor parte de la programabilidad para reducir el movimiento de datos entre la memoria y el hardware de cómputo.
La compensación es severa. Un chip de Taalas optimizado para un modelo no puede simplemente cargar otro modelo mediante software. Los nuevos modelos requieren nuevas máscaras de chip, lo que hace a Taalas dependiente de un proceso de diseño que pueda traducir un modelo a silicio con la suficiente rapidez para seguir el ritmo de los lanzamientos de IA.
Taalas afirma que su proceso automatizado puede convertir un modelo previamente no visto en silicio personalizado en aproximadamente dos meses. Esa afirmación sobre el tiempo de respuesta es central para el valor que AMD está comprando: sin ella, los chips específicos para un modelo corren el riesgo de quedar obsoletos antes de alcanzar la producción.
Taalas demostró públicamente el enfoque en febrero con HC1, un chip diseñado de forma fija para el modelo Llama 3.1 8B de Meta. Taalas informó que HC1 podía generar 17,000 tokens por segundo por usuario mientras usaba una décima parte de la energía de los sistemas competidores. Esos resultados fueron producidos o compilados por Taalas, en lugar de establecerse mediante una amplia serie de pruebas de producción independientes.
Taalas también reconoció que la agresiva mezcla de parámetros de 3 bits y 6 bits en HC1 provocó un deterioro de la calidad en comparación con los puntos de referencia en GPU. El rendimiento del chip venía acompañado de otra limitación básica: HC1 podía ejecutar Llama 3.1 8B y ningún otro modelo.
Esas limitaciones explican por qué AMD planea usar la tecnología junto con Instinct GPUs en lugar de presentarla como un reemplazo total de GPU. Las GPUs pueden manejar modelos cambiantes, cargas de trabajo grandes de procesamiento de prompts y cómputo de propósito general. El silicio de Taalas puede asignarse a las partes estables y repetitivas de la inferencia donde la especialización produce la mayor ganancia.
AMD construye en torno a la inferencia especializada
El acuerdo sigue a la asociación para inferencia del 23 de julio de AMD con Cerebras, que empareja los sistemas AMD Helios con procesadores a escala de oblea de Cerebras. Bajo ese diseño, el hardware de AMD procesa prompts y ventanas de contexto largas mientras que Cerebras acelera la generación de tokens, o la decodificación.
Taalas le da a AMD una arquitectura que posee para una división de trabajo similar. EE Times informó que el silicio de Taalas podría servir como acelerador de decodificación junto a las Instinct GPUs, permitiendo a AMD suministrar y controlar ambos motores de cómputo. Los chips de Taalas también podrían ejecutar cargas completas de inferencia para modelos más pequeños usados en sistemas edge con restricción de energía.
La adquisición se produce menos de seis meses después de que Taalas recaudara $169 millones, llevando su financiamiento total a $219 millones. Los inversionistas incluyeron a Quiet Capital, Fidelity y el inversionista en semiconductores Pierre Lamond, según informes de Reuters.
Taalas dijo en febrero que 24 empleados desarrollaron HC1 después de gastar $30 millones del capital que había recaudado. Por lo tanto, AMD está adquiriendo un grupo de ingeniería compacto, su flujo de herramientas de modelo a silicio y hardware funcional antes de que Taalas tuviera que demostrar que el enfoque podía sostener una amplia línea de productos comerciales.
Para Bajic, la venta cambia la tarea de financiar diseños de chips repetidos a encajar hardware específico de modelos dentro del portafolio Instinct, Helios y ROCm de AMD. AMD obtiene una vía técnica para sortear los cuellos de botella de memoria que limitan la generación de tokens. La prueba restante es si Taalas puede conservar su ventaja de velocidad mientras avanza más allá de un único modelo fuertemente cuantizado y hacia sistemas que los clientes puedan desplegar a escala.