stamatios
← Voltar ao feed
AMD compra startup Taalas para acelerar inferência em silício
Hardware & Chips · Startups & Deals

AMD compra startup Taalas para acelerar inferência em silício

resumo de ~3 min

AMD adquire Taalas para gravar modelos de IA diretamente em silício

A AMD anunciou a aquisição da startup canadense Taalas, fundada em 2023 em Toronto, cuja tecnologia grava os pesos de modelos de IA diretamente no silício - criando circuitos integrados específicos por modelo (MSICs). Os termos financeiros não foram divulgados, mas trata-se de uma aquisição completa, não apenas um acquihire.

Como funciona a tecnologia

Diferentemente de GPUs convencionais ou arquiteturas de dataflow (como as da Groq e Cerebras), os chips da Taalas não dependem de memória HBM para armazenar pesos. Em vez disso, os pesos são gravados fisicamente no silício por meio de uma "mask-ROM recall fabric". Uma segunda região de SRAM armazena KV caches e adaptadores de fine-tuning (como LoRA).

Resultados de desempenho

O primeiro chip de teste da Taalas, o HC1, fabricado no processo de 6nm da TSMC, alcançou 16.960 tokens por segundo ao servir o Llama 3.1 8B - 48 vezes mais rápido que GPUs Nvidia e 8,5 vezes mais rápido que aceleradores Cerebras na época do anúncio (fevereiro de 2025). O chip HC2, previsto para o verão de 2026, deve suportar até 20 bilhões de parâmetros por unidade. Com 50 aceleradores, seria possível servir um modelo de 1 trilhão de parâmetros.

Integração com a plataforma AMD

A AMD pretende combinar seus racks Helios baseados em Instinct (GPUs) com os aceleradores da Taalas em uma arquitetura disagregada: o processamento de prompt ficaria nas GPUs, enquanto a geração de tokens seria delegada aos MSICs. Também se especula um modelo "tick-tock" em que clientes validam modelos nos Instinct e depois migram para os aceleradores Taalas.

Limitações

A principal desvantagem é a rigidez: uma vez gravado o modelo no silício, trocar por outro exige um re-spin do chip. A Taalas afirma que o processo é mais simples do que parece - apenas duas camadas de metal precisam ser alteradas -, mas ainda assim representa custo e tempo adicionais. A empresa estima que gravar pesos em silício é 100 vezes mais barato do que treinar um modelo de fronteira.

Implicações para desenvolvimento de modelos

A tecnologia pode viabilizar test-time scaling mais agressivo (deixar o modelo "pensar" mais antes de responder), já que o custo por token e a latência cairiam drasticamente. Isso é relevante para clientes como OpenAI, Anthropic e Meta, que já usam aceleradores Instinct da AMD.

O negócio está sujeito a aprovação regulatória e deve ser concluído no quarto trimestre de 2026.