NotizieAzioniAMD acquisirà Taalas per accelerare le capacità di inferenza AI

AMD acquisirà Taalas per accelerare le capacità di inferenza AI

Autore: Blockonomi·

Punti chiave

  • AMD ha concordato l'acquisizione di Taalas, una startup di chip per inferenza AI con sede a Toronto fondata nel 2023 che ha raccolto $219 milioni di finanziamenti totali.
  • I processori Taalas incorporano i pesi del modello direttamente nel silicio, riducendo la dipendenza dalla memoria a larghezza di banda elevata e raggiungendo circa 17.000 token al secondo sul modello Llama 3.1 da otto miliardi di parametri di Meta nei benchmark iniziali.
  • AMD intende integrare la tecnologia Taalas con le sue GPU Instinct, processori EPYC, sistemi rack-scale Helios e software ROCm per offrire configurazioni più specializzate per carichi di lavoro di inferenza ad alto volume.
  • L'acquisizione riflette una più ampia transizione del settore dei semiconduttori verso il computing ottimizzato per l'inferenza, in seguito all'acquisizione degli asset di Groq da $20 miliardi da parte di Nvidia a dicembre 2025.
  • AMD prevede che la transazione Taalas si concluda nel quarto trimestre del 2026, subordinatamente all'approvazione normativa.
AMD acquisirà Taalas per accelerare le capacità di inferenza AI

AMD ha concordato l'acquisizione di Taalas, una startup con sede a Toronto specializzata in processori model-specific per carichi di lavoro di inferenza AI, mentre il produttore di chip approfondisce la sua spinta nel computing specializzato per la crescente domanda di AI commerciale.

Il titolo AMD (AMD) ha chiuso in calo dell'1,21% a $483,36 alla chiusura di venerdì, per poi scendere ulteriormente dello 0,12% nelle contrattazioni after-hours a $482,80.

Tecnologia Taalas e piani di integrazione

AMD ha dichiarato che l'acquisizione porterà la tecnologia Taalas nel più ampio roadmap di acceleratori e sistemi. Taalas progetta processori che incorporano i pesi del modello direttamente nel silicio, riducendo la dipendenza dalla memoria a larghezza di banda elevata. La memoria a larghezza di banda elevata è stata uno dei componenti più soggetti a vincoli di approvvigionamento nella catena di supply degli acceleratori AI, e ridurne la dipendenza potrebbe abbassare i costi di produzione e alleviare i colli di bottiglia negli approvvigionamenti per implementazioni su larga scala. Questo approccio mira a migliorare velocità ed efficienza per modelli con architetture stabili e forte domanda di inferenza.

La startup ha testato il suo chip HC1 utilizzando il modello Llama 3.1 da otto miliardi di parametri di Meta, riportando un throughput di circa 17.000 token al secondo nei primi risultati benchmark rilasciati a febbraio. Tuttavia, l'architettura sacrifica la flessibilità in favore delle prestazioni, poiché ogni processore è tarato su un modello specifico anziché supportare carichi di lavoro diversificati. Ciò significa che i clienti dovrebbero impegnarsi su una particolare architettura di modello per beneficiare dei guadagni di prestazioni, scommettendo sul fatto che i design dei modelli rimangano sufficientemente stabili nel corso di un ciclo di deployment hardware.

AMD intende combinare la tecnologia Taalas con GPU Instinct, processori EPYC, sistemi Helios e software ROCm. Questo potrebbe consentire di gestire l'elaborazione dei prompt e la generazione dei token con tipi diversi di processori, permettendo ad AMD di offrire ai clienti configurazioni più specializzate per carichi di lavoro di inferenza ad alto volume.

Strategia rack-scale Helios

L'acquisizione rafforza il più ampio sforzo di AMD per fornire sistemi AI rack-scale completi ai principali clienti cloud. AMD ha recentemente iniziato a spedire sistemi Helios progettati per competere direttamente con le piattaforme server integrate di Nvidia. Meta e Microsoft si sono già impegnate in deployment utilizzando l'infrastruttura rack-scale di AMD.

Taalas potrebbe introdurre un livello di inferenza dedicato all'interno delle future configurazioni Helios, in cui le GPU gestiscono attività di calcolo flessibili mentre gli acceleratori model-specific elaborano carichi di lavoro ripetitivi di generazione di token. Una tale configurazione potrebbe migliorare l'efficienza del sistema per clienti che eseguono modelli di grandi dimensioni a volumi elevati e prevedibili.

AMD ha ampliato il proprio portafoglio AI attraverso molteplici acquisizioni negli ultimi due anni, tra cui Silo AI per $665 milioni e ZT Systems per $4,9 miliardi. L'azienda ha inoltre acquisito società software più piccole, come lo specialista di inferenza MK1, per rafforzare le capacità della propria piattaforma. L'accumulo di asset hardware, integrazione di sistemi e software riflette lo sforzo di AMD di colmare il divario con lo stack verticalmente integrato di Nvidia, che combina GPU con il suo ecosistema software CUDA che ha dominato i flussi di lavoro di sviluppo AI.

Più ampia transizione del settore verso l'inferenza

L'operazione Taalas arriva in un momento di più ampia riallocazione di risorse del settore verso l'inferenza AI piuttosto che verso la sola formazione dei modelli. Poiché sempre più aziende passano dall' sviluppo di modelli AI a servizi in produzione destinati agli utenti finali, il calcolo di inferenza sta diventando una quota maggiore della spesa totale per infrastrutture AI. I servizi AI commerciali richiedono sempre più tempi di risposta più rapidi, minori costi operativi e throughput più elevato su basi utente in espansione. I processori specializzati possono soddisfare questi requisiti quando i clienti eseguono gli stessi modelli ripetutamente su larga scala.

Nvidia ha fatto una mossa comparabile a dicembre 2025, acquisendo gli asset di Groq per $20 miliardi, una transazione che ha sottolineato la crescente importanza strategica della tecnologia di inferenza ad alta velocità in tutto il settore dei semiconduttori. L'acquisizione di Taalas da parte di AMD segue la stessa tendenza, ma introduce un'architettura model-specific diversa.

Taalas ha raccolto $219 milioni dalla sua fondazione nel 2023 e continua a sviluppare il suo processore HC2 di seconda generazione, progettato per supportare modelli con un massimo di 20 miliardi di parametri.

AMD prevede che la transazione si concluda durante il quarto trimestre del 2026, subordinatamente all'approvazione normativa.