Cerebras aggira i colli di bottiglia nella supply chain dei chip AI con un design wafer-scale a 5nm
Punti chiave
- •Il chip wafer-scale WSE-3 di Cerebras evita HBM, il packaging CoWoS e la produzione a 3nm utilizzando il processo a 5nm di TSMC con tutta la memoria on-chip come SRAM, aggirando tre grandi colli di bottiglia nella fornitura di semiconduttori.
- •La società ha dichiarato un portafoglio ordini di 25,4 miliardi di dollari a giugno 2026, di cui oltre 20 miliardi legati a un accordo pluriennale con OpenAI.
- •Cerebras dispone di oltre 600 MW di capacità di data center attivi o contrattualizzati, e i ricavi del secondo trimestre sono quasi raddoppiati su base annua.
- • settembre 2026, Cerebras ha concordato di fornire sistemi CS-4 per circa 100 MW a Gimlet Labs, con un separato deploy a lungo termine con General Compute previsto per il primo trimestre del 2027.
- •L'amministratore delegato Andrew Feldman sostiene che l'architettura eroghi l'inferenza più veloce al mondo di un ordine di grandezza, sebbene il limite di 44 GB di SRAM on-chip e lo scaling per i modelli più grandi dovranno affrontare il vaglio dei carichi di lavoro reali.

La corsa all'hardware AI è stata in gran parte una battaglia per componenti scarsi, e Cerebras Systems sta cercando di vincerla avendone bisogno di meno. I chip wafer-scale dell'azienda prescindono dalla memoria ad alta larghezza di banda (HBM), dal packaging avanzato CoWoS e dalla produzione a 3nm—tre dei più stretti colli di bottiglia dell'industria dei semiconduttori in questo momento. Si tratta degli input da cui dipendono la maggior parte dei progetti concorrenti di acceleratori AI, e la ragione per cui le file d'attesa per ottenerli determinano chi può costruire hardware all'avanguardia, e quando.
Un chip costruito attorno a ciò che esclude
Cerebras ha preso una strada diversa dalla maggior parte del settore. Il suo WSE-3 e il derivato WSE-3T sono costruiti sul nodo produttivo a 5nm di TSMC, e tutta la memoria risiede sul chip stesso come SRAM anziché in stack HBM separati. Mentre un acceleratore convenzionale è un piccolo die ritagliato da una porzione di wafer di silicio, l'approccio wafer-scale utilizza quasi l'intero wafer come un singolo chip—da qui il nome del design.
Il WSE-3 è stato annunciato a marzo 2024, e le sue specifiche sembrano più un piano urbanistico che una scheda tecnica: 900.000 core AI, 44 GB di SRAM on-chip e circa 4 trilioni di transistor, il tutto dentro un'area di 46.225 mm².
L'amministratore delegato Andrew Feldman ha sostenuto che il design ripaga dove conta di più per i clienti: la velocità con cui i modelli AI generano risposte. Parlando a giugno 2026, ha descritto l'architettura come capace di erogare "l'inferenza più veloce al mondo di un ordine di grandezza."
Secondo quanto emerso dalle ricerche, l'affermazione di Feldman si concentra sull'accelerazione della velocità di generazione dei token, eliminando i rallentamenti tipici dei design basati su GPU.
Il portafoglio ordini dietro la scommessa
A giugno 2026, la società ha dichiarato un portafoglio ordini di ,4 miliardi di dollari. Oltre 20 miliardi di tale totale provengono da un accordo pluriennale con OpenAI.
Cerebras dichiara inoltre di avere oltre 600 MW di capacità di data center attivi o contrattualizzati, e i ricavi del secondo trimestre sono quasi raddoppiati su base annua, secondo quanto emerso dalle ricerche.
A settembre 2026, Cerebras ha concordato di fornire sistemi CS-4 per circa 100 MW di capacità a Gimlet Labs. La società ha anche stipulato un accordo a lungo termine con General Compute, con un deploy previsto per il primo trimestre del 2027.
Tutto ciò fa seguito al debutto al Nasdaq di Cerebras a maggio 2026. Dal quotazione, la società ha iniziato ad espandere la produzione negli Stati Uniti e a costruire partnership per aumentare la capacità operativa.
Perché evitare la fila conta
Le ricerche evidenziano che la domanda di infrastrutture AI dipende sempre più da spazio nei data center, energia e costruzioni, e non solo dalla disponibilità dei chip. Questo aiuta a spiegare perché Cerebras oggi parla di capacità in megawatt anziché in numero di chip: il dato di 600 MW e l'impegno di circa 100 MW verso Gimlet Labs sono misure di potenza e di superficie. Aggirando HBM, CoWoS e le allocazioni a 3nm, la società scambia la dipendenza dalle filiere di fornitura dell'industria dei chip con i vincoli su scala industriale individuati dalle ricerche—energia, superficie e capacità costruttiva.
Cosa monitorare
Per gli investitori di Cerebras, la domanda centrale è l'esecuzione. Un portafoglio ordini di 25,4 miliardi di dollari è una promessa, non un ricavo, e convertirlo dipende dal costruire, alimentare e mettere in funzione i data center nei tempi previsti. Le ricerche indicano nei costi di ramp-up dei data center una sfida che la società sta lavorando per superare. Il rollout di circa 100 MW verso Gimlet Labs e il deploy con General Compute previsto per il primo trimestre del 2027 offrono punti di controllo a breve termine su questa questione.
La concentrazione della clientela è il secondo fattore da seguire. Con oltre 20 miliardi di dollari del portafoglio ordini legati a OpenAI, la solidità di questo singolo rapporto ha un peso fuori misura. Accordi come quelli con Gimlet Labs e General Compute aiutano a diversificare il mix, pur essendo molto più piccoli in confronto.
Sul fronte delle prestazioni, l'affermazione di Feldman su un'inferenza di un ordine di grandezza superiore sarà sottoposta al vaglio dei clienti che eseguono carichi di lavoro reali. La SRAM on-chip è estremamente veloce, ma 44 GB per chip sono un budget fisso, e il modo in cui i sistemi scalano per i modelli più grandi determinerà l'adozione più o meno ampia del design.