Cerebras omzeilt supplyknelpunten bij AI-chips met 5nm wafer-scale design
Belangrijkste punten
- •De wafer-scale chip WSE-3 van Cerebras vermijdt HBM, CoWoS-verpakking en 3nm-productie door TSMC's 5nm-procedé te gebruiken met al het geheugen on-chip als SRAM, waarmee drie grote supplyknelpunten in de halfgeleiderindustrie worden omzeild.
- •Het bedrijf meldde per juni 2026 een orderportefeuille van $25,4 miljard, waarvan meer dan $20 miljard verbonden aan een meerjarige overeenkomst met OpenAI.
- •Cere heeft ruim 600 MW aan datacentercapaciteit live of gecontracteerd, en de Q2-omzet was bijna verdubbeld op jaarbasis.
- •In september 2026 kwam Cerebras overeen om CS-4-systemen te leveren voor ongeveer 100 MW aan Gimlet Labs, met een afzonderlijke langetermijn-implementatie bij General Compute gepland voor het eerste kwartaal van 2027.
- •CEO Andrew Feldman beweert dat de architectuur de snelste inferentie ter wereld levert, met een orde van grootte voorsprong, al wordt verwacht dat de limiet van 44 GB on-chip SRAM en de opschaling voor de grootste modellen onder kritisch onderzoek komen van realistische workloads.

De race om AI-hardware is grotendeels een strijd om schaarse onderdelen geweest, en Cerebras Systems probeert die te winnen door minder onderdelen nodig te hebben. De wafer-scale chips van het bedrijf doen zonder high-bandwidth memory (HBM), geavanceerde CoWoS-verpakking en 3nm-productie—momenteel drie van de grootste knelpunten in de halfgeleiderindustrie. Dat zijn de invoer waar de meeste concurrerende AI-acceleratorontwerpen van afhankelijk zijn, en de reden waarom wachtrijen bepalen wie geavanceerde hardware kan bouwen, en wanneer.
Een chip gebouwd rond wat het achterlaat
Cerebras koos een andere route dan het merendeel van de industrie. De WSE-3 en de afgeleide WSE-3T zijn gebouwd op TSMC's 5nm-procedé, en al het geheugen bevindt zich on-chip als SRAM in plaats van in aparte HBM-stacks. Waar een conventionele accelerator een klein die is, gesneden uit een deel van een siliconenwafer, gebruikt de wafer-scale aanpak vrijwel de hele wafer als één chip—de herkomst van de naam van het ontwerp.
De WSE-3 werd in maart 2024 aangekondigd, en de specificaties lezen meer als een stedenbouwkundig plan dan als een chipdatasheet: 900.000 AI-cores, 44 GB on-chip SRAM en ongeveer 4 biljoen transistoren, allemaal binnen een oppervlakte van 46.225 mm².
CEO Andrew Feldman heeft betoogd dat het ontwerp zich uitbetaalt waar het voor klanten het meest telt: snelheid wanneer AI-modellen antwoorden genereren. In juni 2026 omschreef hij de architectuur als levering van "the fastest inference in the world by an order of magnitude."
Volgens de onderzoeksbevindingen draait Feldmans bewering om het verhogen van de token-generatiesnelheid terwijl de vertragingen die kenmerkend zijn voor GPU-gebaseerde ontwerpen worden geëlimineerd.
De orderportefeuille achter de gok
Per juni 2026 meldde het bedrijf een orderportefeuille van $25,4 miljard. Meer dan $20 miljard daarvan komt uit een meerige deal met OpenAI.
Cerebras zegt ook ruim 600 MW aan datacentercapaciteit live of gecontracteerd te hebben, en de Q2-omzet bijna werd verdubbeld op jaarbasis, volgens de onderzoeksbevindingen.
In september 2026 kwam Cerebras overeen om CS-4-systemen te leveren voor ongeveer 100 MW aan capaciteit aan Gimlet Labs. Het bedrijf sloot ook een langetermijnovereenkomst met General Compute, met implementatie gepland voor het eerste kwartaal van 2027.
Dit alles volgt op de Nasdaq-beursgang van Cerebras in mei 2026. Sinds de notering is het bedrijf begonnen de Amerikaanse productie uit te breiden en partnerschappen op te bouwen om de operationele capaciteit te vergroten.
Waarom de wachtrij overslaan ertoe doet
De onderzoeksbevindingen merken op dat de vraag naar AI-infrastructuur steeds meer afhangt van datacenterruimte, stroom en bouw, en niet alleen van de beschikbaarheid van chips. Dat helpt verklaren waarom Cerebras nu over capaciteit in megawatts praat in plaats van over aantallen chips: het cijfer van 600 MW en de toezegging van ongeveer 100 MW aan Gimlet Labs zijn maten voor stroom en vloeroppervlak. Door HBM, CoWoS en 3nm-toewijzing te omzeilen, verwisselt het bedrijf de afhankelijkheid van toeleveringsketens van de chipindustrie voor de sectombrede beperkingen die de bevindingen identificeren—stroom, vloeroppervlak en bouwcapaciteit.
Waar je op moet letten
Voor Cerebras-investeerders is de kernvraag de uitvoering. Een orderportefeuille van $25,4 miljard is een belofte, geen omzet, en het omzetten ervan hangt af van datacenters die op schema worden gebouwd, van stroom voorzien en operationeel worden gemaakt. De onderzoeksbevindingen wijzen op de opschalingskosten van datacenters als een uitdaging waaraan het bedrijf werkt. De uitrol van ongeveer 100 MW bij Gimlet Labs en de General Compute-implementatie, gericht op het eerste kwartaal van 2027, geven die uitvoeringsvraag kortetermijn-ijkpunten.
Klantconcentratie is de tweede factor om in de gaten te houden. Nu meer dan $20 miljard van de orderportefeuille aan OpenAI verbonden is, weegt de gezondheid van die ene relatie onevenredig zwaar. Deals zoals de overeenkomsten met Gimlet Labs en General Compute helpen de mix te diversifiëren, al zijn ze in vergelijking veel kleiner.
Wat de prestaties betreft, zal Feldmans bewering van inferentie die een orde van grootte sneller is, worden onderworpen aan kritisch onderzoek door klanten die realistische workloads draaien. On-chip SRAM is extreem snel, maar 44 GB per chip is een vast budget, en hoe systemen opschalen voor de grootste modellen zal bepalen hoe breed het ontwerp wordt toegepast.