Cerebras contourne les goulots d'étranglement de l'approvisionnement en puces IA avec une conception wafer-scale en 5nm
Points clés
- •La puce wafer-scale WSE-3 de Cerebras évite le HBM, le packaging CoWoS et la fabrication en 3nm en utilisant le procédé 5nm de TSMC avec toute la mémoire sur puce en SRAM, contournant ainsi trois goulots d'étranglement majeurs de l'approvisionnement en semi-conducteurs.
- •La société a déclaré un carnet de commandes de 25,4 milliards de dollars à juin 2026, dont plus de 20 milliards liés à un accord pluriannuel avec OpenAI.
- •Cerebras dispose de plus de 600 MW de capacité de centres de données en service ou sous contrat, et son chiffre d'affaires du T2 a presque doublé sur un an.
- •En septembre 2026, Cerebras a convenu de fournir des systèmes CS-4 pour environ 100 MW à Gimlet Labs, avec un déploiement à long terme distinct chez General Compute prévu au premier trimestre 2027.
- •Le PDG Andrew Feldman affirme que l'architecture délivre l'inférence la plus rapide au monde avec un ordre de grandeur d'avance, bien que la limite de 44 Go de SRAM sur puce et le passage à l'échelle pour les plus grands modèles devraient scrutés dans des charges de travail réelles.

La course aux matériels IA s'est largement jouée sur les composants rares, et Cerebras Systems tente de la gagner en en nécessitant moins. Les puces wafer-scale de la société se passent de mémoire à large bande passante (HBM), de packaging CoWoS avancé et de fabrication en 3nm — trois des goulots d'étranglement les plus tendus de l'industrie des semi-conducteurs actuellement. Ce sont les intrants dont dépendent la plupart des conceptions concurrentes d'accélérateurs IA, et la raison pour laquelle les files d'attente déterminent qui peut construire du matériel de pointe, et quand.
Une puce conçue autour de ce qu'elle élimine
Cerebras a emprunté une voie différente de celle de la majeure partie de l'industrie. Son WSE-3 et son dérivé WSE-3T sont fabriqués sur le nœud 5nm de TSMC, et toute leur mémoire réside sur la puce elle-même en SRAM plutôt que dans des piles HBM séparées. Là où un accélérateur classique est une petite puce découpée dans une partie d'une pastille de silicium, l'approche wafer-scale utilise presque toute la pastille comme une seule puce — d'où le nom de la conception.
Le WSE-3 a été annoncé en mars 2024, et ses spécifications tiennent davantage d'un plan d'urbanisme que d'une fiche technique : 900 000 cœurs IA, 44 Go de SRAM sur puce et environ 4 000 milliards de transistors, le tout dans une superficie de 46 225 mm².
Le directeur général Andrew Feldman a soutenu que cette conception porte ses fruits là où cela compte le plus pour les clients : la vitesse à laquelle les modèles IA génèrent des réponses. S'exprimant en juin 2026, il a décrit cette architecture comme délivrant « l'inférence la plus rapide au monde, avec un ordre de grandeur d'avance ».
Selon les conclusions de la recherche, l'affirmation de Feldman porte principalement sur l'accélération de la vitesse de génération de tokens tout en supprimant les ralentissements typiques des conceptions à base de GPU.
Le carnet de commandes derrière le pari
À juin 202, la société a déclaré un carnet de commandes de 25,4 milliards de dollars. Plus de 20 milliards de ce total proviennent d'un accord pluriannuel avec OpenAI.
Cerebras indique également disposer de plus de 600 MW de capacité de centres de données, en service ou sous contrat, et son chiffre d'affaires du T2 a presque doublé sur un an, selon les conclusions de la recherche.
En septembre 2026, Cerebras a convenu de fournir des systèmes CS-4 pour une capacité d'environ 100 MW à Gimlet Labs. La société a également conclu un accord à long terme avec General Compute, avec un déploiement prévu au premier trimestre 2027.
Tout cela fait suite à l'introduction en bourse de Cerebras au Nasdaq en mai 2026. Depuis sa cotation, la société a commencé à étendre sa fabrication aux États-Unis et à nouer des partenariats pour accroître sa capacité opérationnelle.
Pourquoi passer devant la file d'attente compte
Les conclusions de la recherche soulignent que la demande d'infrastructure IA dépend de plus en plus de l'espace, de l'énergie et de la construction des centres de données, et pas seulement de la disponibilité des puces. Cela explique pourquoi Cerebras parle désormais de capacité en mégawatts plutôt qu'en nombre de puces : le chiffre de 600 MW et l'engagement d'environ 100 MW auprès de Gimlet Labs mesurent l'énergie et la surface au sol. En contournant le HBM, le CoWoS et l'allocation de capacité 3nm, la société troque sa dépendance aux chaînes d'approvisionnement de l'industrie des puces contre les contraintes à l'échelle du secteur identifiées par les conclusions — énergie, surface au sol et capacité de construction.
Ce qu'il faut surveiller
Pour les investisseurs de Cerebras, la question centrale est l'exécution. Un carnet de commandes de 25,4 milliards de dollars est une promesse, pas un chiffre d'affaires, et sa conversion dépend de la construction des centres de données, de leur alimentation et de leur mise en service dans les délais. Les conclusions de la recherche pointent les coûts de montée en puissance des centres de données comme un défi que la société s'efforce de surmonter. Le déploiement d'environ 100 MW chez Gimlet Labs et le déploiement chez General Compute prévu au premier trimestre 2027 constituent des jalons à court terme pour cette question d'exécution.
La concentration de la clientèle est le deuxième facteur à suivre. Avec plus de 20 milliards de dollars du carnet de commandes liés à OpenAI, la santé de cette relation unique pèse de manière disproportionnée. Des accords comme ceux conclus avec Gimlet Labs et General Compute aident à diversifier le portefeuille, bien qu'ils soient beaucoup plus modestes en comparaison.
Sur le plan des performances, l'affirmation de Feldman d'une inférence supérieure d'un ordre de grandeur sera soumise à l'examen des clients exécutant des charges de travail réelles. La SRAM sur puce est extrêmement rapide, mais 44 Go par puce constituent un budget fixe, et la manière dont les systèmes passent à l'échelle pour les plus grands modèles déterminera l'ampleur de l'adoption de cette conception.