Cerebras umgeht KI-Chip-Engpässe mit 5nm-Wafer-Scale-Design
Wichtige Erkenntnisse
- •Cerebras' Wafer-Scale-Chip WSE-3 vermeidet HBM, CoWoS-Verpackung und 3nm-Fertigung durch TSMCs 5nm-Prozess mit vollständig on-chip SRAM-Speicher und umgeht damit drei große Halbleiter-Engpässe.
- •Das Unternehmen wies Stand Juni 2026 ein Auftragsbuch von 25,4 Mrd. US-Dollar aus, davon mehr als 20 Mrd. US-Dollar aus einer mehrjährigen Vereinbarung mit OpenAI.
- •Cerebras verfügt über mehr als 600 MW Rechenzentrumskapazität in Betrieb oder vertraglich gesichert, und der Q2-Umsatz hat sich fast verdoppelt.
- •Im September 2026 vereinbarte Cerebras die Lieferung von CS-4-Systemen für rund 100 MW an Gimlet Labs, zusätzlich ist eine langfristige General-Compute-Bereitstellung für das erste Quartal 2027 geplant.
- •CEO Andrew Feldman behauptet, die Architektur liefere die schnellste Inferenz der Welt um eine Größenordnung; das 44-GB-SRAM-Limit und die Skalierung für die größten Modelle dürften jedoch von realen Workloads kritisch geprüft werden.

Das Rennen um KI-Hardware wurde bisher weitgehend um knappe Bauteile geführt, und Cerebras Systems versucht, es zu gewinnen, indem es die meisten davon gar nicht braucht. Die Wafer-Scale-Chips des Unternehmens verzichten auf High-Bandwidth-Memory (HBM), fortschrittliche CoWoS-Verpackung und 3nm-Fertigung – drei der derzeit engsten Engpässe der Halbleiterindustrie. Das sind genau die Zutaten, von denen die meisten konkurrierenden KI-Beschleuniger-Designs abhängen, und der Grund, warum Warteschlangen dafür bestimmen, wer wann Spitzenhardware bauen kann.
Ein Chip, der rund um das gebaut ist, was er weglässt
Cerebras nahm einen anderen Weg als der Großteil der Branche. Sein WSE-3 und der daraus abgeleitete WSE-3T basieren auf TSMCs 5nm-Prozessknoten, und der gesamte Speicher liegt als SRAM direkt auf dem Chip statt in separaten HBM-Modulen. Während ein konventioneller Beschleuniger ein kleines Die ist, das aus einem Teil eines Silizium-Wafers geschnitten wird, nutzt der Wafer-Scale-Ansatz nahezu den gesamten Wafer als einzelnen Chip – daher der Name des Designs.
Der WSE-3 wurde im März 2024 angekündigt, und seine Spezifikationen lesen sich eher wie ein Stadtplan als ein Datenblatt: 900.000 KI-Kerne, 44 GB On-Chip-SRAM und rund 4 Billionen Transistoren, alles auf einer Fläche von 46.225 mm².
CEO Andrew Feldman hat argumentiert, dass sich das Design dort auszahlt, wo für Kunden am wichtigsten ist: bei der Geschwindigkeit, wenn KI-Modelle Antworten generieren. Im Juni 2026 beschrieb er die Architektur als die „schnellste Inferenz der Welt um eine Größenordnung".
Den Research-Erkenntnissen zufolge zielt Feldmans Behauptung darauf ab, die Token-Generierungsgeschwindigkeit zu steigern und gleichzeitig die typischen Verzögerungen von GPU-basierten Designs zu beseitigen.
Das Auftragsbuch hinter dem Plan
Stand Juni 2026 wies das Unternehmen ein Auftragsbuch von 25,4 Mrd. US-Dollar aus. Mehr als 20 Mrd. US-Dollar davon entfallen auf einen mehrjährigen Vertrag mit OpenAI.
Cerebras gibt zudem an, über 600 MW Rechenzentrumskapazität in Betrieb oder vertraglich gesichert zu haben, und der Q2-Umsatz hat sich laut Research-Erkenntnissen fast verdoppelt.
Im September 2026 vereinbarte Cerebras die Lieferung von CS-4-Systemen für rund 100 MW Kapazität an Gimlet Labs. Darüber hinaus schloss das Unternehmen eine langfristige Vereinbarung mit General Compute, deren Umsetzung für das erste Quartal 2027 geplant ist.
All dies folgt auf Cerebras' Nasdaq-Börsengang im Mai 2026. Seit der Notierung hat das Unternehmen begonnen, die US-Fertigung auszubauen und Partnerschaften zur Steigerung der betrieblichen Kapazität aufzubauen.
Warum das Überspringen der Warteschlange zählt
Die Research-Erkenntnisse weisen darauf hin, dass die Nachfrage nach KI-Infrastruktur zunehmend von Rechenzentrumsfläche, Energie und Baukapazität abhängt – nicht nur davon, ob Chips verfügbar sind. Das erklärt, warum Cerebras inzwischen über Kapazität in Megawatt statt in Chipzahlen spricht: Die 600-MW-Zahl und die rund 100-MW-Zusage an Gimlet Labs sind Maße für Leistung und Grundfläche. Indem das Unternehmen HBM, CoWoS und 3nm-Kontingente umgeht, tauscht es die Abhängigkeit von Lieferketten der Chipindustrie gegen die branchenweiten Beschränkungen aus, die die Erkenntnisse benennen – Leistung, Grundfläche und Baukapazität.
Worauf zu achten ist
Für Cerebras-Investoren ist die Kernfrage die Umsetzung. Ein Auftragsbuch von 25,4 Mrd. US-Dollar ist ein Versprechen, kein Umsatz, und dessen Verwandlung hängt davon ab, dass Rechenzentren planmäßig gebaut, mit Strom versorgt und in Betrieb genommen werden. Die Research-Erkenntnisse nennen die Hochlaufkosten der Rechenzentren als Herausforderung, an der das Unternehmen arbeitet. Der rund 100 MW umfassende Rollout bei Gimlet Labs und die für das erste Quartal 2027 geplante General-Compute-Bereitstellung bieten kurzfristige Prüfsteine für diese Frage.
Ein zweiter Faktor ist die Kundenkonzentration. Da mehr als 20 Mrd. US-Dollar des Auftragsbuchs an OpenAI gebunden, kommt dieser einen Geschäftsbeziehung überproportionales Gewicht zu. Geschäfte wie die Vereinbarungen mit Gimlet Labs und General Compute tragen zur Diversifikation bei, sind im Vergleich dazu aber deutlich kleiner.
In puncto Leistung wird Feldmans Behauptung einer um eine Größenordnung schnelleren Inferenz von Kunden mit realen Workloads kritisch geprüft werden. On-Chip-SRAM ist extrem schnell, aber 44 GB pro Chip sind ein festes Budget, und wie die Systeme für die größten Modelle skalieren, wird darüber entscheiden, wie breit das Design zum Einsatz kommt.