Cerebras sortea los cuellos de botella de suministro de chips de IA con un diseño wafer-scale de 5nm
Puntos clave
- •El chip wafer-scale WSE-3 de Cerebras evita la memoria HBM, el empaque CoWoS y la fabricación de 3nm al usar el proceso de 5nm de TSMC con toda la memoria en el chip como SRAM, esquivando tres grandes cuellos deella de suministro de semiconductores.
- •La compañía reportó una cartera de pedidos de 25.400 millones de dólares a junio de 2026, con más de 20.000 millones vinculados a un acuerdo plurianual con OpenAI.
- •Cerebras cuenta con más de 600 MW de capacidad de centros de datos en operación o contratados, y sus ingresos del segundo trimestre casi se duplicaron interanualmente.
- •En septiembre de 2026, Cerebras acordó suministrar sistemas CS-4 para aproximadamente 100 MW a Gimlet Labs, con un despliegue a largo plazo separado con General Compute previsto para el primer trimestre de 2027.
- •El CEO Andrew Feldman afirma que la arquitectura ofrece la inferencia más rápida del mundo por un orden de magnitud, aunque el límite de 44 GB de SRAM en el chip y el escalado para los modelos más grandes enfrentarán el escrutinio de cargas de trabajo reales.

La carrera del hardware de IA se ha librado, en gran medida, por componentes escasos, y Cerebras Systems intenta ganarla necesitando menos de ellos. Los chips wafer-scale de la compañía prescinden de la memoria de alto ancho de banda (HBM), del empaque avanzado CoWoS y de la fabricación de 3nm—tres de los cuellos de botella más apretados de la industria de semiconductores en la actualidad. Estos son los insumos de los que dependen la mayoría de los diseños rivales de aceleradores de IA, y la razón por la que las filas de espera definen quién puede construir hardware de vanguardia, y cuándo.
Un chip construido en torno a lo que omite
Cerebras tomó un camino distinto al de la mayoría de la industria. Su WSE-3 y el derivado WSE-3T se fabrican en el nodo de proceso de 5nm de TSMC, y toda su memoria reside en el propio chip como SRAM, en lugar de en pilas separadas de HBM. Mientras un acelerador convencional es un pequeño dado recortado de una parte de una oblea de silicio, el enfoque wafer-scale usa casi toda la oblea como un solo chip—de ahí el nombre del diseño.
El WSE-3 fue anunciado en marzo de 2024, y sus especificaciones se leen más como un plano urbano que como una ficha de chip: 900.000 núcleos de IA, 44 GB de SRAM en el chip y aproximadamente 4 billones de transistores, todo dentro de un área de 46.225 mm².
El director ejecutivo Andrew Feldman ha argumentado que el diseño rinde donde más le importa a los clientes: la velocidad cuando los modelos de IA generan respuestas. Al hablar en junio de 2026, describió la arquitectura como la que entrega "la inferencia más rápida del mundo por un orden de magnitud".
Según los hallazgos de investigación, la afirmación de Feldman se centra en aumentar la velocidad generación de tokens y eliminar las ralentizaciones típicas de los diseños basados en GPU.
La cartera de pedidos detrás de la apuesta
A junio de 2026, la compañía reportó una cartera de pedidos de 25.400 millones de dólares. Más de 20.000 millones de ese total provienen de un acuerdo plurianual con OpenAI.
Cerebras también dice tener más de 600 MW de capacidad de centros de datos ya en operación o contratados, y sus ingresos del segundo trimestre casi se duplicaron interanualmente, según los hallazgos de investigación.
En septiembre de 2026, Cerebras acordó suministrar sistemas CS-4 para aproximadamente 100 MW de capacidad a Gimlet Labs. La compañía también cerró un acuerdo a largo plazo con General Compute, con despliegue previsto para el primer trimestre de 2027.
Todo esto sigue a la OPI de Cerebras en Nasdaq en mayo de 2026. Desde su cotización, la compañía ha comenzado a expandir su fabricación en EE. UU. y a construir alianzas para aumentar su capacidad operativa.
Por qué importa saltarse la fila
Los hallazgos de investigación señalan que la demanda de infraestructura de IA depende cada vez más del espacio, la energía y la construcción de centros de datos, y no solo de la disponibilidad de chips. Eso ayuda a explicar por qué Cerebras ahora habla de capacidad en megavatios en lugar de conteos de chips: la cifra de 600 MW y el compromiso de aproximadamente 100 MW con Gimlet Labs son medidas de energía y superficie. Al esquivar HBM, CoWoS y la asignación de 3nm, la compañía intercambia la dependencia de las cadenas de suministro de la industria de chips por las restricciones de toda la industria que los hallazgos identifican: energía, superficie y capacidad de construcción.
Qué observar
Para los inversionistas de Cerebras, la pregunta central es la ejecución. Una cartera de pedidos de 25.400 millones de dólares es una promesa, no ingresos, y convertirla depende de que los centros de datos se construyan, se energicen y operen según lo previsto. Los hallazgos de investigación señalan los costos de implementación de centros de datos como un desafío que la compañía trabaja por superar. El despliegue de aproximadamente 100 MW con Gimlet Labs y el despliegue con General Compute previsto para el primer trimestre de 2027 ofrecen puntos de control a corto plazo para esa pregunta de ejecución.
La concentración de clientes es el segundo factor a seguir. Con más de 20.000 millones de dólares de la cartera de pedidos atados a OpenAI, la salud de esa única relación pesa de manera desproporcionada. Acuerdos como los de Gimlet Labs y General Compute ayudan a diversificar la mezcla, aunque son mucho más pequeños en comparación.
En cuanto al rendimiento, la afirmación de Feldman sobre una inferencia un orden de magnitud más rápida enfrentará el escrutinio de clientes que ejecuten cargas de trabajo reales. La SRAM en el chip es extremadamente rápida, pero 44 GB por chip es un presupuesto fijo, y la forma en que los sistemas escalen para los modelos más grandes determinará qué tan ampliamente se adopta el diseño.