OpenAI zegt dat zijn Jalapeño-chip Nvidia’s GB300 overtreft bij inference
Belangrijkste punten
- •OpenAI zei dat Jalapeño werd getest op SemiAnalysis’ InferenceX-benchmark met GPT-OSS 120B, DeepSeek’s R1 670B en Moonshot AI’s Kimi K2.5 1T.
- •Het bedrijf meldde dat Jalapeño 1,5 tot 1,9 keer meer werk per eenheid elektriciteit leverde en 1,7 tot 3,6 keer snellere reacties gaf dan de vergelijkingssystemen.
- •OpenAI zei dat het voordeel van de chip opliep tot 2,1 tot 4,1 keer bij taken met meer heen-en-weer interactie.
- •OpenAI zei dat het Jalapeño niet wil verkopen of verhuren, en dat de belangrijkste beperking datacentervermogen is in plaats van geld of vloeroppervlak.
- •De chip zal naar verwachting tegen eind 2026 in beperkte mate worden ingezet en in 2027 verder worden opgeschaald, terwijl OpenAI naast zijn eigen silicon blijft vertrouwen op Nvidia en Cerebras.

OpenAI heeft zijn eerste benchmarkresultaten gepubliceerd voor Jalapeño, zijn interne inference-chip die samen met Broadcom is gebouwd.
Volgens het bedrijf verricht de chip meer AI-werk per watt en levert hij snellere antwoorden dan Nvidia’s GB200- en GB300-racksystemen, die in de tests als vergelijkingsbasis werden gebruikt.
Met Jalapeño voegt OpenAI zich bij andere grote AI-exploitanten — Google met zijn Tensor Processing Units, Amazon met zijn Trainium-chips, Microsoft met zijn Maia-accelerators en Meta met zijn MTIA — die eigen AI-silicon ontwerpen nu de inference-kosten in de sector toenemen.
Hoe Jalapeño volgens OpenAI presteerde
OpenAI zei dat Jalapeño is beoordeeld met InferenceX, een openbare benchmark van SemiAnalysis die het volledige proces van het afhandelen van een AI-verzoek meet. De chip werd getest op OpenAI’s GPT-OSS 120B, DeepSeek’s R1 670B en Moonshot AI’s Kimi K2.5 1T.
Volgens OpenAI verrichtte Jalapeño 1,5 tot 1,9 keer meer werk per eenheid elektriciteit dan de andere systemen in de benchmark. Ook gaf de chip 1,7 tot 3,6 keer sneller een antwoord.
Voor taken die meer heen-en-weer interactie vereisen, liep het voordeel volgens OpenAI op tot tussen 2,1 en 4,1 keer.
Richard Ho, vicepresident hardware bij OpenAI, vertelde journalisten dat de chip meer werk tegelijk kan verwerken en ook sneller reageert, iets wat de meeste chips volgens hem niet tegelijkertijd kunnen doen.
De vergelijkingspunten waren Nvidia’s GB200- en GB300-superchips, die op dat moment de beste resultaten waren die InferenceX had geregistreerd. Bij het grootste geteste model, Kimi K2.5, zei OpenAI dat Jalapeño ongeveer 1,5 keer de piekprestaties per watt behaalde en 3,4 keer lagere latentie had.
OpenAI zei ook dat er geen verhuurmarkt, geen instance type en geen plan is om Jalapeño te verkopen. Dat verschilt van cloudproviders zoals Amazon en Google, die hun eigen aangepaste chips verhuren aan externe klanten. Toen hem werd gevraagd of het bedrijf de chip aan anderen zou aanbieden, zei Ho dat OpenAI “moeite heeft om genoeg” compute te hebben voor de eigen behoeften.
Ho zei dat OpenAI het budget en de vloeroppervlakte heeft die het nodig heeft, maar momenteel wordt beperkt door datacentervermogen in plaats van door geld of fysieke ruimte, waardoor tokens per megawatt de belangrijkste maatstaf zijn. Beschikbaarheid van stroom is sectorbreed een beperkende factor geworden voor de bouw van datacenters, waarbij netcapaciteit steeds sterker bepaalt hoe snel AI-infrastructuur kan worden gebouwd. Omdat inference continu draait over ChatGPT en de API, telt elke vermindering in watt per token snel op op de schaal waarop OpenAI opereert.
De chip heeft een vermogen van 700 watt, maar OpenAI hield hem bij de geteste workloads op of onder 550 watt.
De hardware past ook binnen OpenAI’s overeenkomst uit oktober 2025 met Broadcom om tegen 2029 10 gigawatt aan door OpenAI ontworpen accelerators uit te rollen. Cryptopolitan berichtte eerder toen het partnerschap voor het eerst werd geschetst.
Zal OpenAI volledig overstappen op zijn eigen chips?
Tijdens Hot Chips, een jaarlijkse conferentie over halfgeleidertechniek, zei Ho dat OpenAI Jalapeño zal uitrollen in racks van 128 chips, met een volledige pod die 2.048 ASIC’s gebruikt. Hij zei dat een uitrol met 128 chips 1,7 exaflops aan 4-bit compute levert en 27,5 terabyte HBM4, waarbij elk pakket 15,4 terabyte per seconde aan geheugendoorvoer biedt.
OpenAI zei dat het zijn eigen modellen heeft gebruikt om de ontwikkeling te versnellen, waardoor het traject van ontwerp naar tape-out in slechts negen maanden werd afgerond. Ho voegde eraan toe dat een tweede generatie “vergevorderd in ontwikkeling” is en dat aan een derde versie al wordt gewerkt.
Toch vervangt OpenAI, ondanks de benchmarkclaims, zijn GPU-vloot niet. Ho omschreef Jalapeño als één onderdeel van een compute-strategie die nog steeds steunt op “zeer, zeer goede partners” bij Nvidia en Cerebras. Volgens berichtgeving zal de chip tegen eind 2026 in kleine volumes worden uitgerold, waarna de opschaling in 2027 volgt.
Opmerkelijk is dat alle cijfers van OpenAI zelf kwamen; SemiAnalysis verifieerde de InferenceX-runs ter plaatse, maar draaide niet de volledige suite en zag ook geen resultaten van AgentX.
Als u dit leest, loopt u al voor. Blijf dat met onze nieuwsbrief.