OpenAI twierdzi, że jego układ Jalapeño wyprzedza GB300 Nvidii w inferencji
Najważniejsze informacje
- •OpenAI poinformowało, że Jalapeño został przetestowany w benchmarku InferenceX firmy SemiAnalysis przy użyciu modeli GPT-OSS 120B, R1 670B DeepSeek oraz Kimi K2.5 1T firmy Moonshot AI.
- •Firma podała, że Jalapeño wykonał 1,5 do 1,9 raza więcej pracy na jednostkę energii elektrycznej i odpowiadał 1,7 do 3,6 raza szybciej niż systemy porównawcze.
- •OpenAI podało, że przewaga układu wzrosła do 2,1 do 4,1 raza w zadaniach wymagających większej liczby interakcji w obie strony.
- •OpenAI zaznaczyło, że nie planuje sprzedaży ani wynajmu Jalapeño, a jego głównym ograniczeniem jest moc centrów danych, a nie pieniądze czy powierzchnia.
- •Układ ma zostać wdrożony w ograniczonej skali do końca 2026 roku i skalowany w 2027 roku, podczas gdy OpenAI nadal polega na Nvidii i Cerebras obok własnych układów.

OpenAI opublikowało pierwsze wyniki testów benchmarkowych Jalapeño, własnego układu inferencyjnego zbudowanego we współpracy z Broadcom.
Firma twierdzi, że układ wykonuje więcej pracy AI na wat i dostarcza szybsze odpowiedzi niż rackowe systemy GB200 i GB300 Nvidii, które posłużyły jako systemy porównawcze w testach.
Z Jalapeño OpenAI dołącza do grona innych dużych operatorów AI — Google z jednostkami Tensor Processing Units, Amazon z układami Trainium, Microsoft z akceleratorami Maia oraz Meta z układami MTIA — projektujących własny krzem AI w obliczu rosnących w całej branży kosztów inferencji.
Jak według OpenAI wypadł Jalapeño
OpenAI poinformowało, że Jalapeño został oceniony za pomocą InferenceX, publicznego benchmarku firmy SemiAnalysis, który mierzy pełny proces obsługi zapytania AI. Układ przetestowano na modelach GPT-OSS 120B OpenAI, R1 670B DeepSeek oraz Kimi K2.5 1T firmy Moonshot AI.
Według OpenAI Jalapeño wykonał 1,5 do 1,9 raza więcej pracy na jednostkę energii elektrycznej niż pozostałe systemy w benchmarku. Odpowiadał on również 1,7 do 3,6 raza szybciej.
W przypadku zadań wymagających większej liczby interakcji w obie strony OpenAI podało, że przewaga wzrosła do 2,1 do 4,1 raza.
Wiceprezes OpenAI ds. sprzętu, Richard Ho, powiedział dziennikarzom, że układ może obsługiwać więcej pracy jednocześnie, a przy tym szybciej odpowiadać — czego, jego zdaniem, większości układów nie udaje się osiągać równocześnie.
Punktem odniesienia były superukłady GB200 i GB300 Nvidii, które w chwili testów były najlepszymi wynikami zarejestrowanymi przez InferenceX. Na największym z testowanych modeli, Kimi K2.5, OpenAI podało, że Jalapeño osiągnął około 1,5 raza wyższą szczytową wydajność na wat oraz 3,4 raza niższe opóźnienie.
OpenAI zaznaczyło również, że nie istnieje rynek wynajmu, typ instancji ani plan sprzedaży Jalapeño. Odróżnia to firmę od dostawców chmury, takich jak Amazon i Google, którzy udostępniają własne układy dedykowane klientom zewnętrznym. Zapytany, czy firma zaoferuje układ innym, Ho odpowiedział, że OpenAI „z trudem zaspokaja” własne potrzeby obliczeniowe.
Ho powiedział, że OpenAI posiada potrzebny budżet i powierzchnię, ale ogranicza je dostępna moc centrów danych, a nie pieniądze czy przestrzeń fizyczna, przez co kluczowym wskaźnikiem stają się tokeny na megawat. Dostępność energii stała się czynnikiem ograniczającym budowę centrów danych w całej branży, a przepustowość sieci energetycznej w coraz większym stopniu decyduje o tempie wznoszenia infrastruktury AI. Ponieważ inferencja działa nieprzerwanie w ChatGPT i API, każde zmniejszenie liczby watów na token kumuluje się w skali, w jakiej operuje OpenAI.
Układ ma moc znamionową 700 watów, ale OpenAI podało, że podczas testowanych obciążeń utrzymywano go na poziomie 550 watów lub poniżej.
Sprzęt wpisuje się również w zawartą w październiku 2025 roku umowę OpenAI z Broadcom na wdrożenie 10 gigawatów akceleratorów zaprojektowanych przez OpenAI do 2029 roku. Cryptopolitan relacjonował wcześniej, kiedy partnerstwo zostało po raz pierwszy nakreślone.
Plany wdrożenia OpenAI
Występując na konferencji Hot Chips, dorocznym wydarzeniu poświęconym inżynierii półprzewodników, Ho powiedział, że OpenAI wdroży Jalapeño w szafach rackowych po 128 układów, przy czym pełny pod będzie wykorzystywał 2048 układów ASIC. Według niego wdrożenie obejmujące 128 układów zapewnia 1,7 eksaflopsa obliczeń 4-bitowych i 27,5 terabajta pamięci HBM4, a każdy pakiet oferuje przepustowość pamięci wynoszącą 15,4 terabajta na sekundę.
OpenAI poinformowało, że wykorzystało własne modele do przyspieszenia prac rozwojowych, przechodząc od projektu do tape-out w ciągu zaledwie dziewięciu miesięcy — tempie znacznie krótszym niż typowe dla rozwoju układów wieloletnie cykle. Ho dodał, że druga generacja jest „głęboko w fazie rozwoju”, a prace nad trzecią wersją już trwają.
Mimo to OpenAI nie rezygnuje ze swojej floty GPU. Ho określił Jalapeño jako jeden z elementów szerszej strategii obliczeniowej, która nadal opiera się na „bardzo, bardzo dobrych partnerach”, jakimi są Nvidia i Cerebras, producent układów w skali podłoża krzemowego.
Układ ma zostać wdrożony w niewielkich ilościach do końca 2026 roku, a następnie skalowany w 2027 roku.
OpenAI podało, że wszystkie dane pochodzą od samej firmy. SemiAnalysis osobiście zweryfikowało przebiegi testów InferenceX, ale nie uruchomiło pełnego zestawu testów ani nie zapoznało się z wynikami AgentX, towarzyszącego benchmarku SemiAnalysis przeznaczonego dla agentowych, wieloetapowych obciążeń.