ActualitésActionsOpenAI affirme que sa puce Jalapeño surpasse le GB300 de Nvidia en inférence

OpenAI affirme que sa puce Jalapeño surpasse le GB300 de Nvidia en inférence

Auteur: Cryptopolitan·

Points clés

  • OpenAI a indiqué que Jalapeño a été testée sur le benchmark InferenceX de SemiAnalysis avec GPT-OSS 120B, R1 670B de DeepSeek et Kimi K2.5 1T de Moonshot AI.
  • L'entreprise a rapporté que Jalapeño a fourni 1,5 à 1,9 fois plus de travail par unité d'électricité et des réponses 1,7 à 3,6 fois plus rapides que les systèmes de comparaison.
  • OpenAI a indiqué que l'avantage de la puce est monté à 2,1 à 4,1 fois sur les tâches impliquant davantage d'interactions en va-et-vient.
  • OpenAI a déclaré ne pas avoir l'intention de vendre ou de louer Jalapeño, et que sa principale contrainte est l'alimentation électrique des centres de données plutôt que l'argent ou la surface au sol.
  • La puce devrait commencer à être déployée de manière limitée d'ici fin 2026 et à monter en puissance tout au long de 2027, alors qu'OpenAI continue de s'appuyer sur Nvidia et Cerebras en plus de son propre silicium.
OpenAI affirme que sa puce Jalapeño surpasse le GB300 de Nvidia en inférence

OpenAI a publié ses premiers résultats de benchmark pour Jalapeño, sa puce d'inférence développée en interne avec Broadcom.

L'entreprise affirme que la puce effectue davantage de travail d'IA par watt et fournit des réponses plus rapides que les systèmes en rack GB200 et GB300 de Nvidia, qui ont servi de systèmes de comparaison lors des tests.

Avec Jalapeño, OpenAI rejoint d'autres grands opérateurs d'IA — Google avec ses Tensor Processing Units, Amazon avec ses puces Trainium, Microsoft avec ses accélérateurs Maia et Meta avec son MTIA — en concevant son propre silicium d'IA alors que les coûts d'inférence augmentent dans toute l'industrie.

Les performances de Jalapeño selon OpenAI

OpenAI a indiqué que Jalapeño a été évaluée avec InferenceX, un benchmark public de SemiAnalysis qui mesure l'ensemble du processus de traitement d'une requête d'IA. La puce a été testée sur GPT-OSS 120B d'OpenAI, R1 670B de DeepSeek et Kimi K2.5 1T de Moonshot AI.

Selon OpenAI, Jalapeño a effectué 1,5 à 1,9 fois plus de travail par unité d'électricité que les autres systèmes du benchmark. Elle a également renvoyé des réponses 1,7 à 3,6 fois plus rapides.

Pour les tâches nécessitant davantage d'interactions en va-et-vient, OpenAI a indiqué que l'avantage passait à entre 2,1 et 4,1 fois.

Richard Ho, vice-président matériel d'OpenAI, a déclaré aux journalistes que la puce peut traiter davantage de travail à la fois tout en répondant plus rapidement, ce que la plupart des puces ne peuvent pas faire simultanément selon lui.

Les cibles de comparaison étaient les superpuces GB200 et GB300 de Nvidia, qui affichaient les meilleurs résultats enregistrés par InferenceX à l'époque. Sur le plus grand modèle testé, Kimi K2.5, OpenAI a indiqué que Jalapeño atteignait environ 1,5 fois la performance de crête par watt et une latence 3,4 fois inférieure.

OpenAI a également précisé qu'il n'existe aucun marché de location, aucun type d'instance et aucun projet de vendre Jalapeño. Cela la distingue des fournisseurs de cloud comme Amazon et Google, qui louent leurs propres puces personnalisées à des clients externes. Interrogé sur l'éventualité d'offrir la puce à d'autres, Ho a déclaré qu'OpenAI « lutte pour en avoir assez » de capacités de calcul pour ses propres besoins.

Ho a indiqué qu'OpenAI dispose du budget et de la surface au sol nécessaires, mais qu'il est limité par l'alimentation électrique des centres de données plutôt que par l'argent ou la capacité physique, ce qui fait des tokens par mégawatt la métrique clé. La disponibilité de l'énergie est devenue un facteur bloquant pour la construction de centres de données dans toute l'industrie, la capacité du réseau déterminant de plus en plus la vitesse à laquelle les infrastructures d'IA peuvent être construites. Comme l'inférence fonctionne en continu sur ChatGPT et l'API, toute réduction des watts par token se cumule à l'échelle d'OpenAI.

La puce est évaluée à 700 watts, mais OpenAI a indiqué qu'elle a été maintenue à 550 watts ou moins pendant les charges de travail testées.

Ce matériel s'inscrit également dans l'accord conclu en octobre 2025 entre OpenAI et Broadcom pour déployer 10 gigawatts d'accélérateurs conçus par OpenAI d'ici 2029. Cryptopolitan avait déjà rapporté l'annonce initiale de ce partenariat.

Les plans de déploiement d'OpenAI

S'exprimant à Hot Chips, une conférence annuelle d'ingénierie des semi-conducteurs, Ho a déclaré qu'OpenAI déploiera Jalapeño dans des racks de 128 puces, un pod complet utilisant 2 048 ASIC. Un déploiement de 128 puces offre 1,7 exaflops de calcul en 4 bits et 27,5 téraoctets de HBM4, chaque boîtier fournissant 15,4 téraoctets par seconde de bande passante mémoire.

OpenAI a indiqué avoir utilisé ses propres modèles pour accélérer le développement, passant de la conception au tape-out en neuf mois, un rythme bien plus rapide que les cycles pluriannuels typiques du développement de puces. Ho a également déclaré qu'une version de deuxième génération est « en pleine phase de développement » et que les travaux sur une troisième version ont déjà commencé.

Malgré cela, OpenAI ne remplace pas sa flotte de GPU. Ho a décrit Jalapeño comme un élément d'une stratégie de calcul plus large qui dépend toujours de « très, très bons partenaires » que sont Nvidia et Cerebras, le fabricant de puces à l'échelle du wafer.

La puce devrait être déployée en petits volumes d'ici fin 2026 avant une montée en puissance tout au long de 2027.

OpenAI a précisé que tous les chiffres provenaient de l'entreprise elle-même. SemiAnalysis a vérifié les exécutions InferenceX en personne, mais n'a pas exécuté la suite complète ni vu les résultats d'AgentX, le benchmark compagnon de SemiAnalysis pour les charges de travail agentiques multi-étapes.