NoticiasAccionesOpenAI dice que su chip Jalapeño supera al GB300 de Nvidia en inferencia

OpenAI dice que su chip Jalapeño supera al GB300 de Nvidia en inferencia

Autor: Cryptopolitan·

Puntos clave

  • OpenAI dijo que Jalapeño se probó en el benchmark InferenceX de SemiAnalysis con GPT-OSS 120B, DeepSeek’s R1 670B y Kimi K2.5 1T de Moonshot AI.
  • La empresa informó que Jalapeño realizó entre 1.5 y 1.9 veces más trabajo por unidad de electricidad y respondió entre 1.7 y 3.6 veces más rápido que los sistemas de comparación.
  • OpenAI dijo que la ventaja del chip subió a entre 2.1 y 4.1 veces en tareas con más interacción de ida y vuelta.
  • OpenAI dijo que no planea vender ni alquilar Jalapeño, y que su principal limitación es la energía del centro de datos y no el dinero ni el espacio.
  • Se espera que el chip comience un despliegue limitado a finales de 2026 y que aumente su uso durante 2027, mientras OpenAI sigue apoyándose en Nvidia y Cerebras junto con su propio silicio.
OpenAI dice que su chip Jalapeño supera al GB300 de Nvidia en inferencia

OpenAI ha publicado sus primeros resultados de referencia para Jalapeño, su chip de inferencia interno construido con Broadcom.

La empresa afirma que el chip realiza más trabajo de IA por vatio y ofrece respuestas más rápidas que los sistemas de rack GB200 y GB300 de Nvidia, que fueron los sistemas de comparación utilizados en las pruebas.

Con Jalapeño, OpenAI se suma a otros grandes operadores de IA —Google con sus Tensor Processing Units, Amazon con sus chips Trainium, Microsoft con sus aceleradores Maia y Meta con MTIA— al diseñar su propio silicio de IA a medida que aumentan los costos de inferencia en toda la industria.

Cómo dice OpenAI que rindió Jalapeño

OpenAI señaló que Jalapeño fue evaluado mediante InferenceX, un benchmark público de SemiAnalysis que mide el proceso completo de atender una solicitud de IA. El chip se probó con GPT-OSS 120B de OpenAI, R1 670B de DeepSeek y Kimi K2.5 1T de Moonshot AI.

Según OpenAI, Jalapeño completó entre 1.5 y 1.9 veces más trabajo por unidad de electricidad que los otros sistemas del benchmark. También devolvió respuestas entre 1.7 y 3.6 veces más rápido.

Para tareas que requieren más interacción de ida y vuelta, OpenAI dijo que la ventaja se amplió a entre 2.1 y 4.1 veces.

Richard Ho, vicepresidente de hardware de OpenAI, dijo a los periodistas que el chip puede manejar más trabajo al mismo tiempo y, a la vez, responder con mayor rapidez, algo que, según indicó, la mayoría de los chips no puede hacer simultáneamente.

Los puntos de comparación fueron los superchips GB200 y GB300 de Nvidia, que eran los mejores resultados registrados por InferenceX en ese momento. En el modelo más grande probado, Kimi K2.5, OpenAI dijo que Jalapeño alcanzó alrededor de 1.5 veces el rendimiento máximo por vatio y una latencia 3.4 veces menor.

OpenAI también dijo que no existe un mercado de alquiler, ni un tipo de instancia, ni un plan para vender Jalapeño. Eso difiere de proveedores de nube como Amazon y Google, que alquilan sus propios chips personalizados a clientes externos. Cuando se le preguntó si la empresa ofrecería el chip a otros, Ho dijo que OpenAI estaba “struggling to have enough” compute para sus propias necesidades.

Ho dijo que OpenAI tiene el presupuesto y el espacio físico que necesita, pero está limitada por la energía del centro de datos y no por el dinero o la capacidad física, lo que convierte en la métrica clave los tokens por megavatio. La disponibilidad de energía se ha convertido en un factor limitante para la construcción de centros de datos en toda la industria, y la capacidad de la red influye cada vez más en la velocidad con la que puede construirse la infraestructura de IA. Debido a que la inferencia funciona de forma continua en ChatGPT y la API, cualquier reducción de vatios por token se acumula rápidamente a la escala de OpenAI.

El chip tiene una potencia nominal de 700 vatios, pero OpenAI dijo que se mantuvo en 550 vatios o menos durante las cargas de trabajo probadas.

El hardware también encaja dentro del acuerdo de OpenAI con Broadcom de octubre de 2025 para desplegar 10 gigavatios de aceleradores diseñados por OpenAI hasta 2029. Cryptopolitan informó previamente cuando la asociación se esbozó por primera vez.

Los planes de despliegue de OpenAI

Hablando en Hot Chips, una conferencia anual de ingeniería de semiconductores, Ho dijo que OpenAI desplegará Jalapeño en racks de 128 chips, con un pod completo que utilizará 2,048 ASICs. Señaló que un despliegue de 128 chips entrega 1.7 exaflops de cómputo de 4 bits y 27.5 terabytes de HBM4, con cada paquete aportando 15.4 terabytes por segundo de ancho de banda de memoria.

OpenAI dijo que utilizó sus propios modelos para acelerar el desarrollo, pasando del diseño al tape-out en nueve meses, un ritmo muy por debajo de los ciclos de varios años típicos del desarrollo de chips. Ho añadió que una versión de segunda generación está “deep into development” y que ya se trabaja en una tercera versión.

Sin embargo, incluso con estas afirmaciones de rendimiento, OpenAI no está sustituyendo su flota de GPU. Ho describió Jalapeño como una parte de una estrategia de cómputo más amplia que sigue dependiendo de “very, very good partners” en Nvidia y Cerebras, el fabricante de chips a escala de oblea.

Según se informó, el chip se desplegará en volúmenes pequeños a finales de 2026 antes de aumentar su uso a lo largo de 2027.

OpenAI dijo que todas las cifras provinieron de la propia compañía. SemiAnalysis verificó en persona las ejecuciones de InferenceX, pero no ejecutó la suite completa ni vio resultados de AgentX, el benchmark complementario de SemiAnalysis para cargas de trabajo multi-step y agénticas.