jalapeño este es el primero del autor acelerador de IA diseñado por el equipo de Sam Altman en colaboración con Broadcom. Este es un sistema especializado. destinado a la inferenciaes decir, manejar modelos y agentes de IA ya entrenados. Por lo tanto, no reemplazará los chips utilizados para entrenar generaciones posteriores de GPT, pero puede hacerse cargo de gran parte de las consultas diarias de los usuarios de ChatGPT, Codex o API.
OpenAI cuenta con latencias incluso x3.6 más bajas
Los estadounidenses probaron el jalapeño utilizando el punto de referencia público y probado InferenceX de SemiAnalysis. El sistema fue verificado con GPT-OSS 120B, DeepSeek R1 670B y enorme Kimi K2.5 1T. Los puntos de referencia fueron sistemas que utilizan Nvidia GB200 y GB300.
Dependiendo del modelo Jalapeño ofreció entre 1,5 y 1,9 veces más trabajo de IA por vatio al máximo rendimiento. Una diferencia aún mayor apareció en el caso del tiempo de respuesta, donde La latencia de un extremo a otro fue de 1,7 a 3,6 veces menor. En las aplicaciones más interactivas, la ventaja de rendimiento fue de hasta 4,1 veces.
Curiosamente, el jalapeño no TDP declarado a 700 Wpero duradero durante las cargas probadas. El consumo de energía no superó los 550 W. OpenAI sostiene que esto se debe a que su equipo optimizó simultáneamente la memoria, la red y el software, reduciendo así la latencia y mejorando el rendimiento de toda la plataforma.
Sin embargo, tenemos que esperar a que se produzca un cambio masivo en la infraestructura.
Jalapeño empezará a llegar a los centros de datos de OpenAI a finales de 2026inicialmente en cantidades muy pequeñas. Richard Ho anunció significativamente mayor escala de implementación en 2027. La empresa no tiene intención de renunciar a los aceleradores Nvidiay Jalapeño es solo la primera generación de una familia más grande: la segunda ya se encuentra en una etapa avanzada de desarrollo y la tercera está comenzando a tomar forma.