Jalapeño на OpenAI бие Nvidia по ефективност

OpenAI публикува на 25 август първите измервания на собствения си ускорител Jalapeño и твърди, че чипът върши между 1,5 и 1,9 пъти повече работа на киловат от флагманските стелажни системи GB200 и GB300 на Nvidia. Резултатите са от публичния пакет InferenceX на анализаторската къща SemiAnalysis и обхващат три отворени модела — GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 с трилион параметъра. Чипът е разработен съвместно с Broadcom и е предназначен само за inference, не за трениране на модели.
Какво точно показват числата
Освен предимството по енергийна ефективност, OpenAI отчита и 1,7 до 3,6 пъти по-ниска end-to-end латентност спрямо най-добрите налични търговски системи. При интерактивни натоварвания — тоест когато потребителят чака отговор на живо — разликата е 2,1 до 4,1 пъти. В абсолютни стойности Jalapeño изкарва около 1400 токена в секунда за един потребител при GPT-OSS 120B и над 700 токена в секунда при DeepSeek R1 със заявка без конкуренция.
Най-ефектните числа идват от режимите с ниска латентност: там публикацията на OpenAI заявява от 8,6 до 104,3 пъти повече throughput на киловат при най-бързите настройки за време между токените, които GB300 изобщо може да достигне. Тук е важно да се чете внимателно — това е сравнение в работна точка, в която конкурентът вече едва издържа, а не общо превъзходство от два порядъка.
Хардуерът отдолу
По данни на SemiAnalysis изчислителният чиплет е произведен по TSMC N3P, а входно-изходният — по N3E, с 32 линии 800G SerDes. Паметта е шест стека HBM4: 216 GiB при 15,4 TB/s. Пиковата изчислителна мощ на степинг B0 е 13,4 PFLOPS в MXFP4.
TDP-то е 700 W, но при реални натоварвания измерената трайна консумация остава на или под 550 W. За сравнение, Tom’s Hardware припомня, че флагманският ускорител на Nvidia е с обявени 1400 W. Стелажът събира 128 чипа Jalapeño в 16 трея, а scale-up домейнът стига до 2048 ускорителя в 16 стелажа през комутатори Tomahawk 6 на Broadcom. Двустелажна система тегли около 160 kW.
Снимка: OpenAI
Уговорките, които не бива да пропускате
Първо, сравнението по консумация зависи от това какво броите. В приложението към собствения си документ OpenAI дава и сметка по цялостна консумация от контакта на ускорител — 1,18 kW за Jalapeño срещу 2,55 kW за GB300 — и там разликата се свива чувствително. Ако пък GB300 работи с multi-token prediction, предимството по пикова ефективност пада до около 1,5 пъти.
Второ, Jalapeño не е тестван срещу Vera Rubin — платформата, с която Nvidia ще захрани първия гигават системи, договорени с OpenAI за второто полугодие на 2026 г. Rubin вече се доставя на клиенти, докато Jalapeño засега съществува в инженерни образци. SemiAnalysis все пак сравнява публикуваните данни и заключава, че Jalapeño изважда повече изходни токени на мегават от Vera Rubin — но това е сметка на хартия, не измерване на едно и също място.
Трето — и това работи в полза на OpenAI — чипът постига тези резултати без multi-token prediction, без спекулативно декодиране и без разделяне на prefill и decode фазите. Тези оптимизации тепърва предстоят. Самата SemiAnalysis отбелязва и че тестът е при контекст 8k, който е по-кратък от типичните многоходови агентни задачи в реална експлоатация.
Как стигнахме дотук
Партньорството с Broadcom беше обявено на 13 октомври 2025 г., а самият чип — публично на 24 юни 2026 г., когато Hock Tan предаде първите образци лично на Сам Алтман и Грег Брокман. Пътят от първия дизайн до финалния blueprint е отнел девет месеца, а производството е тръгнало през ноември 2025 г. OpenAI твърди, че част от кода за отделни компоненти на модела е генериран от AI и се изпълнява 1,5 до 1,8 пъти по-бързо от човешките реализации.
Ричард Хо, който води хардуерното направление в компанията, определя резултатите като „много, много значителен напредък спрямо state of the art”. Логиката зад проекта е същата, която Apple прилага от години в телефоните си: когато моделът, софтуерът за обслужване, чипът, паметта и мрежата се проектират заедно, се печели на всички фронтове наведнъж. Специализираният силиций постепенно става стандартният отговор на скъпите GPU — по същия път вървят и класическите производители на процесори с все по-нишови дизайни като 256-ядрения Xeon 7 на Intel.
Какво следва
Внедряването в собствената инфраструктура на OpenAI започва в малки количества до края на 2026 г., а сериозните обеми идват през 2027 г. Второ поколение вече е в разработка, трето — в ранно планиране.
Дотогава Nvidia няма да стои на едно място, а и Jalapeño не се докосва до трениране на модели — областта, в която CUDA екосистемата остава без реален конкурент. За OpenAI обаче сметката е друга: ако собственият чип свали цената на един токен, това променя икономиката на цялата компания, която иначе е под непрекъснат натиск — от разходите за инфраструктура до проверките на регулаторите.
Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.
Предпочитан източник в Google