Nvidia разкри Vera Rubin: NVL72 система за AI инференс с 800VDC захранване

Nvidia отвори вратите на инженерната си „superlab“ и разкри детайли за платформата Vera Rubin — следващото поколение AI система, която комбинира новия Rubin GPU и специализирания Vera CPU в стелаж под името NVL72. На брифинг през юли 2026 г. компанията показа архитектурните оптимизации за AI инференс, публикува неофициални резултати от новия бенчмарк SPEC CPU 2026 и за пръв път демонстрира захранване с 800 волта прав ток (800VDC). По думите на Nvidia прототипите вече изпълняват реални натоварвания на OpenAI.
Шест (вече седем) чипа в един ускорител
Vera Rubin не е един чип, а цяла платформа от специализирани компоненти: Vera CPU, Rubin GPU, комутатор NVLink 6, мрежов адаптер ConnectX-9, DPU BlueField-4 и Ethernet суич Spectrum-6. През март 2026 г. Nvidia добави и седми елемент — инференс ускорителя Groq 3 LPX. Идеята е цялата верига — от изчислението до стелажа — да е проектирана заедно, за да изстисква максимум токени на ват.
Пълната система Vera Rubin NVL72 обединява 36 Vera CPU и 72 Rubin GPU, които работят като един ускорител. Числата са внушителни: 3,6 EFLOPS FP4 инференс изчисление, 20,7 TB HBM4 памет, 260 TB/s NVLink 6 пропускателна способност и 54 TB системна LPDDR5X памет.
Rubin GPU: оптимизиран за инференс
Rubin е първият GPU на Nvidia, при който акцентът явно се измества от обучение към инференс — там, където днес се харчи най-много изчислителна мощ. Чипът събира 336 милиарда транзистора и 224 стрийминг мултипроцесора с пето поколение Tensor ядра. Nvidia посочва 50 sparse PFLOPS NVFP4 инференс производителност и 35 PFLOPS за обучение.
Ключът е паметта. Rubin ползва новото поколение HBM4 — до 288 GB на GPU с 22 TB/s пропускателна способност. HBM4 удвоява ширината на интерфейса спрямо HBM3e, а комбинацията от нови контролери и по-плътна интеграция между изчисление и памет прави Rubin близо три пъти по-бърз откъм памет от Blackwell. NVLink 6 също се удвоява — до 3,6 TB/s на GPU.
Според ранни резултати на CoreWeave върху модела DeepSeek-R1, Vera Rubin доставя 10 пъти повече токени на ват от предходния GB200 NVL72 — точно метриката, която определя рентабилността на един AI дата център.
Vera CPU: Olympus ядра и SPEC CPU 2026
Най-голямата изненада е процесорът. Vera е ARM-базиран чип с 88 ядра и 176 нишки (чрез spatial multithreading), построен върху собствената архитектура Olympus, съвместима с Armv9.2. Всяко Olympus ядро има широк фронтенд — до 16 инструкции на цикъл при извличане и 10-широк декодер, който захранва 18 изпълнителни канала. Кешовете са солидни: 2 MB L2 на ядро и 164 MB унифициран L3.
Паметта е LPDDR5X — до 1,5 TB капацитет и 1,2 TB/s пропускателна способност, при пиково потребление около 50 W. Връзката към GPU е NVLink-C2C с 1,8 TB/s, а сокетът достига 450 W пиково. Nvidia твърди двойна производителност спрямо предишния Grace, плюс 2x ускорение на агенти и 40% по-ниска латентност.
По-интересни са неофициалните SPEC CPU 2026 резултати, които Nvidia публикува в бяла книга. Vera изпреварва с 3% AMD Epyc 9755 (Turin), при това с чувствително по-малко нишки, и по данни на компанията стои 55% над Intel Xeon 6980P. Phoronix определи чипа като „най-добрата производителност, виждана някога на ARM“. Любопитен детайл: поддръжката на SVE2 FP8 позволява леко квантувано оценяване на модели да върви изцяло в CPU конвейера, без да заема GPU.
800VDC — новата електрическа архитектура
Другата голяма демонстрация е енергийна. Nvidia показа работещо 800VDC захранване — преход от традиционните 415/48 V стелажни архитектури към високоволтов прав ток, който намалява загубите при преноса и опростява конверсията. Това е предпоставка за бъдещата Kyber (NVL576) архитектура, замислена за 600 kW на стелаж — граница, която просто не е достижима със старото захранване.
Практичен детайл, който говори за зрялост на дизайна: сглобяването на един compute tray отнема една минута срещу 90 минути при GB200 — 90-кратно подобрение, важно при мащабите на дата центровете.
Какво означава това
Vera Rubin очертава посоката на AI хардуера: специализация за инференс, по-плътна памет и радикално по-ефективно захранване. Nvidia не е сама в тази надпревара — Microsoft вече внедрява rack-scale системата Helios на AMD в Azure, а Google вгражда архитектурата на Gemini директно в силиция. Rubin се очаква да тръгне през втората половина на 2026 г., а Rubin Ultra — през 2027 г.
Източници: Tom’s Hardware, The Register, ServeTheHome, Phoronix и NVIDIA Technical Blog.
Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.
Предпочитан източник в Google