Huawei ускорява Ascend 960: 960PR удвоява FP4

На откриването на HUAWEI CONNECT 2026 в Шанхай на 17 септември заместник-председателят и ротационен председател на Huawei Дейвид Уанг обяви, че следващото поколение AI ускорители Ascend излиза по-рано от плана. Ascend 960DT ще е в продажба през първото тримесечие на 2027 г. — три тримесечия преди първоначалния график, а Ascend 960PR идва през третото тримесечие на 2027 г., едно тримесечие по-рано. По-интересното е в цифрите: FP4 производителността на 960PR е двойно над това, което самата Huawei обяви в предишната си пътна карта.
Снимка: Huawei
Какво се променя в графика
Старата пътна карта, показана преди по-малко от година, поставяше Ascend 960 в края на 2027 г. с 2 PFLOPS FP8 и 4 PFLOPS FP4 на чип. Сега Trendforce и официалното съобщение на компанията описват друга картина:
- Ascend 960DT — Q1 2027, 2 PFLOPS FP8 и 4 PFLOPS FP4, до 288 GB собствена памет HiZQ.
- Ascend 960PR — Q3 2027, до 8 PFLOPS FP4 и 192 GB памет HiBL с 2,4 TB/s честотна лента.
- Ascend 970 — 2028 г., 3,6 PFLOPS FP8 и 14 PFLOPS FP4, 288 GB при 14,4 TB/s.
- Ascend 980 — 2029 г., 7,2 PFLOPS FP8 и 28 PFLOPS FP4, 384 GB при 38,4 TB/s.
„Развиваме серията Ascend с темп едно поколение годишно. През 2028 и 2029 г. ще пуснем съответно чиповете Ascend 970 и 980“, каза Уанг.
Защо PR и DT са различни чипове
Двете букви не са маркетинг. PR означава prefill и препоръчителни системи, DT — decode и трениране. Huawei разделя двете фази на инференса между отделен силиций: фазата на обработка на промпта е тежка откъм изчисления, затова 960PR жертва капацитет и честотна лента на паметта в замяна на два пъти повече изчисления с ниска точност. Генерирането на токени опира до паметта, затова 960DT носи 288 GB и по-широка шина.
Точно тук е скокът, който The Register отбелязва: 8 PFLOPS FP4 на 960PR са двойно повече от 4-те PFLOPS, които Huawei обеща за поколението. Срещу Nvidia сметката все още не излиза в полза на Китай — очакваният Rubin се движи в диапазона 35–50 PFLOPS FP4 с 288 GB HBM4. Разликата на ниво чип остава сериозна.
Залогът е в мащаба, не в чипа
Отговорът на Huawei е системен. Atlas 960E SuperPoD е първата в индустрията система с near-packaged optics (NPO) и събира до 4096 NPU с 8 EFLOPS FP8 и до 1 PB памет с висока честотна лента. Оптичният модул Hi-ONE с 7,2 Tbit/s заменя около 48 000 конвенционални 800G модула с приблизително 5500 единици — минус над 550 kW консумация и 99,8% достъпност на системата по данни на компанията.
Междусистемната шина Lingqu UnifiedBus от четвърто поколение е проектирана за клъстери до 512 000 NPU в двустепенна четириравнинна Clos мрежа, а с multi-rail топология — над милион. За сравнение, NVLink обединява до 576 GPU в един домейн. Ако едно ускорение изостава четирикратно, но можете да свържете хиляди пъти повече от тях, сметката за някои натоварвания се променя.
Търсенето вече изпреварва производството. DeepSeek планира да разположи 160 000 чипа Ascend 950DT в център за данни във Вътрешна Монголия, а Huawei оглежда Малайзия и Египет за разширяване.
Контекст: санкциите като ускорител
Ускоряването на пътната карта идва на фона на американските експортни ограничения, които отрязаха Huawei от TSMC и от западна HBM памет — оттам и собствените формати HiBL и HiZQ. Китайската индустрия търси заобиколни пътища и в литографията, както показва работата по 3-нм транзистори със стара DUV техника, а натискът върху паметта се усеща и при пренареждането на производството на Samsung към HBM.
Има и измерим ефект. Изследване, публикувано в Science и представено от Nature, установява, че санкционираните китайски компании произвеждат с 72,3% повече патенти, цитиращи научни публикации, отколкото сходни несанкционирани фирми, и публикуват с 85,2% повече статии в Web of Science. Авторите тълкуват това като преминаване към собствена наука, когато достъпът до чужда технология е затворен. Изследването описва период 2010–2022 г. и не доказва, че санкциите са полезни — показва по-скоро накъде се пренасочват ресурсите.
Заключение
Цифрите на Huawei са самоотчетени и няма независими тестове, които да ги потвърдят. Но графикът е конкретен, партньорите са реални и заявката за темп „едно поколение годишно“ до 2029 г. е ясна. Ако 960PR наистина излезе с 8 PFLOPS FP4 през третото тримесечие на 2027 г., китайският пазар ще има домашна алтернатива, която не е задължително да бие Nvidia на ниво чип — достатъчно е да се събира в достатъчно голям шкаф.
Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.
Предпочитан източник в Google