AI

Редакция Overclock.bg ·

DeepSeek и Huawei с отворена алтернатива на CUDA

DeepSeek и Huawei с отворена алтернатива на CUDA

DeepSeek обяви на 30 септември 2026 г. в официалния си канал в WeChat, че публикува с отворен код набор инструменти за програмиране на AI ускорителите Ascend на Huawei. Пакетът е безплатен за сваляне и включва версия на езика TileLang за Ascend, както и библиотеките за изчисления и комуникация, които досега съществуваха само за хардуера на Nvidia. Двете компании ще работят заедно и по supernode от 128 чипа Ascend 950.

Какво точно е пуснато

Ако следите репозиториите на DeepSeek в GitHub, ще забележите няколко нови имена, появили се в края на септември:

  • DeepGEMM-Ascend — библиотека за матрични умножения за NPU-та Ascend, огледален вариант на DeepGEMM за GPU;
  • DeepEP-Ascend — комуникационна библиотека за обучение и inference върху много чипове, аналог на DeepEP за expert parallelism;
  • TileKernels — набор ядра, писани директно на TileLang, за стандартни векторни операции и достъп до паметта;
  • FlashMLA и DeepSelect — съответно ядра за разредено внимание при дълъг контекст и TopK ядра за DeepSeek Sparse Attention;
  • clangd-ascend — форк на clangd, който дава автодовършване и проверка на кода за Ascend.

Ключовият елемент обаче е езикът. „За да се изгради ново поколение независима и самоуправляема софтуерна екосистема за GPU, първият приоритет е език от високо ниво — универсален, лесен за програмиране и същевременно способен да извлече пълната производителност на хардуера“, цитира изявлението на DeepSeek изданието SDxCentral. Компанията благодари на Huawei за „безрезервна и активна подкрепа“, отбелязва Bloomberg TV Bulgaria.

TileLang не е китайски проект от нулата

TileLang е отворен проект в GitHub с около 7800 звезди, разработван основно от екип около проф. Zhi Yang в Пекинския университет, с участие и по време на стажове в Microsoft Research. Синтаксисът е Python-подобен, а компилацията минава през TVM. Последната стабилна версия v0.1.13 е от август 2026 г.

Езикът вече поддържа CUDA (SM70 до SM120), AMD ROCm, Apple Metal, експериментално LLVM за CPU, а от тази година и Ascend 950 — за което са нужни CANN и torch_npu. Тоест DeepSeek не измисля нов CUDA, а залага на междинен слой, който абстрахира хардуера: описвате какви изчисления искате на по-високо ниво, а компилаторът ги привежда към конкретния ускорител. За разработчиците това означава по-малко зависимост от един доставчик — и по-малко ръчно пренаписване на ядра.

Хардуерът отзад: Ascend 950 и 128-чипов възел

Ascend 950 е наследникът на 910C и идва в два варианта. Според официалната пътна карта на Huawei 950PR е за prefill фазата на inference и за препоръчителни системи, със собствена HBM памет HiBL 1.0, и излезе през първото тримесечие на 2026 г. 950DT е за decode и обучение, с 144 GB памет HiZQ 2.0, 4 TB/s честотна лента към паметта и 2 TB/s за връзка между чиповете; той е планиран за четвъртото тримесечие на 2026 г. Двата варианта ползват един и същ die и се целят в 1 PFLOPS при FP8 и 2 PFLOPS при FP4.

Съвместният supernode от 128 такива чипа е стъпката, в която софтуерът има най-голямо значение: комуникацията между ускорителите обикновено е тясното място, а точно за това са DeepEP-Ascend и оптимизациите в CANN.

CANN — от „трудна и нестабилна“ към общност

Софтуерният слой на Huawei дълго беше основното оплакване на разработчиците. На HUAWEI CONNECT 2026 в Шанхай (17–19 септември) компанията представи числа, които показват промяна: външните разработчици вече са 61% от всички около CANN, месечно активните са над 5200, над 40 модела са предварително обучавани нативно върху Ascend, а платформата поддържа над 90 външни open source проекта, включително PyTorch, Triton, vLLM и veRL. Huawei обяви и програма „100 NPU-часа“ за всеки разработчик и 5 млрд. юана (около 600 млн. евро) за екосистемата през следващите три години.

Джу Джаошън представя развитието на екосистемите Kunpeng и Ascend Снимка: Huawei

Защо това е важно

DeepSeek е принудена да оптимизира софтуер, защото не може свободно да купува западен хардуер. По данни на Bloomberg компанията планира да ползва поне 160 000 ускорителя Ascend в център за данни във Вътрешна Монголия, а в последния си кръг е оценена на около 500 млрд. юана (приблизително 74 млрд. долара), пише investor.bg. Същият натиск се вижда и в моделите — компанията сряза цените на API-то си с до 90%, докато американските ѝ конкуренти се борят за други неща: GPT-6.1 Sol е пет пъти по-евтин от Astra, а Anthropic върви към IPO с 42 млрд. долара загуба.

Софтуерът обаче не решава производството. Машините за EUV литография на ASML струват около 350 млн. евро, съдържат над 100 000 части и зависят от близо 200 основни доставчици и около 2000 компании в цялата верига — а Китай няма достъп до тях и работи по собствена DUV техника. „Виждаме само върха на айсберга“, казва изпълнителният директор на ASML Christophe Fouquet, според когото ефектът на AI върху индустрията ще се разгръща 10 до 15 години, пише TechSpot.

Заключение

Отвореният код не прави Ascend равен на Nvidia H-серията, но премахва една конкретна бариера: досега писането на ядра за китайски ускорители изискваше познания за ниско ниво, които имат малцина. С TileLang, готови библиотеки и дори работещ clangd, прагът за влизане пада значително. Ако наистина искате да пробвате, започнете от репозиториите:

git clone https://github.com/deepseek-ai/DeepGEMM-Ascend
git clone https://github.com/deepseek-ai/DeepEP-Ascend

Истинската проверка ще дойде, когато DeepSeek обучи следващия си голям модел изцяло върху Ascend. Дотогава това е инфраструктурна работа — по-малко ефектна от нов модел, но вероятно по-важна.

Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.

Предпочитан източник в Google

Прочетете още