Хардуер и гейминг

Редакция Overclock.bg ·

Samsung LPDDR5X-PIM: 3 пъти по-бърз AI инференс

Samsung LPDDR5X-PIM: 3 пъти по-бърз AI инференс

Samsung представи на конференцията Hot Chips 2026 първата в индустрията LPDDR5X памет с вградени изчислителни блокове — LPDDR5X-PIM. В демонстрацията с езиковия модел Llama-3.1-8B чипът изкарва 81,3 токена в секунда срещу 27,0 при обикновена LPDDR5X, а вътрешната честотна лента скача от 76,8 GB/s на 614 GB/s — осемкратна разлика. Детайлите от сесията публикува ServeTheHome на 25 август.

Слайд от презентацията на Samsung за LPDDR5X-PIM на Hot Chips 2026 Снимка: Samsung / Hot Chips 2026 (via ServeTheHome)

Защо изобщо се слага логика в паметта

При генериране на текст големите езикови модели прекарват по-голямата част от времето си не в смятане, а в чакане. Всеки нов токен изисква прочитане на теглата на модела от паметта, а самата операция върху тях — умножение на матрица по вектор (GEMV) — е елементарна. Резултатът е, че процесорът или NPU стои полупразен, а тесното място е шината към DRAM.

Processing-in-Memory обръща логиката: вместо данните да пътуват до чипа, малко изчислително ядро отива при данните. То не замества процесора — върши само тясно определен набор операции, но ги върши там, където няма ограничение от външната шина.

Какво има вътре

Samsung е вградила 16 PIM блока в банките на DRAM матрицата. Всеки съдържа паралелни MAC дървета (умножение с натрупване) и аритметично устройство, което поддържа както плаваща запетая, така и цели числа — общо 15 избираеми комбинации от прецизност.

Ключовите числа от презентацията:

  • 614 GB/s вътрешна честотна лента за PIM блоковете при x64 и 9600 Mbps
  • 76,8 GB/s през стандартния интерфейс за същия чип — оттам идва „8 пъти“
  • 2,4 TOPS при тегла SINT4, или около 1,2 TFLOPS при FP8, на пакет
  • 16 GB капацитет от четири матрици на ранг

Важното за практиката: пакетът е JEDEC-стандартен, с 561 топчета. Тоест физически стъпва на същото място като обикновена LPDDR5X, което е съвсем различна ситуация от HBM-PIM, изискващ специализиран ускорител.

Двете числа — 2,28x и 3,01x

Тестът е с Llama-3.1-8B при контекст от 320 токена, активации SINT8, тегла SINT4 и изход SINT32. Samsung дава два резултата, които е добре да не се смесват:

  • Време за изпълнение: 5,4 срещу 12,3 секунди — ускорение 2,28 пъти
  • Пропускателна способност: 81,3 срещу 27,0 токена в секунда — 3,01 пъти

Разликата между двете е нормална — първата фаза (обработката на входния текст) е ограничена от изчислителна мощ, а не от паметта, и PIM не ѝ помага почти с нищо. Печалбата идва при генерирането на всеки следващ токен. Затова и по-дългият контекст би свил общото ускорение — числата важат за конкретния сценарий, не за всеки модел.

Струва си да се отбележи и че това са вътрешни измервания на производителя, представени на конференция, а не независим benchmark.

Още един слайд от сесията на Samsung на Hot Chips 2026 Снимка: Samsung / Hot Chips 2026 (via ServeTheHome)

Пет години подготовка

PIM не е нова идея за Samsung. През 2021 г. компанията показа Aquabolt-XL — HBM2 с изчислителни ядра, а на Hot Chips 33 същата година демонстрира и първата LPDDR5-PIM с обещание за над 2 пъти по-висока производителност и над 60% по-малко изразходвана енергия при разпознаване на реч и превод. Оттогава до сега липсваше най-важното — стандартен пакет и реален модел за тестване.

По-рано това лято Samsung показа LPDDR5X-PIM и на изложението FMS 2026 (4 август), заедно със zNAND-O и SSD-то PM1763, съобщи SamMobile. Корейският Electronic Times пък писа през юли за академична симулация с ускорение до 6,2 пъти при GEMV операции и за възможно сдвояване с GAIA — 4-нанометровия AI ускорител на Samsung.

Конкуренцията не спи: SK hynix развива своя AiM (Accelerator-in-Memory) с GDDR6-AiM и модулите AiMX.

Какво още липсва

Samsung не обяви нито цена, нито дата за масово производство, нито клиент. Целевите пазари са три — сървъри, клиентски машини и мобилни устройства — но между демонстрация на Hot Chips и чип в телефон обикновено минават години.

Основната пречка е софтуерна. PIM работи само ако компилаторът и runtime-ът знаят кои операции да пренасочат към паметта, а това изисква стандартизация през JEDEC и поддръжка от Qualcomm, MediaTek, Apple и останалите. Без нея чипът си остава изследователска платформа.

Заключение

LPDDR5X-PIM е първият опит този подход да излезе от нишата на скъпите ускорители и да стъпи в стандартен пакет памет. Ако се получи, ефектът върху локалния AI е директен: същият модел, същият телефон или лаптоп, три пъти повече токени в секунда — без по-голяма батерия и без връзка към облак.

Дотогава по-бързият локален инференс минава през груба сила — повече честотна лента и повече памет, както при новите Mac mini с M6 и Mac Studio с M5 Ultra. Hot Chips 2026 иначе се оказа щедра конференция — там Intel показа и Xeon 7 Diamond Rapids с 256 ядра.

Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.

Предпочитан източник в Google

Прочетете още