AI

Редакция Overclock.bg ·

DeepSeek V4.1 Flash: 763 млрд. параметъра, 8 млрд. активни

DeepSeek V4.1 Flash: 763 млрд. параметъра, 8 млрд. активни

DeepSeek пусна на 10 септември DeepSeek V4.1 Flash — модел с 763 милиарда параметъра, който въпреки размера си изисква по-малко ресурси от версията, която заменя. Тежестите са на Hugging Face под MIT лиценз, а The Register определя това, което на хартия е междинна ревизия, като промяна, която задава шаблон за следващото поколение „слаби“ (lean) големи езикови модели.

Числото 763 милиарда е над 2,5 пъти повече от предишния V4 Flash и повече от V3 и R1, които направиха компанията известна в началото на 2025 г. Но при извод (inference) активни са само 8 милиарда параметъра при обработка на промпта и 16 милиарда при генериране.

Две промени, които свиват сметката

Първата е в key-value кеша — паметта, в която моделът пази състоянието на разговора. Новата причинно-следствена encoder-decoder архитектура (CED) и преработените механизми за внимание свалят KV кеша до между 13% и 25% от изискванията на V4 Flash. На практика един и същ сървър обслужва четири до осем пъти повече едновременни потребители.

По данни от картата на модела това означава около 890 байта на токен — приблизително четири пъти по-малко от V4 Flash и 437 пъти по-малко от първия DeepSeek. Част от ефекта идва от FP4 кеширане във формат E2M1 със скалиращ коефициент на всеки 16 канала.

Сравнение на KV кеша между поколенията модели на DeepSeek Снимка: DeepSeek-AI / Hugging Face

Какво са N-gram параметрите

Втората промяна е по-интересна. От общите 763 милиарда параметъра 196 милиарда са N-gram параметри — модул за условна памет, който DeepSeek нарича Engram. N-gram е просто група последователни токени: три токена са три-грам, два са дву-грам.

Идеята е позната от Per-Layer Embedding на екипа зад Google Gemma, но вместо embedding-и DeepSeek ползва хешове и огромни справочни таблици (lookup tables). Моделът не изчислява всичко наново — той бързо „отваря страницата“ с релевантния вектор и я подава на конвейера за извод.

Разликата в цената на достъпа е същината. Съвременните модели са авторегресивни при декодиране: за всеки генериран токен целият набор активни тежести трябва да се прочете от паметта, а честотната лента е тясното място. N-gram тежестите не се четат цели — трябват им само няколко десетки справки в таблицата на токен.

Затова те не е задължително да стоят в GPU паметта. При FP8 моделът иска минимум 763 GB видеопамет; ако изнесете N-gram тежестите към системна RAM или достатъчно бърз масив за съхранение, слизате до около 567 GB. Това е минимумът за тежестите — в реална експлоатация към него се добавят KV кешовете, които растат с контекста и броя потребители.

Важно уточнение: N-gram параметрите не увеличават броя активни параметри. Те работят по-скоро като странно специфична енциклопедия, която моментално се отваря на нужното място.

Резултати и цени

В агентните и кодовите тестове моделът се движи наравно или пред водещите: 90,6 Pass@1 на Terminal-Bench 2.1, 74,2% решени задачи на DeepSWE v1.1, 88,1 на CyberGym и рейтинг 3471 в Codeforces. На чисто знаниеви тестове като MMLU-Pro (74,1) остава зад по-големите затворени модели. Контекстът е 1 милион токена, максималният изход — 384 000 токена, а моделът приема изображения нативно през вградения DeepSeek-ViT енкодер.

Цените в официалните бележки към API-то запазват схемата с върхови и извънвърхови тарифи: 0,15 щатски долара за милион входни токена и 0,60 долара за милион изходни извън пиковите часове (около 0,13 € и 0,52 €), двойно повече в пиковите прозорци през делничните дни. От 14 септември всички заявки към deepseek-v4-pro ще се обслужват от V4.1 Flash и ще се таксуват по неговата тарифа, докато не излезе V4.1 Pro.

curl https://api.deepseek.com/chat/completions \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -d '{"model": "deepseek-flash", "messages": [...]}'

Не е само DeepSeek

Подходът вече се разпространява. В края на август Alibaba показа експерименталния Qwen 3.8-Flash-Next — 180 милиарда параметъра, от които 51 милиарда N-gram тежести, по същата методика от януарската публикация на DeepSeek. Според Alibaba тази архитектура ще е основата на следващото поколение Qwen 4.

Контекстът около китайските лаборатории обаче остава напрегнат. Ден по-рано TechCrunch описа доклад на Anthropic за близо 200 милиона разговора, свързани с опити за дистилация от Alibaba, Moonshot AI и DeepSeek — само кампанията на Alibaba между май и юли 2026 г. е включвала 151 милиона обмена през 3500 акаунта, с пикове от около 3 милиона на ден. Обвиненията се наслагват върху съвместното изявление на NSA, CISA и ФБР за шест китайски AI фирми.

Заключение

Две неща си струва да запомните. Първо, връзката „повече параметри — повече интелигентност“ вече не означава задължително „повече видеопамет“: паметта и изчислението започват да се разделят. Второ, това се случва в отворен модел с MIT лиценз, докато конкурентите настъпват със затворени продукти за бизнеса.

Възел с осем GPU все още не е домашен хардуер и V4.1 Flash няма да тръгне на вашия компютър. Но посоката е ясна: ако N-gram таблиците могат да се изнасят към RAM и SSD, следващите поколения „слаби“ модели ще са значително по-достъпни за самостоятелно хостване.

Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.

Предпочитан източник в Google

Прочетете още