
DeepSeek пусна на 10 септември DeepSeek V4.1 Flash — модел с 763 милиарда параметъра, който въпреки размера си изисква по-малко ресурси от версията, която заменя. Тежестите са на Hugging Face под MIT лиценз, а The Register определя това, което на хартия е междинна ревизия, като промяна, която задава шаблон за следващото поколение „слаби“ (lean) големи езикови модели.
Числото 763 милиарда е над 2,5 пъти повече от предишния V4 Flash и повече от V3 и R1, които направиха компанията известна в началото на 2025 г. Но при извод (inference) активни са само 8 милиарда параметъра при обработка на промпта и 16 милиарда при генериране.
Две промени, които свиват сметката
Първата е в key-value кеша — паметта, в която моделът пази състоянието на разговора. Новата причинно-следствена encoder-decoder архитектура (CED) и преработените механизми за внимание свалят KV кеша до между 13% и 25% от изискванията на V4 Flash. На практика един и същ сървър обслужва четири до осем пъти повече едновременни потребители.
По данни от картата на модела това означава около 890 байта на токен — приблизително четири пъти по-малко от V4 Flash и 437 пъти по-малко от първия DeepSeek. Част от ефекта идва от FP4 кеширане във формат E2M1 със скалиращ коефициент на всеки 16 канала.
Снимка: DeepSeek-AI / Hugging Face
Какво са N-gram параметрите
Втората промяна е по-интересна. От общите 763 милиарда параметъра 196 милиарда са N-gram параметри — модул за условна памет, който DeepSeek нарича Engram. N-gram е просто група последователни токени: три токена са три-грам, два са дву-грам.
Идеята е позната от Per-Layer Embedding на екипа зад Google Gemma, но вместо embedding-и DeepSeek ползва хешове и огромни справочни таблици (lookup tables). Моделът не изчислява всичко наново — той бързо „отваря страницата“ с релевантния вектор и я подава на конвейера за извод.
Разликата в цената на достъпа е същината. Съвременните модели са авторегресивни при декодиране: за всеки генериран токен целият набор активни тежести трябва да се прочете от паметта, а честотната лента е тясното място. N-gram тежестите не се четат цели — трябват им само няколко десетки справки в таблицата на токен.
Затова те не е задължително да стоят в GPU паметта. При FP8 моделът иска минимум 763 GB видеопамет; ако изнесете N-gram тежестите към системна RAM или достатъчно бърз масив за съхранение, слизате до около 567 GB. Това е минимумът за тежестите — в реална експлоатация към него се добавят KV кешовете, които растат с контекста и броя потребители.
Важно уточнение: N-gram параметрите не увеличават броя активни параметри. Те работят по-скоро като странно специфична енциклопедия, която моментално се отваря на нужното място.
Резултати и цени
В агентните и кодовите тестове моделът се движи наравно или пред водещите: 90,6 Pass@1 на Terminal-Bench 2.1, 74,2% решени задачи на DeepSWE v1.1, 88,1 на CyberGym и рейтинг 3471 в Codeforces. На чисто знаниеви тестове като MMLU-Pro (74,1) остава зад по-големите затворени модели. Контекстът е 1 милион токена, максималният изход — 384 000 токена, а моделът приема изображения нативно през вградения DeepSeek-ViT енкодер.
Цените в официалните бележки към API-то запазват схемата с върхови и извънвърхови тарифи: 0,15 щатски долара за милион входни токена и 0,60 долара за милион изходни извън пиковите часове (около 0,13 € и 0,52 €), двойно повече в пиковите прозорци през делничните дни. От 14 септември всички заявки към deepseek-v4-pro ще се обслужват от V4.1 Flash и ще се таксуват по неговата тарифа, докато не излезе V4.1 Pro.
curl https://api.deepseek.com/chat/completions \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{"model": "deepseek-flash", "messages": [...]}'
Не е само DeepSeek
Подходът вече се разпространява. В края на август Alibaba показа експерименталния Qwen 3.8-Flash-Next — 180 милиарда параметъра, от които 51 милиарда N-gram тежести, по същата методика от януарската публикация на DeepSeek. Според Alibaba тази архитектура ще е основата на следващото поколение Qwen 4.
Контекстът около китайските лаборатории обаче остава напрегнат. Ден по-рано TechCrunch описа доклад на Anthropic за близо 200 милиона разговора, свързани с опити за дистилация от Alibaba, Moonshot AI и DeepSeek — само кампанията на Alibaba между май и юли 2026 г. е включвала 151 милиона обмена през 3500 акаунта, с пикове от около 3 милиона на ден. Обвиненията се наслагват върху съвместното изявление на NSA, CISA и ФБР за шест китайски AI фирми.
Заключение
Две неща си струва да запомните. Първо, връзката „повече параметри — повече интелигентност“ вече не означава задължително „повече видеопамет“: паметта и изчислението започват да се разделят. Второ, това се случва в отворен модел с MIT лиценз, докато конкурентите настъпват със затворени продукти за бизнеса.
Възел с осем GPU все още не е домашен хардуер и V4.1 Flash няма да тръгне на вашия компютър. Но посоката е ясна: ако N-gram таблиците могат да се изнасят към RAM и SSD, следващите поколения „слаби“ модели ще са значително по-достъпни за самостоятелно хостване.
Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.
Предпочитан източник в Google