
На 31 юли DeepSeek пусна официалната версия на своя малък модел — DeepSeek-V4-Flash-0731 — и той се оказа изненадващо близо до върха. По индекса за интелигентност на Artificial Analysis новият Flash взима 50 точки, само една под GPT-5.6 Luna на OpenAI, но струва около 60% по-малко на изпълнена задача. Теглата са публикувани в Hugging Face под MIT лиценз.
Какво точно се промени
Архитектурата не е нова. Разредената MoE конструкция с 284 млрд. параметъра общо и 13 млрд. активни тръгна още през април с preview версията. Скокът идва от ново post-training — DeepSeek на практика е претренирала същия модел с акцент върху агентните сценарии.
Резултатът е показателен: по индекса на Artificial Analysis Flash се качва от 40 на 50 точки, а по GDPval — от 1189 на 1559 Elo, пише The Decoder. Според същия анализ моделът използва 12% по-малко токени за същата работа и халюцинира по-рядко от предшественика си.
Картата на модела в Hugging Face изброява собствените измервания на компанията:
| Бенчмарк | V4 Flash 0731 |
|---|---|
| Terminal Bench 2.1 | 82,7 |
| Cybergym | 76,7 |
| DSBench-FullStack | 68,7 |
| DSBench-Hard | 59,6 |
| DeepSWE | 54,4 |
| NL2Repo | 54,2 |
Тук е мястото за уговорката: това са числа на производителя, измерени с негов harness. Особено драматичният скок при DeepSWE — от 7,3 на 54,4 — все още няма независимо потвърждение. Terminal Bench 2.1 при 82,7 надминава дори по-голямия V4-Pro-Preview, което само по себе си е достатъчно необичайно, за да изчакате външни проверки.
Цената е истинската новина
През API на DeepSeek Flash струва 0,14 щ.д. за милион входни токена и 0,28 щ.д. за милион изходни (около €0,12 и €0,24) — без промяна спрямо preview версията. При попадение в кеша входът пада до 0,0028 щ.д. за милион, тоест 98% отстъпка там, където индустриалният стандарт е 90%.
За сравнение: OpenAI сряза цената на GPT-5.6 Luna с 80% само ден по-рано, на 30 юли, и тя стигна 0,20 щ.д. вход и 1,20 щ.д. изход за милион токена — ход, който VentureBeat описва като начало на ценова война. Входът е сравним, но при изхода разликата е над четирикратна — а именно изходните токени доминират сметката при разсъждаващи модели. Оттам идва и оценката за 60% по-ниска цена на задача.
Дребен, но важен детайл от документацията: DeepSeek предупреждава, че скоро въвежда тарифа в пиковите часове, при която цените се удвояват между 9:00–12:00 и 14:00–18:00 пекинско време.
Как се ползва
Моделът поддържа 1 млн. токена контекст и до 384K изходни токена. Има три нива на усилие при разсъждаване — low, high и max, задавани чрез параметъра reasoning_effort:
client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "..."}],
reasoning_effort="high",
)
Името на модела в API остава deepseek-v4-flash — старите интеграции автоматично минават на новата версия. Саймън Уилисън тества модела през OpenRouter и го описва като „най-добрата стойност за интелигентност в момента”, отбелязвайки, че бие MiniMax M3 — модел с 428 млрд. параметъра. Файловете в Hugging Face тежат 167 GB, така че локалното пускане остава занимание за сериозен хардуер.
Ако вече ползвате Flash в production, проверете дали кешът ви работи. При 98% отстъпка правилно структурираният prompt (статичната част най-отпред) променя сметката с порядък.
Контекст
Тази новина се вписва в тенденция, която върви от началото на годината: конкуренцията между лабораториите вече не е за най-високия резултат, а за цената на единица интелигентност. Два дни, два хода — OpenAI реже цените с 80%, DeepSeek отговаря с отворени тегла на един пункт разстояние.
За разработчиците това е добра новина, а MIT лицензът означава, че моделът може да се пусне и на собствена инфраструктура. За компаниите, които залагат на агенти с достъп до реални системи, важи обичайното предупреждение — моделите вече правят неща в реални организации, а Cybergym резултат от 76,7 е нож с две остриета.
Ще следим за независимите измервания. Ако числата на DeepSeek се потвърдят от Artificial Analysis и от практиката, августовият ценоразпис на конкурентите ще изглежда доста неудобно.
Новините на Overclock — директно в Telegram, без алгоритми.
Следвайте ни в Telegram