AI

DeepSeek V4 Flash настига Luna при 60% по-ниска цена

DeepSeek V4 Flash настига Luna при 60% по-ниска цена

На 31 юли DeepSeek пусна официалната версия на своя малък модел — DeepSeek-V4-Flash-0731 — и той се оказа изненадващо близо до върха. По индекса за интелигентност на Artificial Analysis новият Flash взима 50 точки, само една под GPT-5.6 Luna на OpenAI, но струва около 60% по-малко на изпълнена задача. Теглата са публикувани в Hugging Face под MIT лиценз.

Какво точно се промени

Архитектурата не е нова. Разредената MoE конструкция с 284 млрд. параметъра общо и 13 млрд. активни тръгна още през април с preview версията. Скокът идва от ново post-training — DeepSeek на практика е претренирала същия модел с акцент върху агентните сценарии.

Резултатът е показателен: по индекса на Artificial Analysis Flash се качва от 40 на 50 точки, а по GDPval — от 1189 на 1559 Elo, пише The Decoder. Според същия анализ моделът използва 12% по-малко токени за същата работа и халюцинира по-рядко от предшественика си.

Картата на модела в Hugging Face изброява собствените измервания на компанията:

БенчмаркV4 Flash 0731
Terminal Bench 2.182,7
Cybergym76,7
DSBench-FullStack68,7
DSBench-Hard59,6
DeepSWE54,4
NL2Repo54,2

Тук е мястото за уговорката: това са числа на производителя, измерени с негов harness. Особено драматичният скок при DeepSWE — от 7,3 на 54,4 — все още няма независимо потвърждение. Terminal Bench 2.1 при 82,7 надминава дори по-голямия V4-Pro-Preview, което само по себе си е достатъчно необичайно, за да изчакате външни проверки.

Цената е истинската новина

През API на DeepSeek Flash струва 0,14 щ.д. за милион входни токена и 0,28 щ.д. за милион изходни (около €0,12 и €0,24) — без промяна спрямо preview версията. При попадение в кеша входът пада до 0,0028 щ.д. за милион, тоест 98% отстъпка там, където индустриалният стандарт е 90%.

За сравнение: OpenAI сряза цената на GPT-5.6 Luna с 80% само ден по-рано, на 30 юли, и тя стигна 0,20 щ.д. вход и 1,20 щ.д. изход за милион токена — ход, който VentureBeat описва като начало на ценова война. Входът е сравним, но при изхода разликата е над четирикратна — а именно изходните токени доминират сметката при разсъждаващи модели. Оттам идва и оценката за 60% по-ниска цена на задача.

Дребен, но важен детайл от документацията: DeepSeek предупреждава, че скоро въвежда тарифа в пиковите часове, при която цените се удвояват между 9:00–12:00 и 14:00–18:00 пекинско време.

Как се ползва

Моделът поддържа 1 млн. токена контекст и до 384K изходни токена. Има три нива на усилие при разсъждаване — low, high и max, задавани чрез параметъра reasoning_effort:

client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "..."}],
    reasoning_effort="high",
)

Името на модела в API остава deepseek-v4-flash — старите интеграции автоматично минават на новата версия. Саймън Уилисън тества модела през OpenRouter и го описва като „най-добрата стойност за интелигентност в момента”, отбелязвайки, че бие MiniMax M3 — модел с 428 млрд. параметъра. Файловете в Hugging Face тежат 167 GB, така че локалното пускане остава занимание за сериозен хардуер.

Съвет

Ако вече ползвате Flash в production, проверете дали кешът ви работи. При 98% отстъпка правилно структурираният prompt (статичната част най-отпред) променя сметката с порядък.

Контекст

Тази новина се вписва в тенденция, която върви от началото на годината: конкуренцията между лабораториите вече не е за най-високия резултат, а за цената на единица интелигентност. Два дни, два хода — OpenAI реже цените с 80%, DeepSeek отговаря с отворени тегла на един пункт разстояние.

За разработчиците това е добра новина, а MIT лицензът означава, че моделът може да се пусне и на собствена инфраструктура. За компаниите, които залагат на агенти с достъп до реални системи, важи обичайното предупреждение — моделите вече правят неща в реални организации, а Cybergym резултат от 76,7 е нож с две остриета.

Ще следим за независимите измервания. Ако числата на DeepSeek се потвърдят от Artificial Analysis и от практиката, августовият ценоразпис на конкурентите ще изглежда доста неудобно.

Новините на Overclock — директно в Telegram, без алгоритми.

Следвайте ни в Telegram

Прочетете още