
Alibaba обяви на 3 август официалното пускане на Qwen3.8-Max — mixture-of-experts модел с 2,4 трилиона параметъра, от които около 95 милиарда се активират при всяка заявка. Моделът вече работи през QwenCloud, а теглата му ще бъдат публикувани в Hugging Face и ModelScope следващата седмица. Заедно с него излиза и по-малък отворен чекпойнт, Qwen3.8-27B.
С това Alibaba се връща към отварянето на теглата на върховите си модели, след като няколко скорошни флагмана останаха затворени — и точно затова ходът се чете като директно предизвикателство към американските AI лидери.
Какво представлява моделът
Qwen3.8-Max приема текст, изображения и видео на вход и връща текст. Контекстният прозорец е 1 милион токена — до 991 хиляди на вход, до 131 хиляди на изход и до 262 хиляди за разсъждение. Това е първият мултимодален модел на екипа над един трилион параметъра.
API-то говори както формата на OpenAI Chat Completions, така и протокола на Anthropic. На практика можете да пренасочите съществуващ код към Qwen с подмяна на базовия URL, без да пренаписвате логиката:
export OPENAI_BASE_URL="https://api.qwencloud.com/v1"
export OPENAI_API_KEY="..."
Цените са обявени в долари: 2 US$ за милион токена на вход и 6 US$ на изход (приблизително €1,74 и €5,21). Четенето от неявен кеш пада до 0,25 US$ за милион токена — числа, които са в пъти под тарифите на затворените западни модели от същия клас.
Числата от бенчмарковете
Alibaba публикува собствени резултати, а не независими измервания — струва си да го имате предвид. По вътрешния индекс на компанията средният сбор по над десет теста се вдига от 0,474 при предишното поколение до 0,725.
Отделните резултати, които компанията изнася:
- PaperBench — 93 точки, най-високият в сравнението
- GPQA Diamond — 92,6
- OSWorld-Verified — 86,1
- Terminal-Bench 2.1 — 86,6, срещу 88,8 за GPT-5.6 Sol
Тоест по агентните задачи в терминал моделът все още изостава, но разликата е малко над два пункта. Самата Alibaba твърди, че Qwen3.8-Max е „втори само след Fable 5“ сред достъпните днес модели.
Снимка: Qwen / the-decoder
Залогът е на дългите задачи
Най-интересната част от представянето не са бенчмарковете, а демонстрациите с дълъг хоризонт, описани от the-decoder.
Моделът е строил 16 дни командния инструмент oh-my-cli без нито една човешка намеса. В друг тест е възпроизвел и шестте основни резултата на научна публикация, след което е тествал 18 свои идеи в четири кръга и е надминал метода от статията с 2,7 точки на математическия бенчмарк AIME24.
Има и симулация на електронна търговия: моделът стартира със 100 000 юана капитал (около €12 000) и управлява няколко онлайн магазина паралелно цяла година. Финалният резултат е 416 252 юана — четирикратен ръст и с 38% по-добре от GLM 5.2.
При задача по дизайн на чип моделът свежда броя на логическите елементи от 8298 до 678 за около 500 итерации, а после постига 81% намаление на физическата площ.
Тези сценарии описват точно посоката, в която върви цялата индустрия — модели, които работят часове и дни без надзор, вместо да отговарят на един въпрос. Същия акцент видяхме и при Claude Opus 5, и при Astra на OpenAI.
Контекстът: надпревара между китайските лаборатории
Qwen3.8-Max беше показан за пръв път на 19 юли на Световната AI конференция в Шанхай, а достъпът до прегледната версия вървеше през абонамента Token Plan и през Qoder на 10% от стандартната цена.
Датата не е случайна. Два дни по-рано, на 17 юли, Moonshot AI пусна Kimi K3 — модел с 2,8 трилиона параметъра и отворени тегла. Moonshot достигна 300 милиона долара годишен повтарящ се приход до юни и се готви за борсов дебют в рамките на шест месеца. Независимите тестове обаче показаха, че Kimi K3 се движи близо до водещите западни модели по общ индекс, но изостава драстично при киберзадачите.
Какво още липсва
Alibaba все още не е публикувала лиценз, model card, пълна таблица с бенчмаркове или точна дата за качването на теглата. Именно лицензът ще определи дали „отворени тегла“ означава реално търговско ползване, или ограничения като при част от предишните китайски модели.
Докато теглата не излязат и независими лаборатории не ги измерят, всички числа тук остават твърдения на производителя. Ако обаче Alibaba удържи обещанието си следващата седмица, за пръв път модел от този клас ще може да се пусне на собствен хардуер — а това променя сметките на всеки, който досега плащаше на токен.
Новините на Overclock — директно в Telegram, без алгоритми.
Следвайте ни в Telegram