
Китайската Moonshot AI публикува на 27 юли 2026 г. пълните тегла на Kimi K3 в Hugging Face — единайсет дни след премиерата на самия модел. Заедно с теглата излезе и част от инфраструктурата, с която компанията го обслужва. Tom’s Hardware описа хода като „изстрел пред носа на OpenAI и Anthropic”: модел, който се представя почти като frontier системите, но струва 2–3 пъти по-малко да го въртите.
Уловката е в лиценза — и VentureBeat съветва фирмите да го прочетат, преди да празнуват.
Какво представлява K3
Kimi K3 е разреден Mixture-of-Experts модел с 2,8 трилиона общи параметъра, от които на всеки токен се активират само около 104 милиарда — 16 избрани от общо 896 експерта. Според източници на Bloomberg това е най-високото съотношение на разреденост, виждано досега в голям модел.
Архитектурата е нестандартна и в друго отношение: 93 слоя, от които 69 са Kimi Delta Attention, а 24 — Gated MLA. Контекстният прозорец е 1 048 576 токена, а моделът е мултимодален и има три нива на разсъждение — low, high и max.
Как се представя на бенчмарковете
В Artificial Analysis Intelligence Index K3 стои около 57 точки — плътно зад Claude Fable 5 (~60) и GPT-5.6 Sol (~59) и наравно с Opus 4.8. По конкретни задачи картината е шарена:
- GPQA Diamond: 93,5 — най-добрият резултат за модел с отворени тегла досега.
- BrowseComp: 91,2, DeepSWE: 67,5, MMMU-Pro: 81,6/83,4.
- Първо място във Frontend Code Arena, но изоставане при най-тежката математика.
The Decoder отбелязва и слабо място, което Moonshot не рекламира: независимите тестове показват, че кибер-възможностите на K3 чувствително изостават от тези на затворените frontier модели. Самата компания твърди, че K3 дава 2,5 пъти повече интелигентност на единица изчисление.
За сравнение — Claude Opus 5 на Anthropic излезе с обратната логика: същото ниво, но на половин цена по API, без никакви тегла за сваляне.
Защо е „2–3 пъти по-лесен” — и къде е границата
Ефективността идва от три неща едновременно: екстремната разреденост (плащате изчисление за 104 млрд., не за 2,8 трлн. параметъра), quantization-aware training директно в MXFP4 за теглата и MXFP8 за активациите, и оптимизираните ядра, които Moonshot пусна заедно с модела.
Резултатът е, че целият чекпойнт заема 96 шарда и около 1,56 TB — приблизително четвърт от това, което би искал FP16 запис.
„По-лесен” не значи „на лаптоп”. За пълния модел ви трябват над 1,4 TB агрегирана GPU памет плюс запас за KV-кеша — на практика клъстер от няколко възела с по осем 80-гигабайтови ускорителя. „Локално” тук означава инфраструктура, която контролирате, а не геймърски компютър.
Уловът в лиценза
Теглата излизат под Kimi K3 License — модифициран MIT. Свалянето, промяната и комерсиалното ползване са позволени, но има два прага:
- Ако вие или свързано с вас дружество въртите Model-as-a-Service бизнес с оборот над 20 млн. долара за 12 последователни месеца, трябва да сключите отделно споразумение с Moonshot, преди да ползвате модела комерсиално.
- Продукти с над 100 млн. месечни потребители или над 20 млн. долара месечен приход са длъжни да показват „Kimi K3” в интерфейса си.
Изключенията обаче са широки: чисто вътрешно ползване, което никога не се излага пред трети страни, и достъп през продуктите на Moonshot или сертифицирани партньори не попадат под ограниченията. За огромната част от корпоративните внедрявания това значи — нищо не се променя. Проблемът е за тези, които искат да препродават K3 като услуга.
Инфраструктура и LM Studio
Освен теглата Moonshot отвори високопроизводителни attention ядра, библиотека за MoE комуникация и инструменти за пускане на AI агенти в мащаб. В хранилището има готови рецепти за vLLM, SGLang и TokenSpeed.
За домашните потребители по-важната новина е друга: на същия ден LM Studio обяви поддръжка на K3 в агентната си среда Bionic за Mac и Windows, с американски сървъри и включено по подразбиране Zero Data Retention.
Снимка: LM Studio
Уточнението е важно: Kimi Delta Attention още не е в llama.cpp и Ollama, така че засега говорим за облачен достъп през LM Studio, не за напълно локален инференс на едно устройство.
Амодей срещу Хуанг
Пускането падна точно в средата на политическия спор. На 24 юли Дженсън Хуанг подписа писмо на 25 компании срещу прибързаните ограничения върху отворените тегла. На 27 юли Дарио Амодей отговори в TechCrunch, че Anthropic „никога не е настоявал за забрана на моделите с отворени тегла” и че безопасните такива са „обществено благо”.
Снимка: TechCrunch
Страхът му е геополитически, не технологичен: авторитарни правителства с по-добри модели и „трайно военно превъзходство”. Затова Амодей подкрепя ограниченията за чипове и мерките срещу дистилацията — но не и обща забрана.
Какво значи това за нас
За български разработчик или малка фирма сметката е проста. API цените на K3 са 3 долара за милион входни токена (0,30 при кеш) и 15 за изходни — около €2,65 и €13,15. Но теглата са безплатни, а с 1M контекст и агентни възможности моделът върши работата, за която иначе се плащат абонаменти на човек всеки месец.
Реалистичният сценарий не е да го въртите в мазето, а да наемете GPU по час при европейски доставчик, когато имате чувствителни данни, и да ползвате API-то за всичко останало. Точно това прави отворените тегла интересни — не че всеки може да ги пусне, а че никой не може да ви ги отнеме.
Източници: Tom’s Hardware, VentureBeat, The Decoder, TechCrunch, Hugging Face, LM Studio.
Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.
Предпочитан източник в Google