AI

Редакция Overclock.bg ·

Kimi K3 с отворени тегла — и с уловка в лиценза

Kimi K3 с отворени тегла — и с уловка в лиценза

Китайската Moonshot AI публикува на 27 юли 2026 г. пълните тегла на Kimi K3 в Hugging Face — единайсет дни след премиерата на самия модел. Заедно с теглата излезе и част от инфраструктурата, с която компанията го обслужва. Tom’s Hardware описа хода като „изстрел пред носа на OpenAI и Anthropic”: модел, който се представя почти като frontier системите, но струва 2–3 пъти по-малко да го въртите.

Уловката е в лиценза — и VentureBeat съветва фирмите да го прочетат, преди да празнуват.

Какво представлява K3

Kimi K3 е разреден Mixture-of-Experts модел с 2,8 трилиона общи параметъра, от които на всеки токен се активират само около 104 милиарда — 16 избрани от общо 896 експерта. Според източници на Bloomberg това е най-високото съотношение на разреденост, виждано досега в голям модел.

Архитектурата е нестандартна и в друго отношение: 93 слоя, от които 69 са Kimi Delta Attention, а 24 — Gated MLA. Контекстният прозорец е 1 048 576 токена, а моделът е мултимодален и има три нива на разсъждение — low, high и max.

Как се представя на бенчмарковете

В Artificial Analysis Intelligence Index K3 стои около 57 точки — плътно зад Claude Fable 5 (~60) и GPT-5.6 Sol (~59) и наравно с Opus 4.8. По конкретни задачи картината е шарена:

  • GPQA Diamond: 93,5 — най-добрият резултат за модел с отворени тегла досега.
  • BrowseComp: 91,2, DeepSWE: 67,5, MMMU-Pro: 81,6/83,4.
  • Първо място във Frontend Code Arena, но изоставане при най-тежката математика.

The Decoder отбелязва и слабо място, което Moonshot не рекламира: независимите тестове показват, че кибер-възможностите на K3 чувствително изостават от тези на затворените frontier модели. Самата компания твърди, че K3 дава 2,5 пъти повече интелигентност на единица изчисление.

За сравнение — Claude Opus 5 на Anthropic излезе с обратната логика: същото ниво, но на половин цена по API, без никакви тегла за сваляне.

Защо е „2–3 пъти по-лесен” — и къде е границата

Ефективността идва от три неща едновременно: екстремната разреденост (плащате изчисление за 104 млрд., не за 2,8 трлн. параметъра), quantization-aware training директно в MXFP4 за теглата и MXFP8 за активациите, и оптимизираните ядра, които Moonshot пусна заедно с модела.

Резултатът е, че целият чекпойнт заема 96 шарда и около 1,56 TB — приблизително четвърт от това, което би искал FP16 запис.

Внимание

„По-лесен” не значи „на лаптоп”. За пълния модел ви трябват над 1,4 TB агрегирана GPU памет плюс запас за KV-кеша — на практика клъстер от няколко възела с по осем 80-гигабайтови ускорителя. „Локално” тук означава инфраструктура, която контролирате, а не геймърски компютър.

Уловът в лиценза

Теглата излизат под Kimi K3 License — модифициран MIT. Свалянето, промяната и комерсиалното ползване са позволени, но има два прага:

  • Ако вие или свързано с вас дружество въртите Model-as-a-Service бизнес с оборот над 20 млн. долара за 12 последователни месеца, трябва да сключите отделно споразумение с Moonshot, преди да ползвате модела комерсиално.
  • Продукти с над 100 млн. месечни потребители или над 20 млн. долара месечен приход са длъжни да показват „Kimi K3” в интерфейса си.

Изключенията обаче са широки: чисто вътрешно ползване, което никога не се излага пред трети страни, и достъп през продуктите на Moonshot или сертифицирани партньори не попадат под ограниченията. За огромната част от корпоративните внедрявания това значи — нищо не се променя. Проблемът е за тези, които искат да препродават K3 като услуга.

Инфраструктура и LM Studio

Освен теглата Moonshot отвори високопроизводителни attention ядра, библиотека за MoE комуникация и инструменти за пускане на AI агенти в мащаб. В хранилището има готови рецепти за vLLM, SGLang и TokenSpeed.

За домашните потребители по-важната новина е друга: на същия ден LM Studio обяви поддръжка на K3 в агентната си среда Bionic за Mac и Windows, с американски сървъри и включено по подразбиране Zero Data Retention.

Kimi K3 в агентната среда LM Studio Bionic Снимка: LM Studio

Уточнението е важно: Kimi Delta Attention още не е в llama.cpp и Ollama, така че засега говорим за облачен достъп през LM Studio, не за напълно локален инференс на едно устройство.

Амодей срещу Хуанг

Пускането падна точно в средата на политическия спор. На 24 юли Дженсън Хуанг подписа писмо на 25 компании срещу прибързаните ограничения върху отворените тегла. На 27 юли Дарио Амодей отговори в TechCrunch, че Anthropic „никога не е настоявал за забрана на моделите с отворени тегла” и че безопасните такива са „обществено благо”.

Дарио Амодей, съосновател и изпълнителен директор на Anthropic Снимка: TechCrunch

Страхът му е геополитически, не технологичен: авторитарни правителства с по-добри модели и „трайно военно превъзходство”. Затова Амодей подкрепя ограниченията за чипове и мерките срещу дистилацията — но не и обща забрана.

Какво значи това за нас

За български разработчик или малка фирма сметката е проста. API цените на K3 са 3 долара за милион входни токена (0,30 при кеш) и 15 за изходни — около €2,65 и €13,15. Но теглата са безплатни, а с 1M контекст и агентни възможности моделът върши работата, за която иначе се плащат абонаменти на човек всеки месец.

Реалистичният сценарий не е да го въртите в мазето, а да наемете GPU по час при европейски доставчик, когато имате чувствителни данни, и да ползвате API-то за всичко останало. Точно това прави отворените тегла интересни — не че всеки може да ги пусне, а че никой не може да ви ги отнеме.

Източници: Tom’s Hardware, VentureBeat, The Decoder, TechCrunch, Hugging Face, LM Studio.

Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.

Предпочитан източник в Google

Прочетете още