AI

Редакция Overclock.bg ·

Meta отвори Muse Glimmer — 30B агентен модел с Apache 2.0

Meta отвори Muse Glimmer — 30B агентен модел с Apache 2.0

В понеделник, 10 август 2026 г., Meta Superintelligence Labs пусна Muse Glimmer — мултимодален модел с 30 милиарда параметъра, разпространяван под Apache 2.0. Тежестите вече са в Hugging Face, а моделът е проектиран така, че да работи локално на един настолен GPU или на Mac, без нито едно обръщение към облак.

Това е първият голям модел на Meta от години, който излиза с истински permissive лиценз вместо със собствения Llama Community License. Apache 2.0 означава, че можете да го ползвате комерсиално, да го променяте и да го разпространявате наново, без праг по брой потребители и без разрешение от Meta.

Какво представлява моделът

Muse Glimmer е dense модел (без mixture-of-experts), дестилиран от по-големия затворен Muse Spark. Общо е около 29,6 млрд. параметъра, от които приблизително 1,8 млрд. са в перцепционния енкодер ViT-G/14 — тоест моделът чете и изображения, не само текст.

Останалото са 52 слоя текстов декодер със скрита размерност 6656 и речник от 202 048 токена. Контекстният прозорец е 131 072 токена, а границата на знанието е 4 януари 2026 г. Обучението покрива над 100 езика.

Архитектурата е скроена за скорост на потребителски машини: три последователни слоя с плъзгащ прозорец от 2048 токена и rotary position embedding, следвани от четвърти слой с пълно внимание без позиционно кодиране. Отгоре има gated grouped-query attention с 32 query глави срещу 2 KV глави — съотношение 16:1, което свива KV-кеша драстично при дълги задачи.

Числата от бенчмарковете

Meta мери Glimmer срещу двата очевидни конкурента в този размер — Gemma 4 31B и Qwen 3.6 27B:

БенчмаркMuse Glimmer 30B
MCP Atlas (агентни инструменти)75,5
SWE-Bench Verified76,0
SWE-Bench Pro51,2
AIME 202694,7%
GPQA Diamond83,5%
Charxiv Reasoning (мултимодален)78,8
DeepSearch QA74,6

Най-показателен е MCP Atlas: 75,5 срещу 54,2 за Gemma 4 31B и 62,5 за Qwen 3.6 27B, сочи техническият преглед на Hugging Face. Тестът мери точно това, за което е правен моделът — извикване на инструменти, планиране, проверка на резултата и възстановяване след грешка. Именно последната част обикновено проваля малките модели: агентът се обърква, повтаря същото извикване и зацикля. Ако сте чели за агента, който хакна фитнес зала в Мелбърн, знаете колко бързо ескалира един цикъл без надзор.

Колко желязо ви трябва

В нативна BF16 точност моделът иска около 60 GB VRAM — територия на RTX Pro 6000 или AMD MI350P, както отбелязва The Register. Квантуван до 4 бита обаче слиза до 16–20 GB и тръгва на RTX 3090, 4090 или Radeon RX 7900 XT/XTX. Има и 3-битови варианти под 16 GB, с очакваната загуба на точност.

Скоростта също е приемлива. С DFlash — лек блоково-дифузионен драфтер за speculative decoding — Meta отчита ускорение от 3,1 пъти: от 74,9 на 233,4 токена в секунда на RTX 5090. На MacBook Pro с M5 Max числата са 26,6 → 50,2 токена/сек, а на M4 Max — 23,7 → 37,8. На обикновен Windows лаптоп без сериозен GPU реалистичното е 6–14 токена в секунда, което върши работа за фонови задачи, но не и за разговор в реално време.

Как да го пуснете

Ollama вече предлага варианта muse-glimmer:30b-mlx — 21 GB, 128K контекст, засега само за Apple Silicon през MLX, с NVIDIA и AMD на път:

ollama run muse-glimmer:30b-mlx

За llama.cpp има готови GGUF квантувания (включително Q4_K_M) в отделно репо, а за сървърен сценарий vLLM поддържа tensor parallel разпределение върху 4 GPU-та. В списъка са още LM Studio, Unsloth, SGLang, ExecuTorch и MLX. Ако предпочитате API, моделът се хоства от Together AI, Fireworks AI и OpenRouter. По оптимизациите Meta е работила с AMD, Arm, Dell, Intel и NVIDIA.

Съвет

Ако имате 24 GB VRAM, 4-битовият вариант е сладкото място. При 16 GB пробвайте 3-битовия, но не му възлагайте дълги агентни вериги — грешките се натрупват.

Защо Meta прави този завой

„Фундаменталните модели постигнаха забележителни възможности, но повечето внедрявания все още зависят от облачна инфраструктура и мрежов достъп”, пише Meta в съобщението за модела. Аргументът е прагматичен: агент, на който му трябват минути за отговор, разваля работния поток.

Контекстът обаче е и конкурентен. Meta изостана видимо в отворените модели след Llama 4, а китайските лаборатории запълниха вакуума — по данни, цитирани около обявяването, те държат 41% от свалянията в Hugging Face за последната година. Марк Зукърбърг придружи пускането с политическо послание към Вашингтон: САЩ да свалят регулаторните бариери пред отворения AI, иначе екосистемата ще се пише на китайски.

В същото видео той обеща, че тежестите на Muse Spark 1.2 — актуалният фундаментален модел на компанията — също ще бъдат отворени „скоро”, без конкретна дата, пише VentureBeat. Ходът идва в момент, в който дестилацията на големи модели до малки се превърна в стандартна практика; Google показа нещо подобно с DiffusionGemma само седмици по-рано.

Заключение

Muse Glimmer не е най-мощният модел на пазара и не претендира да бъде. Стойността му е в комбинацията: агентни резултати над Gemma 4 и Qwen 3.6 в този клас, 131K контекст, мултимодалност, поддръжка на 100+ езика — и всичко това под лиценз, който не ви задължава с нищо. За разработчиците, които искат агент да работи денонощно върху локални файлове без сметка за токени, това е най-сериозното предложение досега. Дали Meta ще удържи курса, ще проличи, когато (и ако) Muse Spark 1.2 наистина излезе с отворени тежести.

Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.

Предпочитан източник в Google

Прочетете още