
В понеделник, 10 август 2026 г., Meta Superintelligence Labs пусна Muse Glimmer — мултимодален модел с 30 милиарда параметъра, разпространяван под Apache 2.0. Тежестите вече са в Hugging Face, а моделът е проектиран така, че да работи локално на един настолен GPU или на Mac, без нито едно обръщение към облак.
Това е първият голям модел на Meta от години, който излиза с истински permissive лиценз вместо със собствения Llama Community License. Apache 2.0 означава, че можете да го ползвате комерсиално, да го променяте и да го разпространявате наново, без праг по брой потребители и без разрешение от Meta.
Какво представлява моделът
Muse Glimmer е dense модел (без mixture-of-experts), дестилиран от по-големия затворен Muse Spark. Общо е около 29,6 млрд. параметъра, от които приблизително 1,8 млрд. са в перцепционния енкодер ViT-G/14 — тоест моделът чете и изображения, не само текст.
Останалото са 52 слоя текстов декодер със скрита размерност 6656 и речник от 202 048 токена. Контекстният прозорец е 131 072 токена, а границата на знанието е 4 януари 2026 г. Обучението покрива над 100 езика.
Архитектурата е скроена за скорост на потребителски машини: три последователни слоя с плъзгащ прозорец от 2048 токена и rotary position embedding, следвани от четвърти слой с пълно внимание без позиционно кодиране. Отгоре има gated grouped-query attention с 32 query глави срещу 2 KV глави — съотношение 16:1, което свива KV-кеша драстично при дълги задачи.
Числата от бенчмарковете
Meta мери Glimmer срещу двата очевидни конкурента в този размер — Gemma 4 31B и Qwen 3.6 27B:
| Бенчмарк | Muse Glimmer 30B |
|---|---|
| MCP Atlas (агентни инструменти) | 75,5 |
| SWE-Bench Verified | 76,0 |
| SWE-Bench Pro | 51,2 |
| AIME 2026 | 94,7% |
| GPQA Diamond | 83,5% |
| Charxiv Reasoning (мултимодален) | 78,8 |
| DeepSearch QA | 74,6 |
Най-показателен е MCP Atlas: 75,5 срещу 54,2 за Gemma 4 31B и 62,5 за Qwen 3.6 27B, сочи техническият преглед на Hugging Face. Тестът мери точно това, за което е правен моделът — извикване на инструменти, планиране, проверка на резултата и възстановяване след грешка. Именно последната част обикновено проваля малките модели: агентът се обърква, повтаря същото извикване и зацикля. Ако сте чели за агента, който хакна фитнес зала в Мелбърн, знаете колко бързо ескалира един цикъл без надзор.
Колко желязо ви трябва
В нативна BF16 точност моделът иска около 60 GB VRAM — територия на RTX Pro 6000 или AMD MI350P, както отбелязва The Register. Квантуван до 4 бита обаче слиза до 16–20 GB и тръгва на RTX 3090, 4090 или Radeon RX 7900 XT/XTX. Има и 3-битови варианти под 16 GB, с очакваната загуба на точност.
Скоростта също е приемлива. С DFlash — лек блоково-дифузионен драфтер за speculative decoding — Meta отчита ускорение от 3,1 пъти: от 74,9 на 233,4 токена в секунда на RTX 5090. На MacBook Pro с M5 Max числата са 26,6 → 50,2 токена/сек, а на M4 Max — 23,7 → 37,8. На обикновен Windows лаптоп без сериозен GPU реалистичното е 6–14 токена в секунда, което върши работа за фонови задачи, но не и за разговор в реално време.
Как да го пуснете
Ollama вече предлага варианта muse-glimmer:30b-mlx — 21 GB, 128K контекст, засега само за Apple Silicon през MLX, с NVIDIA и AMD на път:
ollama run muse-glimmer:30b-mlx
За llama.cpp има готови GGUF квантувания (включително Q4_K_M) в отделно репо, а за сървърен сценарий vLLM поддържа tensor parallel разпределение върху 4 GPU-та. В списъка са още LM Studio, Unsloth, SGLang, ExecuTorch и MLX. Ако предпочитате API, моделът се хоства от Together AI, Fireworks AI и OpenRouter. По оптимизациите Meta е работила с AMD, Arm, Dell, Intel и NVIDIA.
Ако имате 24 GB VRAM, 4-битовият вариант е сладкото място. При 16 GB пробвайте 3-битовия, но не му възлагайте дълги агентни вериги — грешките се натрупват.
Защо Meta прави този завой
„Фундаменталните модели постигнаха забележителни възможности, но повечето внедрявания все още зависят от облачна инфраструктура и мрежов достъп”, пише Meta в съобщението за модела. Аргументът е прагматичен: агент, на който му трябват минути за отговор, разваля работния поток.
Контекстът обаче е и конкурентен. Meta изостана видимо в отворените модели след Llama 4, а китайските лаборатории запълниха вакуума — по данни, цитирани около обявяването, те държат 41% от свалянията в Hugging Face за последната година. Марк Зукърбърг придружи пускането с политическо послание към Вашингтон: САЩ да свалят регулаторните бариери пред отворения AI, иначе екосистемата ще се пише на китайски.
В същото видео той обеща, че тежестите на Muse Spark 1.2 — актуалният фундаментален модел на компанията — също ще бъдат отворени „скоро”, без конкретна дата, пише VentureBeat. Ходът идва в момент, в който дестилацията на големи модели до малки се превърна в стандартна практика; Google показа нещо подобно с DiffusionGemma само седмици по-рано.
Заключение
Muse Glimmer не е най-мощният модел на пазара и не претендира да бъде. Стойността му е в комбинацията: агентни резултати над Gemma 4 и Qwen 3.6 в този клас, 131K контекст, мултимодалност, поддръжка на 100+ езика — и всичко това под лиценз, който не ви задължава с нищо. За разработчиците, които искат агент да работи денонощно върху локални файлове без сметка за токени, това е най-сериозното предложение досега. Дали Meta ще удържи курса, ще проличи, когато (и ако) Muse Spark 1.2 наистина излезе с отворени тежести.
Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.
Предпочитан източник в Google