Streszczenie AI
Muse Glimmer to otwarty, 30‑biliardowy model językowy Meta, wyposażony w gęsty dekoderowy transformer z enkoderem obrazu ViT‑G/14 oraz 52 warstwy transformera i mechanizmem grouped‑query attention, który pozwala obsługiwać kontekst do 131 072 tokenów przy około 16 GB pamięci dzięki 4‑bitowej kwantyzacji i spekulatywnemu dekodowaniu DFlash. Model, który uruchamia się na pojedynczej karcie GPU czy nowoczesnym Macu, potrafi prowadzić wieloetapowe racjonalizacje, wywoływać funkcje i narzędzia, rozumieć obrazy oraz obsługiwać ponad 100 języków, a licencja Apache 2.0 umożliwia zarówno rozwój, jak i komercyjne zastosowania. Dzięki temu Muse Glimmer staje się praktycznym eleganckim rozwiązaniem dla lokalnych agentów, włączając programistów, asystentów, analizatorów dokumentów i ekspertów ds. bezpieczeństwa.
- Architektura: gęsty transformer z enkoderem percepcyjnym
- Proces trenowania: destylacja zachowań agentowych
- Kluczowe możliwości agentowe
- Optymalizacja pod lokalne uruchomienie
- Benchmarki: jak Muse Glimmer wypada na tle konkurentów
- Ekosystem narzędzi i runtime’ów
- Praktyczne zastosowania dla deweloperów i zespołów
- Źródła
Muse Glimmer to 30-miliardowy model językowy opracowany przez Meta Superintelligence Labs, którego wagi udostępniono w formie open weights na licencji Apache 2.0. Został zaprojektowany specjalnie z myślą o zawsze włączonych, lokalnych agentach uruchamianych na pojedynczej karcie GPU lub nowoczesnym Macu, bez konieczności stałego połączenia z chmurą.
Architektura: gęsty transformer z enkoderem percepcyjnym
Muse Glimmer jest gęstym, dekoderowym modelem typu causal transformer z dedykowanym enkoderem percepcyjnym dla obrazu; łącznie ma około 29,6 miliarda parametrów, z czego ok. 1,8 miliarda przypada na wieżę wizualną ViT-G/14. Sam rdzeń tekstowy to 52 warstwy transformera z wymiarem ukrytym rzędu 6656 i mechanizmem grouped-query attention (32 głowy zapytania, 2 głowy key-value), co pozwala ograniczyć koszt pamięci przy długim kontekście. Zastosowano powtarzający się wzorzec uwagi lokalnej i globalnej z oknem 2048 tokenów dla warstw lokalnych, co utrzymuje zapotrzebowanie na pamięć KV cache w ryzach.
Model obsługuje kontekst rzędu 131\,072 tokenów (domyślnie ok. 128k), co odpowiada kilku setkom stron tekstu w pojedynczym zapytaniu. Słownik liczy ponad 200\,000 tokenów, w tym dodatkowe tokeny specjalne, co ułatwia obsługę wielu języków i różnych formatów danych. Wiedza została odcięta na początku stycznia 2026 roku, co jest istotne przy budowaniu agentów korzystających z aktualnych danych z zewnętrznych narzędzi.
| Parametr | Wartość |
|---|---|
| Typ modelu | Gęsty dekoderowy causal transformer z enkoderem obrazu. |
| Łączna liczba parametrów | \sim 29{,}6\text{B} (w tym ok. 1{,}8\text{B} dla ViT-G/14). |
| Liczba warstw tekstowych | 52 warstwy transformera. |
| Mechanizm uwagi | Grouped-query attention 32Q/2KV, wzorzec lokalny/globalny. |
| Okno kontekstu | Domyślnie 131\,072 tokenów (\approx 128\text{k}). |
| Modalność | Wejście: tekst + obraz; wyjście: tekst. |
| Licencja | Apache 2.0 – open weights z możliwością komercyjnego użycia. |
| Cięcie wiedzy | Styczeń 2026. |
Proces trenowania: destylacja zachowań agentowych
Muse Glimmer powstał jako model destylowany z większego, chmurowego modelu Muse Spark, co pozwala przenieść zachowania agentowe nauczyciela do mniejszej architektury. W fazie pre-trainingu użyto destylacji logitów na danych generowanych przez Muse Spark, z mieszanką danych podobną do tej stosowanej dla modelu nauczyciela. Następnie model był trenowany na dłuższych kontekstach z większym udziałem zadań agentowych, w tym śladów wieloetapowego rozumowania i pracy w scaffoldach narzędziowych, uzupełnionych „organicznymi” danymi tekstowymi.
W fazie post-trainingu połączono klasyczne supervised fine-tuning z on-policy distillation oraz reinforcement learning, obejmując domeny ogólne, zadania kodowe, rozumowanie i użycie narzędzi. Takie trzyetapowe podejście ma na celu nie tylko podniesienie jakości odpowiedzi, ale też wzmocnienie stabilności zachowania agenta: utrzymanie planu w czasie, poprawne wywoływanie narzędzi i rozsądne reagowanie na błędy.
Kluczowe możliwości agentowe
Model jest trenowany i oceniany pod kątem pełnych zadań agentowych, w których musi samodzielnie realizować wieloetapowe cele użytkownika, a nie tylko odpowiadać na pojedyncze pytanie. Na benchmarkach takich jak DeepSearch QA, MCP-Atlas, \tau-Bench czy SWE-Bench Muse Glimmer ma za zadanie pracować w istniejących scaffoldach, pisać i poprawiać kod oraz prowadzić wieloturowe sesje aż do uzyskania poprawnego wyniku.
- Wieloetapowe rozumowanie: model potrafi tworzyć i utrzymywać plany obejmujące wiele kroków, co jest kluczowe przy długich workflow agentowych.
- Wywoływanie narzędzi: obsługuje szeroką gamę wywołań funkcji z precyzyjnymi schematami, takimi jak API, funkcje systemowe czy wywołania kodu.
- Odzyskiwanie po błędach: w przypadku błędnej odpowiedzi narzędzia lub nieoczekiwanego wyniku model diagnozuje problem i próbuje ponownie, zamiast „zawieszać” cały proces.
- Multimodalne wejście: dzięki enkoderowi percepcyjnemu potrafi interpretować obrazy – np. zrzuty ekranu, wykresy czy dokumenty – w połączeniu z tekstem.
- Kontrolowalny poziom wysiłku: udostępnia tryby o różnej „mocy” rozumowania (np. low/medium/high/xhigh), co pozwala dobrać kompromis między szybkością a jakością.
- Wielojęzyczność: jest trenowany na danych w ponad 100 językach, co umożliwia budowę agentów globalnych lub lokalnie dopasowanych, np. do języka polskiego.
- Zgodność ze scaffoldami: wspiera popularne wzorce orkiestracji agentów, takie jak OpenClaw czy Hermes Agent, co ułatwia integrację z istniejącą infrastrukturą.
Optymalizacja pod lokalne uruchomienie
W pełnej precyzji 30-miliardowy model wymagałby ponad 55\text{ GB} pamięci, co przekracza możliwości większości konsumenckich kart graficznych. W Muse Glimmer zastosowano 4-bitową kwantyzację (np. K-Quant/Dynamic), która ściska wagi do wariantów około 17\text{–}20\text{ GB}, pozostawiając przestrzeń na KV cache, enkoder percepcyjny i dodatkowy model „draftera”. W praktyce oznacza to możliwość uruchomienia modelu na pojedynczej karcie z 24\text{ GB} lub 32\text{ GB} VRAM.
Drugim kluczowym elementem jest spekulatywne dekodowanie z wykorzystaniem lekkiego modelu DFlash, który proponuje całe bloki tokenów, a nie pojedyncze tokeny. Główny model weryfikuje te propozycje równolegle, akceptując poprawne tokeny i korygując błędne, co przy zachowaniu tej samej jakości generacji pozwala przyspieszyć dekodowanie ponad trzykrotnie (3{,}1\times) na kartach takich jak RTX 5090. Producent udostępnia także kwantyzowane wersje draftera, aby jego obecność nie zwiększała znacząco wymagań pamięciowych.
Według danych z testów, połączenie 4-bitowej kwantyzacji i DFlash pozwala osiągnąć prędkości wystarczające do płynnej konwersacji i interakcji agentowej w czasie rzeczywistym na jednej nowoczesnej karcie GPU lub nowym Macu, przy minimalnej degradacji jakości względem wariantu pełnej precyzji.
Benchmarki: jak Muse Glimmer wypada na tle konkurentów
Model został oceniony w ramach Meta Advanced AI Scaling Framework na szeregu benchmarków pokrywających zadania agentowe, kodowanie, rozumowanie matematyczne, multimodalność oraz bezpieczeństwo. W swojej klasie wielkości Muse Glimmer wypada szczególnie dobrze na testach narzędziowych i długiego kontekstu, często wyprzedzając modele Gemma4-31B i Qwen3.6-27B.
| Kategoria | Benchmark | Wynik Muse Glimmer | Gemma4-31B | Qwen3.6-27B |
|---|---|---|---|---|
| Agentowe (ogólne) | MCP Atlas | 75{,}5 | 54{,}2 | 62{,}5 |
| Agentowe (wyszukiwanie) | DeepSearch QA | 74{,}6 | 61{,}7 | 71{,}1 |
| Kodowanie | SWE-Bench Verified | \sim 76{,}0 | – | – |
| Matematyka | AIME 2026 | 94{,}7 | – | – |
W praktyce oznacza to, że w scenariuszach typu „agent kodujący”, „agent wyszukujący” czy „agent narzędziowy” Muse Glimmer w swoim rozmiarze oferuje poziom jakości, który dotychczas kojarzył się raczej z większymi modelami chmurowymi. Na innych testach, takich jak OSWorld-Verified czy TerminalBench, zdarzają się przypadki, w których konkurencyjne modele wypadają lepiej, co pokazuje, że wyższy wynik na jednym benchmarku nie przekłada się automatycznie na dominację we wszystkich zastosowaniach.
Ekosystem narzędzi i runtime’ów
Udostępnione wagi Muse Glimmer znajdują się w kolekcji meta-models na Hugging Face, w kilku wariantach: pełne wagi BF16, kwantyzacje GGUF (K-Quant), wersje ExecuTorch oraz osobny pakiet dla draftera DFlash. Równolegle przygotowano integracje z popularnymi środowiskami uruchomieniowymi: llama.cpp, MLX (dla Apple Silicon), vLLM, SGLang oraz platformami inferencyjnymi, takimi jak Together AI, Fireworks AI czy OpenRouter, dla zespołów preferujących model hostowany.
Ollama udostępnia Muse Glimmer jako gotowy model do uruchomienia lokalnego, m.in. w wariancie zoptymalizowanym dla MLX, co upraszcza budowę lokalnych agentów kodujących czy osobistych asystentów. Producent współpracuje też z dostawcami sprzętu – AMD, Arm, Dell, Intel, Nvidia – aby dopasować optymalizacje pod różne konfiguracje, od stacji roboczych po edge GPU.
Praktyczne zastosowania dla deweloperów i zespołów
Muse Glimmer celuje w use case’y, w których agent musi być stale dostępny, mieć szeroki i długi kontekst o użytkowniku, a jednocześnie działać lokalnie ze względów na prywatność lub koszty. Poniżej kilka typowych scenariuszy, które da się zbudować w oparciu o ten model bez konieczności sięgania po chmurowe API.
- Agent do kodu lokalnego: asystent programisty, który czyta repozytorium, modyfikuje pliki, uruchamia testy, korzysta z lokalnych narzędzi (git, linters, CI) i nie wynosi kodu poza maszynę.
- Osobisty agent produktywności: model zarządzający kalendarzem, wiadomościami, dokumentami i plikami użytkownika, korzystający z funkcji systemowych i lokalnych baz danych.
- LLM-as-a-judge: lokalny „sędzia” oceniający odpowiedzi innych modeli, recenzujący outputy generatywne lub wyniki pipeline’ów ETL, przy zachowaniu pełnej kontroli nad danymi.
- Agent do analizy dokumentów i ekranów: system, który łączy wejście tekstowe i obrazowe, potrafi przeglądać zrzuty ekranu, wykresy i PDF-y wraz z rozmową i narzędziami analitycznymi.
- Asystent badań i eksploracji danych: lokalny agent łączący się z narzędziami typu wyszukiwarka, API benchmarków czy wewnętrzne bazy, który przygotowuje raporty, zestawienia i rekomendacje.
Wspólnym mianownikiem tych zastosowań jest dążenie do przeniesienia kompetencji dużych modeli agentowych z chmury na pojedyncze urządzenie – przy zachowaniu wysokiej jakości w zadaniach narzędziowych, rozsądnych wymagań sprzętowych i otwartej licencji, która nie ogranicza eksperymentów ani wdrożeń komercyjnych.
W praktyce Muse Glimmer pokazuje, że dziś można uruchomić na biurku model z zachowaniem agentowego zachowania dużych systemów chmurowych, bez oddawania kontroli nad danymi zewnętrznemu dostawcy.
Źródła
- Introducing Muse Glimmer: An Open Agentic Model That Runs on Your Device
- What Is Muse Glimmer? Meta’s Open Agentic Model That Runs on One GPU
- Muse Glimmer: Benchmarks, Pricing & Context Window
- Meta is back with Muse Glimmer: local, agentic, multimodal, and open source!
- Muse Glimmer – Ollama model card
- Meta Open Sources Muse Glimmer: A 30B Agentic AI Model




