Lokalne AI – od czego zacząć?

Gubisz się w gąszczu pojęć? Sprawdź nasz kompletny przewodnik krok po kroku, dobierz sprzęt i uruchom sztuczną inteligencję na własnym komputerze. Zacznij tutaj!

NVIDIA Nemotron 3.5 Lightning 30B A3B NVFP4 – szybki model MoE dla agentów AI

zajawka nowosci
Streszczenie AI

NVIDIA Nemotron 3.5 Lightning 30B A3B NVFP4 to otwarty, hybrydowy Mixture‑of‑Experts z 30 mln parametrów (z czego 3 mln są aktywne podczas inferencji) i 1 mln‑tokenowym kontekstem, który dzięki kwantyzacji NVFP4 i obsłudze Mamba‑2 + Transformer MoE daje wydajność na pojedynczym GPU, nawet RTX 5090. Model wykorzystuje trzy techniki speculative decoding (DSpark, DFlash, MTP), pozwalające na nawet czterokrotne przyspieszenie generowania, a jego warstwy Multi‑Token Prediction oraz specyficzne treningi (pre‑training, SFT, RL) zapewniają dobre wyniki w benchmarkach MMLU, GPQA i SWE‑bench, przy minimalnym spadku jakości. Dzięki otwartym dziennikowi treningowym na Hugging Face i API kompatybilnym z OpenAI, model stanowi atrakcyjną opcję dla deweloperów budujących potężne, lokalne agenty AI i systemy RAG.

NVIDIA Nemotron 3.5 Lightning 30B A3B NVFP4 to otwarty model językowy typu Mixture-of-Experts (MoE), zaprojektowany z myślą o wysokowydajnych, długotrwałych agentach AI. Łączy architekturę hybrydową Mamba-2 + Transformer MoE z kwantyzacją NVFP4, co pozwala na efektywne wnioskowanie nawet na pojedynczym GPU.

Architektura i parametry techniczne

Model charakteryzuje się następującymi parametrami:

  • Łączna liczba parametrów: 30 miliardów, z czego tylko 3 miliardy są aktywne podczas inferencji (3B active parameters).
  • Architektura: hybrydowa MoE z warstwami Mamba-2, MoE oraz Attention.
  • Długość kontekstu: do 1 miliona tokenów.
  • Kwantyzacja: NVFP4 (Four Over Six) – wariant statycznej kalibracji MSE z wagami W4A16 dla ekspertów MoE oraz FP8 dla projekcji Mamba i cache KV.
  • Obsługiwane języki: angielski (w tym kod), hiszpański, francuski, niemiecki, włoski, japoński.

Taka konstrukcja pozwala na uruchomienie modelu na pojedynczym GPU typu DGX Spark (GB10), H100, a nawet RTX 5090, przy zachowaniu wysokiej przepustowości.

Metody przyspieszania generowania tekstu

Nemotron 3.5 Lightning wspiera trzy techniki speculative decoding, które znacząco przyspieszają generowanie:

  • DSpark: semi-autoregresyjny drafter proponujący blok tokenów w jednym forward pass – rekomendowany dla DGX Spark i niskokonkurencyjnych deploymentów w data center.
  • DFlash: lekki model dyfuzyjny generujący cały blok draftu w jednym kroku.
  • MTP (Multi-Token Prediction): warstwy przewidujące kilka przyszłych tokenów jednocześnie, co wzbogaca sygnał treningowy i przyspiesza inferencję.

W praktyce oznacza to, że model może osiągać nawet 4-krotnie wyższą szybkość generowania w porównaniu do modeli o podobnej wielkości.

Proces treningu

Model był trenowany w pięciu etapach:

  1. Pre-trening: ponad 20 bilionów tokenów z użyciem Megatron-LM, dane obejmują kod, matematykę, nauki ścisłe i wiedzę ogólną.
  2. Trening MTP: dalsze pre-treningowe dostrojenie warstw Multi-Token Prediction.
  3. Supervised Fine-Tuning (SFT): dane syntetyczne z kodu, matematyki, narzędzi, instrukcji i długiego kontekstu.
  4. Reinforcement Learning (RL): GRPO (Group Relative Policy Optimization) w środowiskach matematycznych, kodujących, narzędziowych i konwersacyjnych.
  5. Post-training Quantization (PTQ): kwantyzacja NVFP4 z użyciem NVIDIA Model Optimizer.

Dane treningowe są udostępnione publicznie na Hugging Face, co zwiększa transparentność i umożliwia reprodukcję wyników.

Wyniki benchmarków

Poniżej przedstawiono wybrane wyniki dla wersji NVFP4 w porównaniu do BF16:

ZadanieNVFP4BF16
MMLU Pro81.6281.94
GPQA Diamond (no tools)75.5775.44
SWE-bench Verified52.8051.56
Terminal-Bench 2.123.4624.58
IFBench (loose)72.8871.88

Wyniki pokazują, że kwantyzacja NVFP4 nie powoduje znaczącego spadku jakości, a w niektórych zadaniach (np. SWE-bench) nawet lekko poprawia rezultaty.

Praktyczne zastosowania

Model jest szczególnie przydatny w następujących scenariuszach:

  • Agenci AI: długotrwałe, autonomiczne agenty wykonujące specjalistyczne zadania (kodowanie, research, analiza dokumentów).
  • Systemy RAG: dzięki kontekstowi 1M tokenów model skutecznie przetwarza długie dokumenty i wieloetapowe zapytania.
  • Lokalna inferencja: możliwość uruchomienia na pojedynczym GPU (np. RTX 5090, H100) czyni go atrakcyjnym dla developerów pracujących on-premise.
  • Tool calling: wbudowane parsery (qwen3_coder, nemotron_v3) umożliwiają integrację z zewnętrznymi narzędziami i API.

Przykład deployu z vLLM

Poniżej przedstawiono przykładową komendę uruchamiającą model z vLLM na DGX Spark z użyciem DSpark speculative decoding:

Model obsługuje również API kompatybilne z OpenAI, co ułatwia integrację z istniejącymi aplikacjami.

Bash
vllm serve --model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 
 --moe-backend marlin 
 --kv-cache-dtype fp8 
 --enable-prefix-caching 
 --speculative_config.num_speculative_tokens 3 
 --mamba-backend flashinfer 
 --mamba-cache-mode align 
 --gpu-memory-utilization 0.91 
 --reasoning-parser nemotron_v3 
 --speculative_config.model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark 
 --tool-call-parser qwen3_coder 
 --enable-auto-tool-choice

Podsumowanie

Nemotron 3.5 Lightning 30B A3B NVFP4 to model, który łączy wysoką wydajność z otwartością. Dzięki architekturze MoE, kwantyzacji NVFP4 i wsparciu dla speculative decoding, jest idealnym wyborem dla developerów budujących zaawansowane agenty AI. Udostępnienie danych treningowych i receptur dodatkowo zwiększa jego wartość dla społeczności open source.

Dostępność modelu

Model jest już dostępny do przetestowania w ollamie:
ollama run nemotron-3.5-lightning

Źródła

🧠 Utrwal wiedzę z tego artykułu!

Kliknij pojęcie, by przypomnieć sobie definicję.

Mamba-2 (stateful recurrent architecture) (Mamba-2)
?
Mamba-2 to wydajna architektura modelowania sekwencji, będąca rozwinięciem modeli przestrzeni stanów (SSM). Działa w czasie liniowym, co pozwala na znacznie...
Czytaj pełną definicję
DSpark (semi‑autoregressive drafter for speculative decoding) (DSpark)
?
DSpark to zaawansowane rozwiązanie z zakresu dekodowania spekulatywnego, służące do przyspieszania wnioskowania w dużych modelach językowych (LLM). Wykorzystuje ono półautoregresyjną...
Czytaj pełną definicję
DFlash (lightweight diffusion model for block‑wise draft generation) (DFlash)
?
DFlash to metoda dekodowania spekulatywnego (speculative decoding), która wykorzystuje lekki model dyfuzji bloku (block diffusion model) do równoległego generowania sekwencji...
Czytaj pełną definicję
Megatron‑LM (large‑scale language model training framework) (Megatron‑LM)
?
Megatron-LM to rozbudowany framework stworzony przez firmę NVIDIA, przeznaczony do wydajnego trenowania bardzo dużych modeli językowych. Wykorzystuje zaawansowane techniki paralelizacji,...
Czytaj pełną definicję
Multi‑Token Prediction (MTP)
?
Multi-Token Prediction (MTP) to technika stosowana w dużych modelach językowych, która polega na jednoczesnym przewidywaniu kilku kolejnych tokenów w jednym...
Czytaj pełną definicję

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *

Powiązane posty

Zacznij wpisywać wyszukiwane hasło powyżej i naciśnij Enter, aby wyszukać. Naciśnij ESC, aby anulować.

Powrót do góry