Streszczenie AI
NVIDIA Nemotron 3.5 Lightning 30B A3B NVFP4 to otwarty, hybrydowy Mixture‑of‑Experts z 30 mln parametrów (z czego 3 mln są aktywne podczas inferencji) i 1 mln‑tokenowym kontekstem, który dzięki kwantyzacji NVFP4 i obsłudze Mamba‑2 + Transformer MoE daje wydajność na pojedynczym GPU, nawet RTX 5090. Model wykorzystuje trzy techniki speculative decoding (DSpark, DFlash, MTP), pozwalające na nawet czterokrotne przyspieszenie generowania, a jego warstwy Multi‑Token Prediction oraz specyficzne treningi (pre‑training, SFT, RL) zapewniają dobre wyniki w benchmarkach MMLU, GPQA i SWE‑bench, przy minimalnym spadku jakości. Dzięki otwartym dziennikowi treningowym na Hugging Face i API kompatybilnym z OpenAI, model stanowi atrakcyjną opcję dla deweloperów budujących potężne, lokalne agenty AI i systemy RAG.
NVIDIA Nemotron 3.5 Lightning 30B A3B NVFP4 to otwarty model językowy typu Mixture-of-Experts (MoE), zaprojektowany z myślą o wysokowydajnych, długotrwałych agentach AI. Łączy architekturę hybrydową Mamba-2 + Transformer MoE z kwantyzacją NVFP4, co pozwala na efektywne wnioskowanie nawet na pojedynczym GPU.
Architektura i parametry techniczne
Model charakteryzuje się następującymi parametrami:
- Łączna liczba parametrów: 30 miliardów, z czego tylko 3 miliardy są aktywne podczas inferencji (3B active parameters).
- Architektura: hybrydowa MoE z warstwami Mamba-2, MoE oraz Attention.
- Długość kontekstu: do 1 miliona tokenów.
- Kwantyzacja: NVFP4 (Four Over Six) – wariant statycznej kalibracji MSE z wagami W4A16 dla ekspertów MoE oraz FP8 dla projekcji Mamba i cache KV.
- Obsługiwane języki: angielski (w tym kod), hiszpański, francuski, niemiecki, włoski, japoński.
Taka konstrukcja pozwala na uruchomienie modelu na pojedynczym GPU typu DGX Spark (GB10), H100, a nawet RTX 5090, przy zachowaniu wysokiej przepustowości.
Metody przyspieszania generowania tekstu
Nemotron 3.5 Lightning wspiera trzy techniki speculative decoding, które znacząco przyspieszają generowanie:
- DSpark: semi-autoregresyjny drafter proponujący blok tokenów w jednym forward pass – rekomendowany dla DGX Spark i niskokonkurencyjnych deploymentów w data center.
- DFlash: lekki model dyfuzyjny generujący cały blok draftu w jednym kroku.
- MTP (Multi-Token Prediction): warstwy przewidujące kilka przyszłych tokenów jednocześnie, co wzbogaca sygnał treningowy i przyspiesza inferencję.
W praktyce oznacza to, że model może osiągać nawet 4-krotnie wyższą szybkość generowania w porównaniu do modeli o podobnej wielkości.
Proces treningu
Model był trenowany w pięciu etapach:
- Pre-trening: ponad 20 bilionów tokenów z użyciem Megatron-LM, dane obejmują kod, matematykę, nauki ścisłe i wiedzę ogólną.
- Trening MTP: dalsze pre-treningowe dostrojenie warstw Multi-Token Prediction.
- Supervised Fine-Tuning (SFT): dane syntetyczne z kodu, matematyki, narzędzi, instrukcji i długiego kontekstu.
- Reinforcement Learning (RL): GRPO (Group Relative Policy Optimization) w środowiskach matematycznych, kodujących, narzędziowych i konwersacyjnych.
- Post-training Quantization (PTQ): kwantyzacja NVFP4 z użyciem NVIDIA Model Optimizer.
Dane treningowe są udostępnione publicznie na Hugging Face, co zwiększa transparentność i umożliwia reprodukcję wyników.
Wyniki benchmarków
Poniżej przedstawiono wybrane wyniki dla wersji NVFP4 w porównaniu do BF16:
| Zadanie | NVFP4 | BF16 |
|---|---|---|
| MMLU Pro | 81.62 | 81.94 |
| GPQA Diamond (no tools) | 75.57 | 75.44 |
| SWE-bench Verified | 52.80 | 51.56 |
| Terminal-Bench 2.1 | 23.46 | 24.58 |
| IFBench (loose) | 72.88 | 71.88 |
Wyniki pokazują, że kwantyzacja NVFP4 nie powoduje znaczącego spadku jakości, a w niektórych zadaniach (np. SWE-bench) nawet lekko poprawia rezultaty.
Praktyczne zastosowania
Model jest szczególnie przydatny w następujących scenariuszach:
- Agenci AI: długotrwałe, autonomiczne agenty wykonujące specjalistyczne zadania (kodowanie, research, analiza dokumentów).
- Systemy RAG: dzięki kontekstowi 1M tokenów model skutecznie przetwarza długie dokumenty i wieloetapowe zapytania.
- Lokalna inferencja: możliwość uruchomienia na pojedynczym GPU (np. RTX 5090, H100) czyni go atrakcyjnym dla developerów pracujących on-premise.
- Tool calling: wbudowane parsery (qwen3_coder, nemotron_v3) umożliwiają integrację z zewnętrznymi narzędziami i API.
Przykład deployu z vLLM
Poniżej przedstawiono przykładową komendę uruchamiającą model z vLLM na DGX Spark z użyciem DSpark speculative decoding:
Model obsługuje również API kompatybilne z OpenAI, co ułatwia integrację z istniejącymi aplikacjami.
vllm serve --model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4
--moe-backend marlin
--kv-cache-dtype fp8
--enable-prefix-caching
--speculative_config.num_speculative_tokens 3
--mamba-backend flashinfer
--mamba-cache-mode align
--gpu-memory-utilization 0.91
--reasoning-parser nemotron_v3
--speculative_config.model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark
--tool-call-parser qwen3_coder
--enable-auto-tool-choicePodsumowanie
Nemotron 3.5 Lightning 30B A3B NVFP4 to model, który łączy wysoką wydajność z otwartością. Dzięki architekturze MoE, kwantyzacji NVFP4 i wsparciu dla speculative decoding, jest idealnym wyborem dla developerów budujących zaawansowane agenty AI. Udostępnienie danych treningowych i receptur dodatkowo zwiększa jego wartość dla społeczności open source.
Dostępność modelu
Model jest już dostępny do przetestowania w ollamie:
ollama run nemotron-3.5-lightning
Źródła
- nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 – Hugging Face
- NVIDIA Nemotron AI Models – NVIDIA Developer
- NVIDIA AI on X – Nemotron 3.5 Lightning announcement




