Pierwsze kroki z Lokalnym AI

Zbuduj własne, prywatne AI. Zobacz kompleksowe zestawienie poradników – od instalacji pierwszej aplikacji po zaawansowanych agentów. Sprawdź poradnik

Qwen3.8‑Flash‑Next: otwarty podgląd architektury Qwen4 z naciskiem na koszt/token

zajawka nowosci
Streszczenie AI

Qwen3.8‑Flash‑Next to otwarty „preview” architektury nadchodzącego Qwen4, łączący 125 B parametrów w rdzeniu z tylko 6 B aktywowanych przy każdym tokenie dzięki MoE i rzadkiej uwadze, co pozwala na krótkie koszty inferencji przy zachowaniu długiego kontekstu (do 262 144 tokenów) i wsparciu dla kodu, agentów oraz wizyjnych zadań.
Model jest dostępny w wersji open‑weights na Hugging Face i obsługuje lokalne uruchomienie przy 75–78 GB RAM, co czyni go atrakcyjnym dla budowy agentów, systemów RAG i aplikacji wielomodalnych wymagających wysokiej jakości przy umiarkowanom wydatkach.
Choć nie jest finalnym Qwen4, jego publiczne wagi i realne wydajności (np. w CoWorkBench i JobBench) pokazują, że Qwen3.8‑Flash‑Next stanowi solidny kompromis między rozdzielczością, długością kontekstu a kosztami tokena.

Spis treści:

Qwen3.8‑Flash‑Next to otwarty, wielomodalny model Mixture‑of‑Experts (MoE) od zespołu Qwen (Alibaba), który pełni rolę „architekturalnego preview” dla nadchodzącej rodziny Qwen4. Model łączy bardzo duże całkowite parametry (ok. 125B w rdzeniu + dodatkowe bloki) z niską liczbą aktywowanych parametrów na token (ok. 6B), co ma przełożyć się na niższy koszt inferencji przy zachowaniu wysokiej jakości wyników.

Co to jest Qwen3.8‑Flash‑Next i jaką pełni rolę

Qwen3.8‑Flash‑Next nie jest finalnym modelem Qwen4, lecz wczesnym, otwartym wdrożeniem kluczowych elementów architektury planowanej dla Qwen4. Zespół Qwen pozycjonuje go jako krok w stronę „ostatecznej efektywności kosztowej” (ultimate cost‑efficiency), czyli modelu, który przy dużych zadaniach (długi kontekst, agenci, praca z kodem i wizją) oferuje lepszy stosunek jakości do kosztu tokena.

Rola: Qwen3.8‑Flash‑Next = publiczny, otwarty „szkielet” Qwen4, testowany w realnych scenariuszach (kod, agenci, wizja), zanim pełna rodzina Qwen4 trafi do produkcji.

Architektura i parametry: hybryda liniowa + rzadka uwaga, MoE i n‑gramy

Model jest causal language modelem z enkoderem wizyjnym, trenowanym w etapach pre‑training i post‑training, z natywnym oknem kontekstowym 262 144 tokenów, rozszerzalnym do 1 mln tokenów (YaRN).

Kluczowe cechy techniczne:

  • Parametry: 125B w rdzeniu językowym, z czego aktywowane jest ok. 6B na token; dodatkowo 51B parametrów w tabeli n‑gram embedding oraz 4B w głowicy multi‑token prediction (MTP).
  • Liczba warstw: 48 warstw tekstowych, w hybrydowym układzie: 12 bloków, każdy zawierający 3× Gated DeltaNet (liniowa uwaga) i 1× Qwen Sparse Attention (QSA).
  • MoE: 512 ekspertów, z routingiem top‑10 plus 1 ekspert współdzielony (10 routed + 1 shared) aktywowanych na token.
  • QSA (Qwen Sparse Attention): pracuje z budżetem 512 bloków / 2048 tokenów, co pozwala na rzadsze, ale celowe odczytywanie długiego kontekstu zamiast pełnej uwagi na całej sekwencji.
  • N‑gram Embedding: tabela 20 mln wpisów (bigramy/trigramy) na warstwie 2, dodająca pojemność modelu przez deterministyczne lookupy, a nie tylko przez sieciowe przekształcenia.
  • MTP (Multi‑Token Prediction): 1 warstwa, trenowana z multi‑steps, wspierająca szybszą generację przez przewidywanie kilku tokenów naraz.
  • Modalności: tekst, obraz i wideo (model jest natiwnie wielomodalny dzięki enkoderowi wizyjnemu).

Taka konstrukcja łączy tanie, liniowe mechanizmy pamięci (Gated DeltaNet) z rzadką, budżetowaną uwagą (QSA) i dużą pojemnością ekspertów (MoE) oraz n‑gramów, co w praktyce oznacza: szybkie przywoływanie długiego kontekstu przy kontrolowanym koszcie obliczeniowym.

Wydajność i benchmarki: kod, agenci, zadania profesjonalne

W dostępnych doniesieniach Qwen3.8‑Flash‑Next wypada bardzo dobrze w zadaniach agencji i pracy z kodem, często przewyższając mocne modele konkurencji w testach typu CoWorkBench i JobBench.

  • CoWorkBench: 73.9 pkt (vs DeepSeek‑V4‑Flash: 45.1).
  • JobBench: 55.7 pkt, co wskazuje na dobrą przydatność w profesjonalnych przepływach pracy.

Model ma również wspierać sterowanie zachowaniem rozumowania poprzez flagi takie jak enable_thinking, preserve_thinking oraz parametr reasoning_effort, co jest istotne w scenariuszach agentowych i przy złożonych zadaniach wymagających planowania.

Koszty i dostępność: otwarte wagi vs wersja produkcyjna w chmurze

Wagi modelu są udostępnione publicznie (Hugging Face, ModelScope) na licencji Qwen Community License 1.0, co umożliwia lokalne uruchamianie i eksperymenty.

  • Otwarte wagi: Qwen3.8‑Flash‑Next (BF16) – ok. 180B parametrów łącznie na dysku (rdzeń + n‑gramy + MTP).
  • Wersja produkcyjna: Qwen3.8‑Flash w QwenCloud, wyceniana na 0.16 USD / 1 mln tokenów wejściowych i 0.47 USD / 1 mln tokenów wyjściowych.

Dla uruchamiania lokalnego pojawiają się doniesienia, że model da się uruchomić na urządzeniach z ~75–78 GB RAM/unified memory (bez wymogu dużego VRAM GPU), co czyni go realnym kandydatem do pracy na mocnych laptopach/stacjach roboczych z dużą pamięcią.

Praktyczne zastosowania: gdzie ten model ma sens

Ze względu na architekturę i profil kosztowy, Qwen3.8‑Flash‑Next jest szczególnie interesujący w następujących scenariuszach:

  • Długi kontekst i RAG: natywne 262k tokenów (z rozszerzeniem do 1 mln) plus hybrydowa uwaga sprawiają, że model dobrze nadaje się do analizy długich dokumentów, kodu, logów czy transkrypcji.
  • Agenci i automatyzacja: wysoka wydajność w benchmarkach agencji i kodu, plus mechanizmy sterowania rozumowaniem, sugerują przydatność w agentach pracujących z wieloma narzędziami i długimi historiami interakcji.
  • Wielomodalne pipeline’y: obsługa tekstu, obrazu i wideo w jednym modelu upraszcza architekturę systemów analizujących materiały multimedialne (np. raporty z wykresami, filmy instruktażowe).
  • Koszt‑efektywna inferencja: niska liczba aktywowanych parametrów na token (6B) przy dużej pojemności modelu (125B+51B+4B) pozwala na tańsze uruchamianie dużych zadań, zwłaszcza w chmurze (Qwen3.8‑Flash).

Na co uważać i co jest jeszcze niejasne

Qwen3.8‑Flash‑Next to preview architektury, a nie finalny Qwen4, więc część decyzji projektowych może się jeszcze zmienić w pełnej rodzinie modeli. Dodatkowo:

  • Licencja: Qwen Community License 1.0 – przed komercyjnym użyciem warto sprawdzić warunki (ograniczenia, wymogi atrybucji itp.).
  • Wymagania sprzętowe: choć możliwe jest uruchamianie na CPU/unified memory, to pełna wydajność i niskie opóźnienia będą wymagały odpowiednio mocnego sprzętu (dużo RAM, ewentualnie akceleratory).
  • Dojrzałość ekosystemu: jako nowy model, może mieć jeszcze mniej gotowych integracji, quantyzacji i narzędzi niż starsze, popularne modele, choć szybko pojawiają się konwersje GGUF i wsparcie w frameworkach (SGLang, Unsloth itp.).

Podsumowanie techniczne

Qwen3.8‑Flash‑Next to ważny sygnał kierunku, w którym idzie Qwen: duże modele MoE z hybrydową uwagą, rozbudowanymi mechanizmami pamięci (n‑gramy) i silnym naciskiem na koszt/token, przy jednoczesnym otwieraniu wag dla społeczności. Dla zespołów budujących agenty, systemy RAG i wielomodalne aplikacje, model ten oferuje interesujący kompromis między jakością, długością kontekstu a kosztem inferencji – zarówno w wersji open‑weights, jak i w chmurze jako Qwen3.8‑Flash.

qwen3.8-flash-next

Ollama Library

This experimental preview of the architecture that will underpin Qwen4.

$ ollama run qwen3.8-flash-next

Źródła

🧠 Utrwal wiedzę z tego artykułu!

Kliknij pojęcie, by przypomnieć sobie definicję.

Causal Language Model – autoregressive text generator (Causal Language Model)
?
Causal Language Model (przyczynowy model językowy) to typ autoregresywnego modelu sztucznej inteligencji, który przewiduje kolejny token w sekwencji na podstawie...
Czytaj pełną definicję
n‑gram – token‑level memory units (n‑gram)
?
N-gram to ciąg n następujących po sobie elementów, takich jak słowa, litery lub tokeny, w danym fragmencie tekstu. W przetwarzaniu...
Czytaj pełną definicję
Preserve_thinking – flag to retain reasoning state (Preserve_thinking flag)
?
Flaga Preserve_thinking to parametr stosowany w zaawansowanych modelach językowych do zachowania ciągłości stanu wnioskowania. Umożliwia ona przekazywanie wewnętrznych przemyśleń i...
Czytaj pełną definicję
Reasoning_effort – parameter controlling depth of reasoning (Reasoning_effort)
?
Reasoning_effort to parametr stosowany w zaawansowanych modelach językowych, który kontroluje głębokość oraz czas poświęcony na wewnętrzny proces wnioskowania. Pozwala on...
Czytaj pełną definicję
YaRN – context window extension technique (up to 1 M tokens) (YaRN)
?
YaRN (Yet Another RoPE Extension) to zaawansowana technika służąca do rozszerzania okna kontekstowego w dużych modelach językowych. Pozwala ona modelom...
Czytaj pełną definicję
Sparse Attention (Quadratic Sparse Attention) (QSA)
?
Sparse Attention (rzadka uwaga) to technika zoptymalizowanej uwagi w modelach transformatorowych, która redukuje złożoność obliczeniową poprzez obliczanie zależności tylko dla...
Czytaj pełną definicję

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *

Powiązane posty

Powrót do góry