Streszczenie AI
Qwen3.8‑27B to otwartoźródłowy multimodalny model 27 mld parametrów, który łączy liniową atencję Gated‑DeltaNet z pełną warstwą Gated‑Attention, umożliwiającą wydajne przetwarzanie sekwencji do 1 mln tokenów i obsługę obrazów, dokumentów oraz wideo w jednej tokenizacji. Dzięki wbudowanemu trybowi łańcuchowego myślenia oraz mechanizmowi preserve_thinking utrzymuje spójność rozumowania w długich dialogach oraz zwiększa wykorzystanie KV‑cache, co przekłada się na wysoką wydajność w zadaniach agentowych, inżynierii oprogramowania i analizy multimodalnego tekstu. Model konkuruje z komercyjnymi gigantami, a jego łatwa integracja (Chat‑Completions, vLLM, SGLang) sprawia, że szybko może być wdrożony w środowiskach produkcyjnych, np. jako autonomiczny asystent programisty czy automatyzacja interfejsów GUI.
Spis treści:
- Architektura wewnętrzna: Połączenie Gated DeltaNet i Gated Attention
- Kontrola procesu myślenia i mechanizm Preserve Thinking
- Skalowanie okna kontekstu do 1M tokenów i przetwarzanie wideo
- Analiza wyników w benchmarkach tekstowych, agentowych i wizyjnych
- Praktyczna integracja i wdrożenie produkcyjne
- Zastosowania inżynieryjne i scenariusze wdrożeniowe
- Źródła
Qwen3.8-27B to otwartoźródłowy model multimodalny, który łączy natywne przetwarzanie tekstu, obrazu oraz wideo z zaawansowanym łańcuchem myślenia zoptymalizowanym pod zadania agentowe. Model bazuje na gęstej architekturze hybrydowej, wykorzystującej warstwy liniowej atencji Gated DeltaNet oraz standardowe mechanizmy Gated Attention, co zapewnia wysoką przepustowość inferencji przy jednoczesnym zachowaniu precyzji w złożonym wnioskowaniu logicznym. Konstrukcja ta została zaprojektowana z myślą o efektywnym wdrażaniu na pojedynczych węzłach obliczeniowych z zachowaniem natywnego kontekstu rzędu 256 tysięcy tokenów i możliwością skalowania do miliona tokenów.
Architektura wewnętrzna: Połączenie Gated DeltaNet i Gated Attention
W modelu Qwen3.8-27B inżynierowie zrezygnowali z jednolitego stosu transformera opartego wyłącznie na standardowej atencji kwadratowej na rzecz zaawansowanego układu hybrydowego. Architektura łączy 64 warstwy, zorganizowane w powtarzalne bloki, w których warstwy liniowej atencji (Gated DeltaNet) przeplatają się z pełnymi warstwami transformera (Gated Attention) w proporcji 3:1. Taki zabieg pozwala drastycznie zredukować narzut pamięciowy i czasowy związany z buforem kluczy i wartości (KV cache), nie tracąc przy tym zdolności do precyzyjnego wyszukiwania relacji w długich sekwencjach.
W warstwach Gated DeltaNet zaimplementowano 48 liniowych głów atencji dla wektorów wartości (V) oraz 16 głów dla wektorów zapytań i kluczy (QK), przy wymiarze pojedynczej głowy wynoszącym 128. Z kolei w klasycznych warstwach atencji zastosowano mechanizm Grouped Query Attention (GQA) z 24 głowami zapytań i 4 głowami kluczy/wartości o wymiarze 256, co dodatkowo optymalizuje pamięć operacyjną. Ponadto model wykorzystuje predykcję wielotokenową (Multi-Token Prediction – MTP), trenowaną wieloetapowo, co przyspiesza generowanie odpowiedzi i stabilizuje proces uczenia reprezentacji.
Parametr architektoniczny | Wartość / Konfiguracja | Znaczenie techniczne |
|---|---|---|
| Liczba parametrów bazowych | 27 miliardów (gęsty model) | Optymalny kompromis między wydajnością a wymaganiami sprzętowymi vRAM. |
| Układ warstw (Hidden Layout) | 16 × (3 × DeltaNet → 1 × Gated Attention) | Hybrydowa struktura redukująca złożoność obliczeniową przy długim kontekście. |
| Wymiar ukryty / FFN | 5120 / 17 408 | Wysoka pojemność reprezentacji wektorowej w warstwach feed-forward. |
| Słownik tokenizatora | 248 320 tokenów | Gęste kodowanie tekstu wielojęzycznego, kodu oraz znaczników multimodalnych. |
| Natywne okno kontekstu | 262 144 tokeny (256k) | Bezstratna obsługa całych repozytoriów kodu i długich transkrypcji. |
| Maksymalny kontekst (YaRN) | Do 1 000 000 tokenów (1M) | Możliwość przetwarzania godzinnych nagrań wideo i rozległych baz wiedzy. |
Kontrola procesu myślenia i mechanizm Preserve Thinking
Model domyślnie funkcjonuje w trybie wnioskowania łańcuchowego (ang. thinking mode), generując ustrukturyzowany blok analityczny w znacznikach przed sformułowaniem końcowej odpowiedzi. Użytkownik ma możliwość płynnego sterowania głębokością rozumowania za pomocą parametru reasoning_effort (poziomy: xhigh, medium, low) lub całkowitego wyłączenia procesu myślenia w zastosowaniach wymagających niskich opóźnień.
Kluczową innowacją z perspektywy systemów wieloagentowych jest domyślnie włączony mechanizm preserve_thinking. W tradycyjnych modelach rozumujących kolejne zapytania w ramach tej samej konwersacji często odrzucają wcześniejsze bloki toku myślenia, co prowadzi do utraty spójności decyzyjnej i wymusza ponowne kalkulacje w kolejnych krokach. Zachowanie pełnego śladu dedukcyjnego w historii konwersacji zapewnia następujące korzyści:
- Ciągłość logiczna w złożonych pętlach agentowych – model nie zapomina pierwotnych założeń i ograniczeń środowiska wykonawczego.
- Lepsza utylizacja mechanizmu KV cache – brak konieczności przebudowywania kontekstu od zera przy każdym kroku interakcji.
- Zmniejszenie liczby błędów i ponownych prób wykonania poleceń w powłokach systemowych czy środowiskach programistycznych.
Podczas pracy z modelem zaleca się stosowanie zróżnicowanych parametrów próbkowania w zależności od trybu pracy. W trybie myślenia optymalną konfiguracją jest temperatura 1.0 przy top_p=0.95 i top_k=20, natomiast w trybie bezpośrednich instrukcji (non-thinking) zaleca się obniżenie temperatury do 0.7, top_p=0.80 oraz podniesienie kary za powtórzenia (presence_penalty=1.5) w celu eliminacji zapętleń.
Skalowanie okna kontekstu do 1M tokenów i przetwarzanie wideo
Chociaż bazowe okno kontekstowe modelu wynosi 262 144 tokeny, architektura obsługuje techniki skalowania pozycji RoPE (w szczególności YaRN), co pozwala rozszerzyć przestrzeń roboczą do 1 000 000 tokenów w silnikach takich jak vLLM, SGLang czy TokenSpeed. Zastosowano przeplatane kodowanie mRoPE (sekcje 11, 11, 10) ze współczynnikiem bazowym rope_theta=10000000 oraz współczynnikiem skalowania factor=4.0.
Natywny enkoder wizyjny pozwala modelowi traktować obrazy, dokumenty techniczne oraz wielogodzinne sekwencje wideo jako jednolite sekwencje tokenów. W konfiguracji preprocesora wideo parametr longest_edge może zostać podniesiony do wartości odpowiadającej 224 tysiącom tokenów wizyjnych, co pozwala na próbkowanie klatek wideo o wysokiej rozdzielczości z zachowaniem szczegółów czasowych i przestrzennych.
Analiza wyników w benchmarkach tekstowych, agentowych i wizyjnych
W testach porównawczych Qwen3.8-27B osiąga rezultaty przewyższające nie tylko modele ze swojej klasy wagowej, ale w wielu scenariuszach agentowych i inżynierii oprogramowania konkuruje bezpośrednio z modelami komercyjnymi o znacznie większej skali parametrów.
Obszar ewaluacji | Benchmark | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Opus4.6 Max |
|---|---|---|---|---|---|
| Inżynieria kodu (Agent) | SWE-bench Pro | 61,7% | 53,5% | 57,6% | 53,4% |
| Zaawansowane kodowanie | DeepSWE 1.1 | 42,2% | 13,3% | 14,2% | brak danych |
| Programowanie w terminalu | Terminal Bench 2.1 | 73,0% | 63,4% | 64,0% | 78,2% |
| Zadania biurowe / praca agentowa | CoWorkBench | 70,7% | 61,0% | 65,1% | 68,2% |
| Interakcja z systemem operacyjnym | OSWorld-Verified | 84,3% | 63,9% | 73,3% | 72,7% |
| Nawigacja w przeglądarce | WebArena-Verified | 64,8% | 48,8% | 55,3% | brak danych |
| Matematyka wizualna | MathVision (z interpretatorem) | 94,6% | 85,1% | 90,3% | 65,5% |
| Analiza wykresów naukowych | CharXiv (z interpretatorem) | 90,2% | 78,4% | 85,9% | 66,0% |
Wyniki te pokazują ogromny skok jakościowy w zadaniach wymagających interakcji ze środowiskiem (Computer-Use i Browser-Use). Wynik 84,3% w OSWorld oraz 61,7% w SWE-bench Pro wskazuje, że model bardzo dobrze interpretuje błędy kompilacji, zrzuty ekranu interfejsów graficznych i wyjścia z konsoli bash, korygując swoje plany w czasie rzeczywistym.
Praktyczna integracja i wdrożenie produkcyjne
Dzięki kompatybilności ze standardowym interfejsem Chat Completions oraz frameworkami vLLM i SGLang, uruchomienie i integracja modelu w środowiskach produkcyjnych wymaga minimalnego nakładu pracy. Poniższy fragment kodu ilustruje konfigurację zapytania multimodalnego z kontrolą parametrów rozumowania przy użyciu biblioteki openai:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:8000/v1",
api_key="sk-local-deployment"
)
# Zapytanie łączące obraz schematu technicznego z zadaniem analitycznym
response = client.chat.completions.create(
model="Qwen/Qwen3.8-27B",
messages=[
{
"role": "user",
"content": [
{
"type": "image_url",
"image_url": {"url": "https://przyklad.pl/schemat_architektury.png"}
},
{
"type": "text",
"text": "Przeanalizuj diagram, zidentyfikuj potencjalne wąskie gardła w warstwie bazy danych i napisz skrypt weryfikacyjny w Pythonie."
}
]
}
],
extra_body={
"chat_template_kwargs": {
"enable_thinking": True,
"preserve_thinking": True
}
},
reasoning_effort="xhigh",
temperature=1.0,
top_p=0.95
)
# Wyodrębnienie wygenerowanego toku rozumowania oraz finalnej odpowiedzi
reasoning = getattr(response.choices[0].message, "reasoning_content", "")
content = response.choices[0].message.content
print(f"Tok myślenia: {reasoning}")
print(f"Odpowiedź: {content}")Zastosowania inżynieryjne i scenariusze wdrożeniowe
Zdolność modelu do jednoczesnego operowania na multimodalnym wejściu i utrzymywania długich procesów decyzyjnych otwiera szereg konkretnych zastosowań architektonicznych:
- Autonomiczne usuwanie usterek w oprogramowaniu (SWE Agents): Model może działać w pętli ze środowiskiem CI/CD, pobierając logi błędów, analizując kod źródłowy, wprowadzając poprawki i weryfikując je testami jednostkowymi bez ingerencji człowieka.
- Sterowanie interfejsami graficznymi (OS & Web Agents): Wysoka precyzja w OSWorld i WebArena pozwala na automatyzację skomplikowanych procesów biurowych, klikanie elementów interfejsu na podstawie zrzutów ekranu oraz ekstrakcję danych z systemów legacy pozbawionych API.
- Audyt i dokumentacja wielomodalna: Przetwarzanie wielostronicowych dokumentów PDF zawierających wykresy i tabele (OmniDocBench: 91,1%) umożliwia tworzenie zaawansowanych systemów RAG dla branży prawniczej, medycznej i inżynieryjnej.
- Analiza długich materiałów audiowizualnych: Dzięki rozszerzonemu oknu kontekstu model może indeksować i streszczać wielogodzinne nagrania ze spotkań, wykładów czy monitoringu przemysłowego, wskazując dokładne znaczniki czasowe zdarzeń.
Qwen3.8-27B udowadnia, że optymalizacja architektury wewnętrznej – poprzez połączenie atencji liniowej z gęstym wnioskowaniem logicznym – pozwala modelom o zwartej skali 27 miliardów parametrów osiągać rezultaty dotychczas zarezerwowane wyłącznie dla zamkniętych, gigantycznych klastrów obliczeniowych.
Źródła
- Qwen/Qwen3.8-27B – Karta modelu i repozytorium na Hugging Face
- Qwen Team – Oficjalny przegląd techniczny generacji Qwen3.8




