Pierwsze kroki z Lokalnym AI

Zbuduj własne, prywatne AI. Zobacz kompleksowe zestawienie poradników – od instalacji pierwszej aplikacji po zaawansowanych agentów. Sprawdź poradnik

Fizyka statystyczna w optymalizacji sieci neuronowych: redukcja bloków transformera jako problem Isinga

zajawka nowosci
Streszczenie AI

Nowa metoda „Constrained Binary Optimization” (CBO) traktuje architekturę transformera jak szkło Isinga z długodystansowymi sprzężeniami i optymalizuje dystrybucję binarnych zmiennych bloków, dzięki czemu uwzględnia pełne korelacje między warstwami. W porównaniu z tradycyjnymi, jednocząstkowymi heurystykami, CBO pozwala na agresywną kompresję (do połowy bloków) z minimalnym spadkiem jakości, a nawet na sprawniejsze usuńanie nadmiarowych modułów w hybrydowych modelach MoE/Mamba. Metoda nie wymaga wielokrotnych przejść trenowania, łatwo integruje się z istniejącymi pipeline'ami produkcyjnymi, a jej implementacja jest dostępna jako otwarty kod na GitHub.

Spis treści:

Usuwanie całych bloków warstw (tzw. block pruning lub block removal) stanowi jedną z najbardziej obiecujących metod strukturalnej kompresji dużych modeli językowych, bezpośrednio redukującą opóźnienia inferencyjne oraz zapotrzebowanie na pamięć VRAM. Tradycyjne metody selekcji warstw traktują bloki w sposób niezależny lub ograniczają się do wycinania pojedynczych, ciągłych sekwencji warstw, co prowadzi do drastycznej degradacji parametrów modelu przy głębokiej kompresji. Zespół badawczy z Multiverse Computing przedstawił nowatorskie sformułowanie tego zadania jako problemu binarnej optymalizacji z więzami (CBO), mapując architekturę transformera bezpośrednio na model szkła Isinga ze sprzężeniami dalekozasięgowymi.

Ograniczenia heurystyk jednocząstkowych i podejścia pola średniego

Większość dotychczasowych technik przycinania warstw opiera się na analizie wrażliwości pojedynczych bloków, wykorzystując metryki takie jak wpływ bloku (block influence), norma gradientów czy spadek podobieństwa reprezentacji ukrytych. Z punktu widzenia fizyki układów wielu ciał procedury te odpowiadają przybliżeniu pola średniego (mean-field theory), w którym oddziaływanie danego elementu z otoczeniem zastępuje się uśrednionym polem efektywnym. Takie uproszczenie zakłada, że wkład wnoszony przez blok i jest niezależny od obecności lub usunięcia bloku j.

W praktyce głębokie sieci neuronowe charakteryzują się silnymi, nieliniowymi sprzężeniami pomiędzy warstwami, zwłaszcza w architekturach z gęstymi połączeniami rezydualnymi. Usunięcie określonej warstwy modyfikuje rozkład aktywacji przekazywanych do kolejnych modułów, co sprawia, że koszt usunięcia bloku 20 zależy wprost od tego, czy model zachował blok 19 lub blok 24. Ignorowanie tych korelacji wymusza stosowanie zachowawczych heurystyk, takich jak usuwanie wyłącznie wąskiego, zwartego pasma warstw ze środkowej części modelu, co drastycznie ogranicza przeszukiwaną przestrzeń konfiguracyjną i uniemożliwia osiągnięcie wysokiego stopnia kompresji bez załamania dokładności.

Matematyczne sformułowanie problemu: od rozwinięcia Taylora do szkła Isinga

Metoda zaproponowana przez Multiverse Computing przypisuje każdemu z N bloków transformera zmienną binarną x_i \in \{0, 1\}, gdzie wartość 0 oznacza zachowanie bloku w sieci, a wartość 1 jego bezpowrotne usunięcie. Wprowadzając parametr sprzęgający w ścieżce rezydualnej każdego bloku, funkcję straty modelu można przybliżyć za pomocą rozwinięcia Taylora drugiego rzędu wokół stanu wyjściowego:

L(x) \approx L_0 + \nabla L^\top x + \frac{1}{2} x^\top H_0 x

Wektor gradientu oraz hesjan H_0 są aproksymowane na podstawie pojedynczego przejścia w przód i w tył (forward-backward pass) dla niewielkiego zbioru kalibracyjnego. Ponieważ dla zmiennych binarnych zachodzi tożsamość x_i^2 = x_i, składnik liniowy można włączyć bezpośrednio w przekątną macierzy H_0. Przekątna odzwierciedla wówczas indywidualną wrażliwość poszczególnych warstw (odpowiednik lokalnego pola magnetycznego), podczas gdy elementy pozaprzekątne reprezentują bezpośrednie sprzężenia dwuciałowe pomiędzy parami bloków. Zadanie wyboru M bloków do usunięcia sprowadza się do problemu binarnej optymalizacji z więzami (Constrained Binary Optimization):

\min_{x \in \{0,1\}^N} x^\top H_0 x \quad \text{przy warunku} \quad \sum_{i=0}^{N-1} x_i = M

Z punktu widzenia fizyki teoretycznej sformułowanie to odpowiada hamiltonianowi nieskończenie zasięgowego szkła spinowego Isinga z zachowaniem całkowitego namagnesowania, w którym energia układu pełni rolę wskaźnika zastępczego (proxy) dla błędu kompresowanego modelu. Ponieważ hesjan wyliczany jest jednorazowo, ewaluacja dowolnej z miliardów możliwych konfiguracji wymaga jedynie prostego mnożenia macierzy przez wektor, bez konieczności uruchamiania właściwego modelu ani przeprowadzania kosztownych benchmarków.

Wydajność w warunkach głębokiej kompresji

Zaletą modelowania sprzężeń międzypoziomowych jest stabilność modelu przy agresywnym usuwaniu warstw. Podczas gdy przy niewielkiej redukcji (do około 25–30% warstw) heurystyki oparte na wpływie pojedynczych bloków osiągają wyniki zbliżone do CBO, w reżimie głębokiej redukcji różnice stają się wyraźne. Poniższa tabela przedstawia porównanie zachowania modeli Llama oraz Qwen poddanych kompresji strukturalnej bez dodatkowego dotrenowywania (zero-shot evaluation).

Architektura bazowa
Liczba usuniętych bloków
Stopień kompresji głębokości
MMLU (Baseline: Block Influence)
MMLU (Metoda CBO Isinga)
Zysk punktowy (MMLU)
Llama-3.3-70B-Instruct (80 bloków) 24 / 80 30,0% Zbliżony do CBO Stabilny ~0,0 pp
Llama-3.3-70B-Instruct (80 bloków) 32 / 80 40,0% Widoczny spadek Wysoka retencja Wyraźna przewaga CBO
Llama-3.3-70B-Instruct (80 bloków) 40 / 80 50,0% 54,0% 76,9% +22,9 pp
Qwen3-14B (40 bloków) 12 / 40 30,0% Spadek o ~10 pp Stabilny wynik +10,0 pp

Dla modelu Llama-3.3-70B-Instruct przy usunięciu połowy architektury (40 z 80 bloków) metoda zachowuje wynik benchmarku MMLU na poziomie niemal 77 punktów, podczas gdy standardowa heurystyka powoduje załamanie zdolności wnioskowania modelu do poziomu 54 punktów.

Stany podstawowe a niskoleżące stany wzbudzone

W standardowej optymalizacji dyskretnej celem algorytmu jest odnalezienie globalnego stanu podstawowego (ground state), czyli konfiguracji o ściśle najniższej energii. W przypadku aproksymacji błędu sieci funkcja energii jest silnym, lecz przybliżonym estymatorem rzeczywistej zdolności generalizacji. Badacze wykazali, że stan o bezwzględnie najniższej energii nie zawsze generuje optymalny model po procedurze dostrajania.

Przekształcenie zadania w hamiltonian spinowy umożliwia wygenerowanie całego spektrum niskoleżących stanów wzbudzonych niemal zerowym kosztem obliczeniowym. W testach na modelu Llama-3.1-8B-Instruct (usunięcie 16 z 32 bloków) większość wariantów ze stanu podstawowego sugerowała usunięcie warstw końcowych. Jednak dopiero 17. stan wzbudzony zaproponował usunięcie jednego z początkowych bloków transformera. Po przeprowadzeniu lekkiego dotrenowania regeneracyjnego (healing/retraining) konfiguracja ta przewyższyła stan podstawowy we wszystkich testowanych benchmarkach, podważając dogmat nakazujący usuwanie wyłącznie środkowo-końcowych sekwencji.

Optymalizacja struktury sieci poprzez analogię do szkła spinowego pozwala traktować redundancję transformera nie jako statyczny ciąg warstw, lecz jako sprzężony układ dynamiczny, w którym globalna jakość zależy od zachowania kolektywnych korelacji między blokami.

Generalizacja na heterogeniczne modele hybrydowe (MoE i Mamba)

Większość współczesnych prac nad kompresją koncentruje się na jednorodnych modelach gęstych (dense) opartych wyłącznie na standardowej uwadze wielogłowicowej. Nowoczesne architektury produkcyjne coraz częściej łączą jednak moduły o zróżnicowanej specyfice obliczeniowej. Zespół przetestował opisywaną metodę na modelu NVIDIA-Nemotron-3-Nano-30B-A3B-FP8, w którym przeplatane są bloki Mamba2, warstwy standardowej atencji oraz moduły Mixture-of-Experts (MoE).

Formalizm Isinga nie nakłada żadnych założeń na homogeniczność przetwarzanych bloków, ponieważ hesjan traktuje każdą warstwę jako węzeł grafu powiązanego wagami sprzężeń. W eksperymentach bez ponownego trenowania metoda CBO pozwoliła na usunięcie 2–3 warstw eksperckich MoE lub 2 warstw atencji, przewyższając wyniki baseline’u w testach rozumowania matematycznego i naukowego AIME25 oraz GPQA. Wyniki te dowodzą, że redundancja w architekturach hybrydowych jest asymetryczna, a uwzględnienie sprzężeń pozwala precyzyjnie wytypować nadmiarowe moduły bez destabilizacji całego przepływu sygnału rezydualnego.

Praktyczna implementacja: solwery klasyczne i inspirowane kwantowo

Eksploracja kombinatorycznej przestrzeni wyboru warstw wymaga zróżnicowanego podejścia w zależności od skali problemu:

  • Przeszukiwanie wyczerpujące (Brute-force): Przy usuwaniu niewielkiej liczby warstw (np. do 8 bloków z 80, co generuje około 29 miliardów kombinacji) obliczanie energii na poziomie GPU pozwala na pełne przeszukanie przestrzeni w czasie około dwóch dni.
  • Solwery binarne QUBO (Tabu Search): Po przekształceniu ograniczenia na liczbę bloków w składnik kary (funkcja QUBO), otwarte implementacje algorytmu przeszukiwania z tabu (Tabu Search) odnajdują konfiguracje bliskie stanowi podstawowemu w ciągu zaledwie kilku sekund.
  • Solwery kwantowe i hybrydowe: Zmapowanie hamiltonianu umożliwia bezpośrednie wdrożenie algorytmów takich jak Quantum Approximate Optimization Algorithm (QAOA) czy wyżarzanie kwantowe (Quantum Annealing) na dedykowanym sprzęcie kwantowym lub symulatorach cyfrowych.

Integracja w produkcyjnym potoku kompresji modeli

Metoda CBO nie konkuruje z innymi technikami odchudzania modeli, lecz stanowi pierwszy, kluczowy krok w zintegrowanym potoku optymalizacyjnym. W typowym wdrożeniu produkcyjnym proces przebiega wieloetapowo:

  • Krok 1: Konstrukcja hesjanu sprzężeń: Uruchomienie pojedynczych przejść w przód i w tył na małej próbie kalibracyjnej (np. kilkaset sekwencji z zestawu tokenów ogólnych) w celu wyznaczenia macierzy H_0.
  • Krok 2: Generowanie spektrum rozwiązań: Uruchomienie solwera optymalizacyjnego dla pożądanej głębokości docelowej M, generujące stan podstawowy oraz zbiór stanów wzbudzonych.
  • Krok 3: Walidacja i wybór kandydata: Szybka ewaluacja wygenerowanych architektur na syntetycznym zbiorze walidacyjnym w celu weryfikacji perpleksji.
  • Krok 4: Regeneracja parametrów (Healing): Krótkie dotrenowanie modelu z wykorzystaniem destylacji wiedzy (Knowledge Distillation) z nieprzyciętego modelu bazowego w celu odzyskania utraconej płynności językowej.
  • Krok 5: Składanie z kompresją wag i kwantyzacją: Zastosowanie dekompozycji niskorządowej (SVD/LoRA) w celu zwężenia wymiaru ukrytego oraz finalna kwantyzacja wag do formatów FP8, INT4 lub schematów sub-4-bitowych.

Redukcja głębokości modelu przekłada się bezpośrednio na spadek narzutu pamięciowego pamięci podręcznej kluczy i wartości (KV cache) w sposób liniowy względem usuniętych warstw, co pozwala na jednoczesne wydłużenie okna kontekstowego oraz zwiększenie rozmiaru partii (batch size) podczas serwowania modelu na ograniczonej liczbie akceleratorów graficznych. Kod projektu został opublikowany na zasadach open source na platformie GitHub przez CompactifAI, co umożliwia weryfikację badań społeczności naukowej.

Źródła

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *

Powiązane posty

Powrót do góry