Pierwsze kroki z Lokalnym AI

Zbuduj własne, prywatne AI. Zobacz kompleksowe zestawienie poradników – od instalacji pierwszej aplikacji po zaawansowanych agentów. Sprawdź poradnik

IBM Granite 4.2 – otwartoźródłowe modele z natywnym reasoningiem dla agentów

zajawka nowosci
Spis treści:

Granite 4.2 to nowa generacja dużych modeli językowych IBM, zaprojektowana z myślą o agentach, które nie tylko odpowiadają na pytania, ale potrafią planować, wykonywać złożone zadania i korzystać z narzędzi w kontrolowany sposób. Modele te łączą gęstą (dense) architekturę transformerową z natywnym trybem „thinking”, wieloetapowym treningiem RL oraz otwartą licencją Apache 2.0, co czyni je szczególnie interesującymi dla zastosowań enterprise i open source.

Architektura i rozmiary modeli Granite 4.2

Granite 4.2 to rodzina gęstych, decoder-only modeli językowych w trzech rozmiarach: 3B, 8B i 30B parametrów. Taka skala pozwala dobrać model do konkretnego scenariusza – od lekkich zadań na brzegu (edge) po złożone przepływy analityczne i programistyczne w środowiskach serwerowych.

Wszystkie warianty oferują natywne okno kontekstu rzędu 128k tokenów, a IBM komunikuje możliwość rozszerzenia do 512k w największym modelu, co umożliwia przetwarzanie dużych repozytoriów kodu czy dokumentacji technicznej w jednym zapytaniu. Modele są gęstymi transformerami z grupowaną atencją zapytań (Grouped Query Attention), RoPE oraz głębokimi sieciami MLP typu SwiGLU, co jest typowe dla współczesnych modeli nastawionych na reasoning.

Model
Parametry
Kontekst
AIME25 (math)
SWE-Bench Verified
MMLU-Pro
Granite 4.2 3B 3B 128k (do 512k) 78,33% brak wyniku (bez agentic RL) 67,84%
Granite 4.2 8B 8B 128k 86,67% 47,67 74,04%
Granite 4.2 30B 30B 128k (do 512k) 89,17% 57,00 77,60%

Native reasoning i tryb „thinking” w praktyce

Kluczową różnicą między Granite 4.2 a wcześniejszymi generacjami jest natywne wsparcie dla reasoning’u – modele potrafią wykonywać krok po kroku rozumowanie przed wygenerowaniem finalnej odpowiedzi. Realizowane jest to przez specjalny tryb „thinking”, w którym model generuje chain-of-thought wewnątrz znaczników (np. ), a dopiero potem podaje skróconą odpowiedź użytkownikowi.

Ten tryb jest przełączalny – w zależności od zadania można wymusić pełne rozumowanie (dokładność kosztem latencji), uproszczone reasoning o ograniczonym budżecie lub bezpośrednią odpowiedź bez jawnego łańcucha myśli. W środowiskach enterprise pozwala to wyważyć koszty i szybkość w zależności od krytyczności zadania (np. walidacja konfiguracji systemu vs. proste pytanie FAQ).

Agentowe przepływy pracy i tool calling

Granite 4.2 zostały wyraźnie zaprojektowane pod tzw. agentic workflows – modele mają nie tylko „myśleć”, ale też planować, wybierać i wywoływać odpowiednie narzędzia oraz weryfikować rezultaty. Dzięki temu mogą obsługiwać wieloetapowe zadania: od analizy wymagań, przez wyszukiwanie informacji, po modyfikację kodu czy wykonanie komend w środowisku terminalowym.

Tool calling w Granite 4.2 wykorzystuje format funkcji kompatybilny z API OpenAI, co upraszcza integrację z istniejącymi orkiestratorami agentów i systemami pipeline’ów. Model nie wywołuje narzędzi „w ciemno” – reasoning jest używany do oceny, które narzędzie uruchomić, w jakiej kolejności i czy wynik jest spójny z celem zadania, co zmniejsza liczbę błędnych akcji.

Wieloetapowy proces treningu z RL i kodem syntetycznym

Agentowe zdolności Granite 4.2 nie wynikają tylko z rozmiaru, ale z przeprojektowanego procesu treningowego. IBM wykorzystał wieloetapowy pipeline z reinforcement learning, zbudowany na bazie modeli Granite 4.0. Pretraining sięga około 15 bilionów tokenów, w tym aż 1 bilion tokenów syntetycznego kodu wygenerowanego własnym pipeline’em CodeAlchemy.

Po klasycznym supervised fine-tuning wszystkie modele przechodzą przez fazę „foundational RL”, nastawioną na wzmacnianie umiejętności matematycznych, naukowych, programistycznych, reasoning’u i tool callingu z użyciem nagród weryfikowalnych oraz modeli nagrody. Dla wariantów 8B i 30B dochodzi specjalna faza „agentic RL”, w której model trenowany jest wewnątrz realistycznych środowisk – m.in. zadań programistycznych, pracy w terminalu i przepływów search-driven, co przekłada się na wyniki na benchmarkach takich jak SWE-Bench czy Terminal-Bench.

Dodatkowym elementem jest etap mid-training, wykorzystywany do „odblokowania” większej mocy reasoning’u oraz warstwa speculative decoding, która przyspiesza generowanie tekstu dla dużej liczby jednoczesnych użytkowników. IBM współpracuje też z Hirundo, wykorzystując machine unlearning do redukcji niepożądanych outputów bez konieczności pełnego ponownego treningu, co jest istotne dla higieny danych i zgodności regulacyjnej.

Modele mowy Granite Speech 5.0 Turbo CTC dla edge

Równolegle z Granite 4.2 IBM udostępnił dwa nowe modele mowy: Granite Speech 5.0 Turbo CTC oraz Granite Speech 5.0 Turbo CTC NC, o rozmiarze około 470M parametrów. To kompaktowe, wyłącznie enkoderowe modele ASR oparte na architekturze Conformer i Connectionist Temporal Classification, bez dekodera LLM, co radykalnie zmniejsza zasoby i latencję.

Turbo CTC osiąga przepustowość ponad 12 600 RTFx na pojedynczym GPU H200, co oznacza możliwość transkrypcji ponad 3,5 godziny mowy w sekundę przy batched inference – przy sprawdzonych wynikach około 5,0% WER dla wariantu Apache 2.0 i 4,85% dla wariantu NC. Model trenowany był na ok. 60 000 godzin angielskich danych audio (Apache) oraz ~75 000 godzin w wariancie NC, co celuje głównie w zastosowania enterprise: transkrypcje rozmów call center, podsumowania spotkań, live captioning na laptopie czy w aplikacjach webowych.

Licencjonowanie i otwartość – Apache 2.0 w praktyce

Wszystkie modele Granite 4.2 oraz Granite Speech 5.0 Turbo CTC (w wariancie komercyjnym) są udostępnione jako open weights pod licencją Apache 2.0, co pozwala na swobodne wykorzystanie w produktach komercyjnych, modyfikacje oraz fine-tuning bez dodatkowych ograniczeń licencyjnych. Dla części modeli mowy dostępny jest również wariant NC z licencją CC-BY-NC-SA-4.0, dedykowany do badań i zastosowań niekomercyjnych.

Wagi są publikowane na Hugging Face, GitHub oraz w ekosystemie Ollama, co ułatwia uruchamianie modeli lokalnie – zarówno na stacjach roboczych, jak i w środowiskach serwerowych czy chmurowych. Dodatkowo IBM podkreśla zgodność z normami ISO oraz podpisy kryptograficzne, co ma znaczenie dla organizacji wymagających ścisłej kontroli łańcucha dostaw modeli.

Zastosowania praktyczne Granite 4.2 w środowiskach enterprise

Najbardziej naturalnym zastosowaniem Granite 4.2 są agentowe systemy do inżynierii oprogramowania – modele mogą nawigować po repozytoriach, wykonywać wieloetapowe zadania (np. dodanie funkcji, aktualizacja testów, refaktoryzacja) i operować w terminalu, jednocześnie wykorzystując reasoning do weryfikacji, czy zmiany są sensowne. Dzięki wysokim wynikom na benchmarkach SWE-Bench i LiveCodeBench 30B nadaje się do automatyzacji bardziej wymagających zadań programistycznych, a 8B stanowi kompromis między jakością a kosztami.

Drugim obszarem są agentowe przepływy biznesowe: modele mogą orkiestrwać wywołania usług (API), systemów wyszukiwania, baz danych czy narzędzi analitycznych, np. przy automatyzacji raportowania, generowaniu spersonalizowanych dokumentów lub analizie incydentów w systemach IT. Dzięki długiemu kontekstowi możliwa jest praca z dużymi bazami wiedzy, dokumentacją procesów czy logami systemowymi bez konieczności ręcznego dzielenia danych na małe fragmenty.

Modele mowy Granite Speech 5.0 Turbo CTC uzupełniają ten ekosystem o warstwę wejścia audio – transkrypcja rozmów i spotkań może być przekazywana wprost do agentów opartych na Granite 4.2, tworząc pełne pipeline’y od mowy do działania (speech-to-action).

Jak zacząć pracę z Granite 4.2 w projektach open source

Dla zespołów open source i deweloperów hobbyistycznych najprostszą ścieżką jest pobranie modeli z Hugging Face (kolekcja Granite 4.2) i uruchomienie ich przez standardowe biblioteki, np. Transformers. Wariant 3B jest typowo wybierany do eksperymentów na pojedynczym GPU lub mocniejszym laptopie, natomiast 8B i 30B wymagają już konfiguracji serwerowej lub chmurowej.

W praktyce warto zacząć od:

  • Przygotowania zestawu zadań agentowych (np. proste workflow’y typu „znajdź błąd w kodzie i popraw”) i ich opisania w formie funkcji do tool callingu.
  • Eksperymentów z trybem „thinking” – porównania jakości odpowiedzi przy pełnym reasoning’u i odpowiedziach bez łańcucha myśli, aby dobrać parametry do konkretnego use case’u.
  • Stopniowego dodawania własnego fine-tuningu na domenowych danych (np. wewnętrzna baza ticketów, dokumentacja API) z zachowaniem zgodności z polityką danych organizacji.

W przypadku Granite Speech 5.0 Turbo CTC można od razu skorzystać z gotowych integracji w Transformers (AutoModelForCTC, AutoProcessor), budując pipeline do transkrypcji i prostych aplikacji webowych lub CLI.

Ograniczenia i otwarte kwestie

Mimo wysokich wyników na benchmarkach, Granite 4.2 pozostaje modelem ogólnego przeznaczenia – w zadaniach bardzo niszowych domenowo może wymagać dodatkowego fine-tuningu lub specjalistycznych narzędzi pomocniczych (retrieval, zewnętrzne symulatory). IBM jasno komunikuje, że część wyników (np. WER dla modeli mowy) ma status „nieoficjalny”, a efektywność może się różnić w zależności od danych i konfiguracji inference.

Warto też zwrócić uwagę na aspekty bezpieczeństwa i zgodności – choć machine unlearning z Hirundo ma redukować niepożądane outputy, organizacje korzystające z Granite 4.2 nadal powinny wdrożyć własne warstwy filtrów, monitoringu i kontroli jakości, szczególnie w zastosowaniach regulowanych (finanse, medycyna).

granite4.2

Ollama Library

IBM Granite Models are a family of enterprise-ready, open foundation models that support multilingual capabilities, coding, retrieval-augmented generation (RAG), tool use, thinking and structured JSON output. Released under Apache 2.0 license.

Rozmiary:
3b 8b 30b
$ ollama run granite4.2
Model

Źródła

🧠 Utrwal wiedzę z tego artykułu!

Kliknij pojęcie, by przypomnieć sobie definicję.

Expectation-Maximization algorithm (EM)
?
Algorytm Expectation-Maximization (EM) to iteracyjna metoda statystyczna stosowana do wyznaczania estymatorów największej wiarygodności w modelach ze zmiennymi utajonymi lub brakującymi...
Czytaj pełną definicję
agentic workflows
?
Agentic workflows (przepływy agentowe) to zaawansowane procesy oparte na agentach AI, które potrafią samodzielnie planować, podejmować decyzje i wykonywać złożone...
Czytaj pełną definicję
chain-of-thought
?
Chain-of-thought (CoT) to technika inżynierii promptów, która nakazuje modelowi językowemu przedstawienie toku rozumowania krok po kroku przed podaniem końcowej odpowiedzi....
Czytaj pełną definicję
Grouped Query Attention (GQA)
?
Grouped Query Attention (GQA) to technika optymalizacji mechanizmu uwagi w modelach typu transformer, która stanowi kompromis między precyzją Multi-Head Attention...
Czytaj pełną definicję
attention
?
Attention (mechanizm uwagi) to kluczowy element architektury transformerów, który pozwala modelowi skupić się na najważniejszych częściach danych wejściowych podczas generowania...
Czytaj pełną definicję

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *

Powiązane posty

Powrót do góry