Spis treści:
- Architektura i rozmiary modeli Granite 4.2
- Native reasoning i tryb „thinking” w praktyce
- Agentowe przepływy pracy i tool calling
- Wieloetapowy proces treningu z RL i kodem syntetycznym
- Modele mowy Granite Speech 5.0 Turbo CTC dla edge
- Licencjonowanie i otwartość – Apache 2.0 w praktyce
- Zastosowania praktyczne Granite 4.2 w środowiskach enterprise
- Jak zacząć pracę z Granite 4.2 w projektach open source
- Ograniczenia i otwarte kwestie
- Źródła
Granite 4.2 to nowa generacja dużych modeli językowych IBM, zaprojektowana z myślą o agentach, które nie tylko odpowiadają na pytania, ale potrafią planować, wykonywać złożone zadania i korzystać z narzędzi w kontrolowany sposób. Modele te łączą gęstą (dense) architekturę transformerową z natywnym trybem „thinking”, wieloetapowym treningiem RL oraz otwartą licencją Apache 2.0, co czyni je szczególnie interesującymi dla zastosowań enterprise i open source.
Architektura i rozmiary modeli Granite 4.2
Granite 4.2 to rodzina gęstych, decoder-only modeli językowych w trzech rozmiarach: 3B, 8B i 30B parametrów. Taka skala pozwala dobrać model do konkretnego scenariusza – od lekkich zadań na brzegu (edge) po złożone przepływy analityczne i programistyczne w środowiskach serwerowych.
Wszystkie warianty oferują natywne okno kontekstu rzędu 128k tokenów, a IBM komunikuje możliwość rozszerzenia do 512k w największym modelu, co umożliwia przetwarzanie dużych repozytoriów kodu czy dokumentacji technicznej w jednym zapytaniu. Modele są gęstymi transformerami z grupowaną atencją zapytań (Grouped Query Attention), RoPE oraz głębokimi sieciami MLP typu SwiGLU, co jest typowe dla współczesnych modeli nastawionych na reasoning.
Model | Parametry | Kontekst | AIME25 (math) | SWE-Bench Verified | MMLU-Pro |
|---|---|---|---|---|---|
| Granite 4.2 3B | 3B | 128k (do 512k) | 78,33% | brak wyniku (bez agentic RL) | 67,84% |
| Granite 4.2 8B | 8B | 128k | 86,67% | 47,67 | 74,04% |
| Granite 4.2 30B | 30B | 128k (do 512k) | 89,17% | 57,00 | 77,60% |
Native reasoning i tryb „thinking” w praktyce
Kluczową różnicą między Granite 4.2 a wcześniejszymi generacjami jest natywne wsparcie dla reasoning’u – modele potrafią wykonywać krok po kroku rozumowanie przed wygenerowaniem finalnej odpowiedzi. Realizowane jest to przez specjalny tryb „thinking”, w którym model generuje chain-of-thought wewnątrz znaczników (np.
Ten tryb jest przełączalny – w zależności od zadania można wymusić pełne rozumowanie (dokładność kosztem latencji), uproszczone reasoning o ograniczonym budżecie lub bezpośrednią odpowiedź bez jawnego łańcucha myśli. W środowiskach enterprise pozwala to wyważyć koszty i szybkość w zależności od krytyczności zadania (np. walidacja konfiguracji systemu vs. proste pytanie FAQ).
Agentowe przepływy pracy i tool calling
Granite 4.2 zostały wyraźnie zaprojektowane pod tzw. agentic workflows – modele mają nie tylko „myśleć”, ale też planować, wybierać i wywoływać odpowiednie narzędzia oraz weryfikować rezultaty. Dzięki temu mogą obsługiwać wieloetapowe zadania: od analizy wymagań, przez wyszukiwanie informacji, po modyfikację kodu czy wykonanie komend w środowisku terminalowym.
Tool calling w Granite 4.2 wykorzystuje format funkcji kompatybilny z API OpenAI, co upraszcza integrację z istniejącymi orkiestratorami agentów i systemami pipeline’ów. Model nie wywołuje narzędzi „w ciemno” – reasoning jest używany do oceny, które narzędzie uruchomić, w jakiej kolejności i czy wynik jest spójny z celem zadania, co zmniejsza liczbę błędnych akcji.
Wieloetapowy proces treningu z RL i kodem syntetycznym
Agentowe zdolności Granite 4.2 nie wynikają tylko z rozmiaru, ale z przeprojektowanego procesu treningowego. IBM wykorzystał wieloetapowy pipeline z reinforcement learning, zbudowany na bazie modeli Granite 4.0. Pretraining sięga około 15 bilionów tokenów, w tym aż 1 bilion tokenów syntetycznego kodu wygenerowanego własnym pipeline’em CodeAlchemy.
Po klasycznym supervised fine-tuning wszystkie modele przechodzą przez fazę „foundational RL”, nastawioną na wzmacnianie umiejętności matematycznych, naukowych, programistycznych, reasoning’u i tool callingu z użyciem nagród weryfikowalnych oraz modeli nagrody. Dla wariantów 8B i 30B dochodzi specjalna faza „agentic RL”, w której model trenowany jest wewnątrz realistycznych środowisk – m.in. zadań programistycznych, pracy w terminalu i przepływów search-driven, co przekłada się na wyniki na benchmarkach takich jak SWE-Bench czy Terminal-Bench.
Dodatkowym elementem jest etap mid-training, wykorzystywany do „odblokowania” większej mocy reasoning’u oraz warstwa speculative decoding, która przyspiesza generowanie tekstu dla dużej liczby jednoczesnych użytkowników. IBM współpracuje też z Hirundo, wykorzystując machine unlearning do redukcji niepożądanych outputów bez konieczności pełnego ponownego treningu, co jest istotne dla higieny danych i zgodności regulacyjnej.
Modele mowy Granite Speech 5.0 Turbo CTC dla edge
Równolegle z Granite 4.2 IBM udostępnił dwa nowe modele mowy: Granite Speech 5.0 Turbo CTC oraz Granite Speech 5.0 Turbo CTC NC, o rozmiarze około 470M parametrów. To kompaktowe, wyłącznie enkoderowe modele ASR oparte na architekturze Conformer i Connectionist Temporal Classification, bez dekodera LLM, co radykalnie zmniejsza zasoby i latencję.
Turbo CTC osiąga przepustowość ponad 12 600 RTFx na pojedynczym GPU H200, co oznacza możliwość transkrypcji ponad 3,5 godziny mowy w sekundę przy batched inference – przy sprawdzonych wynikach około 5,0% WER dla wariantu Apache 2.0 i 4,85% dla wariantu NC. Model trenowany był na ok. 60 000 godzin angielskich danych audio (Apache) oraz ~75 000 godzin w wariancie NC, co celuje głównie w zastosowania enterprise: transkrypcje rozmów call center, podsumowania spotkań, live captioning na laptopie czy w aplikacjach webowych.
Licencjonowanie i otwartość – Apache 2.0 w praktyce
Wszystkie modele Granite 4.2 oraz Granite Speech 5.0 Turbo CTC (w wariancie komercyjnym) są udostępnione jako open weights pod licencją Apache 2.0, co pozwala na swobodne wykorzystanie w produktach komercyjnych, modyfikacje oraz fine-tuning bez dodatkowych ograniczeń licencyjnych. Dla części modeli mowy dostępny jest również wariant NC z licencją CC-BY-NC-SA-4.0, dedykowany do badań i zastosowań niekomercyjnych.
Wagi są publikowane na Hugging Face, GitHub oraz w ekosystemie Ollama, co ułatwia uruchamianie modeli lokalnie – zarówno na stacjach roboczych, jak i w środowiskach serwerowych czy chmurowych. Dodatkowo IBM podkreśla zgodność z normami ISO oraz podpisy kryptograficzne, co ma znaczenie dla organizacji wymagających ścisłej kontroli łańcucha dostaw modeli.
Zastosowania praktyczne Granite 4.2 w środowiskach enterprise
Najbardziej naturalnym zastosowaniem Granite 4.2 są agentowe systemy do inżynierii oprogramowania – modele mogą nawigować po repozytoriach, wykonywać wieloetapowe zadania (np. dodanie funkcji, aktualizacja testów, refaktoryzacja) i operować w terminalu, jednocześnie wykorzystując reasoning do weryfikacji, czy zmiany są sensowne. Dzięki wysokim wynikom na benchmarkach SWE-Bench i LiveCodeBench 30B nadaje się do automatyzacji bardziej wymagających zadań programistycznych, a 8B stanowi kompromis między jakością a kosztami.
Drugim obszarem są agentowe przepływy biznesowe: modele mogą orkiestrwać wywołania usług (API), systemów wyszukiwania, baz danych czy narzędzi analitycznych, np. przy automatyzacji raportowania, generowaniu spersonalizowanych dokumentów lub analizie incydentów w systemach IT. Dzięki długiemu kontekstowi możliwa jest praca z dużymi bazami wiedzy, dokumentacją procesów czy logami systemowymi bez konieczności ręcznego dzielenia danych na małe fragmenty.
Modele mowy Granite Speech 5.0 Turbo CTC uzupełniają ten ekosystem o warstwę wejścia audio – transkrypcja rozmów i spotkań może być przekazywana wprost do agentów opartych na Granite 4.2, tworząc pełne pipeline’y od mowy do działania (speech-to-action).
Jak zacząć pracę z Granite 4.2 w projektach open source
Dla zespołów open source i deweloperów hobbyistycznych najprostszą ścieżką jest pobranie modeli z Hugging Face (kolekcja Granite 4.2) i uruchomienie ich przez standardowe biblioteki, np. Transformers. Wariant 3B jest typowo wybierany do eksperymentów na pojedynczym GPU lub mocniejszym laptopie, natomiast 8B i 30B wymagają już konfiguracji serwerowej lub chmurowej.
W praktyce warto zacząć od:
- Przygotowania zestawu zadań agentowych (np. proste workflow’y typu „znajdź błąd w kodzie i popraw”) i ich opisania w formie funkcji do tool callingu.
- Eksperymentów z trybem „thinking” – porównania jakości odpowiedzi przy pełnym reasoning’u i odpowiedziach bez łańcucha myśli, aby dobrać parametry do konkretnego use case’u.
- Stopniowego dodawania własnego fine-tuningu na domenowych danych (np. wewnętrzna baza ticketów, dokumentacja API) z zachowaniem zgodności z polityką danych organizacji.
W przypadku Granite Speech 5.0 Turbo CTC można od razu skorzystać z gotowych integracji w Transformers (AutoModelForCTC, AutoProcessor), budując pipeline do transkrypcji i prostych aplikacji webowych lub CLI.
Ograniczenia i otwarte kwestie
Mimo wysokich wyników na benchmarkach, Granite 4.2 pozostaje modelem ogólnego przeznaczenia – w zadaniach bardzo niszowych domenowo może wymagać dodatkowego fine-tuningu lub specjalistycznych narzędzi pomocniczych (retrieval, zewnętrzne symulatory). IBM jasno komunikuje, że część wyników (np. WER dla modeli mowy) ma status „nieoficjalny”, a efektywność może się różnić w zależności od danych i konfiguracji inference.
Warto też zwrócić uwagę na aspekty bezpieczeństwa i zgodności – choć machine unlearning z Hirundo ma redukować niepożądane outputy, organizacje korzystające z Granite 4.2 nadal powinny wdrożyć własne warstwy filtrów, monitoringu i kontroli jakości, szczególnie w zastosowaniach regulowanych (finanse, medycyna).
granite4.2
Ollama LibraryIBM Granite Models are a family of enterprise-ready, open foundation models that support multilingual capabilities, coding, retrieval-augmented generation (RAG), tool use, thinking and structured JSON output. Released under Apache 2.0 license.
ollama run granite4.2





