Lokalne AI – od czego zacząć?

Gubisz się w gąszczu pojęć? Sprawdź nasz kompletny przewodnik krok po kroku, dobierz sprzęt i uruchom sztuczną inteligencję na własnym komputerze. Zacznij tutaj!

LFM2.5‑2.6B: model działający w pełni lokalnie

zajawka nowosci
Ostatnia aktualizacja: 6 sierpnia, 2026

Liquid AI udostępniło model LFM2.5‑2.6B – ważący 2,6 mld parametrów, zaprojektowany do uruchamiania agentów AI bezpośrednio na urządzeniach końcowych (laptop, telefon), bez potrzeby odwoływania się do chmury. Jego celem jest zapewnienie wysokiej wydajności przy bardzo niskim zużyciu pamięci i energii, co umożliwia budowę prywatnych, skalowalnych systemów agentowych działających 24/7.

Architektura i parametry techniczne

LFM2.5‑2.6B należy do rodziny Liquid Foundation Models (LFM2), wykorzystującej hybrydową architekturę łączącą bloki konwolucyjne z mechanizmami uwagi, co pozwala na bardzo szybkie wnioskowanie na CPU. Model ma 2,69 mld parametrów, 30 warstw (w tym 22 bloki z krótkimi konwolucjami i 8 warstw z grupową uwagą – GQA), rozszerzony słownik 128 tys. tokenów oraz okno kontekstowe 128 tys. tokenów.

Ważne cechy techniczne:

  • Pre‑trening: ~34 biliony tokenów, z fazą wydłużania kontekstu do 128K.
  • Wersje: dostępny jest checkpoint bazowy (LFM2.5‑2.6B‑Base) oraz wersja post‑treningowa (LFM2.5‑2.6B) zoptymalizowana pod zadania agentowe.
  • Licencja: LFM Open License v1.0 – dozwolone użycie komercyjne dla podmiotów poniżej 10 mln USD rocznego przychodu, darmowe dla badań i nonprofit.

Pipeline post‑treningu pod agenty

Model został poddany czterostopniowemu procesowi post‑treningu, którego celem jest maksymalizacja zdolności do planowania, wywoływania narzędzi i realizacji wieloetapowych zadań.

  1. Supervised Fine‑Tuning (SFT): dwa etapy SFT z silnym naciskiem na dane agentowe (użycie narzędzi, przeszukiwanie sieci, ścieżki z agentów).
  2. Teacher Specialization: trening osobnych „nauczycieli” dla każdej domeny (matematyka, kod, narzędzia, długi kontekst itd.), każdy optymalizowany pod swój obszar.
  3. Multi‑Domain On‑Policy Distillation (MOPD): destylacja zdolności specjalistów do jednego modelu‑studenta, z informacją na poziomie tokenów.
  4. Agentic Reinforcement Learning (Agentic RL): wieloturkowy RL w prawdziwych środowiskach agentowych (m.in. OpenClaw, Hermes Agent), gdzie model uczy się działać w różnych harnessach, z różnymi narzędziami i promptami systemowymi.

Architektura treningowa rozdziela optymalizację modelu, generowanie rolloutu i wykonanie akcji w sandboxie, co pozwala traktować zewnętrzne harnessy jako „czarne skrzynki” i jednocześnie zbierać pełne trajektorie tokenów do treningu RL.

Wydajność i wymagania sprzętowe

LFM2.5‑2.6B został zaprojektowany tak, aby działać szybko nawet na CPU i w bardzo ograniczonej pamięci.

Zmierzone prędkości dekodowania:

  • Apple M5 Max (CPU): ~220 tokenów/s, zużycie pamięci < 2,5 GB.
  • AMD Ryzen AI Max+ 395 (CPU): ~113 tokenów/s.
  • Telefon (mobile CPU): ~30 tokenów/s – wystarczające do interaktywnych agentów.
  • GPU (H100): do ~15 tys. tokenów wyjściowych/s przy wysokiej współbieżności (~1,3 mld tokenów/dzień na jednej karcie).

Model ma natywne wsparcie w popularnych frameworkach inferencyjnych: llama.cpp (GGUF), MLX (Apple Silicon), vLLM, SGLang oraz ONNX.

Wyniki benchmarków (agenty, narzędzia, instrukcje)

Liquid AI porównało LFM2.5‑2.6B z modelami o 4–5× większej liczbie parametrów (m.in. Gemma‑4 5.1B/8B, Qwen3.5 4.7B/9.7B). Mimo mniejszego rozmiaru, model często je przewyższa w zadaniach istotnych dla agentów.

BenchmarkLFM2.5‑2.6B (2.6B)Gemma‑4‑E2B‑it (5.1B)Gemma‑4‑E4B‑it (8B)Qwen3.5‑4B (4.7B)Qwen3.5‑9B (9.7B)
IFBench (instruction following)59.1734.0839.2448.4056.47
Multi‑IF80.0769.4477.3555.6762.55
IFStruct85.4964.8576.6536.2578.50
BFCLv4 (tool use)56.8836.9846.3950.5660.13
ToolSandbox77.8352.4065.0075.5576.44
Claw‑Eval avg (EN)62.8553.1458.0262.2866.53
BrowseComp+ (OpenClaw)26.898.3115.9024.4627.23
AIME25 (matematyka)51.8726.3334.2749.3356.07
LiveCodeBench v6 (kod)59.4154.9263.7760.8569.86

Wyniki pokazują, że LFM2.5‑2.6B jest najlepszy w swojej klasie rozmiarowej w zakresie podążania za instrukcjami i użycia narzędzi, a w zadaniach agentowych (Claw‑Eval, BrowseComp+) rywalizuje z modelami wielokrotnie większymi. Słabszym obszarem pozostaje zaawansowane programowanie – tam większe modele nadal mają przewagę.

Praktyczne zastosowania

LFM2.5‑2.6B celuje w scenariusze, w których liczy się:

  • Prywatność: dane nie opuszczają urządzenia (np. asystenci osobiste, analiza dokumentów firmowych).
  • Koszt tokenów: przy masowo równoległych agentach (np. tło: sprawdzanie maili, kalendarza, planowanie podróży, research) lokalne wnioskowanie jest „darmowe” po stronie inference.
  • Niska latencja: szybka reakcja na CPU, bez opóźnień związanych z wywołaniami API.

Przykładowe przypadki użycia:

  • Osobisty agent na telefonie/laptopie, który czyta maile, sprawdza kalendarz, rezerwuje bilety/hotele, przygotowuje podsumowania.
  • Wielu agentów działających w tle, każdy z własnym zadaniem (travel, finanse, research, notatki), uruchamianych równolegle na jednym urządzeniu.
  • Wyspecjalizowane asystenty domenowe (medyczne, prawne, techniczne) wytrenowane przez fine‑tuning na LFM2.5‑2.6B‑Base.

Jak uruchomić model lokalnie

Podstawowy schemat użycia w Pythonie (przy użyciu transformers):

  • Zainstaluj najnowszą wersję transformers (kompatybilną z v≥5.0.0).
  • Załaduj model i tokenizer z Hugging Face:
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "LiquidAI/LFM2.5-2.6B"
model = AutoModelForCausalLM.from_pretrained(
model_id,
device_map="auto",
dtype="bfloat16",
# attn_implementation="flash_attention_2" # opcjonalnie na GPU
)
tokenizer = AutoTokenizer.from_pretrained(model_id)
prompt = "What is C. elegans?"
input_ids = tokenizer.apply_chat_template(
[{"role": "user", "content": prompt}],
add_generation_prompt=True,
return_tensors="pt",
tokenize=True,
).to(model.device)
output = model.generate(
input_ids,
do_sample=True,
temperature=0.2,
top_k=80,
repetition_penalty=1.05,
max_new_tokens=512,
)
print(tokenizer.decode(output, skip_special_tokens=False))

W praktyce agentowej model jest zwykle wystawiany za OpenAI‑kompatybilnym endpointem (np. przez vLLM, SGLang lub llama.cpp), a następnie podpinany pod harness agenta (Hermes Agent, OpenClaw, Pi itp.).

Dostępność w narzędziach

W momencie pisania wpisu, model jest możliwy do przetestowania w LM Studio.

Podsumowanie techniczne

LFM2.5‑2.6B to model, który w małym rozmiarze (2.6B) osiąga wydajność agentową porównywalną z modelami 4–5× większymi, dzięki:

  • hybrydowej architekturze LFM2 (szybkość na CPU),
  • intensywnemu post‑treningowi pod agenty (SFT → specjaliści → MOPD → Agentic RL),
  • długiemu kontekstowi (128K) i szerokiemu słownikowi (128K tokenów).

Dla zastosowań wymagających ciężkiego kodowania lub bardzo złożonych zadań STEM nadal warto rozważyć większe modele, ale dla większości zadań agentowych na urządzeniach końcowych LFM2.5‑2.6B jest obecnie jednym z najciekawszych otwartych wyborów.

Źródła

🧠 Utrwal wiedzę z tego artykułu!

Kliknij pojęcie, by przypomnieć sobie definicję.

Agentic Reinforcement Learning (Agentic RL)
?
Agentic Reinforcement Learning (Agentic RL) to zaawansowany nurt w uczeniu przez wzmacnianie, który koncentruje się na tworzeniu autonomicznych agentów AI...
Czytaj pełną definicję
OpenClaw (agent benchmark/environment) (OpenClaw)
?
OpenClaw to otwartoźródłowy, samodzielnie hostowany agent sztucznej inteligencji oraz środowisko uruchomieniowe wprowadzone pod koniec 2025 roku. Narzędzie działa jako pomost...
Czytaj pełną definicję
Liquid Foundation Models (LFM2)
?
Liquid Foundation Models (LFM2) to generacja modeli językowych opracowana przez firmę Liquid AI, zaprojektowana z myślą o wydajnym działaniu bezpośrednio...
Czytaj pełną definicję
Liquid Foundation Model 2.5‑2.6B (LFM2.5-2.6B)
?
Liquid Foundation Model 2.5-2.6B (LFM2.5-2.6B) to kompaktowy model językowy o rozmiarze 2,6 miliarda parametrów, wydany przez firmę Liquid AI w...
Czytaj pełną definicję
Hybrid architecture combining convolutional blocks and attention mechanisms (Hybrid architecture)
?
Architektura hybrydowa łącząca bloki konwolucyjne i mechanizmy uwagi to zaawansowany model głębokiego uczenia, który integruje zalety różnych podejść sieciowych. Bloki...
Czytaj pełną definicję
Multi‑Domain On‑Policy Distillation (MOPD)
?
Multi-Domain On-Policy Distillation (MOPD) to zaawansowana metoda uczenia post-trainingowego modeli językowych, służąca do integrowania różnorodnych umiejętności w ramach jednego modelu...
Czytaj pełną definicję

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *

Powiązane posty

Zacznij wpisywać wyszukiwane hasło powyżej i naciśnij Enter, aby wyszukać. Naciśnij ESC, aby anulować.

Powrót do góry