Liquid AI udostępniło model LFM2.5‑2.6B – ważący 2,6 mld parametrów, zaprojektowany do uruchamiania agentów AI bezpośrednio na urządzeniach końcowych (laptop, telefon), bez potrzeby odwoływania się do chmury. Jego celem jest zapewnienie wysokiej wydajności przy bardzo niskim zużyciu pamięci i energii, co umożliwia budowę prywatnych, skalowalnych systemów agentowych działających 24/7.
Architektura i parametry techniczne
LFM2.5‑2.6B należy do rodziny Liquid Foundation Models (LFM2), wykorzystującej hybrydową architekturę łączącą bloki konwolucyjne z mechanizmami uwagi, co pozwala na bardzo szybkie wnioskowanie na CPU. Model ma 2,69 mld parametrów, 30 warstw (w tym 22 bloki z krótkimi konwolucjami i 8 warstw z grupową uwagą – GQA), rozszerzony słownik 128 tys. tokenów oraz okno kontekstowe 128 tys. tokenów.
Ważne cechy techniczne:
- Pre‑trening: ~34 biliony tokenów, z fazą wydłużania kontekstu do 128K.
- Wersje: dostępny jest checkpoint bazowy (
LFM2.5‑2.6B‑Base) oraz wersja post‑treningowa (LFM2.5‑2.6B) zoptymalizowana pod zadania agentowe. - Licencja: LFM Open License v1.0 – dozwolone użycie komercyjne dla podmiotów poniżej 10 mln USD rocznego przychodu, darmowe dla badań i nonprofit.
Pipeline post‑treningu pod agenty
Model został poddany czterostopniowemu procesowi post‑treningu, którego celem jest maksymalizacja zdolności do planowania, wywoływania narzędzi i realizacji wieloetapowych zadań.
- Supervised Fine‑Tuning (SFT): dwa etapy SFT z silnym naciskiem na dane agentowe (użycie narzędzi, przeszukiwanie sieci, ścieżki z agentów).
- Teacher Specialization: trening osobnych „nauczycieli” dla każdej domeny (matematyka, kod, narzędzia, długi kontekst itd.), każdy optymalizowany pod swój obszar.
- Multi‑Domain On‑Policy Distillation (MOPD): destylacja zdolności specjalistów do jednego modelu‑studenta, z informacją na poziomie tokenów.
- Agentic Reinforcement Learning (Agentic RL): wieloturkowy RL w prawdziwych środowiskach agentowych (m.in. OpenClaw, Hermes Agent), gdzie model uczy się działać w różnych harnessach, z różnymi narzędziami i promptami systemowymi.
Architektura treningowa rozdziela optymalizację modelu, generowanie rolloutu i wykonanie akcji w sandboxie, co pozwala traktować zewnętrzne harnessy jako „czarne skrzynki” i jednocześnie zbierać pełne trajektorie tokenów do treningu RL.
Wydajność i wymagania sprzętowe
LFM2.5‑2.6B został zaprojektowany tak, aby działać szybko nawet na CPU i w bardzo ograniczonej pamięci.
Zmierzone prędkości dekodowania:
- Apple M5 Max (CPU): ~220 tokenów/s, zużycie pamięci < 2,5 GB.
- AMD Ryzen AI Max+ 395 (CPU): ~113 tokenów/s.
- Telefon (mobile CPU): ~30 tokenów/s – wystarczające do interaktywnych agentów.
- GPU (H100): do ~15 tys. tokenów wyjściowych/s przy wysokiej współbieżności (~1,3 mld tokenów/dzień na jednej karcie).
Model ma natywne wsparcie w popularnych frameworkach inferencyjnych: llama.cpp (GGUF), MLX (Apple Silicon), vLLM, SGLang oraz ONNX.
Wyniki benchmarków (agenty, narzędzia, instrukcje)
Liquid AI porównało LFM2.5‑2.6B z modelami o 4–5× większej liczbie parametrów (m.in. Gemma‑4 5.1B/8B, Qwen3.5 4.7B/9.7B). Mimo mniejszego rozmiaru, model często je przewyższa w zadaniach istotnych dla agentów.
| Benchmark | LFM2.5‑2.6B (2.6B) | Gemma‑4‑E2B‑it (5.1B) | Gemma‑4‑E4B‑it (8B) | Qwen3.5‑4B (4.7B) | Qwen3.5‑9B (9.7B) |
|---|---|---|---|---|---|
| IFBench (instruction following) | 59.17 | 34.08 | 39.24 | 48.40 | 56.47 |
| Multi‑IF | 80.07 | 69.44 | 77.35 | 55.67 | 62.55 |
| IFStruct | 85.49 | 64.85 | 76.65 | 36.25 | 78.50 |
| BFCLv4 (tool use) | 56.88 | 36.98 | 46.39 | 50.56 | 60.13 |
| ToolSandbox | 77.83 | 52.40 | 65.00 | 75.55 | 76.44 |
| Claw‑Eval avg (EN) | 62.85 | 53.14 | 58.02 | 62.28 | 66.53 |
| BrowseComp+ (OpenClaw) | 26.89 | 8.31 | 15.90 | 24.46 | 27.23 |
| AIME25 (matematyka) | 51.87 | 26.33 | 34.27 | 49.33 | 56.07 |
| LiveCodeBench v6 (kod) | 59.41 | 54.92 | 63.77 | 60.85 | 69.86 |
Wyniki pokazują, że LFM2.5‑2.6B jest najlepszy w swojej klasie rozmiarowej w zakresie podążania za instrukcjami i użycia narzędzi, a w zadaniach agentowych (Claw‑Eval, BrowseComp+) rywalizuje z modelami wielokrotnie większymi. Słabszym obszarem pozostaje zaawansowane programowanie – tam większe modele nadal mają przewagę.
Praktyczne zastosowania
LFM2.5‑2.6B celuje w scenariusze, w których liczy się:
- Prywatność: dane nie opuszczają urządzenia (np. asystenci osobiste, analiza dokumentów firmowych).
- Koszt tokenów: przy masowo równoległych agentach (np. tło: sprawdzanie maili, kalendarza, planowanie podróży, research) lokalne wnioskowanie jest „darmowe” po stronie inference.
- Niska latencja: szybka reakcja na CPU, bez opóźnień związanych z wywołaniami API.
Przykładowe przypadki użycia:
- Osobisty agent na telefonie/laptopie, który czyta maile, sprawdza kalendarz, rezerwuje bilety/hotele, przygotowuje podsumowania.
- Wielu agentów działających w tle, każdy z własnym zadaniem (travel, finanse, research, notatki), uruchamianych równolegle na jednym urządzeniu.
- Wyspecjalizowane asystenty domenowe (medyczne, prawne, techniczne) wytrenowane przez fine‑tuning na
LFM2.5‑2.6B‑Base.
Jak uruchomić model lokalnie
Podstawowy schemat użycia w Pythonie (przy użyciu transformers):
- Zainstaluj najnowszą wersję
transformers(kompatybilną z v≥5.0.0). - Załaduj model i tokenizer z Hugging Face:
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "LiquidAI/LFM2.5-2.6B"
model = AutoModelForCausalLM.from_pretrained(
model_id,
device_map="auto",
dtype="bfloat16",
# attn_implementation="flash_attention_2" # opcjonalnie na GPU
)
tokenizer = AutoTokenizer.from_pretrained(model_id)
prompt = "What is C. elegans?"
input_ids = tokenizer.apply_chat_template(
[{"role": "user", "content": prompt}],
add_generation_prompt=True,
return_tensors="pt",
tokenize=True,
).to(model.device)
output = model.generate(
input_ids,
do_sample=True,
temperature=0.2,
top_k=80,
repetition_penalty=1.05,
max_new_tokens=512,
)
print(tokenizer.decode(output, skip_special_tokens=False))
W praktyce agentowej model jest zwykle wystawiany za OpenAI‑kompatybilnym endpointem (np. przez vLLM, SGLang lub llama.cpp), a następnie podpinany pod harness agenta (Hermes Agent, OpenClaw, Pi itp.).
Dostępność w narzędziach
W momencie pisania wpisu, model jest możliwy do przetestowania w LM Studio.
Podsumowanie techniczne
LFM2.5‑2.6B to model, który w małym rozmiarze (2.6B) osiąga wydajność agentową porównywalną z modelami 4–5× większymi, dzięki:
- hybrydowej architekturze LFM2 (szybkość na CPU),
- intensywnemu post‑treningowi pod agenty (SFT → specjaliści → MOPD → Agentic RL),
- długiemu kontekstowi (128K) i szerokiemu słownikowi (128K tokenów).
Dla zastosowań wymagających ciężkiego kodowania lub bardzo złożonych zadań STEM nadal warto rozważyć większe modele, ale dla większości zadań agentowych na urządzeniach końcowych LFM2.5‑2.6B jest obecnie jednym z najciekawszych otwartych wyborów.
Źródła
- Deploy local agents everywhere with LFM2.5-2.6B – Liquid AI (Hugging Face Blog)
- LFM2.5-2.6B: Deploy Agents Everywhere – Liquid AI Blog
- LFM2 Technical Report
- LFM2.5-2.6B: Liquid AI’s On-Device Agent Model Runs at 220 tok/s
- LFM2.5-2.6B-Base Explained: 34T Tokens, Zero Benchmarks




