Streszczenie AI
Apple zaprezentował model LensVLM‑9B, który zamiast wczytywać długie dokumenty w postaci tokenów tekstowych, zamienia je w skompresowane obrazy stron. Dzięki szybkiemu skanowaniu wizualnych “skrótów” model selektywnie przywraca wybrane fragmenty do pełnej rozdzielczości, redukując pamięć i koszty operacji uwagi, przy zachowaniu jakości odpowiedzi. LensVLM jest dostępny na licencji badawczej Apple ML Research i otriszonym kodzie na Hugging Face oraz GitHub.
Spis treści:
Firma Apple opublikowała model wizyjno-językowy LensVLM-9B, który wprowadza nowatorskie podejście do przetwarzania bardzo długich dokumentów poprzez zamianę tekstu na skompresowane obrazy stron. Zamiast umieszczać całą treść w oknie kontekstowym w postaci standardowych tokenów tekstowych, architektura skanuje miniatury dokumentu i za pomocą wyuczonych narzędzi dynamicznie przywraca do pełnej rozdzielczości wyłącznie te fragmenty, które są niezbędne do udzielenia odpowiedzi.
Architektura i zasada działania LensVLM
Tradycyjne modele językowe oraz multimodalne napotykają na barierę kwadratowej lub wysokiej liniowej złożoności obliczeniowej mechanizmu uwagi wraz ze wzrostem długości sekwencji wejściowej. LensVLM-9B opiera się na fundamencie Qwen3.5-9B i proponuje odwrócenie klasycznego potoku RAG czy pełnotekstowego przetwarzania wielokontekstowego na rzecz reprezentacji wizualnej.
Zamiast traktować dokument jako ciąg dziesiątek tysięcy tokenów tekstowych, silnik renderuje poszczególne strony jako obrazy o zredukowanej rozdzielczości przy konfigurowalnych współczynnikach kompresji (dostępne profile to 5x, 10x oraz 15x). Model w pierwszej fazie dokonuje szybkiego przeglądu wizualnych skrótów całego dokumentu, identyfikując kluczowe układy tabel, nagłówków czy akapitów, a następnie uruchamia wyuczone wywołanie narzędziowe (m.in. funkcję read_page) w celu selektywnej dekompresji wytypowanych stron do ich oryginalnej postaci tekstowej lub wysokorozdzielczej grafiki.
LensVLM nie próbuje bezbłędnie odczytywać każdego znaku przy ekstremalnej kompresji wizualnej, lecz wykorzystuje skompresowany obraz jako mapę przestrzenną, z której selektywnie powiększa tylko relewantne fragmenty za pośrednictwem wyuczonych akcji narzędziowych.
Podejście to pozwala drastycznie zmniejszyć obciążenie pamięci podręcznej KV Cache oraz przyspieszyć czas pierwszego tokenu (TTFT), eliminując konieczność ciągłego przetrzymywania pełnego tekstu w oknie uwagi.
Porównanie wydajności i kompresji
Zgodnie z danymi zaprezentowanymi w publikacji badawczej przygotowanej przez inżynierów Apple, mechanizm selektywnej ekspansji pozwala zachować jakość zbliżoną do przetwarzania pełnotekstowego przy jednoczesnej redukcji kosztu tokenowego. Skuteczność rozwiązania zestawiono z klasycznymi metodami wyszukiwania i kompresji:
Metoda przetwarzania | Efektywny współczynnik kompresji | Zachowanie dokładności QA | Zarządzanie kontekstem |
|---|---|---|---|
| Pełny tekst (Full-text Upper Bound) | 1.0x (brak kompresji) | 100% (baza referencyjna) | Wysoki narzut KV Cache, pełne okno tokenów |
| LensVLM (tryb zrównoważony) | 4.3x | Zbliżona do pełnego tekstu | Renderowane obrazy + dynamiczne wywołanie stron |
| LensVLM (wysoka kompresja) | Do 10.1x | Wyższa niż klasyczne RAG i Text-Compression | Skanowanie miniatur 10x/15x + ekspansja docelowa |
| Klasyczny RAG (wyszukiwanie wektorowe) | Zmienna (zależna od top-k) | Podatność na utratę kontekstu i błędy chunkingu | Utrata relacji przestrzennych i struktury wizualnej |
Główne atuty techniczne modelu
- Ochrona integralności wizualnej: Dokumenty zawierające tabele, wielokolumnowy skład, infografiki lub schematy nie ulegają spłaszczeniu ani uszkodzeniu podczas parsowania tekstu, ponieważ model operuje bezpośrednio na wyrenderowanym układzie graficznym.
- Skalowalność okna kontekstowego: Zmniejszenie liczby tokenów przypadających na stronę pozwala analizować wielostronicowe raporty finansowe, dokumentację techniczną czy książki w ramach standardowych limitów pamięciowych kart graficznych.
- Natywna integracja z silnikami inferencyjnymi: Mimo specyfiki działania LensVLM-9B jest w pełni kompatybilny ze współczesnymi bibliotekami wdrożeniowymi, takimi jak Transformers, vLLM oraz SGLang, a także posiada społecznościowe kwantyzacje formatu GGUF i MLX.
Praktyczne zastosowania w inżynierii danych i systemach agentowych
Koncepcja reprezentowania długiego tekstu jako obrazów podlegających selektywnej dekompresji rozwiązuje kilka fundamentalnych problemów współczesnych architektur LLM:
- Analiza złożonych raportów finansowych i prawnych: W dokumentach, gdzie kolejność komórek w tabeli lub układ przypisów decyduje o sensie merytorycznym, LensVLM eliminuje błędy typowe dla silników OCR i parserów PDF bazujących na wyrażeniach regularnych.
- Autonomiczni agenci przeszukujący archiwa: Agent wyposażony w LensVLM może w ułamku sekundy przejrzeć setki stron zminimalizowanych dokumentów, wywołać selektywne odczytanie wyłącznie dwóch kluczowych stron i wygenerować precyzyjną odpowiedź bez zapychania pamięci podręcznej sesji.
- Optymalizacja kosztów operacyjnych infrastruktury chmurowej: Zmniejszenie efektywnego rozmiaru sekwencji wejściowej o współczynnik od 4x do 10x przekłada się bezpośrednio na redukcję opóźnień przetwarzania wsadowego oraz mniejsze zapotrzebowanie na pamięć VRAM w klastrach obliczeniowych.
Licencja i dostępność
Model LensVLM-9B został udostępniony w formacie Safetensors w ekosystemie Hugging Face na dedykowanej licencji badawczej Apple Machine Learning Research Model License (apple-amlr), która zezwala na ewaluację akademicką i eksperymenty badawcze, wykluczając bezpośrednie wdrożenia komercyjne bez odrębnych porozumień licencyjnych. Kod źródłowy implementujący potok kompresji oraz demonstracyjne skrypty uruchomieniowe udostępniono w oficjalnym repozytorium badawczym Apple na platformie GitHub.





