Llama.cpp to otwartoźródłowy silnik wnioskowania napisany w języku C/C++, którego głównym celem jest uruchamianie dużych modeli językowych (LLM) przy minimalnych wymaganiach sprzętowych. Został zoptymalizowany pod kątem działania na procesorach (CPU) oraz zintegrowanych układach graficznych, co umożliwia lokalne i wydajne procesowanie AI na standardowych komputerach osobistych bez dedykowanych kart graficznych NVidia. Projekt ten wykorzystuje zaawansowane techniki kwantyzacji do kompresji modeli do formatu GGUF, drastycznie zmniejszając zapotrzebowanie na pamięć RAM i VRAM przy zachowaniu wysokiej jakości generowanych odpowiedzi. Dzięki swojej lekkości i braku zewnętrznych zależności, llama.cpp stanowi fundament dla wielu popularnych narzędzi i aplikacji do lokalnego uruchamiania sztucznej inteligencji.
C++ inference engine for large language models (llama.cpp)
Źródło: llama.app



