Llama.cpp to otwartoźródłowy, lekki silnik inferencyjny napisany w czystym języku C/C++, który umożliwia lokalne uruchamianie dużych modeli językowych (LLM). Projekt skupia się na optymalizacji wydajności i minimalizacji wymagań sprzętowych, m.in. poprzez zaawansowaną kwantyzację wag modeli i obsługę formatu GGUF. Dzięki brakowi zewnętrznych zależności pozwala na efektywne generowanie odpowiedzi zarówno na standardowych procesorach (CPU), jak i z wykorzystaniem akceleracji graficznej (GPU) na różnych systemach operacyjnych. Stanowi on fundament dla wielu popularnych narzędzi do lokalnego przetwarzania AI, takich jak Ollama czy Jan.
llama.cpp (lightweight inference engine) (llama.cpp)
Źródło: llama.app



