Pierwsze kroki z Lokalnym AI

Zbuduj własne, prywatne AI. Zobacz kompleksowe zestawienie poradników – od instalacji pierwszej aplikacji po zaawansowanych agentów. Sprawdź poradnik

Large Language Model with Vision Capabilities (LLMVision)

Large Language Model with Vision Capabilities (LLMVision) to zaawansowany model multimodalny, który łączy zdolności przetwarzania tekstu z analizą obrazów. Dzięki zastosowaniu architektury transformer do fragmentów zdjęć (tokenów wizualnych), system ten potrafi opisywać, tagować i interpretować zawartość wizualną w kontekście języka naturalnego.

Źródło: github.com

Powiązane posty

Powrót do góry