Pierwsze kroki z Lokalnym AI

Zbuduj własne, prywatne AI. Zobacz kompleksowe zestawienie poradników – od instalacji pierwszej aplikacji po zaawansowanych agentów. Sprawdź poradnik

Large Language Model with Vision Capabilities (LLMVision)

Large Language Model with Vision Capabilities (LLMVision) to zaawansowany model multimodalny, który łączy zdolności przetwarzania tekstu z analizą obrazów. Dzięki zastosowaniu architektury transformer do fragmentów zdjęć (tokenów wizualnych), system ten potrafi opisywać, tagować i interpretować zawartość wizualną w kontekście języka naturalnego.

Źródło: github.com

Powiązane posty

Zacznij wpisywać wyszukiwane hasło powyżej i naciśnij Enter, aby wyszukać. Naciśnij ESC, aby anulować.

Powrót do góry