Vision Encoder (koder wizyjny) to komponent modeli sztucznej inteligencji odpowiedzialny za przetwarzanie i analizę danych obrazowych, takich jak zdjęcia czy klatki wideo. Przekształca on surowe piksele na abstrakcyjne reprezentacje wektorowe, które uchwytują kluczowe cechy i kontekst wizualny. Dzięki temu systemy multimodalne mogą efektywnie łączyć informacje wizualne z danymi tekstowymi. Jest to kluczowy element umożliwiający modelom AI pełne rozumienie i interpretowanie obrazów.




