Pierwsze kroki z Lokalnym AI

Zbuduj własne, prywatne AI. Zobacz kompleksowe zestawienie poradników – od instalacji pierwszej aplikacji po zaawansowanych agentów. Sprawdź poradnik

Vision Transformer (ViT-G/14) (ViT)

Vision Transformer (ViT) to architektura sieci neuronowej, która przenosi mechanizm atencji znany z modeli Transformer na obszar rozpoznawania i analizy obrazów. W odróżnieniu od tradycyjnych splotowych sieci neuronowych (CNN), ViT dzieli obraz na mniejsze, nakładające się lub rozłączne fragmenty (tzw. patches), które są następnie przetwarzane jako sekwencja tokenów. Dzięki mechanizmowi self-attention model potrafi efektywnie wychwytywać globalne zależności oraz relacje przestrzenne między różnymi częściami obrazu. Rozwiązanie to osiąga doskonałe wyniki w zadaniach takich jak klasyfikacja obrazów, detekcja obiektów czy segmentacja widokowa, szczególnie przy wykorzystaniu dużych zbiorów danych treningowych.

Źródło: github.com

Powiązane posty

Powrót do góry