Vision Transformer (ViT) to architektura sieci neuronowej, która przenosi mechanizm atencji znany z modeli Transformer na obszar rozpoznawania i analizy obrazów. W odróżnieniu od tradycyjnych splotowych sieci neuronowych (CNN), ViT dzieli obraz na mniejsze, nakładające się lub rozłączne fragmenty (tzw. patches), które są następnie przetwarzane jako sekwencja tokenów. Dzięki mechanizmowi self-attention model potrafi efektywnie wychwytywać globalne zależności oraz relacje przestrzenne między różnymi częściami obrazu. Rozwiązanie to osiąga doskonałe wyniki w zadaniach takich jak klasyfikacja obrazów, detekcja obiektów czy segmentacja widokowa, szczególnie przy wykorzystaniu dużych zbiorów danych treningowych.
Vision Transformer (ViT-G/14) (ViT)
Źródło: github.com



