Lokalne AI – od czego zacząć?

Gubisz się w gąszczu pojęć? Sprawdź nasz kompletny przewodnik krok po kroku, dobierz sprzęt i uruchom sztuczną inteligencję na własnym komputerze. Zacznij tutaj!

Vision Transformer (ViT-G/14) (ViT)

Vision Transformer (ViT) to architektura sieci neuronowej, która przenosi mechanizm atencji znany z modeli Transformer na obszar rozpoznawania i analizy obrazów. W odróżnieniu od tradycyjnych splotowych sieci neuronowych (CNN), ViT dzieli obraz na mniejsze, nakładające się lub rozłączne fragmenty (tzw. patches), które są następnie przetwarzane jako sekwencja tokenów. Dzięki mechanizmowi self-attention model potrafi efektywnie wychwytywać globalne zależności oraz relacje przestrzenne między różnymi częściami obrazu. Rozwiązanie to osiąga doskonałe wyniki w zadaniach takich jak klasyfikacja obrazów, detekcja obiektów czy segmentacja widokowa, szczególnie przy wykorzystaniu dużych zbiorów danych treningowych.

Źródło: github.com

Powiązane posty

Zacznij wpisywać wyszukiwane hasło powyżej i naciśnij Enter, aby wyszukać. Naciśnij ESC, aby anulować.

Powrót do góry