Zanikanie gradientu to problem występujący podczas trenowania głębokich sieci neuronowych za pomocą algorytmu wstecznej propagacji. Polega on na tym, że wartości gradientów funkcji straty stają się bardzo małe w miarę przekazywania ich do początkowych warstw sieci. W efekcie wagi pierwszych warstw zmieniają się w niewielkim stopniu, co znacząco spowalnia lub całkowicie uniemożliwia ich efektywne uczenie się. Zjawisko to występuje szczególnie często przy stosowaniu tradycyjnych funkcji aktywacji, takich jak sigmoidalna czy tangens hiperboliczny.
Zanikanie gradientu (Vanishing Gradient)
Źródło: en.wikipedia.org




