Megatron-LM to rozbudowany framework stworzony przez firmę NVIDIA, przeznaczony do wydajnego trenowania bardzo dużych modeli językowych. Wykorzystuje zaawansowane techniki paralelizacji, takie jak równoległość tensorowa i potokowa, co pozwala rozbić obliczenia i parametry sieci na wiele układów GPU. Dzięki temu umożliwia trenowanie modeli z miliardami parametrów, ułatwiając pokonanie ograniczeń pamięciowych pojedynczych akceleratorów. Framework ten stanowi jedno z kluczowych narzędzi do skalowania architektur typu Transformer w obszarze uczenia maszynowego.



