Multi-Token Prediction (MTP) to technika stosowana w dużych modelach językowych, która polega na jednoczesnym przewidywaniu kilku kolejnych tokenów w jednym kroku zamiast tradycyjnego generowania pojedynczego słowa. Podczas treningu rozwiązanie to zapewnia bogatszy sygnał uczenia i pozwala modelowi lepiej planować strukturę wypowiedzi w szerszym kontekście. W fazie wnioskowania dodatkowe głowice predykcyjne umożliwiają dekodowanie spekulatywne, co znacząco przyspiesza generowanie tekstu i zwiększa przepustowość. Dzięki temu MTP pozwala na wydajniejsze wykorzystanie zasobów sprzętowych przy zachowaniu wysokiej jakości odpowiedzi.



