Multi-Domain On-Policy Distillation (MOPD) to zaawansowana metoda uczenia post-trainingowego modeli językowych, służąca do integrowania różnorodnych umiejętności w ramach jednego modelu bez utraty ich wydajności. Proces ten polega na niezależnym trenowaniu wyspecjalizowanych modeli nauczycieli (tzw. ekspertów dziedzinowych) za pomocą uczenia ze wzmocnieniem, a następnie transferowaniu ich wiedzy do jednego modelu ucznia. Kluczowym elementem MOPD jest prowadzenie destylacji na trajektoriach wygenerowanych bezpośrednio przez model ucznia (on-policy), co eliminuje błędy związane z przesunięciem dystrybucji danych. Dzięki temu podejście to skutecznie rozwiązuje problem tzw. efektu huśtawki, czyli regresji jednych zdolności modelu podczas rozwijania innych.
Multi‑Domain On‑Policy Distillation (MOPD)
Źródło: earlyconnections.mo.gov



