DFlash to metoda dekodowania spekulatywnego (speculative decoding), która wykorzystuje lekki model dyfuzji bloku (block diffusion model) do równoległego generowania sekwencji tokenów roboczych. W przeciwieństwie do tradycyjnych podejść sekwencyjnych, model ten przewiduje cały blok tokenów w pojedynczym przebiegu (forward pass). Technika ta warunkuje model roboczy na podstawie ukrytych cech kontekstowych wydobytych z głównego modelu docelowego, co znacząco podnosi jakość i akceptowalność proponowanych tokenów. Dzięki temu DFlash umożliwia znaczne przyspieszenie wnioskowania dużych modeli językowych przy zachowaniu bezstratnej jakości wyjściowej.



