Destylacja wiedzy (ang. knowledge distillation) to technika uczenia maszynowego polegająca na przenoszeniu wiedzy z dużego, złożonego modelu („nauczyciela”) do mniejszego i bardziej kompaktowego modelu („ucznia”). Celem tego procesu jest stworzenie lżejszego modelu, który zachowuje wysoką dokładność oryginału, ale wymaga znacznie mniejszych zasobów obliczeniowych. W procesie tym model uczniowski uczy się na podstawie prawdopodobieństw wyjściowych generowanych przez nauczyciela, co pozwala mu przejąć wzorce wnioskowania. Dzięki temu zdestylowany model może być efektywnie wdrażany na urządzeniach o ograniczonej mocy obliczeniowej, takich jak telefony komórkowe czy systemy wbudowane.



