Knowledge distillation (Hinton 2015) huấn luyện một model student nhỏ để bắt chước một model teacher lớn (hoặc ensemble), thay vì chỉ học từ nhãn cứng của dữ liệu gốc.
Điểm cốt lõi: thay vì học hard label (one-hot: đáp án đúng = 1, còn lại = 0), student học soft target — toàn bộ phân phối xác suất của teacher. Phân phối này chứa "dark knowledge": teacher không chỉ nói "đây là mèo" mà còn cho biết "hơi giống chó, rất không giống xe" — tín hiệu giàu hơn nhiều one-hot. Dùng temperature T cao khi softmax để làm mềm phân phối, cho thấy rõ quan hệ giữa các lớp. Loss thường là kết hợp: distillation loss (student vs soft target teacher) + student loss (vs nhãn thật).
Vì sao hiệu quả: soft target truyền tải "cách teacher tổng quát hóa", nên student đạt chất lượng gần teacher với ít tham số hơn nhiều → suy luận nhanh, rẻ, dễ triển khai (edge/on-device).
Trong LLM hiện đại: các model "-mini/-small" thường được distill từ model lớn; một biến thể phổ biến là sequence-level / response distillation — dùng teacher mạnh sinh dữ liệu (response, reasoning trace) để fine-tune student.