Hàm mất mát định nghĩa thế nào là "sai" và tạo ra gradient để học.
- MSE (sai số bình phương trung bình)
mean((y − ŷ)²): cho hồi quy (mục tiêu liên tục). Phạt sai số lớn theo bình phương; nhạy với outlier. Đi cùng đầu ra tuyến tính. - Cross-entropy (log loss): cho phân loại. Đo độ lệch giữa phân phối xác suất dự đoán và phân phối nhãn thật. Binary CE với đầu ra sigmoid; categorical CE với đầu ra softmax.
Vì sao không dùng MSE cho phân loại: với sigmoid/softmax, MSE cho gradient nhỏ (có khi gần triệt tiêu) ngay khi mô hình dự đoán sai một cách tự tin, và bề mặt loss ở đó không lồi → học chậm. Cross-entropy ghép sạch với softmax/sigmoid (gradient rút gọn về ŷ − y) → gradient mạnh khi sai, hội tụ nhanh hơn, và chính là hàm hợp lý cực đại (maximum likelihood) cho đầu ra phân loại.