Chuẩn hoá quan trọng với mọi mô hình mà thang đo của feature ảnh hưởng trực tiếp tới hàm mục tiêu hoặc tới khoảng cách.
Cần chuẩn hoá:
- Mô hình dựa trên khoảng cách: KNN, K-Means, SVM với kernel RBF. Feature income đơn vị triệu đồng sẽ áp đảo feature age khi tính khoảng cách Euclid.
- Mô hình tối ưu bằng gradient descent: hồi quy tuyến tính/logistic, mạng nơ-ron. Feature lệch thang làm mặt lỗi kéo dài, gradient descent hội tụ chậm.
- Mô hình có regularization L1/L2: phạt được áp lên hệ số, mà hệ số phụ thuộc thang đo → không chuẩn hoá thì phạt không công bằng giữa các feature.
- PCA: tối đa hoá phương sai, nên feature có phương sai lớn do đơn vị đo sẽ chiếm hết thành phần chính.
Không cần chuẩn hoá:
- Mô hình dựa trên cây: decision tree, random forest, gradient boosting (XGBoost, LightGBM). Cây chỉ so sánh x < ngưỡng, kết quả không đổi khi nhân/chia thang đo.
- Naive Bayes dạng đếm (multinomial) trên dữ liệu văn bản.
Chọn kiểu nào: StandardScaler (trừ trung bình, chia độ lệch chuẩn) cho dữ liệu gần chuẩn; MinMaxScaler khi cần đưa về khoảng cố định; RobustScaler khi có ngoại lai. Luôn fit trên tập train rồi transform cho tập test.