Regularization thêm một số hạng phạt vào hàm mất mát để kìm độ lớn của hệ số, giảm variance và chống overfit. Cường độ do siêu tham số λ (hay α) điều khiển.
- L2 / Ridge — phạt
λ·Σβⱼ². Co các hệ số về gần 0 nhưng không đúng bằng 0. Xử lý tốt khi có nhiều đặc trưng tương quan cao (chia đều trọng số giữa chúng). Nghiệm khả vi, tính được dạng đóng. - L1 / Lasso — phạt
λ·Σ|βⱼ|. Có thể đẩy một số hệ số về đúng 0, nên vừa hồi quy vừa chọn đặc trưng (tạo nghiệm thưa). Hữu ích khi nghi ngờ chỉ một phần nhỏ đặc trưng thật sự quan trọng. - Elastic Net — kết hợp cả L1 và L2. Vừa tạo nghiệm thưa vừa ổn định khi các đặc trưng tương quan cao (Lasso thuần dễ chọn ngẫu nhiên 1 trong nhóm tương quan).
Lưu ý: nên chuẩn hoá đặc trưng trước khi phạt, vì phạt phụ thuộc thang đo của hệ số.