Chia dữ liệu thành ba phần để mỗi phần giữ một vai trò riêng:
- Train — dùng để khớp tham số mô hình.
- Validation — dùng để chọn mô hình và tinh chỉnh siêu tham số. Vì ta đưa ra quyết định dựa trên nó nên điểm số validation đã bị "lây" thông tin.
- Test — chỉ chạm một lần cuối cùng để có ước lượng khách quan về khả năng tổng quát hoá. Nhìn tập test nhiều lần sẽ khiến ước lượng lạc quan giả.
Data leakage là khi thông tin lẽ ra không có lúc dự đoán lại lọt vào lúc huấn luyện, khiến điểm số cao ảo rồi sụp khi lên production. Các dạng thường gặp:
- Rò rỉ tiền xử lý — fit scaler/encoder/imputer trên toàn bộ dữ liệu trước khi chia. Cách đúng: fit chỉ trên train, gói mọi bước bằng Pipeline đặt trong cross-validation.
- Target leakage — một đặc trưng thực chất chứa thông tin của nhãn (hoặc chỉ xuất hiện sau thời điểm dự đoán).
- Temporal leakage — dùng dữ liệu tương lai để đoán quá khứ; với chuỗi thời gian phải chia theo thời gian.