Quyết định theo loại dữ liệu và lượng dữ liệu, không theo độ hiện đại của mô hình.
Để mô hình tự học khi dữ liệu là phi cấu trúc và có đủ nhiều: ảnh, âm thanh, văn bản. CNN học đặc trưng thị giác tốt hơn bộ lọc thủ công (HOG, SIFT); transformer học biểu diễn ngôn ngữ tốt hơn túi từ. Trong các miền này, feature thủ công gần như đã bị thay thế hoàn toàn, và cách hiệu quả nhất thường là fine-tune mô hình đã huấn luyện sẵn thay vì tự thiết kế đặc trưng.
Feature engineering thủ công vẫn quyết định khi dữ liệu là bảng (tabular) — chiếm phần lớn bài toán doanh nghiệp ở Việt Nam. Gradient boosting trên feature tốt vẫn là lựa chọn mạnh nhất, và những feature sau thường tạo ra chênh lệch lớn hơn mọi việc tinh chỉnh siêu tham số:
- Tổng hợp theo thực thể: số đơn 30 ngày gần nhất, giá trị trung bình, độ lệch so với thói quen của chính khách đó.
- Đặc trưng thời gian: khoảng cách từ lần tương tác gần nhất, giờ trong ngày, ngày trong tuần, cờ ngày lễ.
- Tỷ lệ và hiệu, thay vì để mô hình phải xấp xỉ phép chia bằng nhiều nhánh cắt.
- Kiến thức nghiệp vụ đã mã hoá thành cờ: quá hạn thanh toán, vượt hạn mức, thiết bị lạ.
Cách làm thực dụng:
1. Baseline với feature thô.
2. Thêm một nhóm feature có giả thuyết nghiệp vụ rõ ràng, đo lại bằng cùng một quy trình đánh giá.
3. Giữ lại nhóm nào cải thiện thực sự; bỏ nhóm không đóng góp để giảm chi phí tính toán lúc serve.
Lưu ý ràng buộc production: mọi feature nghĩ ra phải tính được tại thời điểm dự đoán trong ngân sách độ trễ cho phép. Một feature mạnh nhưng cần truy vấn tổng hợp 3 giây thì không dùng được trong luồng realtime.