Baseline là mốc so sánh để biết mô hình phức tạp có thực sự tạo ra giá trị hay không. Không có baseline thì con số AUC 0.85 không nói lên điều gì.
Các baseline nên chạy trước:
- Hằng số / đa số: luôn đoán lớp phổ biến nhất (phân loại) hoặc trung bình (hồi quy). Trong scikit-learn là DummyClassifier / DummyRegressor.
- Quy tắc nghiệp vụ hiện có: rule mà bộ phận vận hành đang dùng bằng tay. Nếu mô hình không vượt được rule này thì không nên triển khai.
- Mô hình tuyến tính đơn giản trên vài feature rõ ràng (logistic regression, gradient boosting mặc định).
Lợi ích:
- Baseline chạy nhanh nên hoàn thiện pipeline dữ liệu trước: đọc dữ liệu, tách tập, tính metric, log kết quả. Pipeline chạy được rồi mới đổi mô hình.
- Lộ sớm lỗi dữ liệu: nếu baseline hằng số đạt độ chính xác 0.99 thì dữ liệu đang mất cân bằng nặng hoặc có rò rỉ.
- Cho quyết định chi phí: mô hình phức tạp hơn 2 điểm phần trăm nhưng tốn hạ tầng và thời gian bảo trì có thể không đáng.
Quy tắc thực dụng: mô hình đơn giản với feature tốt thường thắng mô hình phức tạp với feature kém.