Vì mô hình đoán tất cả là âm đã đạt 99.5% accuracy mà không phát hiện được giao dịch gian lận nào. Với dữ liệu mất cân bằng, accuracy bị chi phối bởi lớp đa số nên không phản ánh năng lực trên lớp cần quan tâm.
Chỉ số nên dùng:
- Recall (độ nhạy): trong số ca gian lận thật, bắt được bao nhiêu. Quan trọng khi bỏ sót tốn kém.
- Precision: trong số ca bị gắn cờ, bao nhiêu là gian lận thật. Quan trọng khi cảnh báo nhầm gây phiền cho khách và tốn nhân lực xử lý.
- F1 hoặc F-beta khi cần một con số duy nhất; beta > 1 ưu tiên recall.
- PR-AUC (average precision) để đánh giá toàn dải ngưỡng trên bài toán hiếm.
- Confusion matrix để nhìn số tuyệt đối, tránh bị phần trăm che lấp.
Cách trình bày với người ra quyết định: quy về đơn vị nghiệp vụ. "Ở ngưỡng hiện tại, mỗi ngày mô hình gắn cờ 120 giao dịch, trong đó 30 là gian lận thật, bỏ sót 8 ca" dễ đối chiếu chi phí hơn con số F1.
Baseline hằng số (DummyClassifier(strategy='most_frequent')) nên được báo cáo kèm để người đọc thấy accuracy 99.5% không phải thành tích.