Model học từ dữ liệu nên thừa hưởng thiên lệch có sẵn trong dữ liệu. Với hệ ảnh hưởng quyết định thật (tuyển dụng, tín dụng, y tế), đây vừa là rủi ro gây hại vừa là rủi ro pháp lý.
Bias đến từ đâu:
- Dữ liệu — nguồn chính. Dữ liệu lịch sử phản ánh phân biệt đối xử trong quá khứ (hồ sơ tuyển cũ thiên về nam thì model học đúng cái thiên lệch đó); nhóm thiểu số ít mẫu nên model phục vụ họ kém hơn; corpus gần như toàn tiếng Anh nên tri thức lệch hẳn về phương Tây.
- Thuật toán — hàm mất mát tối ưu độ chính xác trung bình sẵn sàng hy sinh nhóm nhỏ để kéo điểm tổng lên.
- Lúc triển khai — dùng model trong bối cảnh khác lúc train, hoặc vòng lặp phản hồi tự khuếch đại (gợi ý cái gì thì người dùng chỉ còn thấy cái đó).
Đo bằng cách nào:
- Kiểm thử phản thực (counterfactual) — cách trực tiếp và thuyết phục nhất: giữ nguyên mọi thứ, chỉ đổi thuộc tính nhạy cảm (cùng một CV, đổi mỗi cái tên) rồi xem kết quả có đổi không.
- Chỉ số công bằng cho bài toán phân loại: tỉ lệ dự đoán dương bằng nhau giữa các nhóm (demographic parity), hoặc tỉ lệ dương thật bằng nhau (equal opportunity). Lưu ý đã có chứng minh không thể thoả mãn đồng thời các chỉ số này — phải chọn cái nào đúng với bài toán của mình.
- Bộ đề sẵn như BBQ, StereoSet, WinoBias cho phần ngôn ngữ, cộng red team thủ công bằng prompt cố tình gợi định kiến.
Giảm thiểu theo tầng:
- Dữ liệu — bổ sung mẫu cho nhóm thiếu, tạo cặp dữ liệu phản thực. Đây là chỗ hiệu quả nhất.
- Huấn luyện — thêm ràng buộc công bằng vào loss, hoặc hiệu chỉnh ngưỡng riêng theo nhóm sau khi train.
- Với LLM — dữ liệu preference đa dạng khi RLHF, chỉ dẫn trong system prompt, và lọc/viết lại đầu ra.
- Vận hành — theo dõi chỉ số tách theo từng nhóm liên tục, vì nhìn số tổng sẽ không thấy gì; và giữ người quyết định cuối ở các việc hệ trọng.
Pháp lý: EU AI Act xếp tuyển dụng và tín dụng vào nhóm rủi ro cao, bắt buộc kiểm toán bias; NYC Local Law 144 yêu cầu audit cho công cụ sàng lọc ứng viên.
Quy tắc: không có "AI không thiên lệch" — mọi dữ liệu đều mang thiên lệch. Mục tiêu là ghi nhận, đo, giảm, giám sát, và không giao quyết định cuối cho model ở việc hệ trọng.