RLHF là quy trình biến một base model (chỉ biết đoán token tiếp theo) thành trợ lý biết nghe chỉ dẫn và biết từ chối. Base model đọc xong cả internet vẫn không biết nên trả lời thế nào — RLHF dạy nó điều đó.
Ba bước chuẩn:
1. SFT — thu tập dữ liệu (câu hỏi → câu trả lời mẫu) do người viết, rồi fine-tune base model trên đó. Bước này dạy định dạng hội thoại và thói quen làm theo chỉ dẫn.
2. Huấn luyện reward model — với mỗi câu hỏi, sinh vài câu trả lời từ model SFT rồi để người xếp hạng cái nào hơn cái nào. Dùng dữ liệu xếp hạng đó train một model chấm điểm. Điểm mấu chốt: người so sánh dễ và nhất quán hơn nhiều so với chấm điểm tuyệt đối — đó là lý do bước này dùng xếp hạng chứ không dùng thang điểm.
3. Tối ưu bằng PPO — model SFT sinh câu trả lời, reward model chấm, PPO cập nhật để điểm cao dần. Kèm phạt KL so với model SFT để nó không lệch quá xa.
Vì sao cần phạt KL: không có nó, policy sẽ tìm ra những đầu ra đạt điểm rất cao mà vô nghĩa với người đọc — nó tối ưu vào lỗ hổng của reward model chứ không tối ưu vào chất lượng thật. Đây gọi là reward hacking, và là thất bại đặc trưng của bước này.
Các hướng thay thế:
- DPO — bỏ hẳn reward model và RL, tối ưu trực tiếp từ dữ liệu so sánh bằng một hàm loss có dạng đóng. Đơn giản hơn nhiều, chất lượng tương đương, nên hiện là mặc định cho phần lớn việc align model mở.
- RLAIF / Constitutional AI — thay người chấm bằng model chấm dựa trên một bộ nguyên tắc viết sẵn. Rẻ hơn nhiều bậc, và là cách duy nhất để có phản hồi ở quy mô lớn.
Ba khó khăn thật:
- Alignment tax — model sau khi align thường mất bớt năng lực ở một số việc so với bản chưa align.
- Reward hacking như đã nói.
- Người gán nhãn không đồng thuận — cùng một cặp câu trả lời, hai người xếp hạng khác nhau, nên trần chất lượng của reward model bị chặn bởi chính mức đồng thuận đó.