Chất lượng dữ liệu quyết định kết quả fine-tune nhiều hơn kỹ thuật fine-tune. Model học đúng những gì được cho xem, kể cả cái sai.
Cần bao nhiêu:
- LoRA/QLoRA cho tác vụ hẹp — 500 tới vài nghìn ví dụ chất lượng cao thường là đủ.
- Full fine-tune — từ chục nghìn ví dụ trở lên; ít hơn rất dễ overfit.
- Dữ liệu preference cho DPO — vài nghìn tới vài chục nghìn cặp, và chỉ làm sau khi đã có bản SFT tốt.
Quy luật đáng nhớ: gấp đôi số lượng chỉ nhích được chừng 10–20% chỉ số, trong khi dọn sạch dữ liệu bẩn thường cho mức tăng lớn hơn nhiều. Đầu tư vào chất lượng trước, số lượng sau.
Định dạng — theo chuẩn hội thoại, mỗi mẫu là một chuỗi lượt nói:
{"messages": [
{"role": "system", "content": "..."},
{"role": "user", "content": "..."},
{"role": "assistant", "content": "..."}
]}Hội thoại nhiều lượt thì lưu trọn cuộc; có gọi tool thì thêm schema và phần tool_calls. Kiểm lại định dạng riêng của nền tảng bạn dùng trước khi sinh hàng loạt.
Lấy dữ liệu từ đâu:
- Người viết tay — chất lượng cao nhất, dùng làm bộ chuẩn và bộ đánh giá.
- Log production — nguồn tốt nhất về mặt phân phối, vì đúng là những gì người dùng thật hỏi. Cách làm: lọc các hội thoại tốt rồi biên tập lại câu trả lời cho thành mẫu lý tưởng, đừng lấy nguyên.
- Sinh tổng hợp bằng model mạnh — nhanh và rẻ, nhưng thừa hưởng cả thiên lệch lẫn lỗi của model đó, nên phải có người soát một phần.
Kiểm chất lượng — phần quyết định:
- Đa dạng và khử trùng lặp. Trùng lặp làm model học thuộc thay vì học quy luật; khử bằng độ tương đồng embedding, không chỉ so chuỗi.
- Đúng đắn. Một câu trả lời sai trong tập train là một lỗi được dạy trực tiếp.
- Nhất quán định dạng. Cùng một kiểu trả lời cho cùng một kiểu câu hỏi. Dữ liệu lúc thế này lúc thế kia thì model học đúng sự lộn xộn đó.
- Không lẫn PII, secret, hay dữ liệu của tập test.
- Chia tập — giữ 5–10% để dừng sớm, và một tập test độc lập không bao giờ dùng để chỉnh.
Cách làm thực tế: viết tay 100–500 mẫu trước, chạy thử LoRA và đánh giá, xem model hỏng ở đâu, rồi mới mở rộng dữ liệu đúng vào chỗ hỏng thay vì sinh thêm tràn lan.