Synthetic data là dữ liệu do LLM (thường model mạnh — "teacher") sinh ra để huấn luyện hoặc đánh giá, thay vì hoàn toàn do người gán nhãn. Dùng khi dữ liệu thật khan hiếm, đắt, hoặc nhạy cảm về quyền riêng tư.
Cách tạo phổ biến:
- Instruction generation — dùng teacher sinh cặp instruction→response để SFT (Self-Instruct, Evol-Instruct làm phức tạp hóa dần prompt).
- Distillation — teacher sinh response/reasoning trace, student học lại.
- Sinh preference pair cho DPO/RLHF (hai đáp án, chấm cái nào tốt hơn).
- Sinh dữ liệu cho embedding/reranker (cặp câu tương đồng/không).
- Công cụ: distilabel, Synthetic Data Generator (Hugging Face).
Rủi ro cần kiểm soát:
- Khuếch đại lỗi & bias của teacher — student thừa hưởng cả sai lệch.
- Model collapse — train nhiều đời trên dữ liệu tự sinh làm đa dạng suy giảm, chất lượng tụt.
- Thiếu đa dạng / trùng lặp — cần seed đa dạng, khử trùng lặp, lọc chất lượng.
- Pháp lý/điều khoản — một số nhà cung cấp cấm dùng output để train model cạnh tranh.
Thực hành tốt: luôn có bước curate + eval (lọc, chấm điểm, người review mẫu); trộn với một phần dữ liệu thật; và không dùng dữ liệu tổng hợp làm test set để tránh rò rỉ khép kín.