Nền tảng là in-context learning: model suy ra khuôn mẫu từ ví dụ ngay trong prompt qua attention, trọng số không đổi — "sự học" chỉ tồn tại trong một lần gọi (hiện tượng GPT-3 làm nổi bật). Câu hỏi thực dụng là chọn giữa few-shot và fine-tuning.
Few-shot thắng khi:
- Tác vụ đổi thường xuyên hoặc còn dò yêu cầu — sửa ví dụ trong prompt là xong, không cần vòng train/deploy.
- Dữ liệu gán nhãn ít (vài chục mẫu) — chưa đủ fine-tune tử tế.
- Một model phục vụ nhiều tác vụ — mỗi tác vụ một bộ ví dụ, không phải host nhiều bản fine-tune.
Fine-tuning thắng khi:
- Volume lớn + tác vụ cố định — ví dụ few-shot tốn token mỗi request; fine-tune trả chi phí một lần, prompt ngắn lại, latency giảm.
- Cần style/format/domain ăn sâu mà vài ví dụ không truyền tải nổi (giọng thương hiệu, thuật ngữ ngành, phân loại nhiều nhãn tinh).
- Muốn model nhỏ rẻ đạt chất lượng model lớn trên một tác vụ hẹp.
- Few-shot đã kịch trần trên eval — thêm ví dụ không tăng điểm.
Cách chọn example few-shot:
- Đại diện phân phối thật — phủ các dạng input chính, kèm 1–2 edge case hay sai.
- Đúng định dạng đầu ra mong muốn — model bắt chước format mạnh hơn nghe mô tả.
- Đa dạng, không trùng lặp; thứ tự có ảnh hưởng (recency bias) — thử đảo và đo.
- Nâng cao: dynamic few-shot — retrieve ví dụ tương đồng nhất với input hiện tại từ kho ví dụ, thay vì cố định.
Quyết định cuối cùng bằng eval: so hai phương án trên cùng golden set + tính chi phí mỗi request ở volume thật.