Không thể cải thiện thứ không đo được. Một hệ eval LLM chín gồm hai vòng.
Offline evaluation (trước khi release):
- Golden dataset — tập ví dụ đại diện gồm input và (khi có) đáp án/ngữ cảnh mong muốn. Xây từ log thật, ca lỗi đã gặp, edge case; giữ cố định để so sánh công bằng qua các phiên bản.
- Chấm điểm: metric xác định (exact match, JSON valid, regex) cho tác vụ có đáp án rõ; LLM-as-judge cho chất lượng mở; con người cho mẫu quan trọng.
- Chạy như regression test trong CI: mỗi lần đổi prompt/model/pipeline → chạy lại suite, chặn nếu điểm tụt.
Online evaluation (sau khi release, trên traffic thật):
- Feedback ngầm & tường minh — thumbs up/down, tỉ lệ retry, tỉ lệ bỏ dở, tỉ lệ escalate cho người.
- A/B test giữa prompt/model.
- Guardrail & giám sát: sample response hằng ngày chấm faithfulness/an toàn tự động, cảnh báo khi drift.
Nguyên tắc: bắt đầu bằng golden set nhỏ nhưng thật; ưu tiên metric bám tác vụ hơn điểm chung; offline để lặp nhanh, online để bắt cái offline bỏ sót. Vòng lặp: online phát hiện lỗi → thêm vào golden set → tái đo offline.