Trong RAG, nếu bước retrieval trả sai đoạn thì generation không thể đúng — nên phải đo riêng chất lượng retrieval bằng các metric IR offline, dựa trên tập query có đánh dấu tài liệu liên quan (ground truth).
Recall@k — tỉ lệ tài liệu liên quan lọt vào top-k kết quả. Order-unaware (không quan tâm thứ hạng trong top-k). Quan trọng nhất với RAG: chỉ cần đoạn đúng nằm trong k đoạn đưa cho LLM. Thường theo dõi recall@5, recall@10.
Precision@k — tỉ lệ trong top-k là liên quan; đo nhiễu đưa vào context.
MRR (Mean Reciprocal Rank) — trung bình của 1/rank của kết quả đúng đầu tiên. Order-aware; hợp khi chỉ cần một câu trả lời đúng và muốn nó xếp cao. MRR=1 nghĩa là kết quả đúng luôn ở vị trí 1.
NDCG (Normalized Discounted Cumulative Gain) — order-aware và hỗ trợ relevance nhiều mức (rất liên quan > hơi liên quan); áp log-discount phạt việc xếp đoạn liên quan xuống thấp, rồi chuẩn hóa về [0,1]. Đầy đủ nhất khi độ liên quan không chỉ nhị phân.
Chọn: theo dõi recall@k làm chỉ số chính cho RAG (đảm bảo đoạn đúng có mặt), thêm MRR/NDCG khi quan tâm thứ hạng và dùng reranker. Đo retrieval tách khỏi generation để biết lỗi nằm ở khâu nào.