- Reward
r— tín hiệu số vô hướng môi trường trả về sau mỗi bước, đo mức "tốt" tức thời của một hành động. Mục tiêu của agent là tối đa tổng phần thưởng tích luỹ (return), không phải reward từng bước. - Policy
π— chiến lược của agent, ánh xạ trạng thái → hành động. Có thể tất địnha = π(s)hoặc ngẫu nhiênπ(a|s). - Value function — kỳ vọng return khi bắt đầu từ một trạng thái (
V^π(s)) hoặc từ một cặp trạng thái–hành động (Q^π(s,a)), rồi đi theo policyπ. Nó đo giá trị dài hạn, khác với reward tức thời. - Discount factor
γ ∈ [0,1)— trọng số cho phần thưởng tương lai:G_t = r_{t+1} + γ·r_{t+2} + γ²·r_{t+3} + ….γgần 0 → agent "thiển cận", chỉ quan tâm phần thưởng gần;γgần 1 → coi trọng phần thưởng xa.γ < 1cũng bảo đảm tổng hội tụ với chuỗi vô hạn.
Hình dung: reward là điểm ghi được ở mỗi nước đi, value là ước lượng tổng điểm sẽ đạt từ đây đến hết ván, còn γ cho biết ta "quy đổi" điểm ở tương lai xa về hiện tại nhẹ đi bao nhiêu.