Cả hai đều học hàm giá trị hành động Q(s,a) bằng temporal-difference (TD), khác nhau ở target cập nhật.
SARSA (on-policy) — dùng hành động a′ thực sự được chọn ở trạng thái kế:
Q(s,a) ← Q(s,a) + α[ r + γ·Q(s′,a′) − Q(s,a) ]Tên "SARSA" đến từ bộ (s, a, r, s′, a′). Nó học giá trị của chính policy đang thực thi, tính cả phần khám phá.
Q-Learning (off-policy) — dùng hành động tốt nhất ở trạng thái kế, bất kể thực tế chọn gì:
Q(s,a) ← Q(s,a) + α[ r + γ·max_a′ Q(s′,a′) − Q(s,a) ]Nó học policy tối ưu trong khi vẫn hành xử theo policy khám phá (vd ε-greedy).
Khác biệt thực tế: gần vùng rủi ro (vd cliff walking), SARSA học đường đi an toàn hơn vì tính cả rủi ro của bước khám phá; Q-Learning học đường tối ưu nhưng "liều" hơn. Cả hai hội tụ về Q* dưới các điều kiện phù hợp.