Khác biệt nằm ở việc agent có học/dùng mô hình môi trường (hàm chuyển P(s′|s,a) và reward R) hay không.
Model-based RL — agent xây (hoặc được cho) mô hình động lực môi trường, rồi lập kế hoạch (planning) bằng cách mô phỏng các bước tương lai trước khi hành động. Ví dụ: Dyna, AlphaZero, MuZero.
- Ưu: hiệu quả mẫu cao (tận dụng mô hình để "tưởng tượng" nhiều tình huống), lập kế hoạch xa.
- Nhược: mô hình sai → kế hoạch sai (lỗi tích luỹ); học được mô hình chính xác thường khó.
Model-free RL — agent không dựng mô hình, học trực tiếp policy hoặc value từ trải nghiệm thử–sai. Ví dụ: Q-Learning, SARSA, DQN, policy gradient.
- Ưu: đơn giản, không cần biết động lực môi trường, mạnh khi môi trường phức tạp/khó mô hình hoá.
- Nhược: tốn nhiều mẫu/tương tác hơn để hội tụ.
Chốt: model-based đổi công sức mô hình hoá lấy hiệu quả mẫu; model-free đơn giản hơn nhưng "đói" dữ liệu.