Trong RL, agent phải cân bằng:
- Exploitation (khai thác) — chọn hành động tốt nhất đã biết để tối đa phần thưởng ngay.
- Exploration (khám phá) — thử hành động chưa chắc chắn để thu thêm thông tin, có thể tìm ra lựa chọn tốt hơn về sau.
Chỉ khai thác → dễ kẹt ở tối ưu cục bộ (chưa từng thử phương án thật sự tốt). Chỉ khám phá → không tận dụng được điều đã học.
ε-greedy là chiến lược đơn giản, phổ biến:
- Với xác suất 1 − ε: chọn hành động có Q cao nhất (khai thác).
- Với xác suất ε: chọn ngẫu nhiên một hành động (khám phá).
Thường dùng ε-decay: bắt đầu ε lớn (khám phá nhiều lúc đầu) rồi giảm dần về giá trị nhỏ khi agent đã học đủ. Các phương án khác: softmax/Boltzmann (chọn theo xác suất tỉ lệ giá trị), UCB (ưu tiên hành động ít được thử), optimistic initialization.