Tất cả đều là biến thể của gradient descent, khác nhau ở cách dùng lịch sử gradient để định bước cập nhật.
- SGD + momentum: cộng dồn trung bình trượt (giảm dần) của gradient thành "vận tốc" → làm mượt cập nhật, tăng tốc theo hướng nhất quán, giảm dao động. Learning rate cố định toàn cục (cần tinh chỉnh/scheduling). Thường cho khả năng tổng quát hóa tốt nhất ở thị giác máy tính.
- Adagrad: learning rate riêng cho từng tham số, chia cho căn của tổng tích lũy bình phương gradient → cập nhật mạnh cho đặc trưng hiếm. Nhược điểm: mẫu số tăng đơn điệu → learning rate tụt dần về
0, việc học đình trệ. - RMSProp: sửa Adagrad bằng cách dùng trung bình trượt bình phương gradient thay cho tổng tích lũy → learning rate không tụt về 0. Hợp với dữ liệu không dừng và RNN.
- Adam: kết hợp momentum (moment bậc 1) + RMSProp (moment bậc 2) kèm hiệu chỉnh độ chệch. Mặc định vững, hội tụ nhanh, ít phải tinh chỉnh.
Chọn: Adam làm mặc định/prototype nhanh; SGD + momentum kèm scheduling khi cần tổng quát hóa cao nhất (CNN/thị giác SOTA); RMSProp cho mạng hồi tiếp.