Cả ba đều là boosting — ghép nhiều mô hình yếu (thường là cây nông) theo tuần tự — nhưng cách "học từ lỗi" khác nhau:
- AdaBoost: sau mỗi vòng, tăng trọng số cho mẫu bị phân loại sai để mô hình tiếp theo chú ý hơn; kết quả cuối là tổng có trọng số của các mô hình yếu (mô hình chính xác hơn được trọng số lớn hơn).
- Gradient Boosting: tổng quát hóa hơn — mỗi mô hình mới khớp với gradient âm của hàm mất mát (với bình phương sai số thì đúng bằng phần dư) của tổ hợp hiện tại. Cho phép dùng bất kỳ hàm mất mát khả vi nào (hồi quy, phân loại, ranking).
- XGBoost: một hiện thực gradient boosting tối ưu hóa. Nó thêm regularization (phạt độ phức tạp cây) vào hàm mục tiêu, dùng khai triển bậc hai (Newton) với cả gradient lẫn hessian, cộng nhiều tối ưu kỹ thuật (xử lý giá trị thiếu, tìm điểm tách song song, tận dụng cache). Nhờ vậy vừa chính xác vừa nhanh — rất phổ biến trên dữ liệu dạng bảng.