Khi backprop, gradient của loss được lan ngược qua từng lớp bằng chuỗi quy tắc dây chuyền — tức nhân liên tiếp nhiều đạo hàm riêng. Với mạng sâu:
- Nếu các thừa số
< 1nhân dồn → gradient co lại theo cấp số nhân → các lớp gần đầu vào gần như không được cập nhật: vanishing gradient. - Nếu các thừa số
> 1→ gradient phồng lên, cập nhật bất ổn, dễ tràn số (NaN): exploding gradient.
Activation bão hòa (sigmoid, tanh) có đạo hàm nhỏ (sigmoid tối đa 0.25) nên góp phần làm vanishing.
Cách khắc phục:
- Dùng activation không bão hòa: ReLU và biến thể.
- Khởi tạo trọng số hợp lý (Xavier/He) để giữ phương sai ổn định qua các lớp.
- Batch/Layer Normalization.
- Residual/skip connection (ResNet) tạo đường tắt cho gradient.
- Với exploding: gradient clipping (chặn norm gradient).
- Với chuỗi: kiến trúc có cổng (LSTM/GRU).