Alert fatigue là trạng thái đội trực nhận quá nhiều cảnh báo không hành động được nên bắt đầu bỏ qua, tắt tiếng, hoặc phản xạ acknowledge mà không đọc. Hậu quả không phải mệt mỏi mà là bỏ lỡ cảnh báo thật.
Cách giảm, theo thứ tự hiệu quả:
1. Mỗi trang gọi phải kèm hành động. Nếu cách xử lý là "chờ vài phút rồi tự hết" thì đó không phải paging alert — hạ xuống ticket hoặc xóa.
2. Chuyển sang alert triệu chứng trên SLO, gộp hàng chục rule nguyên nhân thành vài rule.
3. Gộp và ức chế. Gom theo service/sự cố; khi cluster down thì ức chế mọi alert của service bên trong nó.
4. Đặt ngưỡng theo burn rate, không theo con số cứng.
5. Rà định kỳ. Mỗi tuần xem alert nào nổ nhiều nhất và tỉ lệ dẫn tới hành động thật; alert không bao giờ dẫn tới hành động thì xóa.
Multi-window multi-burn-rate giải bài toán ngưỡng: cửa sổ ngắn phản ứng nhanh nhưng nhiễu, cửa sổ dài ổn định nhưng phát hiện muộn. Burn rate = tốc độ tiêu error budget so với mức đều (burn rate 1 nghĩa là tiêu vừa hết budget đúng cuối chu kỳ; burn rate 14.4 nghĩa là hết trong ~2 ngày với chu kỳ 30 ngày).
Cấu hình thường dùng với SLO 99.9%:
- Nhanh, gọi điện: burn rate ≥ 14.4 trên cửa sổ 1 giờ và vẫn ≥ 14.4 trên cửa sổ 5 phút.
- Chậm, mở ticket: burn rate ≥ 3 trên cửa sổ 6 giờ và ≥ 3 trên cửa sổ 30 phút.
Cửa sổ dài quyết định có đáng báo không (đã tiêu đủ nhiều budget), cửa sổ ngắn quyết định có còn đang diễn ra không — nhờ vế thứ hai, alert tự đóng nhanh khi sự cố đã dứt thay vì kêu thêm hàng giờ.