Mặc định log group có retention là Never expire — log giữ vĩnh viễn và bạn trả tiền lưu trữ mãi. Đây là khoản chi phí bị quên phổ biến nhất trên CloudWatch. Việc đầu tiên khi tạo log group là set retention (vd 14 hoặc 30 ngày với log ứng dụng, dài hơn cho log audit).
Ba khoản tính tiền của CloudWatch Logs cần phân biệt: ingest (theo GB đẩy vào), storage (theo GB-tháng lưu), và query (Logs Insights quét bao nhiêu dữ liệu).
Cảnh báo lỗi — hai đường:
1. Metric có sẵn → alarm thẳng. Ví dụ Lambda có metric Errors, Throttles; ALB có HTTPCode_Target_5XX_Count. Tạo alarm theo ngưỡng, action gửi vào SNS topic (email/Slack/PagerDuty).
2. Log chưa có metric → tạo metric filter trên log group để đếm dòng khớp mẫu, rồi alarm trên metric đó.
filter pattern: ?ERROR ?Exception
metric: AppErrorCount
alarm: Sum >= 5 in 5 minutes -> SNSĐặt alarm ở mức triệu chứng người dùng thấy (tỉ lệ 5xx, latency p99) thay vì cảnh báo mọi dòng ERROR, tránh nhiễu tới mức không ai đọc alert nữa.
Nhớ cấu hình xử lý trạng thái INSUFFICIENT_DATA cho metric thưa.