Điều tra trước, cắt sau. Mở Cost Explorer, nhóm theo service rồi theo usage type và so với tháng trước để khoanh vùng khoản tăng; bật Cost Anomaly Detection để lần sau được báo sớm. Nếu tài nguyên đã gắn tag thì nhóm theo tag để biết team/môi trường nào gây ra.
Những khoản hay bị quên — kiểm tra theo danh sách này trước khi động vào instance size:
- Data transfer: egress ra internet, cross-AZ giữa app và DB hoặc giữa các node của cluster, và phí xử lý của NAT Gateway. Với hệ thống chatty, đây thường là khoản lớn nhất và vô hình nhất.
- Tài nguyên mồ côi: EBS volume của instance đã terminate, snapshot cũ, Elastic IP không gắn vào đâu, load balancer không còn target, cụm test bật rồi quên.
- CloudWatch Logs để retention Never expire, hoặc log debug bật ở production.
- S3: bản cũ do bật versioning, multipart upload dở dang không bao giờ được dọn (đặt lifecycle rule cho cả hai).
Cắt giảm theo thứ tự đòn bẩy:
1. Xoá thứ không dùng — hiệu quả tức thì, rủi ro thấp nhất.
2. Right-sizing dựa trên metric thật (CPU/memory p95) chứ không theo cảm giác; bật auto scaling để không phải trả cho đỉnh suốt ngày; tắt môi trường dev ngoài giờ làm việc.
3. Sửa kiến trúc gây phí truyền dữ liệu: đặt app cùng AZ với DB cho đường nóng, thêm VPC gateway endpoint, đưa CloudFront ra trước để giảm egress từ origin.
4. Cam kết giá cho phần tải nền ổn định: Savings Plans / Reserved Instances. Chỉ làm sau khi right-sizing, nếu không bạn cam kết dài hạn cho một kích thước sai.
5. Spot cho worker bất đồng bộ, batch, CI — rẻ hơn nhiều nhưng phải chịu được bị thu hồi.
Sau đó thiết lập AWS Budgets kèm cảnh báo và bắt buộc gắn tag, để lần sau phát hiện trong ngày chứ không phải cuối tháng.