Hai bộ khung chọn metric, khác nhau ở đối tượng đo.
RED — đo dịch vụ (góc nhìn người dùng gửi request vào):
- Rate: số request mỗi giây.
- Errors: số/tỉ lệ request thất bại.
- Duration: phân bố độ trễ (p50/p95/p99).
Áp cho mọi API, endpoint, hàng đợi. Ba con số này đủ để nói "service có ổn không" mà không cần biết nó chạy trên gì.
USE — đo tài nguyên (góc nhìn tài nguyên bị tiêu thụ):
- Utilization: phần trăm thời gian tài nguyên bận (CPU, disk).
- Saturation: mức xếp hàng chờ (độ dài run queue, số kết nối chờ trong pool).
- Errors: lỗi ở tầng tài nguyên (I/O error, packet drop).
Áp cho CPU, bộ nhớ, disk, network, connection pool, thread pool.
Cách dùng thực tế: RED phát hiện và mô tả sự cố theo cách người dùng cảm nhận → alert đặt trên RED. USE giải thích nguyên nhân → dùng khi đã biết có sự cố. Ví dụ: p99 tăng (RED) vì connection pool bão hòa, request phải xếp hàng (USE saturation) — utilization của CPU vẫn thấp nên chỉ nhìn CPU sẽ không thấy gì.
Saturation là thứ hay bị bỏ sót nhất: hệ thống thường xuống cấp vì xếp hàng trước khi bất kỳ utilization nào chạm 100%.