- Latency: thời gian xử lý một request (ví dụ 20ms). Đo bằng percentile (p50/p95/p99) chứ không chỉ trung bình, vì đuôi phân phối mới phản ánh trải nghiệm xấu nhất.
- Throughput: số request phục vụ được trong một đơn vị thời gian (ví dụ 5000 req/s).
Hai đại lượng độc lập: hệ có thể throughput cao nhưng latency cao (batch), hoặc latency thấp mà throughput thấp. Batching, buffering hay hàng đợi thường tăng throughput nhưng cũng tăng latency — cần cân bằng theo yêu cầu sản phẩm.