Đây là hot spotting. Bốn nguyên nhân theo tần suất:
1. Index đang ghi nhiều dồn vào ít node — với data stream, chỉ index mới nhận write, nên nếu shard của nó nằm chung một node thì node đó gánh hết.
2. Custom routing lệch — một tenant lớn dồn vào một shard.
3. Shard phân bố không đều — Elasticsearch cân bằng theo số shard chứ không theo dung lượng hay tải, nên vài shard lớn có thể nằm chung.
4. Node cấu hình yếu hơn trong cluster không đồng nhất.
Chẩn đoán:
GET /_cat/shards?v&s=store:desc # shard nao lon, nam o node nao
GET /_cat/nodes?v&h=name,heap.percent,cpu,load_1m
GET /_nodes/hot_threads # node do dang ban vi viec giXử lý: đặt index.routing.allocation.total_shards_per_node để chặn dồn shard của một index vào một node; dùng _cluster/reroute để dời shard nóng; xem lại routing key nếu lệch do tenant.
Gốc rễ thường là mô hình dữ liệu chứ không phải cluster — shard quá lớn hoặc routing chọn sai key.