- K-Means: chia dữ liệu thành
kcụm định trước quanh các centroid; nhanh và mở rộng tốt. Nhưng giả định cụm dạng cầu, kích thước tương đương, nhạy với outlier, và phải chọnktrước. - DBSCAN (density-based): nhóm các điểm mật độ cao (đủ
minPtsđiểm trong bán kínhε), coi điểm ở vùng thưa là nhiễu/outlier. Ưu điểm: không cần định trước số cụm, tìm được cụm hình dạng bất kỳ, xử lý outlier tốt. Nhược điểm: nhạy với cách chọnε/minPtsvà kém khi các cụm có mật độ chênh lệch lớn. - Hierarchical (agglomerative): xây một cây lồng cụm (dendrogram), gộp dần các cụm gần nhau theo một tiêu chí liên kết (single/complete/average/ward). Không cần chọn số cụm trước — cắt dendrogram ở mức mong muốn; cho cấu trúc phân cấp trực quan, nhưng tốn tính toán (khoảng
O(n²)trở lên) nên khó mở rộng cho dữ liệu lớn.
Chốt: K-Means khi cụm gọn/tròn và cần nhanh; DBSCAN khi cụm hình dạng bất thường và có outlier; hierarchical khi cần cái nhìn phân cấp hoặc chưa biết số cụm.