Redundancy: nhân bản thành phần để không có single point of failure (SPOF) — nhiều app server, nhiều DB replica, nhiều load balancer, trải trên nhiều availability zone/region.
Failover: khi thành phần chính hỏng, tự động chuyển sang bản dự phòng.
- Active–passive: bản standby chờ sẵn, chỉ nhận traffic khi primary chết (đơn giản, nhưng tài nguyên dự phòng nhàn rỗi).
- Active–active: mọi bản đều phục vụ và chia tải; một bản chết thì phần còn lại gánh (tận dụng tốt nhưng phức tạp hơn về nhất quán).
Điểm hay bị hỏi:
- Failover phải tự động + nhanh và được kiểm thử định kỳ (nếu không, lúc cần lại hỏng).
- Cảnh giác split-brain (hai primary cùng nhận ghi) → dùng quorum/leader election.
- Đo bằng RTO (thời gian phục hồi) và RPO (mức mất dữ liệu chấp nhận được).