- High Availability (HA): hệ thống giảm tối đa downtime, phục hồi nhanh sau lỗi — nhưng có thể có gián đoạn ngắn khi failover. Đo bằng "số 9" (99.9%, 99.99%). Cách làm: loại bỏ single point of failure, chạy đa AZ, health check + auto failover, load balancing.
- Fault Tolerance (FT): mạnh hơn — không gián đoạn dù thành phần hỏng, nhờ dư thừa (redundancy) đủ để không ai nhận ra lỗi. Tốn kém hơn nhiều.
Hai khái niệm liên quan hay hỏi:
- RTO (Recovery Time Objective): bao lâu để khôi phục.
- RPO (Recovery Point Objective): chấp nhận mất tối đa bao nhiêu dữ liệu.
Nguyên tắc chung: bỏ SPOF, dư thừa qua nhiều AZ/region, tự động phát hiện + thay thế, sao lưu và diễn tập khôi phục.