Ba lỗi hay gặp nhất: dừng test sớm khi thấy significant (peeking), cỡ mẫu không đủ, và novelty effect.
1. Peeking. Mức ý nghĩa 5% chỉ đúng khi cỡ mẫu được chốt trước và chỉ đọc kết quả một lần ở cuối. Mở dashboard mỗi ngày rồi dừng ngay khi p < 0,05 thì tỷ lệ dương tính giả tăng mạnh — trong ví dụ của Evan Miller, con số thật lên tới 26,1% thay vì 5%. Cách tránh: tính cỡ mẫu trước, chạy đủ rồi mới kết luận (hoặc dùng phương pháp sequential testing được thiết kế cho việc xem giữa chừng).
2. Cỡ mẫu. Công thức ước lượng nhanh của Evan Miller cho mỗi nhóm: n ≈ 16 × σ² / δ², với conversion rate thì σ² = p(1 − p).
Baseline p = 10%, muốn phát hiện mức tăng 1 điểm % (10% -> 11%):
σ² = 0,1 × 0,9 = 0,09
n ≈ 16 × 0,09 / 0,01² = 14.400 người mỗi nhómSản phẩm chỉ có vài nghìn người dùng mỗi tuần thì không đo nổi mức tăng nhỏ như vậy — hoặc chấp nhận chỉ phát hiện mức tăng lớn, hoặc chạy lâu hơn.
3. Novelty effect. Người dùng cũ bấm thử vì cái mới lạ, không phải vì nó tốt hơn; hiệu ứng giảm dần sau vài tuần. Cách phát hiện: tách kết quả người dùng mới và cũ (thắng ở user cũ nhưng không thắng ở user mới là dấu hiệu), vẽ chênh lệch theo từng ngày xem có đang đi xuống không, và chạy test đủ dài.
Ngoài ra: chạy ít nhất trọn một hoặc hai chu kỳ tuần vì hành vi cuối tuần khác ngày thường; kiểm tra tỷ lệ chia nhóm có đúng 50/50 không (lệch là dấu hiệu lỗi phân nhóm); xem nhiều metric cùng lúc thì một metric "thắng" do ngẫu nhiên là chuyện dễ xảy ra.
Lưu ý: chốt primary metric, cỡ mẫu và thời gian chạy trước khi bật test. Đặt xong mới xem dữ liệu thì mọi quyết định giữa chừng đều dễ bị thiên kiến.