Batch Normalization (BN) chuẩn hóa đầu vào của một lớp theo từng mini-batch. Với mỗi đặc trưng, nó trừ trung bình batch rồi chia độ lệch chuẩn batch: x̂ = (x − μ_B) / sqrt(σ²_B + ε), sau đó co giãn và dịch bằng hai tham số học được γ, β: y = γ·x̂ + β — để lớp vẫn khôi phục được phân phối nó cần.
Lợi ích: cho phép learning rate cao hơn, huấn luyện nhanh và ổn định hơn, bớt nhạy với khởi tạo, và có tác dụng regularization nhẹ (nhiễu từ thống kê batch). Bài báo gốc lý giải BN giảm "internal covariate shift"; nghiên cứu sau cho rằng công dụng chính là làm mượt bề mặt hàm mất mát.
Train vs inference: lúc train dùng thống kê của batch; lúc suy luận dùng trung bình trượt (running mean/var) tích lũy trong quá trình train.
Lưu ý: phụ thuộc kích thước batch (batch nhỏ → thống kê nhiễu); với RNN hoặc batch nhỏ thường ưu tiên Layer Normalization.