Cả hai đều là kỹ thuật regularization — giảm overfitting mà không cần thêm dữ liệu.
- Dropout: trong lúc train, mỗi lượt forward loại bỏ ngẫu nhiên (đưa về 0) mỗi nơ-ron với xác suất
p. Mạng không thể dựa vào vài nơ-ron cùng thích nghi (co-adaptation) → tương đương huấn luyện một ensemble các mạng con dùng chung trọng số. Lúc suy luận không loại bỏ nữa; activation được co giãn (hoặc co giãn ngược ngay khi train) để khớp kỳ vọng độ lớn. Kết quả: giảm co-adaptation, tổng quát hóa tốt hơn. - Early stopping: theo dõi loss trên tập validation trong lúc train, dừng khi nó ngừng cải thiện (sau một số epoch "kiên nhẫn"), giữ lại checkpoint tốt nhất. Ngăn mô hình khớp quá mức dữ liệu train ở các epoch muộn — về bản chất là giới hạn dung lượng mô hình theo thời gian.