CNN xử lý dữ liệu dạng lưới (ảnh) nhờ kết nối cục bộ và chia sẻ trọng số.
- Kernel / filter: ma trận trọng số nhỏ, trượt trên đầu vào; ở mỗi vị trí tính tích vô hướng → phát hiện một mẫu cục bộ (cạnh, kết cấu). Trọng số được học.
- Convolution: trượt kernel khắp đầu vào tạo ra một feature map. Hai ý cốt lõi: trường tiếp nhận cục bộ + chia sẻ trọng số → ít tham số hơn hẳn lớp dày đặc, và bất biến-tương-đương với dịch chuyển.
- Stride: bước trượt; stride 2 làm giảm mẫu (output nhỏ hơn).
- Padding: thêm viền (thường bằng 0) để output giữ kích thước (
same) hoặc thu nhỏ (valid). - Pooling (max/average): giảm mẫu feature map bằng cách tóm tắt một cửa sổ → giảm kích thước/chi phí, thêm chút bất biến với dịch chuyển nhỏ.
Xếp chồng nhiều lớp conv → học đặc trưng phân cấp: cạnh → bộ phận → đối tượng.