- Mixture of Experts (MoE) là gì? Khác gì dense model?
- Flash Attention là gì? Tại sao tăng tốc training/inference mà không đổi kết quả?
- RoPE (Rotary Position Embedding) là gì? Tại sao ưu thế hơn positional embedding học được?
- Scaling laws và emergent abilities: tại sao LLM lớn hơn có khả năng mới?
- Bias-Variance tradeoff là gì?
Test error kỳ vọng của một mô hình phân rã thành ba phần: Bias², Variance và irreducible error (nhiễu σ² không thể loại bỏ): E[(y − f̂(x))²] = Bias(f̂(x))² + Var(f̂(x)) + σ² - Bias — sai số do giả định của mô hình quá…
- Overfitting là gì và làm sao để tránh?
Overfitting là khi mô hình học thuộc cả nhiễu và chi tiết riêng của tập huấn luyện thay vì quy luật tổng quát — kết quả là điểm số trên tập train rất cao nhưng kém trên dữ liệu mới. Dấu hiệu nhận biết: khoảng…
- Confusion matrix là gì? Phân biệt precision, recall và F1-score.
Với bài toán phân loại nhị phân, confusion matrix là bảng 2×2 so khớp nhãn thật với nhãn dự đoán, gồm 4 ô: TP (dự đoán dương đúng), TN (dự đoán âm đúng), FP (dương giả — báo dương nhưng thật ra âm), FN (âm…
- Đường cong ROC và chỉ số AUC là gì?
Bộ phân loại xác suất cần một ngưỡng để biến xác suất thành nhãn 0/1. ROC curve vẽ quan hệ giữa hai đại lượng khi quét ngưỡng từ 0 đến 1: - Trục tung: TPR = Recall = TP / (TP + FN). - Trục…
- Cross-validation là gì? So sánh k-Fold, Leave-One-Out và Hold-Out.
Cross-validation ước lượng khả năng tổng quát hoá bằng cách chia dữ liệu, huấn luyện và kiểm tra trên các phần khác nhau, giúp ước lượng ít may rủi hơn một lần chia duy nhất. - Hold-out — chia một lần thành train/test (ví dụ…
- Regularization là gì? Phân biệt L1 (Lasso), L2 (Ridge) và Elastic Net.
- Phân biệt feature engineering và feature selection.
Feature engineering là tạo và biến đổi đặc trưng để mô hình dễ học hơn: mã hoá biến hạng mục (one-hot, target encoding), chuẩn hoá/scale số, tạo đặc trưng tương tác hay đa thức, trích xuất phần từ ngày giờ, biến đổi log cho phân…
- Curse of dimensionality là gì và cách khắc phục?
- Xử lý imbalanced dataset thế nào? SMOTE hoạt động ra sao?
Dữ liệu lệch lớp (ví dụ 99% âm, 1% dương như phát hiện gian lận) khiến accuracy đánh lừa — một mô hình luôn đoán lớp đa số vẫn đạt 99%. Cần xử lý cả metric lẫn dữ liệu: - Chọn metric phù hợp —…
- Vai trò của tập train/validation/test và data leakage là gì?
Chia dữ liệu thành ba phần để mỗi phần giữ một vai trò riêng: - Train — dùng để khớp tham số mô hình. - Validation — dùng để chọn mô hình và tinh chỉnh siêu tham số. Vì ta đưa ra quyết định dựa…
- Gradient descent: phân biệt batch, stochastic (SGD) và mini-batch.
Gradient descent cập nhật tham số theo hướng ngược gradient của hàm mất mát. Ba biến thể khác nhau ở lượng dữ liệu dùng cho mỗi bước cập nhật: - Batch GD — tính gradient trên toàn bộ tập dữ liệu rồi mới cập nhật…
- Precision-recall tradeoff và threshold tuning là gì?
Bộ phân loại thường sinh ra một xác suất, rồi so với ngưỡng để ra nhãn dương/âm. Ngưỡng mặc định 0.5 hiếm khi tối ưu. Đánh đổi: - Hạ ngưỡng → gắn nhãn dương dễ hơn → recall tăng (bắt được nhiều ca dương) nhưng…
- Các chỉ số đánh giá hồi quy: MSE, RMSE, MAE và R²?
Bốn chỉ số phổ biến để đánh giá mô hình hồi quy (với y là giá trị thật, ŷ là dự đoán): - MSE (Mean Squared Error) = trung bình của (y − ŷ)². Phạt nặng lỗi lớn (bình phương), nhạy với ngoại lai. Đơn…
- Linear Regression hoạt động thế nào và dựa trên những giả định nào?
Linear regression mô hình hoá quan hệ giữa biến mục tiêu liên tục y và các đặc trưng X bằng một hàm tuyến tính: y = β₀ + β₁x₁ + … + βₚxₚ + ε. Hệ số β thường được ước lượng bằng bình phương…
- Vì sao Logistic Regression là thuật toán phân loại dù tên có chữ "regression"?
Vì nó ước lượng xác suất một mẫu thuộc lớp dương rồi so với ngưỡng để ra nhãn. Bên trong, nó vẫn tính một tổ hợp tuyến tính z = β₀ + βᵀx như linear regression, nhưng đưa qua hàm sigmoid/logistic σ(z) = 1 /…
- Phân biệt Bagging và Boosting; Random Forest và bootstrapping liên quan thế nào?
- AdaBoost, Gradient Boosting và XGBoost khác nhau ra sao?
- K-Means hoạt động thế nào và làm sao chọn số cluster k tối ưu?
K-Means chia dữ liệu thành k cụm bằng cách lặp hai bước: 1. Gán: mỗi điểm về tâm cụm (centroid) gần nhất theo khoảng cách Euclid. 2. Cập nhật: centroid mới = trung bình các điểm trong cụm. Lặp đến khi phân cụm ổn định.…
- PCA làm gì và vì sao nó tối đa hoá phương sai?
- K-Nearest Neighbors hoạt động thế nào và vì sao KNN được gọi là thuật toán "lazy"?
KNN dự đoán bằng cách tìm k điểm huấn luyện gần nhất với mẫu cần dự đoán (theo một metric khoảng cách, thường Euclid), rồi bỏ phiếu đa số (phân loại) hoặc lấy trung bình (hồi quy) từ chúng. "Lazy" (lazy learner) vì nó không…
- SVM hoạt động thế nào và kernel trick là gì?
- Cây quyết định chọn điểm tách thế nào (entropy/gini) và vì sao cần pruning?
Cây quyết định chia dữ liệu đệ quy theo các đặc trưng. Ở mỗi nút, nó chọn phép tách làm các nhánh con thuần nhất về nhãn nhất có thể, đo bằng một chỉ số impurity: - Gini impurity: 1 − Σ pᵢ² — xác…
- Phân biệt học có giám sát, không giám sát và học tăng cường?
- Supervised (có giám sát): học từ dữ liệu có nhãn (mỗi input đi kèm output đúng). Mục tiêu là học ánh xạ để dự đoán nhãn cho dữ liệu mới. Gồm phân loại (classification — nhãn rời rạc) và hồi quy (regression — giá…
- Naive Bayes hoạt động thế nào và giả định độc lập "ngây thơ" là gì?
Naive Bayes là bộ phân loại xác suất dựa trên định lý Bayes: nó chọn lớp y có xác suất hậu nghiệm cao nhất, P(y x) ∝ P(y) · Π P(xⱼ y). Giả định "naive" chính là độc lập có điều kiện: các đặc trưng…
- Trong ensemble learning, voting và stacking khác nhau thế nào?
Cả hai đều kết hợp nhiều mô hình cơ sở (base models) để dự đoán tốt hơn từng mô hình riêng, nhưng khác ở cách tổng hợp: - Voting: gộp dự đoán bằng một quy tắc cố định, không học. - Hard voting: lấy nhãn…
- So sánh K-Means, DBSCAN và phân cụm phân cấp (hierarchical)?
- K-Means: chia dữ liệu thành k cụm định trước quanh các centroid; nhanh và mở rộng tốt. Nhưng giả định cụm dạng cầu, kích thước tương đương, nhạy với outlier, và phải chọn k trước. - DBSCAN (density-based): nhóm các điểm mật độ cao…
- Định lý giới hạn trung tâm (Central Limit Theorem) là gì và có ý nghĩa ra sao?
CLT phát biểu rằng khi cỡ mẫu n đủ lớn, phân phối của trung bình mẫu (x̄) xấp xỉ phân phối chuẩn, bất kể phân phối gốc của tổng thể có hình dạng gì — miễn là các quan sát độc lập, cùng phân phối…
- p-value là gì? Phân biệt lỗi loại I và lỗi loại II.
p-value là xác suất quan sát được dữ liệu cực đoan bằng hoặc hơn dữ liệu thực tế, với giả định giả thuyết không (H0) đúng. p-value nhỏ nghĩa là dữ liệu khó xảy ra dưới H0 → bằng chứng chống lại H0. So với…
- Tương quan có phải nhân quả không? Phân biệt hiệp phương sai và hệ số tương quan.
Tương quan (correlation) đo độ mạnh và chiều của quan hệ tuyến tính giữa hai biến. Tương quan không kéo theo nhân quả: một liên hệ có thể đến từ biến gây nhiễu (confounder), nhân quả ngược, hoặc trùng hợp ngẫu nhiên. Chỉ thí nghiệm…
- Kiểm định giả thuyết hoạt động thế nào (H0/H1, mức ý nghĩa α)?
Kiểm định giả thuyết là quy trình dùng dữ liệu mẫu để quyết định giữa hai giả thuyết đối lập: 1. Đặt giả thuyết. H0 (giả thuyết không) mô tả trạng thái mặc định / không có hiệu ứng; H1 (giả thuyết đối) là điều…
- Phân phối chuẩn là gì và z-score dùng để làm gì?
Phân phối chuẩn (Gaussian) là phân phối đối xứng hình chuông, xác định hoàn toàn bởi trung bình μ và độ lệch chuẩn σ, ký hiệu N(μ, σ²). Quy tắc 68–95–99.7 (empirical rule): - ~68% dữ liệu nằm trong μ ± 1σ - ~95% nằm…
- Khoảng tin cậy (confidence interval) là gì và diễn giải thế nào cho đúng?
Khoảng tin cậy (CI) là một khoảng ước lượng cho tham số tổng thể, tính từ dữ liệu mẫu. Với trung bình: x̄ ± z · (σ/√n) (dùng t với độ lệch chuẩn mẫu s khi chưa biết σ). z là giá trị tới hạn…
- Định lý Bayes và xác suất có điều kiện là gì?
Xác suất có điều kiện P(AB) là xác suất của A khi biết B đã xảy ra: P(AB) = P(A∩B) / P(B). Định lý Bayes cho phép "đảo" điều kiện, cập nhật niềm tin sau khi thấy bằng chứng: P(AB) = P(BA) · P(A) /…
- Có những phương pháp lấy mẫu nào và sai lệch chọn mẫu (sampling bias) là gì?
Các phương pháp lấy mẫu xác suất (mỗi đơn vị có xác suất được chọn xác định): - Ngẫu nhiên đơn giản — mỗi cá thể có cơ hội như nhau. - Phân tầng (stratified) — chia tổng thể thành các nhóm con (tầng) rồi…
- Thống kê mô tả: phân biệt mean/median/mode và variance/std.
Đo xu hướng trung tâm: - Mean (trung bình) — tổng chia số phần tử; nhạy với ngoại lai. - Median (trung vị) — giá trị ở giữa khi sắp xếp; bền vững với ngoại lai và phân phối lệch. - Mode (mode/yếu vị) —…
- Độ xiên (skewness) và độ nhọn (kurtosis) là gì?
Cả hai mô tả hình dạng phân phối chứ không chỉ mean và variance. Skewness (độ xiên) đo mức bất đối xứng: - Xiên phải / dương — đuôi dài về phải, mean median (ví dụ thu nhập, thời gian phản hồi). - Xiên trái…
- A/B testing: thiết kế thí nghiệm và đọc kết quả thế nào cho đúng?
- Vanishing gradient và exploding gradient là gì, vì sao xảy ra và cách khắc phục?
- So sánh SGD + momentum, Adagrad, RMSProp và Adam; khi nào dùng cái nào?
Tất cả đều là biến thể của gradient descent, khác nhau ở cách dùng lịch sử gradient để định bước cập nhật. - SGD + momentum: cộng dồn trung bình trượt (giảm dần) của gradient thành "vận tốc" → làm mượt cập nhật, tăng tốc…
- Batch Normalization là gì, hoạt động thế nào và mang lại lợi ích gì?
- Dropout và Early Stopping chống overfitting như thế nào?
Cả hai đều là kỹ thuật regularization — giảm overfitting mà không cần thêm dữ liệu. - Dropout: trong lúc train, mỗi lượt forward loại bỏ ngẫu nhiên (đưa về 0) mỗi nơ-ron với xác suất p. Mạng không thể dựa vào vài nơ-ron cùng…
- Giải thích convolution, kernel, stride, padding và pooling trong CNN.
CNN xử lý dữ liệu dạng lưới (ảnh) nhờ kết nối cục bộ và chia sẻ trọng số. - Kernel / filter: ma trận trọng số nhỏ, trượt trên đầu vào; ở mỗi vị trí tính tích vô hướng → phát hiện một mẫu cục…
- RNN, LSTM và GRU khác nhau thế nào; LSTM giải quyết vấn đề gì?
- GAN hoạt động thế nào; vai trò của generator và discriminator là gì?
- Autoencoder và Variational Autoencoder (VAE) khác nhau ra sao?
- ReLU, sigmoid, tanh và softmax: đặc điểm và khi nào dùng?
Activation đưa phi tuyến vào mạng — thiếu nó, nhiều lớp tuyến tính chồng lên nhau vẫn chỉ tương đương một phép tuyến tính. - Sigmoid 1/(1+e^(-x)): đầu ra (0, 1). Dùng cho xác suất nhị phân ở lớp ra. Nhược điểm ở lớp ẩn:…
- Backpropagation hoạt động như thế nào?
Backpropagation là thuật toán tính gradient của hàm mất mát theo mọi trọng số một cách hiệu quả, để gradient descent cập nhật chúng. Hai lượt: 1. Forward pass: đưa đầu vào qua mạng, tính đầu ra từng lớp và loss cuối cùng. 2. Backward…
- Vì sao khởi tạo trọng số quan trọng; Xavier/Glorot khác He initialization thế nào?
- Cross-entropy và MSE khác nhau thế nào, khi nào dùng cái nào?
Hàm mất mát định nghĩa thế nào là "sai" và tạo ra gradient để học. - MSE (sai số bình phương trung bình) mean((y − ŷ)²): cho hồi quy (mục tiêu liên tục). Phạt sai số lớn theo bình phương; nhạy với outlier. Đi cùng…
- Phân biệt epoch, batch và iteration; learning rate và scheduling là gì?
- Epoch: một lượt đi qua toàn bộ tập huấn luyện. - Batch (mini-batch): nhóm mẫu được xử lý trước một lần cập nhật trọng số; batchsize quyết định độ lớn. - Iteration: một lần cập nhật trọng số = xử lý xong một batch.…
- Markov Decision Process (MDP) là gì và phương trình Bellman phát biểu điều gì?
- Phân biệt Q-Learning và SARSA (off-policy vs on-policy).
- So sánh phương pháp value-based và policy-based trong RL.
- Đánh đổi exploration vs exploitation là gì? ε-greedy hoạt động ra sao?
Trong RL, agent phải cân bằng: - Exploitation (khai thác) — chọn hành động tốt nhất đã biết để tối đa phần thưởng ngay. - Exploration (khám phá) — thử hành động chưa chắc chắn để thu thêm thông tin, có thể tìm ra lựa…
- Giải thích các khái niệm cốt lõi của RL: reward, policy, value function, discount factor γ.
- Reward r — tín hiệu số vô hướng môi trường trả về sau mỗi bước, đo mức "tốt" tức thời của một hành động. Mục tiêu của agent là tối đa tổng phần thưởng tích luỹ (return), không phải reward từng bước. - Policy…
- Phân biệt RL model-free và model-based.
- Deep Q-Network (DQN) là gì? Ý tưởng cơ bản và các kỹ thuật ổn định.
- ARIMA là gì và tính dừng (stationarity) quan trọng thế nào trong chuỗi thời gian?
- Phân biệt lọc cộng tác (collaborative filtering) và lọc theo nội dung (content-based) trong hệ gợi ý.
Content-based filtering — gợi ý dựa trên đặc trưng của item và hồ sơ sở thích của chính người dùng. Nếu bạn thích phim khoa học viễn tưởng, hệ gợi phim sci-fi khác. - Ưu: không cần dữ liệu người dùng khác; xử lý được…
- Có những chiến lược nào để xử lý dữ liệu khuyết (missing data)?
Trước tiên nên hiểu cơ chế khuyết: MCAR (khuyết ngẫu nhiên hoàn toàn), MAR (khuyết phụ thuộc biến quan sát khác), MNAR (khuyết phụ thuộc chính giá trị bị thiếu) — nó quyết định cách xử lý có gây thiên lệch hay không. Các chiến…
- So sánh one-hot, label và target encoding cho biến phân loại.
Nhiều mô hình chỉ nhận đầu vào số nên biến phân loại (categorical) cần mã hoá. - One-hot encoding — mỗi giá trị thành một cột nhị phân riêng. Không áp đặt thứ tự giả, phù hợp biến danh nghĩa (nominal) và mô hình tuyến…
- Feature scaling: phân biệt normalization và standardization, khi nào cần?
Scaling đưa các đặc trưng số về thang tương đương để không đặc trưng nào lấn át chỉ vì đơn vị lớn. - Normalization (Min-Max) — co giá trị về khoảng cố định, thường [0, 1]: x′ = (x − min) / (max − min)…
- Phân biệt mô hình parametric và non-parametric.
Khác biệt ở việc mô hình có giả định trước một dạng hàm cố định (với số tham số hữu hạn, không đổi theo lượng dữ liệu) hay không. Parametric — giả định một dạng hàm, học một số tham số cố định. Ví dụ:…
- Nhìn đường learning curve, làm sao biết mô hình đang thiên lệch (bias) cao hay phương sai (variance) cao, và mỗi trường hợp nên làm gì?
Learning curve vẽ lỗi trên tập train và lỗi trên tập validation theo số mẫu huấn luyện. Hình dạng của hai đường cho biết vấn đề nằm ở đâu. Bias cao (underfit): cả hai đường đều dừng ở mức lỗi cao và gần nhau. Thêm…
- Vì sao nên xây baseline đơn giản trước khi dùng mô hình phức tạp? Baseline gồm những gì?
Baseline là mốc so sánh để biết mô hình phức tạp có thực sự tạo ra giá trị hay không. Không có baseline thì con số AUC 0.85 không nói lên điều gì. Các baseline nên chạy trước: - Hằng số / đa số: luôn…
- Mô hình nào bắt buộc phải chuẩn hoá dữ liệu đầu vào, mô hình nào không cần? Vì sao?
Chuẩn hoá quan trọng với mọi mô hình mà thang đo của feature ảnh hưởng trực tiếp tới hàm mục tiêu hoặc tới khoảng cách. Cần chuẩn hoá: - Mô hình dựa trên khoảng cách: KNN, K-Means, SVM với kernel RBF. Feature income đơn vị…
- Bài toán phát hiện gian lận có 0.5% mẫu dương. Vì sao accuracy 99.5% không nói lên điều gì, và nên báo cáo chỉ số nào?
Vì mô hình đoán tất cả là âm đã đạt 99.5% accuracy mà không phát hiện được giao dịch gian lận nào. Với dữ liệu mất cân bằng, accuracy bị chi phối bởi lớp đa số nên không phản ánh năng lực trên lớp cần…
- Khi nào dùng PR-AUC thay cho ROC-AUC? Vì sao ROC-AUC có thể "đẹp" trên dữ liệu rất mất cân bằng?
Khác biệt nằm ở mẫu số của trục hoành. - ROC vẽ TPR theo FPR, mà FPR = FP / (FP + TN). Khi lớp âm cực đông, TN rất lớn nên FPR gần như không nhúc nhích dù FP tăng hàng nghìn. Đường ROC…
- Data leakage có những dạng nào hay gặp trong thực tế và phòng bằng cách nào?
Leakage là khi thông tin không có ở thời điểm dự đoán thật lọt vào lúc huấn luyện. Triệu chứng điển hình: điểm offline cao bất thường nhưng lên production sụp. Các dạng hay gặp: 1. Tiền xử lý trước khi tách tập. Gọi scaler.fit()…
- Mô hình phân loại trả xác suất. Vì sao 0.5 không phải ngưỡng mặc định đúng, và chọn ngưỡng dựa trên gì?
0.5 chỉ là quy ước của hàm predict(), không phải kết quả tối ưu hoá. Ngưỡng đúng phụ thuộc chi phí của hai loại lỗi và tỷ lệ lớp, hai thứ mà mô hình không biết. Cách chọn ngưỡng có căn cứ: 1. Lập bảng…
- Dữ liệu mất cân bằng: chọn giữa oversampling, undersampling và class weight thế nào? Khi nào không cần xử lý gì cả?
Khi nào không cần làm gì: mất cân bằng tự nó không phải lỗi. Nếu bạn dùng chỉ số phù hợp (PR-AUC, recall ở precision cho trước) và tự chọn ngưỡng, mô hình xác suất huấn luyện trên dữ liệu gốc thường đã đủ. Rất…
- Vì sao không được dùng k-fold ngẫu nhiên cho dữ liệu chuỗi thời gian? Đánh giá đúng thì làm thế nào?
Vì k-fold ngẫu nhiên xáo trộn thứ tự thời gian: mô hình được huấn luyện trên dữ liệu tháng 6 rồi đem dự đoán tháng 3. Đó là rò rỉ thời gian, và điểm cross-validation sẽ cao hơn hẳn kết quả thực tế khi mô…
- Mô hình chạy tốt trên tập test nhưng hiệu quả giảm dần sau vài tháng chạy production. Nguyên nhân có thể là gì và điều tra thế nào?
Ba nhóm nguyên nhân, phân biệt bằng cái gì đã thay đổi: 1. Data drift (covariate shift) — phân phối đầu vào P(X) đổi, quan hệ P(yX) giữ nguyên. Ví dụ tệp khách hàng mở rộng sang tỉnh khác, app đổi luồng đăng ký khiến…
- Xử lý giá trị ngoại lai (outlier) thế nào cho đúng? Có phải lúc nào cũng nên loại bỏ?
Không. Câu hỏi đầu tiên phải là: ngoại lai này là lỗi dữ liệu hay là hiện tượng thật hiếm gặp. - age = 200, price = -1: lỗi nhập liệu hoặc lỗi đơn vị → sửa hoặc loại. - Giao dịch 5 tỷ trong…
- Giải thích mô hình cho người không kỹ thuật thế nào? Feature importance mặc định của random forest có gì sai?
- Biến phân loại có hàng chục nghìn giá trị (mã sản phẩm, quận huyện, user id) thì encode thế nào? Target encoding gây rò rỉ ra sao và khắc phục bằng cách nào?
- Khi nào nên bỏ công feature engineering thủ công, khi nào để mô hình tự học đặc trưng?
- Đồng nghiệp chạy lại code huấn luyện của bạn nhưng ra kết quả khác. Những nguyên nhân nào khiến kết quả không tái lập được, cần kiểm và xử lý thế nào?
- Đưa một mô hình đã huấn luyện lên production cần chuẩn bị những gì (serving, giám sát, huấn luyện lại)?