Data Science

Data Science Roadmap

Lộ trình đầy đủ để quay lại nghề Data Scientist — từ nền tảng toán/thống kê, Python & SQL, xử lý và khám phá dữ liệu, feature engineering, machine learning có & không giám sát, đánh giá mô hình, deep learning cho tới MLOps đưa mô hình lên production. Kèm bộ câu hỏi phỏng vấn để ôn tập và làm thật.

12
Bài học
Python
+ SQL
ML → DL
+ MLOps
Interview
Ôn tập
Lộ trình 12 bài
Bài 1
Data Scientist là gì
Vai trò DS vs Data Analyst vs ML Engineer, kỹ năng cần có, quy trình dự án CRISP-DM, các loại bài toán (mô tả, dự báo, phân loại, đề xuất) và bộ công cụ chuẩn của một Data Scientist.
Vai tròCRISP-DMKỹ năng
Bài 2
Python cho DS
NumPy (ndarray, vectorization, broadcasting) và Pandas (Series/DataFrame, indexing, groupby, merge, pivot, apply, xử lý thời gian). Bộ khung code phân tích dữ liệu hằng ngày.
NumPyPandasVectorize
Bài 3
Xác suất & Thống kê
Phân phối xác suất, kỳ vọng/phương sai, định lý giới hạn trung tâm, khoảng tin cậy, kiểm định giả thuyết (t-test, chi-square, ANOVA), p-value, sai lầm loại I/II và tương quan vs nhân quả.
DistributionHypothesis testp-value
Bài 4
SQL cho DS
JOIN các loại, GROUP BY & aggregate, subquery & CTE, window functions (ROW_NUMBER, RANK, LAG/LEAD, running total), xử lý NULL và các mẫu truy vấn phân tích thường gặp trong phỏng vấn.
JOINWindowCTE
Bài 5
EDA & Làm sạch dữ liệu
Quy trình khám phá dữ liệu (EDA), xử lý missing values, outlier, dữ liệu trùng, kiểu dữ liệu; univariate/bivariate analysis; trực quan hoá với matplotlib/seaborn và đọc phân phối/tương quan.
EDAMissingOutlier
Bài 6
Feature Engineering
Encoding biến hạng mục (one-hot, label, target), scaling (standard/minmax/robust), binning, biến tương tác, xử lý thời gian & text cơ bản, feature selection và tránh data leakage bằng pipeline.
EncodingScalingLeakage
Bài 7
ML có giám sát
Linear/Logistic Regression, Decision Tree, Random Forest, Gradient Boosting (XGBoost/LightGBM), SVM, kNN — trực giác, khi nào dùng, tham số quan trọng và regularization. Regression vs Classification.
RegressionBoostingSVM
Bài 8
ML không giám sát
Clustering (K-Means, Hierarchical, DBSCAN), giảm chiều (PCA, t-SNE, UMAP), phát hiện bất thường, association rules; cách chọn số cụm (elbow, silhouette) và ứng dụng phân khúc khách hàng.
K-MeansPCADBSCAN
Bài 9
Đánh giá mô hình
Train/val/test split & cross-validation, bias–variance, overfitting/underfitting, metrics phân loại (accuracy, precision, recall, F1, ROC-AUC, PR-AUC) & hồi quy (RMSE, MAE, R²), xử lý mất cân bằng, tuning siêu tham số.
Cross-valROC-AUCTuning
Bài 10
Deep Learning
Neuron, mạng nhiều lớp, hàm kích hoạt, backpropagation & gradient descent, loss, regularization (dropout, batch norm); CNN cho ảnh, RNN/LSTM & Transformer cho chuỗi; khi nào nên dùng DL thay vì ML cổ điển.
BackpropCNNTransformer
Bài 11
MLOps & Triển khai
Đưa mô hình ra production — serialize (pickle/ONNX), REST API (FastAPI), batch vs online, experiment tracking (MLflow), feature store, CI/CD, monitoring & data/concept drift, retraining. Vòng đời mô hình thực tế.
FastAPIMLflowDrift
Bài 12
Câu hỏi Phỏng vấn
Ngân hàng câu hỏi & đáp án theo chủ đề: thống kê, ML, SQL/coding, case study nghiệp vụ, câu hỏi hành vi; khung trả lời case study và checklist ôn tập cuối cùng trước phỏng vấn DS.
InterviewCase studyChecklist
3 ý cốt lõi khi làm Data Scientist
80% là dữ liệu, 20% là mô hình
Phần lớn thời gian thực tế dành cho thu thập, làm sạch, hiểu và tạo feature từ dữ liệu. Một mô hình đơn giản trên dữ liệu tốt gần như luôn thắng mô hình phức tạp trên dữ liệu bẩn.
Bắt đầu từ bài toán, không từ thuật toán
Luôn hỏi: quyết định nghiệp vụ nào cần hỗ trợ, đo thành công bằng metric gì. Chọn baseline đơn giản trước, rồi mới tăng độ phức tạp nếu thật sự đáng.
Chống overfitting & leakage
Kết quả đẹp trên tập train mà tệ trên dữ liệu mới là vô nghĩa. Tách dữ liệu đúng cách, validate trung thực và cảnh giác với data leakage — sai lầm phổ biến nhất của người mới.