Bài 1

Data Scientist là gì

Data Science (Khoa học dữ liệu) là ngành kết hợp thống kê, lập trình và kiến thức nghiệp vụ để biến dữ liệu thô thành quyết định. Bài này làm rõ Data Scientist làm gì, khác gì với Data Analyst / ML Engineer / Data Engineer, bộ kỹ năng cần có, quy trình chuẩn CRISP-DM, các nhóm bài toán và bộ công cụ nền tảng để bắt đầu.

Data Science là gì & giá trị mang lại
Từ dữ liệu thô đến quyết định

Data Science là quá trình dùng phương pháp khoa học, thuật toán và hệ thống để trích xuất tri thức và giá trị từ dữ liệu ở nhiều dạng (bảng, văn bản, ảnh, log...). Một Data Scientist không chỉ chạy mô hình — họ đặt câu hỏi đúng, làm sạch dữ liệu, xây mô hình, và quan trọng nhất là kể câu chuyện giúp người ra quyết định hành động.

Ba trụ cột kinh điển của Data Science (theo Drew Conway) là: toán/thống kê, kỹ năng lập trình (hacking)hiểu biết nghiệp vụ (domain). Thiếu một trong ba thì kết quả dễ sai hướng.

Giá trịVí dụ thực tế
Dự báo (predictive)Dự đoán khách hàng rời bỏ (churn), doanh số tháng tới, nhu cầu tồn kho.
Tối ưu quyết địnhĐịnh giá động, phân bổ ngân sách quảng cáo, chấm điểm tín dụng.
Tự động hoáPhân loại email spam, gợi ý sản phẩm, phát hiện gian lận theo thời gian thực.
Thấu hiểu (insight)Phân khúc khách hàng, tìm nguyên nhân sụt giảm, hiểu hành vi người dùng.
Cốt lõi: giá trị của Data Science không nằm ở mô hình phức tạp mà ở quyết định tốt hơn. Một mô hình đơn giản được triển khai và tin dùng có ích hơn mô hình "state-of-the-art" nằm trong notebook.
Phân biệt các vai trò trong Data
Analyst · Scientist · ML Engineer · Data Engineer

Bốn vai trò dưới đây thường bị nhầm lẫn. Chúng nằm trên một chuỗi giá trị dữ liệu: Data Engineer xây "đường ống", Analyst và Scientist khai thác, ML Engineer đưa mô hình vào sản phẩm.

Vai tròNhiệm vụ chínhCông cụ tiêu biểuOutput
Data AnalystTrả lời câu hỏi nghiệp vụ từ dữ liệu quá khứ, mô tả xu hướng.SQL, Excel, Power BI/Tableau, Python cơ bảnDashboard, báo cáo, insight
Data ScientistXây mô hình dự báo/thống kê, thiết kế thí nghiệm (A/B test), giải bài toán mở.Python/R, pandas, scikit-learn, SQL, thống kêMô hình, phân tích, đề xuất, prototype
ML EngineerĐưa mô hình lên production: tối ưu, đóng gói, phục vụ, giám sát (MLOps).Python, Docker, Kubernetes, TensorFlow/PyTorch, MLflow, CI/CDAPI/dịch vụ ML chạy ổn định ở scale
Data EngineerXây pipeline ETL/ELT, kho dữ liệu, đảm bảo dữ liệu sạch & sẵn sàng.SQL, Spark, Airflow, dbt, Kafka, Snowflake/BigQueryData warehouse/lake, pipeline dữ liệu
Mẹo định hướng: thích trả lời câu hỏi & trực quan hoá → Analyst. Thích mô hình hoá & thống kê → Scientist. Thích kỹ thuật phần mềm & hệ thống → ML/Data Engineer. Ranh giới ngày càng mờ, nên biết chút của mọi vai trò là lợi thế.
Bộ kỹ năng cần có
Toán · Lập trình · ML · Domain · Storytelling

Data Scientist là vai trò "full-stack của dữ liệu". Bảng dưới xếp theo mức độ ưu tiên khi mới bắt đầu (★ = quan trọng, càng nhiều sao càng cần đầu tư sớm).

Kỹ năngNội dung cụ thểMức độ ưu tiên
Toán & Thống kêXác suất, phân phối, kiểm định giả thuyết, hồi quy, đại số tuyến tính, giải tích cơ bản.★★★★★
Lập trình – PythonNumPy, pandas, matplotlib; viết code sạch, hàm, môi trường ảo.★★★★★
Lập trình – SQLSELECT, JOIN, GROUP BY, window function, subquery — truy vấn dữ liệu ở nguồn.★★★★★
Machine LearningHồi quy, phân loại, cây/ensemble, đánh giá mô hình, overfitting, cross-validation.★★★★
Domain knowledgeHiểu ngành đang làm (tài chính, e-commerce, y tế...) để đặt câu hỏi đúng.★★★★
Storytelling & VisualizationTrình bày kết quả cho người không kỹ thuật, chọn biểu đồ đúng, dẫn dắt hành động.★★★★
Kỹ thuật phần mềmGit, dòng lệnh, viết test, đóng gói — cần khi lên production.★★★
Deep Learning / Big DataPyTorch/TensorFlow, Spark — cần theo lĩnh vực chuyên sâu, không bắt buộc lúc đầu.★★
Bẫy thường gặp: nhiều người lao vào deep learning trước khi vững thống kê và pandas/SQL. Trong công việc thực tế, 80% thời gian là làm sạch & hiểu dữ liệu, không phải huấn luyện mạng neuron.
Quy trình chuẩn: CRISP-DM
Vòng đời một dự án Data Science

CRISP-DM (Cross-Industry Standard Process for Data Mining) là khung quy trình phổ biến nhất, gồm 6 giai đoạn lặp lại. Nó nhắc rằng dự án bắt đầu và kết thúc bằng nghiệp vụ, không phải bằng thuật toán.

Quan trọng: CRISP-DM là vòng lặp, không phải đường thẳng. Bạn liên tục quay lại các bước trước khi hiểu thêm về dữ liệu và nghiệp vụ.
Các loại bài toán Data Science
Từ mô tả quá khứ đến đề xuất hành động

Bốn cấp độ phân tích (theo Gartner) đi từ dễ đến khó, từ "chuyện gì đã xảy ra" đến "nên làm gì":

LoạiCâu hỏi trả lờiVí dụ / kỹ thuật
Descriptive (mô tả)Chuyện gì đã xảy ra?Báo cáo doanh thu, thống kê tổng hợp, dashboard.
Diagnostic (chẩn đoán)Tại sao lại xảy ra?Phân tích tương quan, root-cause, drill-down.
Predictive (dự báo)Điều gì sẽ xảy ra?Regression (số liên tục), Classification (nhãn).
Prescriptive (đề xuất)Nên làm gì?Tối ưu hoá, mô phỏng, reinforcement learning.

Theo cách học máy, các bài toán được nhóm như sau:

Bộ công cụ chuẩn
Cài gì để bắt đầu
Công cụVai trò
PythonNgôn ngữ chính của Data Science. Cú pháp gọn, hệ sinh thái thư viện khổng lồ.
Jupyter Notebook / LabMôi trường tương tác: viết code, xem kết quả và chú thích trong cùng một tài liệu — lý tưởng cho EDA.
pandasThao tác dữ liệu bảng (DataFrame): đọc, lọc, gộp, biến đổi.
NumPyTính toán mảng số hiệu năng cao — nền tảng của pandas và scikit-learn.
scikit-learnThư viện machine learning cổ điển: mô hình, tiền xử lý, đánh giá, pipeline.
matplotlib / seabornVẽ biểu đồ để khảo sát và trình bày.
SQLTruy vấn dữ liệu ngay tại nguồn (database). Kỹ năng bắt buộc.
Git / GitHubQuản lý phiên bản code, cộng tác nhóm.
Cloud (AWS/GCP/Azure)Lưu trữ, tính toán quy mô lớn, dịch vụ ML sẵn có. Học sau khi vững nền tảng.

Cách cài nhanh môi trường bằng Anaconda hoặc pip:

# Cách 1: dùng conda (khuyến nghị cho người mới)
conda create -n ds python=3.11
conda activate ds
conda install pandas numpy scikit-learn matplotlib seaborn jupyter

# Cách 2: dùng pip + venv
python -m venv .venv
source .venv/bin/activate   # Windows: .venv\Scripts\activate
pip install pandas numpy scikit-learn matplotlib seaborn jupyter

# Khởi động Jupyter
jupyter lab
Lộ trình ôn tập gợi ý
Học theo thứ tự để không bị ngợp
Lời khuyên: học bằng cách làm dự án nhỏ thay vì xem hết khoá này khoá kia. Chọn một tập dữ liệu bạn thấy thú vị, đặt câu hỏi, rồi tự trả lời từ đầu đến cuối — đó là cách học nhanh và nhớ lâu nhất.
← Quay lại
Data Science Roadmap