Bỏ qua đến nội dung chính

Machine Learning thực chiếnƯu đãi khóa học

Sở hữu trọn đời, cập nhật miễn phí, học phí bảo toàn khi bạn học tiếp.

899.000đ

Học phí khóa này

5

Chương

~18,5 giờ

Video bài giảng

Machine Learning thực chiến

Từ một bảng dữ liệu đã sạch đến một mô hình dự đoán chạy được và giải thích được cho người không kỹ thuật.

  • 23 bài · ~18,5 giờ video
  • Project 3: dự đoán churn end-to-end, nộp GitHub
  • Tự chọn thuật toán, xây pipeline sklearn chống leakage, đánh giá đúng metric
  • Cấp độ: Trung cấp

  • 5 chương

  • 23 bài

  • ~18,5 giờ video

  • Sở hữu trọn đời

DÀNH CHO AI & CHUẨN ĐẦU RA

Ai nên học khóa này, và học xong làm được gì

Đây là khóa có yêu cầu đầu vào cao trong lộ trình: bạn cần thạo pandas và hiểu thống kê suy diễn cơ bản trước khi vào, phần machine learning khóa lo. Phần chuẩn đầu ra lấy từ đề cương, mỗi điều đều có chương dạy và một phần của Project 3 để đối chiếu.

Dành cho ai

Vừa học xong Khóa 2

Đã phân tích được dữ liệu và giờ muốn dự đoán chứ không chỉ mô tả lại quá khứ.

Data Analyst muốn đi xa hơn

Vượt qua báo cáo mô tả: ai sắp rời bỏ, giá nào là hợp lý, rủi ro nằm ở đâu.

Đã tự học sklearn qua tutorial

Chạy được thư viện nhưng chưa chắc kết quả có đáng tin hay chỉ là leakage.

Yêu cầu đầu vào

  • Hoàn thành Khóa 1 và Khóa 2 hoặc nắm tương đương: pandas thành thạo, đọc được biểu đồ, hiểu thống kê suy diễn trước khi vào chương 13.

  • Bài kiểm tra đầu vào 15 câu tự đánh giá về pandas và thống kê, chấm xong chỉ ra đúng phần bạn còn hổng kèm hướng dẫn ôn nhanh.

  • Mua lẻ Khóa 3 thì nhận starter pack: dataset đã làm sạch và notebook tóm tắt của Khóa 2, để không phải làm lại phần khám phá dữ liệu.

  • Không cần nền toán đại học. Toán dừng ở mức trực giác, không chứng minh; đại số tuyến tính và đạo hàm ở phụ lục tự chọn.

  • Một máy Windows hoặc macOS thông thường. Khóa này chạy scikit-learn trên dữ liệu bảng nên không cần GPU, kể cả khi đua năm model.

Bạn sẽ làm được gì

  • Chọn được thuật toán phù hợp cho một bài toán dự đoán trên dữ liệu bảng, thay vì chạy hết rồi lấy cái điểm cao nhất trên tập test.

  • Gói tiền xử lý và mô hình thành một pipeline sklearn với ColumnTransformer, để cross-validation không bị data leakage làm hỏng.

  • Đánh giá bằng đúng metric: MAE hay RMSE cho hồi quy; precision, recall, F1 và PR-AUC khi dữ liệu mất cân bằng, và bảo vệ được lựa chọn.

  • Tinh chỉnh có hệ thống bằng GridSearchCV và RandomizedSearchCV, có experiment log thay vì chỉnh mò, và biết lúc nào nên dừng lại.

  • Giải thích mô hình cho người không kỹ thuật bằng permutation importance và SHAP, kèm báo cáo một trang và danh sách khách rủi ro nhất.

Kỹ năng bạn sẽ có sau khóa

Mỗi kỹ năng dưới đây đều có bài tập tương ứng trong đề cương 5 chương.

  • scikit-learn
  • Pipeline sklearn
  • Cross-validation
  • Chống data leakage
  • Linear & Logistic
  • Ridge & Lasso
  • Random Forest
  • XGBoost
  • K-Means & PCA
  • Dữ liệu mất cân bằng
  • GridSearchCV
  • Feature engineering
  • SHAP
  • Experiment log
ĐỀ CƯƠNG

Năm chương, 23 bài, từ khung tư duy đến mô hình giải thích được

Chương 13 dựng khung tư duy chung trước khi học thuật toán nào. Chương 14 và 15 là hai họ bài toán có nhãn, chương 16 là học không giám sát, chương 17 gom những kỹ thuật quyết định chất lượng mô hình. Mở từng chương để xem đủ danh sách bài.

  1. Nhập môn ML5 bài · 3h30'
  2. Hồi quy4 bài · 3h
  3. Phân loại6 bài · 4h30'
  4. Không giám sát4 bài · 3h
  5. Feature & tinh chỉnh4 bài · 3h
13

Nhập môn ML & scikit-learn

5 bài · 10 video · 3h30'
  • Bài 13.1: Machine Learning là gì & phân loại bài toán2 video · 40 phút · thực hành: xếp 10 bài toán kinh doanh vào đúng nhóm supervised, unsupervised
  • Bài 13.2: Quy trình một dự án ML & demo siêu tốc2 video · 40 phút · demo end-to-end 15 phút dự đoán giá nhà · thực hành: chạy lại demo và đổi tham số
  • Bài 13.3: Train/test split & cross-validation2 video · 42 phút · thực hành: dựng thí nghiệm cho thấy data leakage, model 99% sụp còn 70%
  • Bài 13.4: Metrics: đo đúng mới cải đúng2 video · 44 phút · thực hành: chọn metric cho 8 bài toán và bảo vệ lựa chọn
  • Bài 13.5: Overfitting & underfitting2 video · 44 phút · quiz 15 câu và notebook chẩn đoán 4 model có bệnh bằng learning curve
14

Bài toán hồi quy

4 bài · 9 video · 3h
  • Bài 14.1: Linear regression: trực giác & code3 video · 48 phút · thực hành: hồi quy lương theo số năm kinh nghiệm, viết 3 câu diễn giải hệ số
  • Bài 14.2: Hồi quy đa biến & polynomial2 video · 44 phút · thực hành: so sánh bậc 1, 2 và 5 trên cùng dữ liệu bằng learning curve
  • Bài 14.3: Regularization: Ridge & Lasso2 video · 44 phút · thực hành: dùng Lasso tìm 5 feature quan trọng nhất của giá nhà
  • Bài 14.4: Mini-project: dự đoán giá nhà Việt Nam2 video · 44 phút · quiz 12 câu · so sánh Linear, Ridge, Lasso và Polynomial bằng cross-validation rồi viết kết luận
15

Bài toán phân loại

6 bài · 13 video · 4h30'
  • Bài 15.1: Logistic regression3 video · 46 phút · thực hành: tìm ngưỡng tối ưu khi chi phí giữ chân khách bằng một phần mười giá trị khách mất
  • Bài 15.2: K-Nearest Neighbors2 video · 42 phút · thực hành: chạy KNN có và không scaling để thấy chênh lệch
  • Bài 15.3: Decision Tree2 video · 44 phút · thực hành: vẽ cây depth 3 của bài churn rồi dịch thành 5 luật kinh doanh bằng tiếng Việt
  • Bài 15.4: Random Forest2 video · 44 phút · thực hành: top 10 feature quan trọng nhất kèm diễn giải kinh doanh
  • Bài 15.5: Gradient Boosting & XGBoost2 video · 46 phút · thực hành: đua 5 model trên cùng cross-validation của bài churn và lập bảng xếp hạng
  • Bài 15.6: Dữ liệu mất cân bằng2 video · 48 phút · quiz 15 câu và notebook pipeline phân loại hoàn chỉnh cho bài duyệt hồ sơ vay
16

Học không giám sát

4 bài · 9 video · 3h
  • Bài 16.1: K-Means3 video · 48 phút · thực hành: phân cụm quán ăn theo giá và rating rồi đặt tên từng cụm
  • Bài 16.2: Hierarchical clustering2 video · 40 phút · thực hành: dendrogram 30 sản phẩm thương mại điện tử, đề xuất cách gom ngành hàng
  • Bài 16.3: PCA: giảm chiều dữ liệu2 video · 44 phút · thực hành: trực quan hóa dữ liệu khách hàng 15 chiều trên mặt phẳng 2 chiều
  • Bài 16.4: Case: phân cụm khách hàng RFM2 video · 48 phút · quiz 12 câu · đặt tên phân khúc và đề xuất hành động marketing cho từng nhóm
17

Feature engineering & tinh chỉnh mô hình

4 bài · 9 video · 3h
  • Bài 17.1: Feature engineering thực chiến3 video · 48 phút · thực hành: tạo 8 feature mới cho bài churn và đo xem cái nào giúp model thật
  • Bài 17.2: Pipeline & ColumnTransformer2 video · 44 phút · thực hành: viết lại bài churn thành một pipeline sạch trong một file
  • Bài 17.3: Tinh chỉnh siêu tham số2 video · 44 phút · thực hành: tune XGBoost bài churn bằng RandomizedSearch, so kết quả trước và sau
  • Bài 17.4: Diễn giải mô hình2 video · 44 phút · quiz 12 câu và notebook giải thích model churn cho giám đốc bằng SHAP

Tổng: 23 bài · 56 video · ~18,5 giờ

PROJECT CUỐI KHÓA

Một bài toán churn end-to-end, kết bằng báo cáo kinh doanh

Ba bài hướng dẫn đi từ đề bài đến lúc nộp. Bạn tự làm là chính, video chỉ là khung và bài mẫu để đối chiếu.

Project 3: Dự đoán khách hàng rời bỏ end-to-end

3 bài · 6 video · khoảng 90 phút

Một bài toán ML hoàn chỉnh trên dữ liệu churn: từ baseline logistic đến model cuối có feature engineering và tuning, kèm báo cáo kinh doanh đề xuất hành động. Chấm theo rubric 25 điểm, chia cho năm phần: EDA nhanh, baseline, feature engineering, model và tuning, diễn giải và báo cáo.

1

Đề bài & baseline

Đọc rubric 25 điểm, xem sản phẩm mẫu, rồi dựng baseline logistic trong một pipeline chuẩn trong khoảng 30 phút. Lập experiment log ngay từ thí nghiệm đầu tiên, vì mọi cải tiến sau này đều so với con số này.

2

Cải tiến có hệ thống

Vòng một là feature engineering kiểu RFM, đo bằng cross-validation và ghi log. Vòng hai là xử lý mất cân bằng, đua model và tuning. Bài này cũng nói khi nào nên dừng, tức là lúc thêm công sức không còn đổi được thêm tiền.

3

Báo cáo kinh doanh & nộp bài

Chọn ngưỡng theo chi phí giữ chân so với giá trị khách, viết báo cáo một trang cho người không kỹ thuật: các yếu tố churn hàng đầu theo SHAP, danh sách 100 khách rủi ro nhất và đề xuất hành động. Tự chấm theo rubric rồi nộp kèm pipeline lưu bằng joblib.

Đây là sản phẩm cho thấy bạn làm được cả vòng đời một mô hình chứ không chỉ chạy được thư viện. Nộp project là điều kiện nhận chứng nhận Khóa 3, và chính pipeline này được đưa lên web thành ứng dụng người khác dùng được ở Khóa 4.

SAU KHÓA NÀY

Machine Learning thực chiến với scikit-learn | AIDev

Khóa machine learning tiếng Việt cho dữ liệu bảng: 5 chương, 23 bài, ~56 video, ~18,5 giờ về hồi quy, phân loại, pipeline chống leakage, tinh chỉnh và SHAP.

Bạn có trong tay

  • Một pipeline sklearn cho bài churn, lưu bằng joblib và chấm theo rubric 25 điểm.

  • Experiment log ghi từng vòng cải tiến, từ baseline logistic đến model đã tuning.

  • Báo cáo một trang cho người không kỹ thuật: yếu tố churn hàng đầu và 100 khách rủi ro nhất.

  • Thói quen gói tiền xử lý vào pipeline, để cross-validation không bị leakage làm hỏng.

Khóa tiếp theo

Deep Learning & GenAI

Chương 18–23 · 26 bài · ~20,8 giờ video

999.000đ

Lối ra nghề gần nhất

Điểm dừng 1 · sau Khóa 2 hoặc 3 · Nghề dữ liệu

  • Data Analyst
  • BI Analyst
  • Data Scientist
  • Product Analyst

Vị trí lấy theo mô tả tuyển dụng công khai, không phải cam kết việc làm. Kết quả phụ thuộc vào năng lực, nỗ lực và bối cảnh của từng học viên.

CÁCH DẠY

Ba điều bạn sẽ thấy trong mọi bài của khóa

Bốn nguyên tắc quay và dạy áp dụng chung cho cả lộ trình, viết đầy đủ ở trang lộ trình. Ba điều này là phần bạn gặp ngay ở Khóa 3.

Mỗi thuật toán một công thức

Trực giác bằng hình trước, rồi code, rồi phần khi nào dùng và khi nào không.

Toán ở mức trực giác

Không đạo hàm, không chứng minh; phần sâu hơn nằm trong phụ lục tự chọn.

Một bài toán churn xuyên suốt

Cùng một dataset đi qua sáu họ model, từ baseline logistic đến báo cáo kinh doanh.

NGƯỜI DẠY

Ai quay và dạy khóa này

Khóa này, như cả lộ trình, do một người biên soạn, quay và đứng lớp. Hồ sơ dưới đây công khai để bạn tự đối chiếu.

Nguyễn Việt Chung

Nguyễn Việt Chung

Founder AIDev & VietPlatform · Thạc sĩ AI MSE

  • Thạc sĩ AI MSE, tốt nghiệp thủ khoa xuất sắc 9,4/10, nền nghiên cứu đứng sau lộ trình này.

  • Đồng sáng lập, CTO E-University và SVOnline: chuyển đổi số 10+ trường đại học, super app 40.000+ sinh viên.

  • Sáng lập AIDev, đơn vị xây hệ thống AI cho doanh nghiệp và trực tiếp sản xuất toàn bộ lộ trình này.

HỌC PHÍ

Mua riêng khóa này, hoặc đi trọn lộ trình

Học phí trả một lần. Nếu sau này bạn muốn học tiếp, khoản đã đóng cho khóa này được trừ trọn vào gói cao hơn.

Giá gốc: 1.490.000đ

Giá bán: 899.000đ

Sở hữu trọn đời

Giữ chỗ ưu đãi

Năm khóa của lộ trình, mua một lần

Khóa này là chặng thứ ba. Trọn lộ trình gồm năm khóa và một capstone bảo vệ để lấy chứng nhận, đi từ Python đến một sản phẩm AI chạy thật. Model churn bạn làm ở đây được deploy thành web app ở Khóa 4.

Khóa này

899.000đ

Trọn lộ trình

1.790.000đ

Giá Founding đợt 1

Mua lẻ đủ 5 khóa 4.586.000đ · tiết kiệm 2.096.000đ (46%)

Học phí của bạn không bao giờ mất. Mỗi đồng đã đóng đều được trừ trọn khi bạn đi tiếp lên mốc cao hơn trong lộ trình.

Xem trọn lộ trình

Khóa học là nội dung số; sau khi mở quyền truy cập, học phí không được hoàn lại. Ngoại lệ duy nhất là cam kết Founding về lịch phát hành. Xem điều khoản khóa học

CAM KẾT

Ba điều được viết ra để bạn đối chiếu

Mua một khóa đang trong quá trình sản xuất là một rủi ro có thật. Đây là phần rủi ro chúng tôi nhận về mình.

Sở hữu trọn đời

Trả một lần, không phí duy trì, không giới hạn số lần xem lại trong suốt vòng đời của khóa học. Bạn học nhanh hay chậm đều được, khóa không có hạn.

Cập nhật nội dung miễn phí

scikit-learn, XGBoost và SHAP vẫn đổi API theo từng phiên bản, và bảng chọn model cho dữ liệu bảng cũng thay đổi theo. Bài nào phải quay lại hoặc bổ sung, bạn nhận bản mới mà không đóng thêm.

Học phí không bao giờ mất

Học phí của bạn không bao giờ mất. Mỗi đồng đã đóng đều được trừ trọn khi bạn đi tiếp lên mốc cao hơn trong lộ trình. Bậc thang nâng cấp: khóa lẻ, Combo, Cohort rồi Mentor.

CÂU HỎI THƯỜNG GẶP

Những câu hỏi riêng của khóa này

Tám câu về toán, thuật toán, cách đánh giá mô hình và vị trí của Khóa 3 trong lộ trình, cộng hai câu về hoàn tiền và sở hữu trọn đời chung cho mọi khóa. Câu hỏi về học phí, chứng nhận và lịch phát hành cả lộ trình nằm ở trang lộ trình.

Cần toán đến mức nào để học được khóa này?

Bốn phép tính, phần trăm và khả năng đọc một biểu đồ là đủ. Mỗi thuật toán được dạy bằng hình trước: gradient descent là người xuống đồi trong sương mù, bias và variance là bia bắn, regularization là dây cương ghìm hệ số. Khóa không có đạo hàm và không có chứng minh. Ai muốn xuống sâu hơn có phụ lục đại số tuyến tính và đạo hàm để đọc riêng, không tính vào giờ chính khóa.

Làm sao biết bài toán của tôi nên dùng thuật toán nào?

Đó là câu hỏi cả chương 15 trả lời. Sáu bài dạy sáu họ model trên cùng một dataset churn, mỗi bài đóng lại bằng phần khi nào dùng và khi nào không, kèm bảng yêu cầu tiền xử lý của từng họ. Bài 15.5 tổng kết thành một nguyên tắc dùng được ngay: bắt đầu bằng logistic làm baseline, kết thúc bằng boosting. Khóa cũng có một tờ cheatsheet riêng là bản đồ chọn model cho dữ liệu bảng.

Data leakage là gì mà khóa nhắc suốt?

Là khi thông tin của tập test lọt vào lúc huấn luyện, thường qua một bước tiền xử lý chạy trước khi split. Model trông rất giỏi trên máy bạn và sai bét khi chạy thật. Bài 13.3 dựng hẳn một thí nghiệm cho bạn thấy model 99% sụp còn 70% sau khi sửa lỗi đó, bài 17.1 chỉ ra leakage khi tạo feature từ thông tin tương lai, và bài 17.2 dạy dùng Pipeline để lỗi này không xảy ra được nữa.

Model của tôi accuracy 95%, sao vẫn bị chê?

Vì bài toán thật hiếm khi cân bằng. Churn khoảng 5% và gian lận khoảng 0,1%, nên một model đoán tất cả là "không" đã có accuracy 95% mà không giúp được gì. Bài 13.4 dạy chọn metric theo bài toán kinh doanh, phân biệt precision và recall bằng hai case đối lập là lọc spam và tầm soát ung thư. Bài 15.6 xử lý phần mất cân bằng: class_weight, SMOTE dùng đúng chỗ, và khi nào đọc PR-AUC thay cho ROC-AUC.

Sếp hỏi vì sao model nói khách này sắp rời bỏ thì trả lời thế nào?

Bài 17.4 dành riêng cho việc đó. Bạn học permutation importance để biết yếu tố nào thật sự quan trọng, rồi SHAP ở mức thực dụng: waterfall plot giải thích từng dự đoán một, kiểu "khách này rủi ro 85% vì sáu tháng không mua và có khiếu nại". Notebook cuối chương là bài giải thích model churn cho giám đốc, và bài 15.3 còn dạy dịch một cây quyết định thành luật kinh doanh bằng tiếng Việt.

Project 3 làm ra cái gì?

Một bài toán churn hoàn chỉnh: baseline, hai vòng cải tiến có ghi experiment log, model cuối đã tuning, cộng báo cáo một trang cho người không kỹ thuật gồm các yếu tố churn hàng đầu, danh sách 100 khách rủi ro nhất và đề xuất hành động. Chấm theo rubric 25 điểm bạn tự đối chiếu. Pipeline nộp kèm được lưu bằng joblib, và chính nó là thứ Khóa 4 đưa lên web thành ứng dụng chạy thật.

Khóa có dạy deep learning hay đưa model lên production không?

Không, và đó là chủ ý. Khóa 3 dừng ở dữ liệu bảng, nơi boosting vẫn thắng neural network trong phần lớn bài toán doanh nghiệp, và kết thúc ở một pipeline lưu bằng joblib. Mạng nơ-ron, PyTorch, LLM và phần đưa model lên web là nội dung Khóa 4. Đổi lại, những gì bạn học ở đây dùng được ngay trong công việc mà không cần GPU hay hạ tầng gì thêm.

Khóa này nằm ở đâu trong lộ trình?

Đây là khóa 3/5 của Lộ trình AI Engineer từ số 0, gồm chương 13–17 trong tổng số chương của cả lộ trình. Khóa ngay trước là Phân tích dữ liệu với Python (chương 6–12), khóa ngay sau là Deep Learning & GenAI (chương 18–23). Học phí của bạn không bao giờ mất. Mỗi đồng đã đóng đều được trừ trọn khi bạn đi tiếp lên mốc cao hơn trong lộ trình.

Có được hoàn tiền không?

Không. Khóa học là nội dung số; sau khi mở quyền truy cập, học phí không được hoàn lại. Trước khi trả tiền bạn có chương 1 miễn phí, đề cương đến từng bài và một video xem thử mỗi khóa để quyết định. Ngoại lệ duy nhất là cam kết Founding về lịch phát hành: mốc nào trễ quá 30 ngày so với lịch đã công bố, người mua Founding được hoàn 100% phần chưa nhận.

Sở hữu trọn đời nghĩa là gì?

Là bạn truy cập được nội dung đã mua trong suốt vòng đời nền tảng học của AIDev, tối thiểu 5 năm kể từ ngày mua, gồm mọi bản cập nhật nội dung miễn phí. Không gồm các dịch vụ hỗ trợ kèm theo gói như buổi live, chấm tay hay mentor, vốn có thời hạn riêng của gói đó.

Còn câu hỏi nào trước khi bắt đầu?

Nhắn cho AIDev về trình độ hiện tại của bạn, chúng tôi nói thẳng khóa này có hợp với bạn chưa. Người thật trả lời, bằng tiếng Việt.

NhắnTelegram
hoặc gọi085 939 6969
ĐĂNG KÝ

Nhận thông báo khi khóa mở bán

Để lại thông tin, chúng tôi báo bạn ngày mở bán, mức ưu đãi dành cho người đăng ký sớm và thời điểm bộ dữ liệu churn cùng starter kit của Project 3 sẵn sàng để tải.

QUÀ TẶNG

Checklist chống data leakage và mẫu experiment log

Checklist các điểm rò rỉ dữ liệu và mẫu bảng ghi thí nghiệm, do AIDev biên soạn.

Bạn quan tâm