这一页是机器学习与深度学习的"大部头":从"什么是机器学习"讲起,一路穿过线性回归、逻辑回归、决策树、随机森林、XGBoost、SVM、朴素贝叶斯、KNN、聚类、降维,再到神经网络、PyTorch 实战、HuggingFace BERT 微调,最后讲模型调优与部署。版本基线:Scikit-learn 1.5+ / PyTorch 2.4+ / TensorFlow 2.17+ Keras 3 / Transformers 4.4x+ / XGBoost 2.x / LightGBM 4.x / CatBoost 1.2x,以官网最新稳定版为准。前置:看完隔壁《Python AI 数据科学》那一页。
| 库 | 说明 |
|---|---|
| Scikit-learn | 1.5+ / 1.6。经典 ML 一站式库,统一 fit/predict 接口。 |
| PyTorch | 2.4+ / 2.5 / 2.6。动态图 + torch.compile 加速,研究圈首选。 |
| TensorFlow / Keras | 2.17+,Keras 3 多后端。和 PyTorch 二选一。 |
| XGBoost | 2.x。陈天奇的极致 GBDT,Kaggle 竞赛神器。 |
| LightGBM | 4.x。微软出品,直方图 + Leaf-wise,比 XGBoost 快。 |
| CatBoost | 1.2x。Yandex 出品,自动处理类别特征。 |
| HuggingFace Transformers / Datasets | Transformers 4.4x / 4.5x,Datasets 3.x,Tokenizers 0.20。预训练模型仓库。 |
本页目录
机器学习概览
Machine Learning Overview
数学基础回顾
Math Prerequisites (Linked to Math Section)
线性回归
Linear Regression & Regularization
逻辑回归与分类指标
Logistic Regression & Classification Metrics
决策树与随机森林
Decision Tree & Random Forest
梯度提升树:XGBoost / LightGBM / CatBoost
GBDT Trio: XGBoost, LightGBM, CatBoost
支持向量机 SVM
Support Vector Machine
朴素贝叶斯与 KNN
Naive Bayes & K-Nearest Neighbors
聚类:K-Means / DBSCAN / 层次聚类
Clustering: KMeans, DBSCAN, Hierarchical
降维:PCA / t-SNE / UMAP
Dimensionality Reduction
神经网络基础与反向传播
Neural Network Basics & Backpropagation
PyTorch 深度学习实战
PyTorch in Practice: CNN / RNN
HuggingFace Transformers 入门
HuggingFace: BERT / GPT / PEFT
模型调优、正则化与迁移学习
Hyperparameter Tuning & Transfer Learning
模型部署:ONNX / FastAPI / Docker
Model Deployment
常见坑与 30 道高频面试题
Pitfalls & 30 Interview Questions
小结与自测
从线性回归一路走到 BERT 微调,这就是 2026 年机器学习工程师的核心知识图谱。记住:算法是表,数据和问题是里。
别贪多。先把线性回归、决策树、随机森林用熟,再碰 XGBoost;表格数据玩明白了,再上深度学习。每个算法都要动手跑一遍——光看不练等于白看。
最后一句:模型不是终点,解决问题才是。能用一个简单的随机森林帮老板看清销售数据,比训出一个 99% 准确率的花架子有价值得多。
版本基线:Scikit-learn 1.5+ / PyTorch 2.4+ / TensorFlow 2.17+ Keras 3 / Transformers 4.4x+ / XGBoost 2.x / LightGBM 4.x / CatBoost 1.2x。API 以官网最新文档为准。
推荐学习资源
| 资源 | 特点 |
|---|---|
| 吴恩达 Machine Learning | 网课经典,理论入门。 |
| Scikit-learn 官方文档 | 有"教程"章节,例子完整。 |
| PyTorch 官方 60 分钟教程 | 从 Tensor 到 CIFAR-10。 |
| Kaggle | 免费数据集 + 比赛 + 公开 notebook。 |
| HuggingFace Course | 官方免费课,BERT/GPT 实操。 |
| 李宏毅 ML | 中文讲得最通俗的深度学习课。 |
论一句话总结
线性模型是 baseline,树模型吃表格数据,神经网络吃图像文本,预训练模型吃一切。调参的本质是在偏差-方差间找平衡,部署的本质是工程化。
1. 你拿到一份表格数据要预测用户是否流失,先选什么模型?
答案
先逻辑回归当 baseline,再上 XGBoost/LightGBM 表格数据通常最强。
2. 训练 loss 一直降,验证 loss 在第 5 轮后上升,怎么办?
答案
过拟合:早停、Dropout、加数据、降低模型复杂度、L2 正则。
3. 99% 正常 + 1% 欺诈的数据集,准确率 99% 够吗?
答案
不够。全猜正常也 99%。看 PR-AUC、F1、混淆矩阵,用 class_weight 或 SMOTE。
4. PyTorch 训练时 loss 变 NaN,先干什么?
答案
学习率降 10 倍到 1e-4;检查数据有没有 NaN;加梯度裁剪。
5. 为什么测试集只能用一次?
答案
用测试集调参等于偷看答案,指标虚高。测试集是"高考",考完不再看。
① 跑通 Kaggle Titanic 入门赛;② 用 PyTorch 训一个 MNIST;③ 用 HuggingFace 微调一个中文情感分类器;④ 把模型包成 FastAPI。四步走完,你就超过大部分"调包侠"了。
祝调参顺利,loss 往下走。
—— 本学习门户
共 17 章 · 覆盖机器学习与深度学习核心知识 · 配合隔壁《Python AI 数据科学》食用更佳
从"蒙眼下山"到"注意力机制"——这就是 2026 年 AI 工程师的内功心法
下一站:大模型微调与 RAG 实战
本页结束 · 感谢阅读 · 祝学习愉快
—— END ——