模块四 · 机器学习与深度学习
前面的算法是"人写死规则",机器学习换了个思路:不写规则,给模型一堆题和答案,让它自己总结规律。这一节从最朴素的回归,一路爬到 Transformer 和大模型。
上一模块学完了"人写死规则"的算法,这一模块换打法:不写规则,喂题和答案让模型自己总结规律。为什么需要?因为真实世界的垃圾邮件、房价,规则根本写不完。学完你能走通从回归到决策树的完整 ML 流水线。下一模块钻进"多层神经网络"。
4.1 机器学习基本流程
ML Pipeline · 一个 ML 项目从头到尾长啥样想六步流水线
数据收集 → 预处理 → 特征工程 → 训练 → 评估 → 部署。
三份数据:训练集(教模型)、验证集(调超参)、测试集(期末考,不参与训练)。三份必须分开,否则等于"考试前把答案给学生"。
过拟合 vs 欠拟合:过拟合=背答案,训练集 99%、测试集 60%;欠拟合=没学会,两边都烂。目标是中间那个刚刚好。
坑:把测试集混进训练集。为什么错?模型提前见过考卷,测试分数虚高,上线就翻车。铁律:测试集只在最终评估时碰一次。
① ML=数据+模型+评估,不是调包那么简单。② 三份数据别混。③ 过拟合背答案,欠拟合没学会。
4.2 监督 / 无监督 / 强化学习
Three Paradigms · 有答案做题 vs 自己找规律 vs 试错拿奖励监督学习 Supervised
每道题都有标准答案。分类(垃圾/正常邮件)、回归(房价预测)。最常见。
无监督学习 Unsupervised
没答案,自己找结构。聚类(用户分群)、降维(PCA)。
强化学习 RL
试错+奖励。下棋、打游戏、机器人。AlphaGo 的看家本领。
类比
监督=有答案的练习册;无监督=自己整理书架;强化=玩游戏过关拿分。
① 有标签=监督,没标签=无监督,有奖励=强化。② 大模型预训练偏自监督(也是监督的一种特殊形式)。
4.3 线性回归
Linear Regression · 用一条线拟合数据想是什么
找一条直线 y = wx + b,让所有数据点离直线的总偏差最小。最小二乘法:最小化 MSE = (1/n)∑(yᵢ − ŷᵢ)²。
用模块二的梯度下降求解 w 和 b:w ← w − lr·∂MSE/∂w。
① 线性回归=最小化 MSE 的直线拟合。② 梯度下降求解。③ 房价/销量预测的入门 baseline。
4.4 逻辑回归
Logistic Regression · 把直线结果压成 0~1 的概率想是什么
线性回归输出任意数,逻辑回归在外面套一个 Sigmoid 函数 σ(z) = 1/(1+e−z),把 z 压到 0~1,代表"是这一类"的概率。
损失:交叉熵(Cross-Entropy),不是 MSE——因为概率预测用 MSE 会导致梯度消失。
用在哪
垃圾邮件分类、疾病风险、信用评分、广告点击率。
注意
虽然叫"回归",干的是分类活。名字坑人。
① Sigmoid 把线性输出压到 0~1。② 损失用交叉熵。③ 二元分类的万金油 baseline。
4.5 决策树与随机森林
Decision Tree & Random Forest · 一连串是/否问题想是什么
像玩"20 个问题":身高?>180? 瘦? 最后猜一个结果。每个节点问一个最能把数据"劈干净"的问题。
怎么选问题:信息增益 / 基尼系数——问完这个问题,数据纯度提多少。
随机森林:种很多棵树,每棵看不同子集、随机选特征,最后投票。多树投票=减少单棵过拟合,表格数据上常年霸榜。
① 决策树=一串是/否问题,可解释性强。② 随机森林=多树投票,表格数据神器。③ 风控、客户分群的主力。
4.6 概率图模型:贝叶斯网络与 HMM
Probabilistic Graphical Models · 用图画概率依赖想引子与大白话
引子:你咳嗽、发烧了,可能是感冒也可能是肺炎。这俩病都会引起咳嗽发烧,怎么根据症状反推概率?画一张"感冒→咳嗽、感冒→发烧、肺炎→发烧"的图,就是概率图模型(PGM)。
核心思想:节点=随机变量,边=依赖。几十个变量的联合概率有指数级条目存不下,但用条件独立拆开就能算。
① 贝叶斯网络(有向):边有箭头表因果方向。联合分布分解为 P(x₁..xₙ) = Π P(xᵢ | Parents(xᵢ))。朴素贝叶斯是它"假设所有特征条件独立"的退化版。
② 马尔可夫随机场(无向,MRF):边无方向表对称关联,适合像素网格、社交网络这种"相邻相关"。
③ 隐马尔可夫模型(HMM):看不见的状态 + 看得见的观测。三大问题:前向算法算观测概率、Viterbi 解码最可能状态序列、Baum-Welch(EM)学参数。早期语音识别、词性标注主力。
技术里
医疗诊断(症状→疾病)、垃圾邮件(朴素贝叶斯是 PGM 退化版)、HMM 做词性标注。
和深度学习
深度学习兴起后 PGM 部分被神经网络替代,但"条件独立分解""贝叶斯推理"思想仍在贝叶斯深度学习、变分推断里续命。
坑:把相关当因果。"手指黄"和"肺癌"相关,但都被"抽烟"引起。直接画 手指黄→肺癌 就错了——贝叶斯网络的箭头是假设的因果方向,假设错了推理全错。另外贝叶斯网络(有向)和 MRF(无向)的边含义别混。
练一练
基础贝叶斯网络和马尔可夫随机场,边的区别?
看答案
贝叶斯网络边有箭头(有向因果,原因→结果);MRF 边无方向(对称关联,像素/社交网络)。进阶HMM 为什么适合语音识别?
看答案
语音是随时间演化的观测,背后藏着"正在发哪个音"这个隐状态。HMM 用转移概率描述音素过渡、发射概率描述声音,Viterbi 找最可能的词序列。自评反馈:答对了继续;HMM 三问还记混,回看概率图模型那一节。
① 节点=变量,边=依赖;有向=贝叶斯网络,无向=MRF。② 条件独立让高维联合分布可算。③ HMM 三问(前向/Viterbi/Baum-Welch)是语音/NLP 老主力。
① 用自己的话解释:用"练习册"的比喻说清监督 / 无监督 / 强化学习的区别。
② 举个反例 / 生活例子:反例——为什么逻辑回归预测概率时,损失用交叉熵而不是 MSE?
③ 哪里还说不清:随机森林为什么"多树投票"就能减少过拟合,这个直觉你能讲顺吗?