楼层: 首页/ 算法与AI/ 模块四 · 机器学习与深度学习
学

模块四 · 机器学习与深度学习

ML & DL · 从"教模型做题"到"模型自己看"

前面的算法是"人写死规则",机器学习换了个思路:不写规则,给模型一堆题和答案,让它自己总结规律。这一节从最朴素的回归,一路爬到 Transformer 和大模型。

上一模块学完了"人写死规则"的算法,这一模块换打法:不写规则,喂题和答案让模型自己总结规律。为什么需要?因为真实世界的垃圾邮件、房价,规则根本写不完。学完你能走通从回归到决策树的完整 ML 流水线。下一模块钻进"多层神经网络"。

本模块要学什么(按这个顺序学)
ML六步流程 → 三类学习 → 线性回归 → 逻辑回归 → 决策树/随机森林 → 概率图模型/HMM

4.1 机器学习基本流程

ML Pipeline · 一个 ML 项目从头到尾长啥样

想六步流水线

数据收集 → 预处理 → 特征工程 → 训练 → 评估 → 部署。

三份数据:训练集(教模型)、验证集(调超参)、测试集(期末考,不参与训练)。三份必须分开,否则等于"考试前把答案给学生"。

过拟合 vs 欠拟合:过拟合=背答案,训练集 99%、测试集 60%;欠拟合=没学会,两边都烂。目标是中间那个刚刚好。

防坑

坑:把测试集混进训练集。为什么错?模型提前见过考卷,测试分数虚高,上线就翻车。铁律:测试集只在最终评估时碰一次。

记
小结

① ML=数据+模型+评估,不是调包那么简单。② 三份数据别混。③ 过拟合背答案,欠拟合没学会。

4.2 监督 / 无监督 / 强化学习

Three Paradigms · 有答案做题 vs 自己找规律 vs 试错拿奖励
监督学习 Supervised

每道题都有标准答案。分类(垃圾/正常邮件)、回归(房价预测)。最常见。

无监督学习 Unsupervised

没答案,自己找结构。聚类(用户分群)、降维(PCA)。

强化学习 RL

试错+奖励。下棋、打游戏、机器人。AlphaGo 的看家本领。

类比

监督=有答案的练习册;无监督=自己整理书架;强化=玩游戏过关拿分。

记
小结

① 有标签=监督,没标签=无监督,有奖励=强化。② 大模型预训练偏自监督(也是监督的一种特殊形式)。

4.3 线性回归

Linear Regression · 用一条线拟合数据

想是什么

找一条直线 y = wx + b,让所有数据点离直线的总偏差最小。最小二乘法:最小化 MSE = (1/n)∑(yᵢ − ŷᵢ)²。

用模块二的梯度下降求解 w 和 b:w ← w − lr·∂MSE/∂w。

例:房子面积 x 与价格 y,拟合 y = wx + b
两点:(30, 90)、(50, 150)。
解:斜率 w = (150−90)/(50−30) = 3。截距 b = 90 − 3×30 = 0。模型:价格 = 3×面积。40 平米预测 120 万。这就是最简单的"AI"。
记
小结

① 线性回归=最小化 MSE 的直线拟合。② 梯度下降求解。③ 房价/销量预测的入门 baseline。

4.4 逻辑回归

Logistic Regression · 把直线结果压成 0~1 的概率

想是什么

线性回归输出任意数,逻辑回归在外面套一个 Sigmoid 函数 σ(z) = 1/(1+e−z),把 z 压到 0~1,代表"是这一类"的概率。

损失:交叉熵(Cross-Entropy),不是 MSE——因为概率预测用 MSE 会导致梯度消失。

例:σ(0) = ?
Sigmoid 在 0 点的值。
解:σ(0) = 1/(1+e⁰) = 1/2 = 0.5。z 越大越接近 1,越小越接近 0。σ(正) → 1,σ(负) → 0。
用在哪

垃圾邮件分类、疾病风险、信用评分、广告点击率。

注意

虽然叫"回归",干的是分类活。名字坑人。

记
小结

① Sigmoid 把线性输出压到 0~1。② 损失用交叉熵。③ 二元分类的万金油 baseline。

4.5 决策树与随机森林

Decision Tree & Random Forest · 一连串是/否问题

想是什么

像玩"20 个问题":身高?>180? 瘦? 最后猜一个结果。每个节点问一个最能把数据"劈干净"的问题。

怎么选问题:信息增益 / 基尼系数——问完这个问题,数据纯度提多少。

随机森林:种很多棵树,每棵看不同子集、随机选特征,最后投票。多树投票=减少单棵过拟合,表格数据上常年霸榜。

例:判断"这个人会不会买游戏"
特征:年龄、性别、是否学生。
解:第一层问"是否学生?"——学生群体里买的多。第二层再问"年龄<18?"……一层层把人群劈开,叶子节点给结论。整棵树就是一串 if-else,人能看懂,这是它最大的优点。
记
小结

① 决策树=一串是/否问题,可解释性强。② 随机森林=多树投票,表格数据神器。③ 风控、客户分群的主力。

4.6 概率图模型:贝叶斯网络与 HMM

Probabilistic Graphical Models · 用图画概率依赖

想引子与大白话

引子:你咳嗽、发烧了,可能是感冒也可能是肺炎。这俩病都会引起咳嗽发烧,怎么根据症状反推概率?画一张"感冒→咳嗽、感冒→发烧、肺炎→发烧"的图,就是概率图模型(PGM)。

核心思想:节点=随机变量,边=依赖。几十个变量的联合概率有指数级条目存不下,但用条件独立拆开就能算。

① 贝叶斯网络(有向):边有箭头表因果方向。联合分布分解为 P(x₁..xₙ) = Π P(xᵢ | Parents(xᵢ))。朴素贝叶斯是它"假设所有特征条件独立"的退化版。

② 马尔可夫随机场(无向,MRF):边无方向表对称关联,适合像素网格、社交网络这种"相邻相关"。

③ 隐马尔可夫模型(HMM):看不见的状态 + 看得见的观测。三大问题:前向算法算观测概率、Viterbi 解码最可能状态序列、Baum-Welch(EM)学参数。早期语音识别、词性标注主力。

例:感冒概率 10%、感冒时咳嗽概率 80%;肺炎概率 1%、肺炎时咳嗽概率 60%。听到咳嗽,更可能是哪种?
用贝叶斯比后验。
思路:P(病|咳) ∝ P(咳|病)·P(病)。
解:感冒 = 0.8×0.10 = 0.08;肺炎 = 0.6×0.01 = 0.006。0.08 > 0.006,更可能是感冒。基率(先验)起了决定性作用——这就是为什么稀有病别被症状吓自己。
技术里

医疗诊断(症状→疾病)、垃圾邮件(朴素贝叶斯是 PGM 退化版)、HMM 做词性标注。

和深度学习

深度学习兴起后 PGM 部分被神经网络替代,但"条件独立分解""贝叶斯推理"思想仍在贝叶斯深度学习、变分推断里续命。

防坑

坑:把相关当因果。"手指黄"和"肺癌"相关,但都被"抽烟"引起。直接画 手指黄→肺癌 就错了——贝叶斯网络的箭头是假设的因果方向,假设错了推理全错。另外贝叶斯网络(有向)和 MRF(无向)的边含义别混。

练一练

基础贝叶斯网络和马尔可夫随机场,边的区别?

看答案贝叶斯网络边有箭头(有向因果,原因→结果);MRF 边无方向(对称关联,像素/社交网络)。

进阶HMM 为什么适合语音识别?

看答案语音是随时间演化的观测,背后藏着"正在发哪个音"这个隐状态。HMM 用转移概率描述音素过渡、发射概率描述声音,Viterbi 找最可能的词序列。

自评反馈:答对了继续;HMM 三问还记混,回看概率图模型那一节。

记
小结

① 节点=变量,边=依赖;有向=贝叶斯网络,无向=MRF。② 条件独立让高维联合分布可算。③ HMM 三问(前向/Viterbi/Baum-Welch)是语音/NLP 老主力。

费曼学习法:讲给别人听

① 用自己的话解释:用"练习册"的比喻说清监督 / 无监督 / 强化学习的区别。

② 举个反例 / 生活例子:反例——为什么逻辑回归预测概率时,损失用交叉熵而不是 MSE?

③ 哪里还说不清:随机森林为什么"多树投票"就能减少过拟合,这个直觉你能讲顺吗?