2
数学基础回顾
Math Prerequisites (Linked to Math Section)
机器学习不是数学考试,但不懂数学你就永远是"调包侠",出了问题不知道怎么调。这一章把 ML 用到的四块数学串起来,并标注它们对应数学板块的哪一节。
线性代数:数据就是矩阵
| 概念 | 在 ML 中的角色 | 对应 math-undergrad |
|---|---|---|
| 向量 | 一个样本的特征表示(一行就是一个样本)。 | 线性代数 §向量 |
| 矩阵 | 整个数据集(m×n)。 | 线性代数 §矩阵 |
| 矩阵乘法 | 一次线性变换;神经网络一层就是一次矩阵乘。 | 线性代数 §矩阵乘法 |
| 转置 / 逆 | 正规方程解线性回归;正交变换。 | 线性代数 §逆矩阵 |
| 特征值/特征向量 | PCA 找主成分。 | 线性代数 §特征值 |
| 范数 | L1/L2 正则化、向量距离。 | 线性代数 §范数 |
微积分:怎么下山
论梯度下降就是蒙眼下山
你站在山上,蒙着眼想走到山谷(最低点)。你会用脚感受哪个方向最陡,然后往最陡的下坡方向迈一步——这就是梯度下降。梯度是"最陡上坡方向",所以要沿反方向走。链式法则让我们能把多层嵌套函数的导数一层层传回去——这就是反向传播。
链式法则:dL/dx = dL/dy · dy/dx(从后往前逐层相乘)
概率统计:不确定性建模
| 概念 | 在 ML 中的角色 | 对应 math-undergrad |
|---|---|---|
| 正态分布 | 误差项假设、权重初始化。 | 概率论 §常见分布 |
| 期望/方差 | 损失函数、Dropout 方差。 | 概率论 §期望方差 |
| 贝叶斯定理 | 朴素贝叶斯、贝叶斯优化。 | 概率论 §贝叶斯 |
| 最大似然估计 MLE | 交叉熵损失 = MLE 在分布假设下的形式。 | 数理统计 §MLE |
| 协方差 / 相关系数 | 特征相关性、PCA 协方差矩阵。 | 概率论 §协方差 |
贝叶斯定理:P(A|B) = P(B|A) · P(A) / P(B)
最优化:训练的本质
模型训练 = 在参数空间里最小化损失函数。你选一个起点(初始化),用梯度下降往最低点走。学习率是步子大小:太大跨过谷底,太小磨磨蹭蹭。局部最优 vs 全局最优:非凸问题(神经网络)可能卡在小坑里出不来,但实际上高维空间里"真局部最优"很少见,更多是鞍点。
MLE 与损失函数的关系
论损失函数不是拍脑袋的
假设误差服从正态分布,最大化似然等价于最小化 MSE。假设标签服从伯努利分布,最大化似然等价于最小化交叉熵。也就是说:你选什么损失函数,背后就是假设数据服从什么分布。这就是为什么回归用 MSE、分类用交叉熵。
本章面试题
面试 · 第 2 章
Q1. 为什么神经网络需要链式法则?
查看答案
损失是网络最后一层的输出,要算损失对第一层权重的梯度,必须用链式法则把复合函数求导拆成一串局部导数相乘。这就是反向传播的数学基础。
Q2. 什么是梯度?方向呢?
查看答案
梯度是函数在该点上升最快的方向(向量)。梯度下降沿负梯度方向走一步。
Q3. MLE 和损失函数什么关系?
查看答案
假设数据服从某分布(如正态分布),最大化似然等价于最小化负对数似然,而负对数似然就是常见的损失函数(MSE、交叉熵)。