楼层: 首页/ 软件技术/ Python 机器学习与深度学习/ 数学基础回顾
2

数学基础回顾

Math Prerequisites (Linked to Math Section)

机器学习不是数学考试,但不懂数学你就永远是"调包侠",出了问题不知道怎么调。这一章把 ML 用到的四块数学串起来,并标注它们对应数学板块的哪一节。

线性代数:数据就是矩阵

概念在 ML 中的角色对应 math-undergrad
向量一个样本的特征表示(一行就是一个样本)。线性代数 §向量
矩阵整个数据集(m×n)。线性代数 §矩阵
矩阵乘法一次线性变换;神经网络一层就是一次矩阵乘。线性代数 §矩阵乘法
转置 / 逆正规方程解线性回归;正交变换。线性代数 §逆矩阵
特征值/特征向量PCA 找主成分。线性代数 §特征值
范数L1/L2 正则化、向量距离。线性代数 §范数

微积分:怎么下山

论梯度下降就是蒙眼下山

你站在山上,蒙着眼想走到山谷(最低点)。你会用脚感受哪个方向最陡,然后往最陡的下坡方向迈一步——这就是梯度下降。梯度是"最陡上坡方向",所以要沿反方向走。链式法则让我们能把多层嵌套函数的导数一层层传回去——这就是反向传播。

链式法则:dL/dx = dL/dy · dy/dx(从后往前逐层相乘)

概率统计:不确定性建模

概念在 ML 中的角色对应 math-undergrad
正态分布误差项假设、权重初始化。概率论 §常见分布
期望/方差损失函数、Dropout 方差。概率论 §期望方差
贝叶斯定理朴素贝叶斯、贝叶斯优化。概率论 §贝叶斯
最大似然估计 MLE交叉熵损失 = MLE 在分布假设下的形式。数理统计 §MLE
协方差 / 相关系数特征相关性、PCA 协方差矩阵。概率论 §协方差
贝叶斯定理:P(A|B) = P(B|A) · P(A) / P(B)

最优化:训练的本质

模型训练 = 在参数空间里最小化损失函数。你选一个起点(初始化),用梯度下降往最低点走。学习率是步子大小:太大跨过谷底,太小磨磨蹭蹭。局部最优 vs 全局最优:非凸问题(神经网络)可能卡在小坑里出不来,但实际上高维空间里"真局部最优"很少见,更多是鞍点。

MLE 与损失函数的关系

论损失函数不是拍脑袋的

假设误差服从正态分布,最大化似然等价于最小化 MSE。假设标签服从伯努利分布,最大化似然等价于最小化交叉熵。也就是说:你选什么损失函数,背后就是假设数据服从什么分布。这就是为什么回归用 MSE、分类用交叉熵。

本章面试题

面试 · 第 2 章

Q1. 为什么神经网络需要链式法则?

查看答案

损失是网络最后一层的输出,要算损失对第一层权重的梯度,必须用链式法则把复合函数求导拆成一串局部导数相乘。这就是反向传播的数学基础。

Q2. 什么是梯度?方向呢?

查看答案

梯度是函数在该点上升最快的方向(向量)。梯度下降沿负梯度方向走一步。

Q3. MLE 和损失函数什么关系?

查看答案

假设数据服从某分布(如正态分布),最大化似然等价于最小化负对数似然,而负对数似然就是常见的损失函数(MSE、交叉熵)。