楼层: 首页/ 算法与AI/ 模块二 · AI 相关数学回顾
数

模块二 · AI 相关数学回顾

Math for AI · 数学概念 → AI 里的角色

大模型不是玄学,它就是几摞矩阵在做乘法、再加一点求导。这一模块不教你重新学数学,只做一件事:把数学大厦里的概念,翻译成"它在 AI 里扮演谁"。忘了公式没关系,知道它对应哪一层、去哪回炉就行。

上一模块学了"数据怎么摆",这一模块学"变化怎么算"。为什么需要?因为神经网络说白了就是几摞矩阵做乘法、再链式求导,不懂线代、微积分、概率,后面梯度下降和反向传播就跟天书一样。学完你能把数学名词翻译成"它在 AI 里扮演谁"。下一模块学算法。

本模块要学什么(按这个顺序学)
线代(向量/矩阵/特征值) → 微积分(导数/梯度/链式法则) → 概率(分布/贝叶斯/MLE) → 凸优化/正则化

2.1 线性代数在 AI 里

Linear Algebra · 向量、矩阵、特征值

想数学概念 → AI 里的角色

向量(Vector)= 一个数据点的特征表示。一张图片拉平成一串数,一个词变成一串 Embedding,都是向量。"这个苹果多红、多圆、多重"就是三维向量。

矩阵(Matrix)= 一批数据 + 一次线性变换。100 张图就是 100 行矩阵;全连接层干的事就是 y = Wx + b,一个矩阵乘向量。

矩阵乘法 = 两个变换叠加。Transformer 的注意力里 QKT 就是算"每个词和其他词有多相关"。

特征值/特征向量 = 数据的主方向。一堆数据点最散的那个方向就是最大特征值对应的特征向量——PCA 降维就靠它。

例:全连接层 y = Wx + b,x 是 4 维,y 是 2 维,W 是几乘几?
输入特征 4 个,输出 2 个。
思路:矩阵乘法要求:W 的列数 = x 的维数;W 的行数 = y 的维数。
解:W 是 2×4,b 是 2 维。2×4 乘 4×1 得到 2×1,正好是 2 维输出。这就是一个神经元层的几何——把 4 维空间的点,线性投影到 2 维。
记
小结

① 向量=特征,矩阵=批量数据+线性变换。② 全连接层就是矩阵乘法。③ 特征值=数据主方向,PCA 降维用它。

2.2 微积分在 AI 里

Calculus · 导数、梯度、链式法则

想数学概念 → AI 里的角色

导数 = 变化率。x 动一点点,y 动多少?这是"调参数"的指南针。

梯度(∇)= 最陡上升方向。多变量时,梯度向量指向"函数涨得最快"的方向;反方向就是下降最快的方向——梯度下降就这么来的。

偏导数:固定其他变量,单独看某一个参数对损失的影响。神经网络有上百万参数,每个都要算偏导。

链式法则 = 反向传播的全部秘密。复合函数 f(g(x)) 的导数 = f′(g(x))·g′(x)。神经网络是几十层嵌套的复合函数,链式法则让你从后往前一层层把梯度传回去。

例:损失 L = (y − w·x)²,求 ∂L/∂w(w 是权重)
x=2,y=5,当前 w=1。
思路:令 z = y − wx,L = z²。链式法则:∂L/∂w = 2z · ∂z/∂w = 2z · (−x)。
解:z = 5 − 1·2 = 3。∂L/∂w = 2·3·(−2) = −12。意思是 w 增大一点,损失会减小(梯度负),所以 w 应该往正方向调。这就是一次梯度下降的缩影。
记
小结

① 梯度=最陡方向,反着走=梯度下降。② 链式法则=反向传播,从后往前传梯度。③ 所有深度学习训练,本质就是在算几百万个偏导。

2.3 概率统计在 AI 里

Probability & Stats · 分布、贝叶斯、期望

想数学概念 → AI 里的角色

分布 = 数据长什么样。噪声一般假设服从正态分布 N(μ, σ²);图片像素有自己的经验分布。

期望(E)= 长期平均。损失函数本质就是"预测错多少"的期望。

贝叶斯定理 = 根据新证据更新信念。P(垃圾|含"中奖") = P(含"中奖"|垃圾)·P(垃圾) / P(含"中奖")。垃圾邮件过滤、医学诊断全靠它。

最大似然估计(MLE)= 找一组参数,让观测到的数据出现的概率最大。这是"训练模型"的统计学说法。

例:疾病检测 P(病)=1%,检测准确率 99%,真阳率=99%,假阳率=5%。测出阳性,真得病概率多少?
直觉:99%?错。
思路:1000 人里,10 个真病、990 个没病。真病人测出阳性 ≈ 10×0.99 ≈ 10 人;没病的人误报 ≈ 990×0.05 ≈ 50 人。
解:阳性总人数 ≈ 60,其中真病 10,所以 P(病|阳) = 10/60 ≈ 16.7%。基数小的时候,假阳性能把真的淹没。这就是贝叶斯的反直觉。
记
小结

① 分布=数据形状,期望=平均损失。② 贝叶斯=根据证据更新信念,小概率病别被准确率骗了。③ MLE=找参数让数据最合理,训练的本质。

2.4 最优化在 AI 里

Optimization · 损失函数、梯度下降、学习率

想数学概念 → AI 里的角色

损失函数(Loss)= 模型预测错了多少。训练的唯一目标:把它降到最小。MSE 用于回归,交叉熵用于分类。

梯度下降 = 蒙眼下坡找谷底。站在 loss landscape 上,每次朝最陡下坡方向迈一步。

学习率(Learning Rate, lr)= 每步迈多大。太大一步跨过谷底;太小半天到不了。调参 80% 是在调它。

正则化 = 给模型"别太钻牛角尖"。L1/L2 惩罚大权重,防止过拟合。

凸优化:损失函数是凸的(碗状),保证一定找到全局最小;神经网络损失非凸,可能卡在局部最小或鞍点——但实践中大模型照样训得动。

例:梯度下降更新公式 w ← w − lr · ∂L/∂w,沿用上例 lr=0.1
w=1,∂L/∂w=−12。
思路:w 减去学习率乘梯度。
解:新 w = 1 − 0.1×(−12) = 1 + 1.2 = 2.2。梯度是负的,w 往正方向走,loss 下降。这就是训练一轮。重复几百万次,w 就停在最优附近。
防坑

坑:学习率越大越好?为什么错?lr=100 直接从山谷这头飞到那头,loss 震荡甚至爆炸。经验:从 0.01 / 0.001 起步,观察 loss 曲线,不降就降 lr,降得慢就加一点。

记
小结

① 损失函数=训练目标,梯度下降=优化器。② 学习率是头号超参。③ 正则化防过拟合,凸优化才有全局最优保证。

2.5 矩阵在 AI 中的深化:SVD 与批量计算

Matrices in AI · GPU 为什么这么猛

想矩阵到底在 AI 里干了啥

引子:为什么训练 AI 要买贵得离谱的 GPU?因为AI 里几乎一切数据都是矩阵/张量,一切核心运算都是矩阵乘法,而 GPU 天生就是矩阵乘法加速器。

一张图 = 三维张量:高 × 宽 × RGB 三个通道。一批 32 张图叠起来就是四维张量。一次前向 = 一次大矩阵乘法。

全连接层 = 一次矩阵乘:y = Wx + b。一批样本叠成矩阵 X,一次 Y = XW + B 全算完——这就是 GPU 吞吐量的来源。

奇异值分解(SVD):把矩阵 A 拆成 A = UΣVT。Σ 对角线上的奇异值越大,对应方向越重要。PCA 降维、推荐系统协同过滤、图像压缩,本质都是丢掉小奇异值"留主去噪"。

例:注意力里 Q 是 (n×d),K 是 (m×d),QKT 是几乘几?
KT 是 (d×m)。
思路:中间 d 对上,结果是 n×m。
解:QKT = (n×m),代表 n 个 query 对 m 个 key 的注意力分数。这个矩阵的内存和计算都是 O(n²)——长上下文贵就贵在这,FlashAttention、稀疏注意力都是来治它的。
防坑

坑:矩阵乘法不满足交换律。AB ≠ BA。写 AI 代码维度对不上,第一反应就是乘反了(比如该写 QKT 写成 KQT)。另外 QKT 要除以 √dₖ,否则点积方差随 dₖ 暴涨,softmax 变"赢家通吃"梯度消失。

练一练

基础(m×n)·(n×p) 的时间复杂度是多少?

看答案O(mnp)。Transformer 一层主要计算 O(n²d),所以 n(序列长度)是头号开销。

进阶SVD 和 PCA 是什么关系?

看答案PCA 对协方差矩阵做特征分解;对数据矩阵直接做 SVD 数学上等价,且数值更稳。最大的几个奇异值方向就是数据最散的主方向。

自评反馈:答对了继续;矩阵乘法复杂度和 PCA 的关系,回看 2.1 线代那一节。

记
小结

① 图像=三维张量,GPU=矩阵乘法加速器。② SVD 拆矩阵留主方向,PCA/推荐/图像压缩靠它。③ Attention=softmax(QKT/√dₖ)V,O(n²) 是长上下文的瓶颈。

表 2-1 数学 → AI 映射总表
数学概念AI 里的角色出现在哪
向量 / 矩阵特征表示 / 线性变换Embedding、全连接层
矩阵乘法 QKT词与词的相关性打分Transformer 自注意力
特征值 / 特征向量数据主方向PCA 降维
导数 / 偏导参数该往哪调所有训练
链式法则逐层传梯度反向传播 Backprop
梯度 ∇最陡方向SGD / Adam 优化器
正态分布噪声 / 初始化数据增广、权重初始化
贝叶斯定理更新信念朴素贝叶斯分类器
期望 E平均损失损失函数 MSE
最大似然 MLE找最优参数模型训练目标
凸优化全局收敛保证线性回归 / SVM
正则化 L1/L2防过拟合权重衰减
费曼学习法:讲给别人听

① 用自己的话解释:用一句话说清"梯度为什么反着走就是梯度下降"。

② 举个反例 / 生活例子:反例——那个得病率 1%、检测准确率 99% 的例子,为什么测出阳性也只有约 17% 真得病?

③ 哪里还说不清:链式法则在神经网络里到底怎么一层层传回去,哪一步还没完全通?