模块二 · AI 相关数学回顾
大模型不是玄学,它就是几摞矩阵在做乘法、再加一点求导。这一模块不教你重新学数学,只做一件事:把数学大厦里的概念,翻译成"它在 AI 里扮演谁"。忘了公式没关系,知道它对应哪一层、去哪回炉就行。
上一模块学了"数据怎么摆",这一模块学"变化怎么算"。为什么需要?因为神经网络说白了就是几摞矩阵做乘法、再链式求导,不懂线代、微积分、概率,后面梯度下降和反向传播就跟天书一样。学完你能把数学名词翻译成"它在 AI 里扮演谁"。下一模块学算法。
2.1 线性代数在 AI 里
Linear Algebra · 向量、矩阵、特征值想数学概念 → AI 里的角色
向量(Vector)= 一个数据点的特征表示。一张图片拉平成一串数,一个词变成一串 Embedding,都是向量。"这个苹果多红、多圆、多重"就是三维向量。
矩阵(Matrix)= 一批数据 + 一次线性变换。100 张图就是 100 行矩阵;全连接层干的事就是 y = Wx + b,一个矩阵乘向量。
矩阵乘法 = 两个变换叠加。Transformer 的注意力里 QKT 就是算"每个词和其他词有多相关"。
特征值/特征向量 = 数据的主方向。一堆数据点最散的那个方向就是最大特征值对应的特征向量——PCA 降维就靠它。
① 向量=特征,矩阵=批量数据+线性变换。② 全连接层就是矩阵乘法。③ 特征值=数据主方向,PCA 降维用它。
2.2 微积分在 AI 里
Calculus · 导数、梯度、链式法则想数学概念 → AI 里的角色
导数 = 变化率。x 动一点点,y 动多少?这是"调参数"的指南针。
梯度(∇)= 最陡上升方向。多变量时,梯度向量指向"函数涨得最快"的方向;反方向就是下降最快的方向——梯度下降就这么来的。
偏导数:固定其他变量,单独看某一个参数对损失的影响。神经网络有上百万参数,每个都要算偏导。
链式法则 = 反向传播的全部秘密。复合函数 f(g(x)) 的导数 = f′(g(x))·g′(x)。神经网络是几十层嵌套的复合函数,链式法则让你从后往前一层层把梯度传回去。
① 梯度=最陡方向,反着走=梯度下降。② 链式法则=反向传播,从后往前传梯度。③ 所有深度学习训练,本质就是在算几百万个偏导。
2.3 概率统计在 AI 里
Probability & Stats · 分布、贝叶斯、期望想数学概念 → AI 里的角色
分布 = 数据长什么样。噪声一般假设服从正态分布 N(μ, σ²);图片像素有自己的经验分布。
期望(E)= 长期平均。损失函数本质就是"预测错多少"的期望。
贝叶斯定理 = 根据新证据更新信念。P(垃圾|含"中奖") = P(含"中奖"|垃圾)·P(垃圾) / P(含"中奖")。垃圾邮件过滤、医学诊断全靠它。
最大似然估计(MLE)= 找一组参数,让观测到的数据出现的概率最大。这是"训练模型"的统计学说法。
① 分布=数据形状,期望=平均损失。② 贝叶斯=根据证据更新信念,小概率病别被准确率骗了。③ MLE=找参数让数据最合理,训练的本质。
2.4 最优化在 AI 里
Optimization · 损失函数、梯度下降、学习率想数学概念 → AI 里的角色
损失函数(Loss)= 模型预测错了多少。训练的唯一目标:把它降到最小。MSE 用于回归,交叉熵用于分类。
梯度下降 = 蒙眼下坡找谷底。站在 loss landscape 上,每次朝最陡下坡方向迈一步。
学习率(Learning Rate, lr)= 每步迈多大。太大一步跨过谷底;太小半天到不了。调参 80% 是在调它。
正则化 = 给模型"别太钻牛角尖"。L1/L2 惩罚大权重,防止过拟合。
凸优化:损失函数是凸的(碗状),保证一定找到全局最小;神经网络损失非凸,可能卡在局部最小或鞍点——但实践中大模型照样训得动。
坑:学习率越大越好?为什么错?lr=100 直接从山谷这头飞到那头,loss 震荡甚至爆炸。经验:从 0.01 / 0.001 起步,观察 loss 曲线,不降就降 lr,降得慢就加一点。
① 损失函数=训练目标,梯度下降=优化器。② 学习率是头号超参。③ 正则化防过拟合,凸优化才有全局最优保证。
2.5 矩阵在 AI 中的深化:SVD 与批量计算
Matrices in AI · GPU 为什么这么猛想矩阵到底在 AI 里干了啥
引子:为什么训练 AI 要买贵得离谱的 GPU?因为AI 里几乎一切数据都是矩阵/张量,一切核心运算都是矩阵乘法,而 GPU 天生就是矩阵乘法加速器。
一张图 = 三维张量:高 × 宽 × RGB 三个通道。一批 32 张图叠起来就是四维张量。一次前向 = 一次大矩阵乘法。
全连接层 = 一次矩阵乘:y = Wx + b。一批样本叠成矩阵 X,一次 Y = XW + B 全算完——这就是 GPU 吞吐量的来源。
奇异值分解(SVD):把矩阵 A 拆成 A = UΣVT。Σ 对角线上的奇异值越大,对应方向越重要。PCA 降维、推荐系统协同过滤、图像压缩,本质都是丢掉小奇异值"留主去噪"。
坑:矩阵乘法不满足交换律。AB ≠ BA。写 AI 代码维度对不上,第一反应就是乘反了(比如该写 QKT 写成 KQT)。另外 QKT 要除以 √dₖ,否则点积方差随 dₖ 暴涨,softmax 变"赢家通吃"梯度消失。
练一练
基础(m×n)·(n×p) 的时间复杂度是多少?
看答案
O(mnp)。Transformer 一层主要计算 O(n²d),所以 n(序列长度)是头号开销。进阶SVD 和 PCA 是什么关系?
看答案
PCA 对协方差矩阵做特征分解;对数据矩阵直接做 SVD 数学上等价,且数值更稳。最大的几个奇异值方向就是数据最散的主方向。自评反馈:答对了继续;矩阵乘法复杂度和 PCA 的关系,回看 2.1 线代那一节。
① 图像=三维张量,GPU=矩阵乘法加速器。② SVD 拆矩阵留主方向,PCA/推荐/图像压缩靠它。③ Attention=softmax(QKT/√dₖ)V,O(n²) 是长上下文的瓶颈。
| 数学概念 | AI 里的角色 | 出现在哪 |
|---|---|---|
| 向量 / 矩阵 | 特征表示 / 线性变换 | Embedding、全连接层 |
| 矩阵乘法 QKT | 词与词的相关性打分 | Transformer 自注意力 |
| 特征值 / 特征向量 | 数据主方向 | PCA 降维 |
| 导数 / 偏导 | 参数该往哪调 | 所有训练 |
| 链式法则 | 逐层传梯度 | 反向传播 Backprop |
| 梯度 ∇ | 最陡方向 | SGD / Adam 优化器 |
| 正态分布 | 噪声 / 初始化 | 数据增广、权重初始化 |
| 贝叶斯定理 | 更新信念 | 朴素贝叶斯分类器 |
| 期望 E | 平均损失 | 损失函数 MSE |
| 最大似然 MLE | 找最优参数 | 模型训练目标 |
| 凸优化 | 全局收敛保证 | 线性回归 / SVM |
| 正则化 L1/L2 | 防过拟合 | 权重衰减 |
① 用自己的话解释:用一句话说清"梯度为什么反着走就是梯度下降"。
② 举个反例 / 生活例子:反例——那个得病率 1%、检测准确率 99% 的例子,为什么测出阳性也只有约 17% 真得病?
③ 哪里还说不清:链式法则在神经网络里到底怎么一层层传回去,哪一步还没完全通?