测度论基础:σ-代数、勒贝格积分与收敛定理
【章首引子】概率论里"概率"到底是什么?为什么能无穷多个事件取极限?答案都在测度论里:它把"长度、面积、体积、概率"统一成一个叫测度的东西,并给出"积分与极限交换"的合法条件。深度学习里的期望、收敛、KL 散度,严格地基都是这一章。
① 是什么:从长度到测度
啥测度论在严格化什么
① σ-代数:样本空间 Ω 上的一簇子集 F,满足:Ω∈F;A∈F ⇒ Aᶜ∈F;A₁,A₂,…∈F ⇒ ∪Aₙ∈F。即对补和可数并封闭。Borel σ-代数:实数轴上由所有开区间生成的 σ-代数,是日常概率事件的容器。
② 测度:μ: F→[0,∞] 满足 μ(∅)=0 且可数可加:Aₙ 两两不交时 μ(∪Aₙ)=Σμ(Aₙ)。概率测度额外要求 μ(Ω)=1。
③ 可测函数与勒贝格积分:f: Ω→ℝ 可测,若 {f≤a}∈F 对所有 a。积分从示性函数 1_A 开始:∫1_A dμ=μ(A);线性延拓到简单函数,再单调逼近到一般可测函数。
② 三大收敛定理
证交换积分与极限的三把钥匙
直觉:黎曼积分只驯服"整齐"的函数;勒贝格积分通过横切 y 值,能积那些高度震荡、甚至反常的函数。经典例子: Dirichlet 函数(有理数上 1、无理数上 0)黎曼不可积,但勒贝格可积,积分=0(有理数集测度为 0)。
DCT 为什么需要控制函数 g:没有 g 压住,fₙ 的质量可能"逃逸到无穷远处"(如 fₙ=n·1_{[n,n+1/n]},逐点→0 但积分恒为 1),极限交换失败。DCT 说"只要所有 fₙ 被一个可积 g 罩住",交换就合法。
③ 例题
④ AI 落点
AI 落点 1:期望与 KL 散度
期望 E[f]=∫f dP 是勒贝格积分;KL(p‖q)=∫p log(p/q)dμ 定义了概率分布间的"距离",是 VAE、InfoNCE 的损失根基。
AI 落点 2:大数定律
蒙特卡洛采样、SGD 的收敛性靠 LLN(测度论版本):样本均值依概率/几乎必然收敛到期望。
AI 落点 3:L^p 与归一化
权重的 L2 范数、激活的 LayerNorm、谱归一化都是 L^p 范数;Holder/Minkowski 给出范数运算的代数。
AI 落点 4:几乎必然收敛
"几乎必然"(a.s.)=除一个零测集外成立;随机梯度的收敛保证常写成 a.s. 或依分布。
⑤ 延展
展知识衔接地图
往本科走:数学分析的黎曼积分、概率论的古典概率是直观来源。
往算法走:测度 → 严格概率论与随机过程;L^p → 泛函分析与 RKHS;DCT → 统计估计的渐近理论。
以为任何集合都能测。存在不可测集(Vitali 集),所以测度必须定义在 σ-代数上,不是全体幂集。
交换极限不验证条件。逐点收敛不足以交换积分(例3 的质量逃逸),必须有单调性(Levi)或控制函数(DCT)。
混淆几乎处处与处处。"a.e."允许在零测集上失败;概率论里"a.s."允许在概率 0 的事件上失败——工程上可忽略,但证明里要写清。
练习
【基础】μ 是测度,A⊂B,比较 μ(A) 与 μ(B)。
查看解答
B=A∪(B∖A) 不交,μ(B)=μ(A)+μ(B∖A)≥μ(A),测度单调。【进阶】fₙ=n·1_{[0,1/n]},逐点极限是什么?∫fₙ 是多少?DCT 适用吗?
查看解答
x>0 eventually fₙ(x)=0,fₙ(0)=n;逐点极限=0(除 0 点)。∫fₙ=1。无统一可积控制(g≥fₙ 需 ∫g≥1 但 g(0)=∞),DCT 不适用。【挑战】用 Holder 证明 ‖f‖₁≤‖f‖₂(在概率空间 μ(Ω)=1)。
查看解答
取 g=1:∫|f·1|≤‖f‖₂‖1‖₂=‖f‖₂·√μ(Ω)=‖f‖₂,因 μ(Ω)=1。① σ-代数是事件的容器,测度是可数可加的"长度/概率"。
② 勒贝格积分从示性函数单调逼近建立;Levi/Fatou/DCT 给出交换极限的三把钥匙。
③ L^p 空间 + Holder/Minkowski 是函数的"向量空间",深度学习的范数、KL、收敛都建立其上。