路径: 本科数学/ 进阶数学/ 矩阵分析与谱图论/测度论基础:σ-代数、勒贝格积分与收敛定理
32

测度论基础:σ-代数、勒贝格积分与收敛定理

Measure Theory · 把"长度/概率"严格化

【章首引子】概率论里"概率"到底是什么?为什么能无穷多个事件取极限?答案都在测度论里:它把"长度、面积、体积、概率"统一成一个叫测度的东西,并给出"积分与极限交换"的合法条件。深度学习里的期望、收敛、KL 散度,严格地基都是这一章。

卡必背公式 / 记忆口诀
σ-代数:对补与可数并封闭
测度:μ(∪Aₙ)=Σμ(Aₙ) 可数可加
三大收敛:Levi / Fatou / DCT
Holder:‖fg‖₁≤‖f‖ₚ‖g‖q
口诀:先建 σ-代数,再给测度,积分从示性函数搭起来

① 是什么:从长度到测度

啥测度论在严格化什么

① σ-代数:样本空间 Ω 上的一簇子集 F,满足:Ω∈F;A∈F ⇒ Aᶜ∈F;A₁,A₂,…∈F ⇒ ∪Aₙ∈F。即对补和可数并封闭。Borel σ-代数:实数轴上由所有开区间生成的 σ-代数,是日常概率事件的容器。

② 测度:μ: F→[0,∞] 满足 μ(∅)=0 且可数可加:Aₙ 两两不交时 μ(∪Aₙ)=Σμ(Aₙ)。概率测度额外要求 μ(Ω)=1。

③ 可测函数与勒贝格积分:f: Ω→ℝ 可测,若 {f≤a}∈F 对所有 a。积分从示性函数 1_A 开始:∫1_A dμ=μ(A);线性延拓到简单函数,再单调逼近到一般可测函数。

图 32.1:黎曼积分(竖条切 x)vs 勒贝格积分(横条切 y)
黎曼:竖条按 x 切 勒贝格:横条按 y 切

② 三大收敛定理

证交换积分与极限的三把钥匙

① 单调收敛(Levi):0≤f₁↑f(逐点单调不减)⇒ ∫fₙ dμ ↑ ∫f dμ。② Fatou 引理:fₙ≥0 ⇒ ∫liminf fₙ dμ ≤ liminf ∫fₙ dμ(极限下积分不超积分的下极限)。③ 控制收敛(DCT):fₙ→f 逐点(或 a.e.),且 |fₙ|≤g 可积 ⇒ lim ∫fₙ = ∫f。L^p 空间:L^p={f: ∫|f|ᵖdμ<∞},范数 ‖f‖ₚ=(∫|f|ᵖ)^{1/p}。赫尔德:1/p+1/q=1 ⇒ ∫|fg|≤‖f‖ₚ‖g‖_q。闵可夫斯基:‖f+g‖ₚ≤‖f‖ₚ+‖g‖ₚ(三角不等式)。

直觉:黎曼积分只驯服"整齐"的函数;勒贝格积分通过横切 y 值,能积那些高度震荡、甚至反常的函数。经典例子: Dirichlet 函数(有理数上 1、无理数上 0)黎曼不可积,但勒贝格可积,积分=0(有理数集测度为 0)。

DCT 为什么需要控制函数 g:没有 g 压住,fₙ 的质量可能"逃逸到无穷远处"(如 fₙ=n·1_{[n,n+1/n]},逐点→0 但积分恒为 1),极限交换失败。DCT 说"只要所有 fₙ 被一个可积 g 罩住",交换就合法。

③ 例题

例1:用 DCT 求 lim ∫₀ⁿ (1+x/n)ⁿ e^{−2x} dx
【审题】(1+x/n)ⁿ→eˣ。
思路:找控制函数。
逐步:x≥0 时 (1+x/n)ⁿ≤eˣ,故被积函数 ≤ eˣ·e^{−2x}=e^{−x},可积。DCT ⇒ 极限=∫₀^∞ eˣe^{−2x}dx=∫₀^∞e^{−x}dx=1。
例2:赫尔德不等式的应用
【审题】1/p+1/q=1,估计 ∫|fg|。
思路:直接套。
逐步:取 p=q=2(柯西–施瓦茨):∫|fg|≤√(∫f²)√(∫g²)。这是向量内积不等式在函数空间的版本,也是深度学习里"正交化、余弦相似度"的严格来源。
例3:Fatou 引理的"损失"方向
【审题】fₙ=1_{[n,n+1]}。
思路:逐点→0 但积分恒 1。
逐步:∫liminf fₙ=∫0=0 ≤ liminf∫fₙ=1。Fatou 给出严格不等号——这正是"质量逃逸",DCT 在此失效(无统一可积控制函数)。
测度论核心公式 σ-代数:对补、可数并封闭;Borel 由开区间生成
测度可数可加:μ(∪Aₙ)=Σμ(Aₙ);概率测度 μ(Ω)=1
Levi(单调↑)/ Fatou(liminf)/ DCT(有控制 g 可交换极限)
Holder:∫|fg|≤‖f‖ₚ‖g‖_q(1/p+1/q=1);Minkowski:‖f+g‖ₚ≤‖f‖ₚ+‖g‖ₚ

④ AI 落点

稳定性
AI 落点 1:期望与 KL 散度

期望 E[f]=∫f dP 是勒贝格积分;KL(p‖q)=∫p log(p/q)dμ 定义了概率分布间的"距离",是 VAE、InfoNCE 的损失根基。

算法
AI 落点 2:大数定律

蒙特卡洛采样、SGD 的收敛性靠 LLN(测度论版本):样本均值依概率/几乎必然收敛到期望。

稳定性
AI 落点 3:L^p 与归一化

权重的 L2 范数、激活的 LayerNorm、谱归一化都是 L^p 范数;Holder/Minkowski 给出范数运算的代数。

算法
AI 落点 4:几乎必然收敛

"几乎必然"(a.s.)=除一个零测集外成立;随机梯度的收敛保证常写成 a.s. 或依分布。

⑤ 延展

展知识衔接地图

往本科走:数学分析的黎曼积分、概率论的古典概率是直观来源。

往算法走:测度 → 严格概率论与随机过程;L^p → 泛函分析与 RKHS;DCT → 统计估计的渐近理论。

思维陷阱

以为任何集合都能测。存在不可测集(Vitali 集),所以测度必须定义在 σ-代数上,不是全体幂集。

交换极限不验证条件。逐点收敛不足以交换积分(例3 的质量逃逸),必须有单调性(Levi)或控制函数(DCT)。

混淆几乎处处与处处。"a.e."允许在零测集上失败;概率论里"a.s."允许在概率 0 的事件上失败——工程上可忽略,但证明里要写清。

练习

【基础】μ 是测度,A⊂B,比较 μ(A) 与 μ(B)。

查看解答B=A∪(B∖A) 不交,μ(B)=μ(A)+μ(B∖A)≥μ(A),测度单调。
【自评反馈】对 → 下一题。

【进阶】fₙ=n·1_{[0,1/n]},逐点极限是什么?∫fₙ 是多少?DCT 适用吗?

查看解答x>0 eventually fₙ(x)=0,fₙ(0)=n;逐点极限=0(除 0 点)。∫fₙ=1。无统一可积控制(g≥fₙ 需 ∫g≥1 但 g(0)=∞),DCT 不适用。
【自评反馈】对 → 下一题。

【挑战】用 Holder 证明 ‖f‖₁≤‖f‖₂(在概率空间 μ(Ω)=1)。

查看解答取 g=1:∫|f·1|≤‖f‖₂‖1‖₂=‖f‖₂·√μ(Ω)=‖f‖₂,因 μ(Ω)=1。
记
小结卡

① σ-代数是事件的容器,测度是可数可加的"长度/概率"。

② 勒贝格积分从示性函数单调逼近建立;Levi/Fatou/DCT 给出交换极限的三把钥匙。

③ L^p 空间 + Holder/Minkowski 是函数的"向量空间",深度学习的范数、KL、收敛都建立其上。