随机过程与鞅论:马尔可夫链、布朗运动与鞅
【章首引子】明天会不会下雨、用户会不会点广告、股价怎么走——这些都是"随时间演化的随机量",叫随机过程。本章抓三个最有用的:马尔可夫链(下一步只看现在)、泊松过程(随机事件计数)、布朗运动(连续随机游走),再加一个贯穿始终的工具——鞅(公平赌博)。强化学习、Diffusion、MCMC、随机梯度下降都在这套语言里。
① 是什么:四类随机过程
啥随机过程家族
① 随机过程定义:一族随机变量 {X(t) : t∈T},t 是时间。离散时间 X₀,X₁,X₂,…;连续时间 X(t)。平稳过程:统计性质不随时间平移改变;独立增量:不重叠时间区间上的增量相互独立。
② 马尔可夫链:离散状态 + 离散时间,核心是马尔可夫性——下一步只依赖当前状态,与历史无关:P(X_{n+1}=j | Xₙ=i, X_{n−1},…)=P(X_{n+1}=j|Xₙ=i)=p_{ij}。排成转移矩阵 P=(p_{ij}),n 步转移是 Pⁿ。
③ 平稳分布:若 πP=π(即 π 是 P 的左特征向量、特征值 1)且 π 非负归一,则 π 是平稳分布。不可约(任意两状态互通)+ 非周期 ⇒ 遍历:无论初始分布如何,Pⁿ→π。吸收态:一旦进入就出不来(p_{ii}=1)。
④ 泊松过程:N(t)=[0,t] 内事件数。N(t)~Poisson(λt),即 P(N(t)=k)=e^{−λt}(λt)ᵏ/k!。独立增量、无记忆(等待时间指数分布 Exp(λ))。
⑤ 布朗运动 W(t):连续轨道、W(0)=0、独立平稳增量、W(t)−W(s)~N(0,t−s)。它是连续时间的"随机游走极限",是伊藤积分与随机微分方程(SDE)的基石。
② 怎么想到的
思解题心法
状态随时间跳、只看现在 → 马尔可夫链:写转移矩阵 P,求平稳分布 π=πP。
数"事件发生了几次" → 泊松过程:N(t)~Poisson(λt),间隔时间独立指数分布。
连续时间随机游走 → 布朗运动:方差随时间线性增长 Var W(t)=t。
"无偏估计/公平游戏" → 鞅:未来期望等于当下,E(M_{n+1}|Fₙ)=Mₙ。
证核心定理
推导思路(平稳分布):πP=π 表示"按 π 随机抽一个状态,再走一步,分布还是 π"。若链遍历,长期频率收敛到 π,所以 π 也是极限分布。细致平衡 πᵢp_{ij}=πⱼp_{ji} 直接相加即 πP=π,是找 π 的常用捷径。
推导思路(鞅直觉):鞅的"鞅停住"性质:赌徒用任何策略(见好就收、追跌加仓)都不能把公平游戏变成正期望——E(M_τ)=E(M₀)。这是 MCMC、赌博系统、期权定价公平性的数学基础。
伊藤积分直觉:布朗运动路径处处连续但处处不可导,普通积分 ∫f(W)dW 定义不了(dW 抖动太厉害)。伊藤积分用"右端点"采样把它严格化,得到 dW²=dt 的神奇规则,是 SDE dX=f dt+g dW 的根基。
③ 例题
④ AI 落点
AI 落点 1:MCMC 采样
Metropolis-Hastings 构造一条平稳分布为目标后验 π 的马氏链,长时间跑样本即来自 π——贝叶斯推断的核心引擎。
AI 落点 2:Diffusion 模型
前向加噪是布朗运动/高斯扩散过程 Xₜ=√(t)ε;反向学 score 去噪。整条链就是随机过程理论的工程化。
AI 落点 3:强化学习 MDP
马尔可夫决策过程 = 马氏链 + 动作 + 奖励;贝尔曼方程就是在马氏链上做期望。Q-Learning 是随机逼近。
AI 落点 4:SGD 的鞅噪声
随机梯度 = 真梯度 + 鞅差噪声;分析 SGD 收敛要用到鞅的大数定律与 Azuma 不等式。
⑤ 延展
展知识衔接地图
往本科走:概率论的期望、条件期望、大数定律是本章的语言。
往算法走:马氏链 → MCMC/PageRank;布朗运动 → SDE/扩散模型;鞅 → 随机优化与金融数学。
以为平稳分布一定存在。可约链(有多个闭类)或周期链不一定有唯一平稳分布;必须不可约+非周期才有遍历极限。
把独立增量当平稳增量。独立增量说的是"不重叠区间增量独立",平稳增量说的是"增量分布只依赖时间差"——布朗运动两者都有,一般过程未必。
忽略停时有界性。可选抽样定理要求停时 τ 有界(或满足矩条件);无限停时下 E(M_τ)=E(M₀) 可能失效(赌徒输光原理)。
练习
【基础】泊松过程 λ=3/分钟,1 分钟内恰好 3 个事件的概率?
查看解答
P(N(1)=3)=e^{−3}·3³/3! = e^{−3}·27/6 ≈ 0.224。【进阶】W(0.5) 的分布?W(0.5)−W(0.2) 的方差?
查看解答
W(0.5)~N(0,0.5),标准差 √0.5≈0.707;增量 W(0.5)−W(0.2)~N(0,0.3),方差 0.3。【挑战】说明为什么 E(W(t)|W(s))=W(s)(t>s),即 W 是鞅。
查看解答
W(t)=W(s)+(W(t)−W(s)),取条件期望 E(W(t)|W(s))=W(s)+E(W(t)−W(s)|W(s))=W(s)+0=W(s),因为增量独立且均值 0。① 马氏链:P 转移、Pⁿ n 步、π=πP 平稳;不可约非周期则遍历收敛。
② 泊松过程 N(t)~Poisson(λt),独立无记忆;布朗运动 W(t)~N(0,t),连续随机游走。
③ 鞅 E(M_{n+1}|Fₙ)=Mₙ,可选抽样 E(M_τ)=E(M₀);是公平游戏与随机优化的理论语言。