路径: 本科数学/ 进阶数学/ 矩阵分析与谱图论/贝叶斯推断进阶:共轭先验、MCMC 与变分推断
34

贝叶斯推断进阶:共轭先验、MCMC 与变分推断

Bayesian Inference · 把数据和先验揉成后验

【章首引子】看到 10 次抛硬币 7 次正面,你认为硬币正面概率 θ 是多少?贝叶斯的答案不是一个数,而是一个后验分布——它既尊重数据,也保留你"先验的怀疑"。本章讲贝叶斯定理、共轭先验(让后验好算)、MCMC(算不出来就采样)、变分推断(把积分变成优化)。这是现代生成模型、不确定性估计、贝叶斯深度学习的统一框架。

卡必背公式 / 记忆口诀
P(θ|D)=P(D|θ)P(θ)/P(D)
共轭:Beta-Bernoulli、Gamma-Poisson
MAP = argmax P(D|θ)P(θ)
ELBO = E[log p(x|z)] − KL(q‖p)
口诀:先验 × 似然 ∝ 后验,算不动就采样或变分

① 是什么:贝叶斯定理与共轭先验

啥贝叶斯推断在算什么

① 贝叶斯定理:P(θ|D)=P(D|θ)P(θ)/P(D)。后验 ∝ 似然 × 先验。P(D)=∫P(D|θ)P(θ)dθ 是边际似然(证据),常数。

② 共轭先验:选先验使后验与先验同分布族,免去积分。Beta-Bernoulli:θ~Beta(α,β),数据 y∈{0,1} ⇒ 后验 θ|D~Beta(α+Σy, β+n−Σy)。Gamma-Poisson:λ~Gamma(a,b),计数 y~Poisson(λ) ⇒ 后验 λ|D~Gamma(a+Σy, b+n)。Normal-Normal:μ~N(μ₀,σ₀²),观测 y~N(μ,σ²) ⇒ 后验 N(μₙ,σₙ²),精度相加。

③ 后验预测分布:对新 x̃,P(x̃|D)=∫P(x̃|θ)P(θ|D)dθ——把后验积分进去,给出"考虑参数不确定性"的预测。

图 34.1:先验(平缓)被似然拉扯成后验(尖锐,集中在数据支持处)
θ 先验 p(θ)(平缓) 似然 p(D|θ)(数据推到 θ≈0.6) 后验 p(θ|D)(尖锐集中)

② MAP、MCMC 与变分推断

证三种近似后验的策略

① MAP vs MLE:MLE=argmaxθ P(D|θ)(只看数据);MAP=argmaxθ P(D|θ)P(θ)(数据+先验)。当先验均匀时 MAP=MLE。先验对应正则项:高斯先验 ⇒ L2 权重衰减,拉普拉斯先验 ⇒ L1 稀疏。② MCMC 直觉:直接积分后验不可行时,构造一条平稳分布为 p(θ|D) 的马氏链(Metropolis-Hastings:提议 θ′,以 min(1, p(θ′|D)/p(θ|D)) 接受;Gibbs:逐个变量条件采样),长时间跑的样本即后验样本。③ 变分推断 VI:挑一族简单分布 q(θ;λ),找 λ 使 q 尽量贴近 p(θ|D)。最大化 ELBO:log p(D) ≥ ELBO = E_q[log p(D,θ)] − E_q[log q(θ)] = E_q[log p(D|θ)] − KL(q(θ)‖p(θ))。VI 把"积分难题"变成"优化问题"。

ELBO 怎么来:log p(D)=KL(q(θ)‖p(θ|D))+ELBO。KL≥0 恒成立,所以 ELBO≤log p(D);最大化 ELBO 就是在最小化 KL(q‖p(·|D)),让 q 逼近真后验。VAE 就是对隐变量 z 做 VI,编码器=q(z|x),解码器=p(x|z)。

MCMC 为什么对:MH 接受率设计满足细致平衡 q(θ|θ′)p(θ′|D)=q(θ′|θ)p(θ|D),故链的平稳分布就是 p(θ|D);由遍历定理,长时间样本均值收敛到后验期望。

③ 例题

例1:抛硬币 10 次 7 正,Beta 后验
【审题】先验 Beta(1,1)(均匀),n=10,Σy=7。
思路:共轭更新。
逐步:后验 θ|D~Beta(1+7, 1+10−7)=Beta(8,4)。后验均值=8/(8+4)=2/3≈0.667。数据说 70%,先验 50%,后验折中到 67%。
例2:MAP 与正则化
【审题】线性回归 + 高斯先验 θ~N(0,τ²)。
思路:log 后验 = log 似然 + log 先验。
逐步:−log p(θ|D) ∝ ‖y−Xθ‖²/σ² + ‖θ‖²/τ²。第二项就是 L2 正则(权重衰减),正则系数 λ=σ²/τ²。贝叶斯先验 = 频率派正则,同一回事。
例3:ELBO 的两项
【审题】VAE 里 ELBO=E_q[log p(x|z)]−KL(q(z|x)‖p(z))。
思路:理解两项作用。
逐步:第一项"重构损失"——让解码器能从 z 还原 x;第二项"KL 正则"——让编码器 q(z|x) 不偏离先验 p(z)=N(0,I)。两者权衡:重构要像,分布要标准正态。
贝叶斯推断核心公式 P(θ|D)=P(D|θ)P(θ)/P(D);后验 ∝ 似然×先验
共轭:Beta(α,β)+Bernoulli ⇒ Beta(α+Σy, β+n−Σy)
MAP=argmax P(D|θ)P(θ);先验=正则(高斯→L2,拉普拉斯→L1)
ELBO=E_q[log p(D|θ)]−KL(q‖p);VI 把后验积分变成 q 的优化

④ AI 落点

算法
AI 落点 1:VAE 与生成模型

VAE 用编码器 q(z|x) 做 VI,最大化 ELBO;既是贝叶斯推断,又是生成模型框架。

稳定性
AI 落点 2:不确定性估计

贝叶斯神经网络给权重分布而非单点,输出后验预测分布,能说"我有多确定"——医疗、自动驾驶刚需。

算法
AI 落点 3:MCMC 采样

Metropolis-Hastings、HMC 是贝叶斯统计引擎;大模型里的采样(如 LLM 温度采样)也靠随机过程直觉。

优化
AI 落点 4:先验即归纳偏置

选什么先验 = 给模型灌什么领域知识。稀疏先验出 Lasso,层次先验出多层贝叶斯,是模型设计的语言。

⑤ 延展

展知识衔接地图

往本科走:概率论的条件概率、常见分布是基础。

往算法走:共轭 → 指数族;MCMC → 第 30 章马氏链;VI/ELBO → VAE、强化学习(策略梯度的 entropy 正则)。

思维陷阱

把 MAP 当后验本身。MAP 只是后验的众数(一个点),丢掉了不确定性;要预测/置信区间须用整个后验或后验预测。

先验选得随意。小样本时先验主导后验;先验不是"主观瞎猜",而是归纳偏置,要和领域知识对齐。

以为 MCMC 处处快。MCMC 在高维、多模态后验里混合慢(卡住某个峰);VI 快但偏差大,两者是速度 vs 精度的权衡。

练习

【基础】先验 Beta(2,2),观测 5 次全正,后验是什么?

查看解答Beta(2+5, 2+0)=Beta(7,2),均值 7/9≈0.78。
【自评反馈】对 → 下一题。

【进阶】为什么 L2 权重衰减等价于高斯先验?

查看解答log N(0,τ²) ∝ −‖θ‖²/(2τ²),加进 log 后验就是 L2 正则项,系数 1/(2τ²)。
【自评反馈】对 → 下一题。

【挑战】解释为什么 ELBO 是 log p(D) 的下界(用 KL≥0)。

查看解答log p(D)=KL(q(θ)‖p(θ|D))+ELBO;KL≥0 ⇒ ELBO≤log p(D)。最大化 ELBO 即最小化 KL(q‖后验)。
记
小结卡

① 后验 ∝ 似然×先验;共轭先验(Beta-Bernoulli、Gamma-Poisson、Normal-Normal)让后验同族好算。

② MAP 是后验众数,先验对应正则(高斯→L2、拉普拉斯→L1);MLE 是均匀先验下的 MAP。

③ 后验难算时:MCMC 采样(MH/Gibbs)或变分推断(最大化 ELBO=E[似然]−KL);VAE 是 VI 的深度学习实现。