贝叶斯推断进阶:共轭先验、MCMC 与变分推断
【章首引子】看到 10 次抛硬币 7 次正面,你认为硬币正面概率 θ 是多少?贝叶斯的答案不是一个数,而是一个后验分布——它既尊重数据,也保留你"先验的怀疑"。本章讲贝叶斯定理、共轭先验(让后验好算)、MCMC(算不出来就采样)、变分推断(把积分变成优化)。这是现代生成模型、不确定性估计、贝叶斯深度学习的统一框架。
① 是什么:贝叶斯定理与共轭先验
啥贝叶斯推断在算什么
① 贝叶斯定理:P(θ|D)=P(D|θ)P(θ)/P(D)。后验 ∝ 似然 × 先验。P(D)=∫P(D|θ)P(θ)dθ 是边际似然(证据),常数。
② 共轭先验:选先验使后验与先验同分布族,免去积分。Beta-Bernoulli:θ~Beta(α,β),数据 y∈{0,1} ⇒ 后验 θ|D~Beta(α+Σy, β+n−Σy)。Gamma-Poisson:λ~Gamma(a,b),计数 y~Poisson(λ) ⇒ 后验 λ|D~Gamma(a+Σy, b+n)。Normal-Normal:μ~N(μ₀,σ₀²),观测 y~N(μ,σ²) ⇒ 后验 N(μₙ,σₙ²),精度相加。
③ 后验预测分布:对新 x̃,P(x̃|D)=∫P(x̃|θ)P(θ|D)dθ——把后验积分进去,给出"考虑参数不确定性"的预测。
② MAP、MCMC 与变分推断
证三种近似后验的策略
ELBO 怎么来:log p(D)=KL(q(θ)‖p(θ|D))+ELBO。KL≥0 恒成立,所以 ELBO≤log p(D);最大化 ELBO 就是在最小化 KL(q‖p(·|D)),让 q 逼近真后验。VAE 就是对隐变量 z 做 VI,编码器=q(z|x),解码器=p(x|z)。
MCMC 为什么对:MH 接受率设计满足细致平衡 q(θ|θ′)p(θ′|D)=q(θ′|θ)p(θ|D),故链的平稳分布就是 p(θ|D);由遍历定理,长时间样本均值收敛到后验期望。
③ 例题
④ AI 落点
AI 落点 1:VAE 与生成模型
VAE 用编码器 q(z|x) 做 VI,最大化 ELBO;既是贝叶斯推断,又是生成模型框架。
AI 落点 2:不确定性估计
贝叶斯神经网络给权重分布而非单点,输出后验预测分布,能说"我有多确定"——医疗、自动驾驶刚需。
AI 落点 3:MCMC 采样
Metropolis-Hastings、HMC 是贝叶斯统计引擎;大模型里的采样(如 LLM 温度采样)也靠随机过程直觉。
AI 落点 4:先验即归纳偏置
选什么先验 = 给模型灌什么领域知识。稀疏先验出 Lasso,层次先验出多层贝叶斯,是模型设计的语言。
⑤ 延展
展知识衔接地图
往本科走:概率论的条件概率、常见分布是基础。
往算法走:共轭 → 指数族;MCMC → 第 30 章马氏链;VI/ELBO → VAE、强化学习(策略梯度的 entropy 正则)。
把 MAP 当后验本身。MAP 只是后验的众数(一个点),丢掉了不确定性;要预测/置信区间须用整个后验或后验预测。
先验选得随意。小样本时先验主导后验;先验不是"主观瞎猜",而是归纳偏置,要和领域知识对齐。
以为 MCMC 处处快。MCMC 在高维、多模态后验里混合慢(卡住某个峰);VI 快但偏差大,两者是速度 vs 精度的权衡。
练习
【基础】先验 Beta(2,2),观测 5 次全正,后验是什么?
查看解答
Beta(2+5, 2+0)=Beta(7,2),均值 7/9≈0.78。【进阶】为什么 L2 权重衰减等价于高斯先验?
查看解答
log N(0,τ²) ∝ −‖θ‖²/(2τ²),加进 log 后验就是 L2 正则项,系数 1/(2τ²)。【挑战】解释为什么 ELBO 是 log p(D) 的下界(用 KL≥0)。
查看解答
log p(D)=KL(q(θ)‖p(θ|D))+ELBO;KL≥0 ⇒ ELBO≤log p(D)。最大化 ELBO 即最小化 KL(q‖后验)。① 后验 ∝ 似然×先验;共轭先验(Beta-Bernoulli、Gamma-Poisson、Normal-Normal)让后验同族好算。
② MAP 是后验众数,先验对应正则(高斯→L2、拉普拉斯→L1);MLE 是均匀先验下的 MAP。
③ 后验难算时:MCMC 采样(MH/Gibbs)或变分推断(最大化 ELBO=E[似然]−KL);VAE 是 VI 的深度学习实现。