模块三:概率论与数理统计
世界充满偶然,但偶然不是乱撞——它有规律。概率论告诉你"随机事件长期怎么分布",数理统计告诉你"从一小撮样本怎么反推整体"。保险定价、A/B 测试、推荐系统、贝叶斯垃圾邮件过滤,都是这套语言;而信息论一节,直接就是分类模型的损失函数本身。本模块 5 节。
依赖链:会算概率 → 用分布函数建模 → 中心极限告诉你"为什么数据长成正态" → 信息论接过"分布"往下走,告诉你两个分布差多远(这就是损失函数) → 统计用样本反推总体。
随机事件与概率:贝叶斯的反直觉
【章首引子】体检报告"阳性",检测准确率 99%——你是不是完了?别急。如果这个病本身只有千分之一的人得,那你真得病的概率其实只有 约 9%。因为基率太低,假阳性比真阳性还多。这就是贝叶斯公式最反直觉的一击。
① 是什么:概率公理与贝叶斯
啥条件概率与贝叶斯公式
样本空间:所有可能结果的集合;事件是其中一部分。概率公理:概率在 0 到 1 之间,必然事件为 1。条件概率 P(A|B):在 B 已发生的前提下 A 发生的概率。独立性:A 不影响 B。
贝叶斯公式:P(A|B) = P(B|A)·P(A) / P(B)。大白话:看到证据 B 后,反过来更新你对 A 的相信程度。P(A) 叫先验,P(A|B) 叫后验。全概率公式:P(A) = Σ P(A|Bᵢ)P(Bᵢ)(把情况拆块分别算再加起来)。
② 怎么想到的:基率思维
思解题心法
先找基率 P(A):这个事本身多常见?别被"准确率 99%"骗了。
列 P(B|A) 和 P(B|¬A):真阳性率和假阳性率。
套贝叶斯:后验 = 似然 × 先验 / 证据。
③ 完整解法:三个例题
证随机事件与概率:贝叶斯的反直觉的核心定理与公式
推导思路:①由条件概率的定义写出两式:$P(A\,|\,B)=\frac{P(A\cap B)}{P(B)}$ 与 $P(B\,|\,A)=\frac{P(A\cap B)}{P(A)}$。②两式解出的是同一个交集概率,于是连等:$P(A\cap B)=P(A\,|\,B)\,P(B)=P(B\,|\,A)\,P(A)$。③两边同除以 $P(B)$(要求 $P(B)>0$),得 $P(A\,|\,B)=\frac{P(B\,|\,A)\,P(A)}{P(B)}$——这就是贝叶斯公式的雏形。④最后把分母用全概率公式展开:$P(B)=\sum\limits_{j}P(B\,|\,A_j)\,P(A_j)$,其中 $A_j$ 两两互斥且并起来是整个样本空间,于是得到完整形式。
直觉把握:贝叶斯就是"先有个老看法(先验),来了新证据,把看法更新成新看法(后验)"。最经典的震撼是体检阳性不等于得病——因为病的先验概率太低,假阳性的人数反而压过了真病人。AI/工程里,朴素贝叶斯分类器、贝叶斯神经网络、VAE 里的后验 $p(z\,|\,x)$、RLHF 中把 reward model 当先验来约束策略,用的都是同一个公式。
④ 用途与案例
医疗诊断
检测阳性别慌,先算基率。传染病筛查、癌症早筛都要做贝叶斯校正。
AI 朴素贝叶斯
垃圾邮件过滤、文本分类、情感分析——贝叶斯分类器是最经典的机器学习之一。
风控反欺诈
"这笔交易多大概率是欺诈"——根据历史特征用贝叶斯更新判断。
法律证据
DNA 匹配、指纹证据的"似然比",本质都是贝叶斯推理。
⑤ 延展
展知识衔接地图
往研究生走:朴素贝叶斯 → 贝叶斯统计/贝叶斯网络(概率图模型、MCMC)。往 AI 走:贝叶斯推断是概率机器学习(贝叶斯神经网络、变分推断)的根基。
基率谬误:忘了"这事本来多罕见"。检测准确率再高,病本身极罕见时假阳性也会淹没真阳性。看到"准确率 99%"先问:这个事件本身常见吗?
练习
【基础】P(A)=0.5,P(B)=0.4,A、B 独立,P(AB)=?
查看思路与解答
独立:P(AB)=P(A)P(B)=0.5×0.4=0.2。【进阶】病发病率 1%,灵敏度 99%、特异度 99%,阳性后真病概率?
查看思路与解答
1000 人:10 真病全检出,990 健康人 1%≈10 假阳性。P=10/(10+10)=50%。比 0.1% 基率时的 9% 高多了——基率越高,阳性越可信。① 贝叶斯 = 看证据更新猜测;先验(基率)永远不能忘。
② 全概率把情况拆块算;检测再准碰到罕见病也别慌,先算后验。