楼层: 小学/ 初中/ 高中/ 大学/随机事件与概率:贝叶斯的反直觉/ 研究生/ 算法/ 奥数
三

模块三:概率论与数理统计

Probability & Statistics · 和不确定性打交道

世界充满偶然,但偶然不是乱撞——它有规律。概率论告诉你"随机事件长期怎么分布",数理统计告诉你"从一小撮样本怎么反推整体"。保险定价、A/B 测试、推荐系统、贝叶斯垃圾邮件过滤,都是这套语言;而信息论一节,直接就是分类模型的损失函数本身。本模块 5 节。

这一模块在整条线里的位置:前面微积分管"确定性的变化",线代管"确定性的变换",这一块专管"说不清的事"。因为现实数据全是带噪的,机器学习本质就是"在不确定里找规律"。学完能看懂贝叶斯滤波、A/B 检验为什么这么做;到了研究生你会学测度论、随机过程、概率图模型,把概率抬到严格化。这个知识在 AI 里直接用来做贝叶斯推断、隐马尔可夫模型、强化学习的奖励期望。
本模块要学什么 · 一张小图
地基:⑰随机事件与概率(贝叶斯)  →  模型:⑱随机变量与分布  →  大数现象:⑲大数定律与中心极限定理  →  ⑳信息论:熵、交叉熵与 KL  →  反推:㉑参数估计与假设检验
依赖链:会算概率 → 用分布函数建模 → 中心极限告诉你"为什么数据长成正态" → 信息论接过"分布"往下走,告诉你两个分布差多远(这就是损失函数) → 统计用样本反推总体。
17

随机事件与概率:贝叶斯的反直觉

Probability · 看证据更新猜测

【章首引子】体检报告"阳性",检测准确率 99%——你是不是完了?别急。如果这个病本身只有千分之一的人得,那你真得病的概率其实只有 约 9%。因为基率太低,假阳性比真阳性还多。这就是贝叶斯公式最反直觉的一击。

卡必背公式 / 记忆口诀
贝叶斯 P(A|B)=P(B|A)P(A)/P(B)
常用分布正态/二项/泊松
大数定律+中心极限定理
口诀:概率核心——分布对号入座

① 是什么:概率公理与贝叶斯

啥条件概率与贝叶斯公式

样本空间:所有可能结果的集合;事件是其中一部分。概率公理:概率在 0 到 1 之间,必然事件为 1。条件概率 P(A|B):在 B 已发生的前提下 A 发生的概率。独立性:A 不影响 B。

贝叶斯公式:P(A|B) = P(B|A)·P(A) / P(B)。大白话:看到证据 B 后,反过来更新你对 A 的相信程度。P(A) 叫先验,P(A|B) 叫后验。全概率公式:P(A) = Σ P(A|Bᵢ)P(Bᵢ)(把情况拆块分别算再加起来)。

② 怎么想到的:基率思维

思解题心法

1

先找基率 P(A):这个事本身多常见?别被"准确率 99%"骗了。

2

列 P(B|A) 和 P(B|¬A):真阳性率和假阳性率。

3

套贝叶斯:后验 = 似然 × 先验 / 证据。

③ 完整解法:三个例题

证随机事件与概率:贝叶斯的反直觉的核心定理与公式

核心定理:①加法公式:$P(A\cup B)=P(A)+P(B)-P(A\cap B)$。②条件概率定义:$P(A\,|\,B)=\frac{P(A\cap B)}{P(B)}$(要求 $P(B)>0$)。③乘法公式与独立性:$P(A\cap B)=P(A)\,P(B\,|\,A)$;独立时 $P(A\cap B)=P(A)\,P(B)$。④全概率公式:若 $A_1,\ldots,A_n$ 构成划分,则 $P(B)=\sum\limits_{i=1}^{n}P(B\,|\,A_i)\,P(A_i)$。⑤贝叶斯公式:$P(A_i\,|\,B)=\frac{P(B\,|\,A_i)\,P(A_i)}{\sum\limits_{j}P(B\,|\,A_j)\,P(A_j)}$。

推导思路:①由条件概率的定义写出两式:$P(A\,|\,B)=\frac{P(A\cap B)}{P(B)}$ 与 $P(B\,|\,A)=\frac{P(A\cap B)}{P(A)}$。②两式解出的是同一个交集概率,于是连等:$P(A\cap B)=P(A\,|\,B)\,P(B)=P(B\,|\,A)\,P(A)$。③两边同除以 $P(B)$(要求 $P(B)>0$),得 $P(A\,|\,B)=\frac{P(B\,|\,A)\,P(A)}{P(B)}$——这就是贝叶斯公式的雏形。④最后把分母用全概率公式展开:$P(B)=\sum\limits_{j}P(B\,|\,A_j)\,P(A_j)$,其中 $A_j$ 两两互斥且并起来是整个样本空间,于是得到完整形式。

直觉把握:贝叶斯就是"先有个老看法(先验),来了新证据,把看法更新成新看法(后验)"。最经典的震撼是体检阳性不等于得病——因为病的先验概率太低,假阳性的人数反而压过了真病人。AI/工程里,朴素贝叶斯分类器、贝叶斯神经网络、VAE 里的后验 $p(z\,|\,x)$、RLHF 中把 reward model 当先验来约束策略,用的都是同一个公式。

例题1:病发病率 0.1%,准确率 99%,阳性后真病概率
【审题】经典基率谬误。
思路:1000 人算一遍。
逐步解法:1000 人里约 1 个真病(检出),其余 999 健康人里 1% 误诊 ≈ 10 个假阳性。P(病|阳) = 1/(1+10) ≈ 9%。
例题2:两个骰子,已知至少一个 6,两个都是 6 的概率
【审题】条件概率。
思路:数样本点。
逐步解法:"至少一个 6"有 11 种,其中 (6,6) 只 1 种。= 1/11,不是 1/6。
例题3:垃圾邮件过滤
【审题】看到"中奖"二字,多大概率是垃圾?
思路:贝叶斯分类。
逐步解法:统计历史:垃圾邮件里"中奖"出现频率高,正常邮件里低。贝叶斯把"看到词"反推"是不是垃圾"。这就是朴素贝叶斯分类的祖宗。
概率核心公式 $\text{条件概率} P(A|B) = P(AB)/P(B)$  |  $\text{乘法公式} P(AB) = P(A|B)P(B)$
$\text{全概率} P(A) = \Sigma P(A|B_i)P(B_i)$  |  $\text{贝叶斯} P(A|B) = P(B|A)P(A)/P(B)$
独立:$P(AB) = P(A)P(B)$

④ 用途与案例

医疗诊断

检测阳性别慌,先算基率。传染病筛查、癌症早筛都要做贝叶斯校正。

AI 朴素贝叶斯

垃圾邮件过滤、文本分类、情感分析——贝叶斯分类器是最经典的机器学习之一。

风控反欺诈

"这笔交易多大概率是欺诈"——根据历史特征用贝叶斯更新判断。

法律证据

DNA 匹配、指纹证据的"似然比",本质都是贝叶斯推理。

⑤ 延展

展知识衔接地图

往研究生走:朴素贝叶斯 → 贝叶斯统计/贝叶斯网络(概率图模型、MCMC)。往 AI 走:贝叶斯推断是概率机器学习(贝叶斯神经网络、变分推断)的根基。

思维陷阱

基率谬误:忘了"这事本来多罕见"。检测准确率再高,病本身极罕见时假阳性也会淹没真阳性。看到"准确率 99%"先问:这个事件本身常见吗?

练习

【基础】P(A)=0.5,P(B)=0.4,A、B 独立,P(AB)=?

查看思路与解答独立:P(AB)=P(A)P(B)=0.5×0.4=0.2。
【自评反馈】和答案对得上 → 继续下一题;对不上 → 回到本页"是什么"和例题区,把卡住的那步再推一遍。

【进阶】病发病率 1%,灵敏度 99%、特异度 99%,阳性后真病概率?

查看思路与解答1000 人:10 真病全检出,990 健康人 1%≈10 假阳性。P=10/(10+10)=50%。比 0.1% 基率时的 9% 高多了——基率越高,阳性越可信。
【自评反馈】和答案对得上 → 继续下一题;对不上 → 回到本页"是什么"和例题区,把卡住的那步再推一遍。
费曼学习法:讲给别人听
① 用自己的话讲:概率是事件发生可能性的度量;贝叶斯公式拿"看到的结果"反推"背后的原因"。
② 举个反例(什么条件下不成立):P(A|B) ≠ P(B|A)(检测阳性≠真得病,基础率一低就反转);互斥和独立完全是两码事。
③ 哪里还说不清:条件概率一上来就搞反 A、B,怎么一眼自查?
记
小结卡

① 贝叶斯 = 看证据更新猜测;先验(基率)永远不能忘。

② 全概率把情况拆块算;检测再准碰到罕见病也别慌,先算后验。