计数原理进阶:从排列到随机变量
二项式
(a+b)ⁿ展开
条件概率
P(A|B)
分布列
每个取值概率
期望方差
平均和波动
【章首引子】你已经会数"有多少种"了。这一步往深走:把"种数"装进一个随机变量,再算它的平均值(期望)和波动幅度(方差)。保险公司凭什么敢卖重疾险?赌场凭什么稳赚不赔?全是这一章的公式在替他们打工。
① 二项式定理:把 (a+b)ⁿ 一眼展开
杨杨辉三角的秘密
每一行是 (a+b)ⁿ 的系数,且每个数 = 肩上两数之和(C(n,k) = C(n−1,k−1) + C(n−1,k))。求特定项系数就用通项公式对号入座,不用整行展开。
② 随机变量、期望与方差
期把结果量化成 X,再算它的"平均值"
分布列:X 取每一个值的概率列成表,概率加起来必须等于 1。期望 E(X) = Σ xᵢ·pᵢ(就是加权平均);方差 D(X) = Σ (xᵢ−EX)²·pᵢ = E(X²) − [E(X)]²,开根号是标准差。期望管"长期平均",方差管"赌性有多大"。
| 分布 | 含义 | 期望 E(X) | 方差 D(X) |
|---|---|---|---|
| 两点分布 | 一次试验,成功概率 p | p | p(1−p) |
| 二项分布 X~B(n,p) | n 次独立试验,成功 k 次 | np | np(1−p) |
条条件概率与贝叶斯:把"已知"塞进分母
条件概率:在事件 $B$ 已经发生的条件下,$A$ 发生的概率:$P(A\mid B)=\frac{P(A\cap B)}{P(B)}$($P(B)>0$)。分母一定是你已经知道的那个事件——它把所有"可能性"重新缩放了一遍。
独立性:若 $A$ 发生不影响 $B$,即 $P(A\mid B)=P(A)$,则 $P(A\cap B)=P(A)P(B)$,称 $A$、$B$ 独立。注意:独立 ≠ 互斥。互斥是"不能同时发生",独立是"互不影响"——两件事可以同时发生又互不影响(比如连抛两次硬币,第一次正不影响第二次正)。
贝叶斯公式(两行推导):由交集的两种写法出发:
$P(A\cap B)=P(A\mid B)\,P(B)=P(B\mid A)\,P(A)$。
两边同除以 $P(B)$ 即得 $P(A\mid B)=\frac{P(B\mid A)\,P(A)}{P(B)}$。
大白话:贝叶斯让你"反着问"——已知结果 $B$,反推原因 $A$ 的可能性有多大。式子里 $P(A)$ 是先验(事先猜),$P(A\mid B)$ 是后验(看到证据后更新过的猜)。
在 AI / 工程里用在哪:输入法联想、垃圾邮件过滤、医疗诊断,全是贝叶斯。比如输入法看到你打了"wo ai",要猜下一个字是"你"还是"喝"——它算 $P(\text{你}\mid\text{wo ai})$,靠的是从海量语料里数出 $P(\text{wo ai 你})$ 与 $P(\text{wo ai})$ 的频率比。你手机键盘上那串联想词,就是贝叶斯公式在实时跑。
抽不放回抽样:超几何分布 vs 二项分布
放回 vs 不放回,天差地别。袋中有 $N$ 个球,其中 $M$ 个红球。抽 $n$ 次:
有放回(每次概率不变)→ 二项分布 $X\sim B(n,\frac{M}{N})$,期望 $np$、方差 $np(1-p)$。
不放回(每次概率在变)→ 超几何分布,概率质量函数为 $P(X=k)=\frac{C_M^k\,C_{N-M}^{n-k}}{C_N^n}$(从 $M$ 个红球里挑 $k$ 个、从其余 $N-M$ 个里挑 $n-k$ 个,除以总挑法)。
何时用哪个:总体很大、抽得很少时,不放回几乎等于放回,超几何近似成二项——所以民意调查抽几千人也能用二项分布估误差。总体很小、抽得很多(比如一副扑克抽 5 张算同花)就必须用超几何,因为"不放回"严重改变了后面每张牌的概率。
在 AI / 工程里用在哪:强化学习里的"经验回放"从缓冲区随机不放回采样一批样本训练——它的方差特性就是超几何的近亲;而"有放回自助采样(bootstrap)"则是二项/伯努利思维。分清这两种抽样,才不会算错置信区间。
③ 正态分布:自然界的默认曲线
态钟形曲线 N(μ, σ²)
人的身高、考试分数、测量误差,都长成中间高两头低的钟形。μ 是中心(均值),σ 是胖瘦(标准差)。3σ 原则:约 68% 的数据落在 μ±σ 内,95% 落在 μ±2σ,99.7% 落在 μ±3σ 内。标准化:Z = (X − μ)/σ 把任意正态变成标准正态 N(0,1),查表就完事。
④ 怎么考:看到概率题先想什么
思解题心法:四步反射
先认分布,别急着算。看到"独立重复 $n$ 次,成功几次"→ 二项分布 $X\sim B(n,p)$;看到"不放回抽球"→ 超几何分布;看到"一直试到第一次成功"→ 几何分布。认对分布,期望方差直接套表,一分不丢。
求期望先想线性性,别硬列分布列。$E(aX+bY) = aE(X)+bE(Y)$——不管独不独立都成立。两个随机变量之和的期望,等于各自期望之和,能省掉一大张分布表。
看到"已知……发生,求……的概率"就是条件概率。$P(A\mid B)=\frac{P(AB)}{P(B)}$,分母一定是"已知的那个事件"。分不清谁是条件的,就把题目重读一遍,画出 $A$、$B$ 两个圈。
在 AI / 工程里用在哪:整个机器学习都建立在随机变量上。朴素贝叶斯把每个词当成一个随机变量、假设它们条件独立再连乘;大模型生成下一个词,就是从这个分布列里掷一次骰子。本章的"分布列 + 期望 + 方差",就是日后所有概率模型的地基。
⑤ 用途与案例
朴素贝叶斯:垃圾邮件过滤
把邮件里每个词看成一个随机变量 $X_i$,假设它们条件独立,于是 $P(\text{垃圾}\mid \text{邮件}) \propto P(\text{垃圾})\prod_i P(X_i\mid \text{垃圾})$。独立假设明显不严谨,但它快得离谱、效果好得出奇——全部数学就是你刚学的"独立事件概率相乘"。
大语言模型:下一个词怎么选
模型输出的是一整张分布列——几万个词各有一个概率,然后按它掷骰子采样。你调的 temperature 参数,就是在给这张分布列"捏形状":调低变尖变保守,调高变平爱冒险。
A/B 实验:敢不敢上线
新推荐算法点击率提升了 $1\%$,是真提升还是运气?方差决定你要跑多久才敢下结论——波动越大,需要的样本量越多。期望管"平均好多少",方差管"要等多久"。
3σ 原则:监控告警
接口响应时间平时 $200\,\text{ms}$,突然窜到 $800\,\text{ms}$,算故障吗?把历史数据当正态分布,超出 $\mu\pm 3\sigma$ 的只占 $0.3\%$——超了就报警,这条规则写在每一套监控系统里。
坑一:分布列概率不凑成 1。写完检查 Σpᵢ 是否 = 1,少了就是漏算。坑二:方差公式用错。D(X) = E(X²) − [E(X)]²,不是 E(X²) − E(X)。坑三:二项分布记错方差。是 np(1−p),不是 np²。
练习(基础 + 进阶 + 奥数)
【基础】求 (x + 2)⁴ 展开式中 x² 的系数。
查看思路与解答
通项 T_{k+1} = C(4,k)·x^{4−k}·2^k。令 4−k = 2 ⇒ k = 2。系数 = C(4,2)·2² = 6×4 = 24。错了或卡壳?回到本章「分布列必须所有概率加起来=1」那一段,把思路再顺一遍。
【进阶】袋中 3 红 2 白,有放回抽 3 次,求抽到红球次数的期望。
查看思路与解答
每次抽到红球概率 p = 3/5 = 0.6,抽 3 次独立 ⇒ X~B(3, 0.6)。E(X) = 3×0.6 = 1.8 次。错了或卡壳?回到本章「分布列必须所有概率加起来=1」那一段,把思路再顺一遍。
【奥数延展】证明 Σ_{k=0..n} C(n,k)² = C(2n, n)。
查看思路与解答
左边 = Σ C(n,k)·C(n,n−k),是 (1+x)ⁿ 与 (1+x)ⁿ 相乘后 xⁿ 的系数,也就是 (1+x)^{2n} 中 xⁿ 的系数 = C(2n,n)。这就是"双计数/母函数"思想:同一个数用两种方式数,结果必须相等。错了或卡壳?回到本章「分布列必须所有概率加起来=1」那一段,把思路再顺一遍。
① 二项式展开用通项 T_{k+1}=C(n,k)a^{n−k}b^k 对号入座。
② 期望管平均 E(X)=Σxᵢpᵢ,方差管波动 D(X)=E(X²)−(EX)²。
③ 二项分布 B(n,p) 的 E=np、D=np(1−p);正态靠 3σ 原则。
- 用自己的话讲:本章核心是「二项式 / 分布列」,合上书用自己的话推一遍,不许跳步。
- 举个反例 / 什么时候最容易错:为什么分布列概率加起来必须等于 1?"所有情况覆盖完,加起来就是"必然事件"。
- 哪里还卡壳(标记你的薄弱点):哪一步你要翻书才推得顺?那个地方就是你的薄弱点,拿笔圈出来。