楼层: 小学/ 初中/ 高中/计数原理进阶:从排列到随机变量/ 大学/ 研究生/ 算法/ 奥数
13

计数原理进阶:从排列到随机变量

Counting & Probability · 掷骰子的大数据
上一章学不等式,这章学计数原理进阶。为啥?从"多少种"升级到"随机变量的分布列和期望",概率论正式入门。下一章学导数进阶。
①
二项式

(a+b)ⁿ展开

②
条件概率

P(A|B)

③
分布列

每个取值概率

④
期望方差

平均和波动

【章首引子】你已经会数"有多少种"了。这一步往深走:把"种数"装进一个随机变量,再算它的平均值(期望)和波动幅度(方差)。保险公司凭什么敢卖重疾险?赌场凭什么稳赚不赔?全是这一章的公式在替他们打工。

① 二项式定理:把 (a+b)ⁿ 一眼展开

二项式定理 $(a + b)^n = \Sigma _{k=0..n} C(n,k)\cdot a^{n−k}\cdot b^k  (\text{通项} T_{k+1} = C(n,k)\cdot a^{n−k}\cdot b^k)$
$\text{令} a = b = 1\text{:}C(n,0)+C(n,1)+…+C(n,n) = 2^n$  |  $\text{令} a = 1, b = −1\text{:}C(n,0)−C(n,1)+…+(−1)^nC(n,n) = 0$

杨杨辉三角的秘密

每一行是 (a+b)ⁿ 的系数,且每个数 = 肩上两数之和(C(n,k) = C(n−1,k−1) + C(n−1,k))。求特定项系数就用通项公式对号入座,不用整行展开。

② 随机变量、期望与方差

期把结果量化成 X,再算它的"平均值"

分布列:X 取每一个值的概率列成表,概率加起来必须等于 1。期望 E(X) = Σ xᵢ·pᵢ(就是加权平均);方差 D(X) = Σ (xᵢ−EX)²·pᵢ = E(X²) − [E(X)]²,开根号是标准差。期望管"长期平均",方差管"赌性有多大"。

两个高考常客分布
分布含义期望 E(X)方差 D(X)
两点分布一次试验,成功概率 ppp(1−p)
二项分布 X~B(n,p)n 次独立试验,成功 k 次npnp(1−p)

条条件概率与贝叶斯:把"已知"塞进分母

条件概率:在事件 $B$ 已经发生的条件下,$A$ 发生的概率:$P(A\mid B)=\frac{P(A\cap B)}{P(B)}$($P(B)>0$)。分母一定是你已经知道的那个事件——它把所有"可能性"重新缩放了一遍。

独立性:若 $A$ 发生不影响 $B$,即 $P(A\mid B)=P(A)$,则 $P(A\cap B)=P(A)P(B)$,称 $A$、$B$ 独立。注意:独立 ≠ 互斥。互斥是"不能同时发生",独立是"互不影响"——两件事可以同时发生又互不影响(比如连抛两次硬币,第一次正不影响第二次正)。

贝叶斯公式(两行推导):由交集的两种写法出发:
$P(A\cap B)=P(A\mid B)\,P(B)=P(B\mid A)\,P(A)$。
两边同除以 $P(B)$ 即得 $P(A\mid B)=\frac{P(B\mid A)\,P(A)}{P(B)}$。
大白话:贝叶斯让你"反着问"——已知结果 $B$,反推原因 $A$ 的可能性有多大。式子里 $P(A)$ 是先验(事先猜),$P(A\mid B)$ 是后验(看到证据后更新过的猜)。

在 AI / 工程里用在哪:输入法联想、垃圾邮件过滤、医疗诊断,全是贝叶斯。比如输入法看到你打了"wo ai",要猜下一个字是"你"还是"喝"——它算 $P(\text{你}\mid\text{wo ai})$,靠的是从海量语料里数出 $P(\text{wo ai 你})$ 与 $P(\text{wo ai})$ 的频率比。你手机键盘上那串联想词,就是贝叶斯公式在实时跑。

抽不放回抽样:超几何分布 vs 二项分布

放回 vs 不放回,天差地别。袋中有 $N$ 个球,其中 $M$ 个红球。抽 $n$ 次:
有放回(每次概率不变)→ 二项分布 $X\sim B(n,\frac{M}{N})$,期望 $np$、方差 $np(1-p)$。
不放回(每次概率在变)→ 超几何分布,概率质量函数为 $P(X=k)=\frac{C_M^k\,C_{N-M}^{n-k}}{C_N^n}$(从 $M$ 个红球里挑 $k$ 个、从其余 $N-M$ 个里挑 $n-k$ 个,除以总挑法)。

何时用哪个:总体很大、抽得很少时,不放回几乎等于放回,超几何近似成二项——所以民意调查抽几千人也能用二项分布估误差。总体很小、抽得很多(比如一副扑克抽 5 张算同花)就必须用超几何,因为"不放回"严重改变了后面每张牌的概率。

在 AI / 工程里用在哪:强化学习里的"经验回放"从缓冲区随机不放回采样一批样本训练——它的方差特性就是超几何的近亲;而"有放回自助采样(bootstrap)"则是二项/伯努利思维。分清这两种抽样,才不会算错置信区间。

③ 正态分布:自然界的默认曲线

态钟形曲线 N(μ, σ²)

人的身高、考试分数、测量误差,都长成中间高两头低的钟形。μ 是中心(均值),σ 是胖瘦(标准差)。3σ 原则:约 68% 的数据落在 μ±σ 内,95% 落在 μ±2σ,99.7% 落在 μ±3σ 内。标准化:Z = (X − μ)/σ 把任意正态变成标准正态 N(0,1),查表就完事。

④ 怎么考:看到概率题先想什么

思解题心法:四步反射

1

先认分布,别急着算。看到"独立重复 $n$ 次,成功几次"→ 二项分布 $X\sim B(n,p)$;看到"不放回抽球"→ 超几何分布;看到"一直试到第一次成功"→ 几何分布。认对分布,期望方差直接套表,一分不丢。

2

求期望先想线性性,别硬列分布列。$E(aX+bY) = aE(X)+bE(Y)$——不管独不独立都成立。两个随机变量之和的期望,等于各自期望之和,能省掉一大张分布表。

3

看到"已知……发生,求……的概率"就是条件概率。$P(A\mid B)=\frac{P(AB)}{P(B)}$,分母一定是"已知的那个事件"。分不清谁是条件的,就把题目重读一遍,画出 $A$、$B$ 两个圈。

4

在 AI / 工程里用在哪:整个机器学习都建立在随机变量上。朴素贝叶斯把每个词当成一个随机变量、假设它们条件独立再连乘;大模型生成下一个词,就是从这个分布列里掷一次骰子。本章的"分布列 + 期望 + 方差",就是日后所有概率模型的地基。

⑤ 用途与案例

朴素贝叶斯:垃圾邮件过滤

把邮件里每个词看成一个随机变量 $X_i$,假设它们条件独立,于是 $P(\text{垃圾}\mid \text{邮件}) \propto P(\text{垃圾})\prod_i P(X_i\mid \text{垃圾})$。独立假设明显不严谨,但它快得离谱、效果好得出奇——全部数学就是你刚学的"独立事件概率相乘"。

大语言模型:下一个词怎么选

模型输出的是一整张分布列——几万个词各有一个概率,然后按它掷骰子采样。你调的 temperature 参数,就是在给这张分布列"捏形状":调低变尖变保守,调高变平爱冒险。

A/B 实验:敢不敢上线

新推荐算法点击率提升了 $1\%$,是真提升还是运气?方差决定你要跑多久才敢下结论——波动越大,需要的样本量越多。期望管"平均好多少",方差管"要等多久"。

3σ 原则:监控告警

接口响应时间平时 $200\,\text{ms}$,突然窜到 $800\,\text{ms}$,算故障吗?把历史数据当正态分布,超出 $\mu\pm 3\sigma$ 的只占 $0.3\%$——超了就报警,这条规则写在每一套监控系统里。

例题:投篮命中率 0.6,投 10 次,求命中次数的期望和方差。
思路:n 次独立重复试验,X~B(n, p)。
逐步解法:X~B(10, 0.6)。期望 E(X) = np = 10×0.6 = 6;方差 D(X) = np(1−p) = 10×0.6×0.4 = 2.4。答案:期望 6 次,方差 2.4。(平均进 6 个,波动幅度约 √2.4 ≈ 1.55 个。)
思维陷阱

坑一:分布列概率不凑成 1。写完检查 Σpᵢ 是否 = 1,少了就是漏算。坑二:方差公式用错。D(X) = E(X²) − [E(X)]²,不是 E(X²) − E(X)。坑三:二项分布记错方差。是 np(1−p),不是 np²。

练习(基础 + 进阶 + 奥数)

【基础】求 (x + 2)⁴ 展开式中 x² 的系数。

查看思路与解答通项 T_{k+1} = C(4,k)·x^{4−k}·2^k。令 4−k = 2 ⇒ k = 2。系数 = C(4,2)·2² = 6×4 = 24。
做对了?很好,下一题走起,别回头。
错了或卡壳?回到本章「分布列必须所有概率加起来=1」那一段,把思路再顺一遍。

【进阶】袋中 3 红 2 白,有放回抽 3 次,求抽到红球次数的期望。

查看思路与解答每次抽到红球概率 p = 3/5 = 0.6,抽 3 次独立 ⇒ X~B(3, 0.6)。E(X) = 3×0.6 = 1.8 次。
做对了?很好,下一题走起,别回头。
错了或卡壳?回到本章「分布列必须所有概率加起来=1」那一段,把思路再顺一遍。

【奥数延展】证明 Σ_{k=0..n} C(n,k)² = C(2n, n)。

查看思路与解答左边 = Σ C(n,k)·C(n,n−k),是 (1+x)ⁿ 与 (1+x)ⁿ 相乘后 xⁿ 的系数,也就是 (1+x)^{2n} 中 xⁿ 的系数 = C(2n,n)。这就是"双计数/母函数"思想:同一个数用两种方式数,结果必须相等。
做对了?很好,下一题走起,别回头。
错了或卡壳?回到本章「分布列必须所有概率加起来=1」那一段,把思路再顺一遍。
记
三句话卡片

① 二项式展开用通项 T_{k+1}=C(n,k)a^{n−k}b^k 对号入座。

② 期望管平均 E(X)=Σxᵢpᵢ,方差管波动 D(X)=E(X²)−(EX)²。

③ 二项分布 B(n,p) 的 E=np、D=np(1−p);正态靠 3σ 原则。

费曼学习法:讲给别人听
合上书本,假装对面坐着一个高中生,把这三件事说清楚——说不清楚的地方,就是你没真懂。
  1. 用自己的话讲:本章核心是「二项式 / 分布列」,合上书用自己的话推一遍,不许跳步。
  2. 举个反例 / 什么时候最容易错:为什么分布列概率加起来必须等于 1?"所有情况覆盖完,加起来就是"必然事件"。
  3. 哪里还卡壳(标记你的薄弱点):哪一步你要翻书才推得顺?那个地方就是你的薄弱点,拿笔圈出来。