楼层: 小学/ 初中/ 高中/ 大学/大数定律与中心极限定理/ 研究生/ 算法/ 奥数
19

大数定律与中心极限定理

LLN & CLT · 为什么样本够大就靠谱

【章首引子】赌场单局输赢靠运气,为什么老板从不慌?因为他每天面对成千上万局。大数定律把波动磨平,庄家稳稳拿走那 1%。这就是赌场和保险公司敢开门的底气。

① 是什么:两条"统计管用"的根基

啥LLN 与 CLT

大数定律(LLN):试验次数越多,事件频率越稳定在真实概率附近。抛 10 次可能 7 正 3 反,抛 10000 次非常接近 50/50。短期靠运气,长期靠规律。

中心极限定理(CLT):不管单个变量什么分布,一大堆独立变量加起来,和(或平均值)趋近正态。无数小因素叠加的结果,天然长成钟形。切比雪夫不等式:P(|X−μ|≥ε) ≤ σ²/ε²,离均值越远概率越小。

② 怎么想到的

思解题心法

1

样本平均趋近真值 → 这是 LLN。解释"问 1000 人为啥能代表全国"。

2

样本平均的分布是正态 → 这是 CLT。让你能算误差、做置信区间。

3

ΣXᵢ 近似 N(nμ, nσ²)。平均值近似 N(μ, σ²/n),n 越大越集中。

③ 完整解法:三个例题

证大数定律与中心极限定理的核心定理与公式

核心定理:①马尔可夫不等式:对非负随机变量 $X$ 和 $a>0$,有 $P(X\geq a)\leq\frac{E[X]}{a}$。②切比雪夫不等式:$P\big(|X-\mu|\geq k\sigma\big)\leq\frac{1}{k^{2}}$。③弱大数定律:$\bar{X}_n=\frac{1}{n}\sum\limits_{i=1}^{n}X_i$ 依概率收敛到 $\mu$,即对任意 $\varepsilon>0$ 有 $\lim\limits_{n\to\infty}P(|\bar{X}_n-\mu|<\varepsilon)=1$。④中心极限定理:$\sqrt{n}\,(\bar{X}_n-\mu)\xrightarrow{d}N(0,\sigma^{2})$,即 $\bar{X}_n\approx N\!\left(\mu,\frac{\sigma^{2}}{n}\right)$。⑤误差随样本量的速度:$\bar{X}_n$ 的标准差是 $\frac{\sigma}{\sqrt{n}}$,样本翻 $4$ 倍精度才提升 $2$ 倍。

推导思路:①先证马尔可夫不等式:把期望按"是否超过 $a$"切成两段,$E[X]=\int X\,\mathrm{d}P\geq\int_{\{X\geq a\}}X\,\mathrm{d}P\geq a\,P(X\geq a)$,除以 $a$ 即得。②取 $Y=(X-\mu)^{2}$,它非负,且 $E[Y]=\mathrm{Var}(X)=\sigma^{2}$。③把 $Y$ 和阈值 $a=(k\sigma)^{2}$ 代入①:$P\big((X-\mu)^{2}\geq k^{2}\sigma^{2}\big)\leq\frac{\sigma^{2}}{k^{2}\sigma^{2}}=\frac{1}{k^{2}}$。④左边事件 $(X-\mu)^{2}\geq k^{2}\sigma^{2}$ 与 $|X-\mu|\geq k\sigma$ 完全等价,不等式成立。

直觉把握:大数定律说"掷一万次硬币,正面频率就贴到 $0.5$,赌场靠这个稳赢";中心极限定理更神——不管单个随机变量长什么样,只要独立同分布、数量够多,它们的和就长成正态钟形。AI/工程里,mini-batch 梯度本质是个样本均值,CLT 保证它近似高斯,这才让"梯度噪声看成高斯扰动"的假设(以及把 SGD 看成随机微分方程)站得住;A/B 实验的置信区间也全靠它。

例题1:抛 10 次 vs 10000 次
【审题】哪种更接近 50%?
思路:大数定律。
逐步解法:10000 次。次数越多频率越贴 50%,少量样本的偶然偏差被大量试验稀释。
例题2:为什么考试总分是钟形
【审题】一道题分布可能很歪,总分却钟形。
思路:中心极限定理。
逐步解法:总分 = 几十道题得分之和,每题都是独立小变量。一堆独立变量加起来天然趋近正态——数学必然,不是巧合。
例题3:民意调查为什么问 1000 人就够
【审题】±3% 误差哪来的?
思路:标准误 σ/√n。
逐步解法:n=1000 时标准误约 √(0.5×0.5/1000)≈0.016,95% 误差带 ≈ ±2×0.016≈±3%。再多问人收益递减。
LLN 与 CLT 核心公式 $\text{切比雪夫} P(|X−\mu | \geq \epsilon ) \leq \sigma ^2/\epsilon ^2$
CLT:$\Sigma X_i \text{近似} N(n\mu , n\sigma ^2)$  |  样本平均 $\bar{X}$ 近似 $N(\mu, \frac{\sigma^2}{n})$

④ 用途与案例

赌场与保险

单局庄家优势 1%,每天成千上万局,LLN 把波动磨平,稳赚。

抽样调查

问一千人就敢代表全国——CLT 让误差可算,LLN 让平均可信。

质量检测

抽检一批产品次品率,样本平均趋近真值,靠 LLN。

机器学习

批量归一化、随机梯度下降的稳定性,背后都是 CLT 在撑腰。

⑤ 延展

展知识衔接地图

往研究生走:伯努利/辛钦大数定律、林德伯格-列维 CLT → 概率测度论里的依概率收敛、依分布收敛。

思维陷阱

赌徒谬误:连开 5 把大,下一把该开小了?错!独立事件没有"还债"机制,骰子没记忆。LLN 说的是"长期平均趋近",不是"错多了要扳回来"。

练习

【基础】抛硬币,10 次和 10000 次哪个更接近 50%?

查看思路与解答10000 次(大数定律)。
【自评反馈】和答案对得上 → 继续下一题;对不上 → 回到本页"是什么"和例题区,把卡住的那步再推一遍。

【进阶】50 人身高近似正态,背后哪条定理?

查看思路与解答中心极限定理。身高由基因、营养、运动等无数独立小因素叠加,天然趋近正态。
【自评反馈】和答案对得上 → 继续下一题;对不上 → 回到本页"是什么"和例题区,把卡住的那步再推一遍。
费曼学习法:讲给别人听
① 用自己的话讲:大数定律说试验次数一多,样本均值就贴着真值走;中心极限说一堆独立小因素叠加起来,总和必然长成正态。
② 举个反例(什么条件下不成立):大数定律要求同分布、方差有限;样本不独立或者尾巴太重(重尾分布),两条定律都失灵。
③ 哪里还说不清:正态分布凭什么满世界都是?它到底特殊在哪?
记
小结卡

① LLN:样本越大频率越贴概率;CLT:一堆独立小因素叠加 = 正态。

② 赌场靠 LLN 稳赢,但骰子没有记忆,别赌徒谬误。