楼层: 小学/ 初中/ 高中/ 大学/参数估计与假设检验/ 研究生/ 算法/ 奥数
21

参数估计与假设检验

Estimation & Hypothesis Testing · 用数据说话

【章首引子】A 版按钮转化率 5%,B 版 5.5%——新版真的更好用,还是运气?你不能光看"差了多少",得看"差得靠不靠谱"。这就是假设检验和 p 值。所有"用数据说话"的岗位,基本功全在这一节。

① 是什么:点估计、区间估计、假设检验

啥从样本反推总体

点估计:用样本某个数猜总体参数。最大似然估计 MLE:找一组参数,让"我们观测到的这批数据"出现的可能性最大。区间估计:给个范围+置信度("平均身高 95% 置信区间 168~172")。

假设检验:先立假设("新旧药一样"),看样本数据多离谱。若假设下这么离谱几乎不可能发生,就拒绝。p 值:假设成立时出现当前(或更极端)结果的概率,p 越小证据越有力。两类错误:弃真(冤枉好人)、取伪(放过坏人)。

② 怎么想到的

思解题心法

1

先立 H₀(原假设):"没差别/没效果"。

证参数估计与假设检验的核心定理与公式

核心定理:①极大似然估计:$\hat{\theta}=\arg\max\limits_{\theta}\prod\limits_{i=1}^{N}p(x_i\,|\,\theta)=\arg\max\limits_{\theta}\sum\limits_{i=1}^{N}\log p(x_i\,|\,\theta)$。②均值估计的标准误:$\mathrm{SE}(\bar{X})=\frac{\sigma}{\sqrt{N}}$,$95\%$ 置信区间 $\bar{x}\pm 1.96\,\frac{\sigma}{\sqrt{N}}$。③两类错误:第一类 $\alpha$(弃真)、第二类 $\beta$(取假),功效 $=1-\beta$。④检验统计量的选择:正态总体方差已知用 $z=\frac{\bar{x}-\mu_0}{\sigma/\sqrt{N}}$;方差未知用 $t=\frac{\bar{x}-\mu_0}{s/\sqrt{N}}$($t$ 分布,$N$ 大时趋近正态)。⑤克拉美-罗下界:无偏估计的方差 $\geq\frac{1}{N\,I(\theta)}$,$I$ 为 Fisher 信息。

推导思路:①极大似然要最大化似然 $\prod_i p_\theta(y_i\,|\,x_i)$,取对数把连乘变成连加(单调变换不改变极值点),得 $\hat{\theta}=\arg\max_\theta\sum_i\log p_\theta(y_i\,|\,x_i)$。②加上负号并除以 $N$,最大化就变成了最小化:$\arg\min_\theta\ -\frac{1}{N}\sum_i\log p_\theta(y_i\,|\,x_i)$,除以常数不影响最优解。③把训练集的经验分布 $\hat{p}(x,y)=\frac{1}{N}\sum_i\delta_{(x_i,y_i)}$ 代入,上式正是交叉熵 $H(\hat{p},p_\theta)=-\sum_{x,y}\hat{p}(x,y)\log p_\theta(y\,|\,x)$。④结论:分类任务里"最小化交叉熵损失"和"最大化对数似然"是同一个优化问题,损失函数不是拍脑袋定的,而是从概率模型推出来的。

直觉把握:估计是"看了一堆数据,反推背后的参数是多少";检验是"这个猜测到底靠不靠谱"。AI/工程里,整个深度学习训练就是一场 MLE——分类用交叉熵、回归用 MSE(等价于假设高斯噪声时的负对数似然);而 $p$ 值决定一次 A/B 实验敢不敢上线,置信区间告诉你"这个提升可能只是噪声"。

2

算检验统计量和 p 值:t 检验比均值、u 检验大样本、卡方看独立性、F 比方差。

3

p<0.05 拒绝 H₀:但同时看效应量和置信区间,别只看 p。

③ 完整解法:三个例题

例题1:民调 ±3% 怎么来的
【审题】n=1000,比例 p≈0.5。
思路:标准误 √(p(1−p)/n)。
逐步解法:标准误 ≈ √(0.25/1000) ≈ 0.0158,95% 误差 ≈ ±1.96×0.0158 ≈ ±3%。
例题2:A/B 测试 p=0.03
【审题】能不能说 B 一定更好?
思路:p 值是证据强度。
逐步解法:p=0.03 只说"若真没差别,这么大差距只有 3% 概率发生"。证据倾向 B 更好,但仍有 3% 假阳性可能,还应看效应量和可重复性。
例题3:最大似然估计思路
【审题】抛 10 次硬币 7 次正,p 多大?
思路:让观测概率最大。
逐步解法:似然 = C(10,7)p⁷(1−p)³,对 p 求导令 0,得 p̂ = 7/10 = 0.7。即"观测到 7 正"最可能的 p 就是 0.7。
估计与检验速查 MLE:$\text{让似然函数} L(\theta ) \text{最大}$  |  评价:无偏、有效、一致
置信区间(正态总体均值,$\sigma$ 已知):$\bar{x} \pm z_{\alpha/2}\cdot \sigma/\sqrt{n}$
常用检验:u 检验、t 检验(比均值)、卡方检验(独立性)、F 检验(比方差)

④ 用途与案例

A/B 测试

互联网公司每个按钮、每个推荐都做 A/B 测试,p 值判显著。

药品临床试验

新药 vs 安慰剂,t 检验看疗效是否显著——FDA 审批的统计基础。

民意调查

支持率 ±3%,n=1000 就够——CLT + 置信区间。

质量抽检

一批产品抽几个,次品率超阈值就整批退货。

⑤ 延展

展知识衔接地图

往研究生走:频率派 → 贝叶斯统计(把参数当随机变量,用后验分布)。往 AI 走:模型评估、交叉验证、bootstrap,都是这一节的工业化。

思维陷阱

把 p<0.05 当"假设一定错了"。p 只是证据强度,不是真相概率。做 20 个实验平均就有 1 个假阳性。别只看 p,看效应量、样本量、做重复实验。

练习

【基础】样本量增大,标准误会怎样?

查看思路与解答标准误 σ/√n 随 n 增大而减小,置信区间变窄,估计更准。
【自评反馈】和答案对得上 → 继续下一题;对不上 → 回到本页"是什么"和例题区,把卡住的那步再推一遍。

【进阶】什么是假设检验的"两类错误"?

查看思路与解答第一类(弃真):H₀ 真却拒绝它(冤枉好人,概率 α);第二类(取伪):H₀ 假却没拒绝(放过坏人,概率 β)。α 小 β 就大,此消彼长。
【自评反馈】和答案对得上 → 继续下一题;对不上 → 回到本页"是什么"和例题区,把卡住的那步再推一遍。
费曼学习法:讲给别人听
① 用自己的话讲:用样本猜总体叫估计(矩估计、最大似然);假设检验是"先立个假设,再找茬,茬找够了就推翻"。
② 举个反例(什么条件下不成立):p 值小 ≠ 效果大;统计显著 ≠ 实际重要;冤枉好人(一类错误)和放过坏人(二类错误)永远在跷跷板两端。
③ 哪里还说不清:置信区间到底是"参数有 95% 概率落在里面"吗?这句话错在哪?
记
小结卡

① 估计 = 用样本猜总体(给范围+置信度);检验 = 先立假设看证据够不够推翻。

② p 值是证据强度不是判决书;做 20 个实验平均有 1 个假阳性。