参数估计与假设检验
【章首引子】A 版按钮转化率 5%,B 版 5.5%——新版真的更好用,还是运气?你不能光看"差了多少",得看"差得靠不靠谱"。这就是假设检验和 p 值。所有"用数据说话"的岗位,基本功全在这一节。
① 是什么:点估计、区间估计、假设检验
啥从样本反推总体
点估计:用样本某个数猜总体参数。最大似然估计 MLE:找一组参数,让"我们观测到的这批数据"出现的可能性最大。区间估计:给个范围+置信度("平均身高 95% 置信区间 168~172")。
假设检验:先立假设("新旧药一样"),看样本数据多离谱。若假设下这么离谱几乎不可能发生,就拒绝。p 值:假设成立时出现当前(或更极端)结果的概率,p 越小证据越有力。两类错误:弃真(冤枉好人)、取伪(放过坏人)。
② 怎么想到的
思解题心法
先立 H₀(原假设):"没差别/没效果"。
证参数估计与假设检验的核心定理与公式
推导思路:①极大似然要最大化似然 $\prod_i p_\theta(y_i\,|\,x_i)$,取对数把连乘变成连加(单调变换不改变极值点),得 $\hat{\theta}=\arg\max_\theta\sum_i\log p_\theta(y_i\,|\,x_i)$。②加上负号并除以 $N$,最大化就变成了最小化:$\arg\min_\theta\ -\frac{1}{N}\sum_i\log p_\theta(y_i\,|\,x_i)$,除以常数不影响最优解。③把训练集的经验分布 $\hat{p}(x,y)=\frac{1}{N}\sum_i\delta_{(x_i,y_i)}$ 代入,上式正是交叉熵 $H(\hat{p},p_\theta)=-\sum_{x,y}\hat{p}(x,y)\log p_\theta(y\,|\,x)$。④结论:分类任务里"最小化交叉熵损失"和"最大化对数似然"是同一个优化问题,损失函数不是拍脑袋定的,而是从概率模型推出来的。
直觉把握:估计是"看了一堆数据,反推背后的参数是多少";检验是"这个猜测到底靠不靠谱"。AI/工程里,整个深度学习训练就是一场 MLE——分类用交叉熵、回归用 MSE(等价于假设高斯噪声时的负对数似然);而 $p$ 值决定一次 A/B 实验敢不敢上线,置信区间告诉你"这个提升可能只是噪声"。
算检验统计量和 p 值:t 检验比均值、u 检验大样本、卡方看独立性、F 比方差。
p<0.05 拒绝 H₀:但同时看效应量和置信区间,别只看 p。
③ 完整解法:三个例题
④ 用途与案例
A/B 测试
互联网公司每个按钮、每个推荐都做 A/B 测试,p 值判显著。
药品临床试验
新药 vs 安慰剂,t 检验看疗效是否显著——FDA 审批的统计基础。
民意调查
支持率 ±3%,n=1000 就够——CLT + 置信区间。
质量抽检
一批产品抽几个,次品率超阈值就整批退货。
⑤ 延展
展知识衔接地图
往研究生走:频率派 → 贝叶斯统计(把参数当随机变量,用后验分布)。往 AI 走:模型评估、交叉验证、bootstrap,都是这一节的工业化。
把 p<0.05 当"假设一定错了"。p 只是证据强度,不是真相概率。做 20 个实验平均就有 1 个假阳性。别只看 p,看效应量、样本量、做重复实验。
练习
【基础】样本量增大,标准误会怎样?
查看思路与解答
标准误 σ/√n 随 n 增大而减小,置信区间变窄,估计更准。【进阶】什么是假设检验的"两类错误"?
查看思路与解答
第一类(弃真):H₀ 真却拒绝它(冤枉好人,概率 α);第二类(取伪):H₀ 假却没拒绝(放过坏人,概率 β)。α 小 β 就大,此消彼长。① 估计 = 用样本猜总体(给范围+置信度);检验 = 先立假设看证据够不够推翻。
② p 值是证据强度不是判决书;做 20 个实验平均有 1 个假阳性。