随机变量的数字特征:期望·方差·协方差与回归
数字特征
期望/方差/协方差
相关系数
r 量化联动强度
回归直线
y=bx+a 最小二乘
独立性检验
卡方 χ² 判关联
【章首引子】收集了 100 个人的身高和体重数据,画在图上像一团云。你能不能画一条直线,尽量贴着这团云,用来"知道身高猜体重"?这就是线性回归。再比如:100 个样本里,抽烟的人是不是真的更容易得肺癌?用一张 2×2 列联表加卡方检验就能给个统计上的说法。
① 数字特征:期望、方差、协方差与相关系数
期把"分布列"压缩成几个关键数
期望 E(X)(长期平均):离散情形 $E(X)=\sum x_i p_i$;连续情形是积分 $\int x\,p(x)\,dx$。方差 D(X)(波动大小):$D(X)=E[(X-E X)^2]=E(X^2)-[E(X)]^2$,开根号是标准差 $\sigma$。协方差 Cov(X,Y)(两变量联动):$\mathrm{Cov}(X,Y)=E[(X-EX)(Y-EY)]$——同涨同跌时为正、此消彼长时为负、互不影响时为 0。
相关系数 r:协方差受量纲影响(身高乘体重单位乱套),除以各自标准差归一化:$r=\frac{\mathrm{Cov}(X,Y)}{\sigma_X\sigma_Y}\in[-1,1]$。$|r|$ 越接近 1,线性相关性越强;$r=0$ 只说明"没有线性关系"(还可能有弯的曲线关系)。
在 AI / 工程里用在哪:把 $n$ 个特征当成随机变量排成一列,它们的协方差两两配对,拼成 $n\times n$ 的协方差矩阵。PCA(主成分分析)的本质,就是对这个矩阵做对角化——找到一组新的正交坐标轴,让数据在新轴第一方向上方差最大、其余方向依次减小。丢掉方差小的方向,就完成了"降维":人脸识别、数据压缩、去噪,第一步往往就是 PCA。你手机相册的人脸聚类,背后也是这套协方差对角化的数学。
② 线性回归:最小二乘找最贴的直线
归是什么:让所有点到直线的误差平方和最小
回归直线方程:ŷ = b x + a。其中斜率 b = Σ(xᵢ−x̄)(yᵢ−ȳ) / Σ(xᵢ−x̄)²,截距 a = ȳ − b x̄。原理(最小二乘法):找一条直线,使每个数据点到它的竖直偏差的平方和最小——平方把正负误差都变正,谁也别抵消谁。这条线必过点 (x̄, ȳ)(数据的"重心")。
用途:知道 x 代入方程预测 ŷ。注意:回归直线只在数据范围内有效,往外瞎推(外推)很不靠谱。
③ 独立性检验:卡方判断两件事有没有关联
验是什么:2×2 列联表 + 卡方统计量
列联表:把样本按两个特征各分两类,数进格子:
| 特征 A | 非 A | 合计 | |
|---|---|---|---|
| 特征 B | a | b | a+b |
| 非 B | c | d | c+d |
| 合计 | a+c | b+d | n=a+b+c+d |
卡方统计量:χ² = n(ad − bc)² / [(a+b)(c+d)(a+c)(b+d)]。判断:算出的 χ² 越大,两个特征关联越强。常用临界值:χ² > 6.635 时有 99% 把握认为有关联;χ² > 3.841 时有 95% 把握。
④ 怎么考:看到统计案例题先想什么
思解题心法:四步反射
见"回归/预测"先看散点图,别上来就套公式。点大致沿一条直线散布才配用线性回归;如果明显是弯的,线性模型再准也是错的。再看相关系数 $r$:$|r|$ 越接近 $1$ 越线性,接近 $0$ 就别硬拟合。
斜率 $b$ 的公式拆开记:分子是 $x$、$y$ 的协方差,分母是 $x$ 的方差。$b = \frac{\sum(x_i-\bar x)(y_i-\bar y)}{\sum(x_i-\bar x)^2}$。再记一个必考点:回归直线一定过重心 $(\bar x,\bar y)$,因为 $a = \bar y - b\bar x$——这条性质常用来秒杀选择题。
见"有没有关系/是否有关"就用列联表 + 卡方。算完 $\chi^2$ 再比临界值:$>3.841$ 有 $95\%$ 把握,$>6.635$ 有 $99\%$ 把握。注意措辞:只能说"有关联",永远不能说"导致"。
在 AI / 工程里用在哪:线性回归就是最简单的监督学习。本章的 $\hat y = bx + a$,换成机器学习写法就是 $y = wx + b$;最小二乘法"让误差平方和最小",正是均方误差损失 $\mathrm{MSE} = \frac{1}{n}\sum (y_i-\hat y_i)^2$。深度学习干的事,只是把这条直线换成几亿个参数的函数——损失函数还是这一个。
⑤ 用途与案例
监督学习的第一课
给你一批"面积 → 房价"的数据,找一条线去预测新房子的价格。这就是全部的监督学习:找函数、算误差、把误差调小。后面所有模型的思路都从这里长出来。
最小二乘 = MSE 损失
"让竖直偏差的平方和最小"——这句话翻译成机器学习就是最小化 MSE。你在 PyTorch 里写的第一行 loss = ((y_pred - y) ** 2).mean(),和本章的公式一字不差。
梯度下降在找什么
本章用公式直接解出 $b$、$a$;参数多了公式解不动,就得沿着导数方向一步步挪。两条路通向同一个答案——这就是"闭式解"与"迭代优化"的区别。
A/B 实验与特征筛选
卡方检验能回答"这个特征和目标有没有关联",常被用来筛掉无用特征;新版按钮点击率是否真的更高,用的也是同一套"算统计量、比临界值"的思路。
相关 ≠ 因果:回归显示身高和体重相关,但"长得高"不直接"导致胖",只是一起变化。卡方"有关联"不等于"有因果":只能说统计上两特征不独立,不证明谁导致谁。外推危险:回归直线只对样本 x 范围内负责。
练习
【基础】回归方程 ŷ = 2x + 1,预测 x=5 时的 ŷ。
查看解答
ŷ = 2×5+1 = 11。错了?回到本章「代入预测」那一段。
【进阶】x̄=10, ȳ=20, b=0.5,回归方程?
查看解答
a = 20 − 0.5×10 = 15 → ŷ = 0.5x + 15。错了?回到本章「a=ȳ−bx̄」那一段。
【延伸】算出 χ² = 4.2,能不能有 95% 把握认为有关联?
查看解答
4.2 > 3.841 → 能,有 95% 把握认为有关联(但够不上 99%,因为小于 6.635)。错了?回到本章「临界值比较」那一段。
① 回归直线 ŷ = bx + a,最小二乘,必过 (x̄, ȳ)。
② 卡方 χ² = n(ad−bc)²/[(a+b)(c+d)(a+c)(b+d)]。
③ χ² > 3.841 有 95% 把握;相关不等于因果。
- 用自己的话讲:最小二乘为什么要让"偏差平方和"最小?
- 举个反例:"相关为什么不等于因果?"冰淇淋卖得好和溺水人数同时上升,是因为夏天热。
- 哪里还卡壳:哪步要翻书才顺?圈出来。