楼层: 小学/ 初中/ 高中/随机变量的数字特征:期望·方差·协方差与回归/ 大学/ 研究生/ 算法/ 奥数
统

随机变量的数字特征:期望·方差·协方差与回归

Numerical Features · 期望方差协方差,与回归、独立性检验
前面概率统计讲的是"抛硬币、摸球"这种理想模型。一个随机变量光有"分布列"还不够——你更想知道它的平均(期望)、波动(方差)、和另一个变量的联动(协方差 / 相关系数)。这一章先补上这些"数字特征",再学两个实战工具:线性回归(找最贴数据的那条直线)和独立性检验(判断两件事到底有没有关联)。
①
数字特征

期望/方差/协方差

②
相关系数

r 量化联动强度

③
回归直线

y=bx+a 最小二乘

④
独立性检验

卡方 χ² 判关联

【章首引子】收集了 100 个人的身高和体重数据,画在图上像一团云。你能不能画一条直线,尽量贴着这团云,用来"知道身高猜体重"?这就是线性回归。再比如:100 个样本里,抽烟的人是不是真的更容易得肺癌?用一张 2×2 列联表加卡方检验就能给个统计上的说法。

① 数字特征:期望、方差、协方差与相关系数

期把"分布列"压缩成几个关键数

期望 E(X)(长期平均):离散情形 $E(X)=\sum x_i p_i$;连续情形是积分 $\int x\,p(x)\,dx$。方差 D(X)(波动大小):$D(X)=E[(X-E X)^2]=E(X^2)-[E(X)]^2$,开根号是标准差 $\sigma$。协方差 Cov(X,Y)(两变量联动):$\mathrm{Cov}(X,Y)=E[(X-EX)(Y-EY)]$——同涨同跌时为正、此消彼长时为负、互不影响时为 0。

相关系数 r:协方差受量纲影响(身高乘体重单位乱套),除以各自标准差归一化:$r=\frac{\mathrm{Cov}(X,Y)}{\sigma_X\sigma_Y}\in[-1,1]$。$|r|$ 越接近 1,线性相关性越强;$r=0$ 只说明"没有线性关系"(还可能有弯的曲线关系)。

在 AI / 工程里用在哪:把 $n$ 个特征当成随机变量排成一列,它们的协方差两两配对,拼成 $n\times n$ 的协方差矩阵。PCA(主成分分析)的本质,就是对这个矩阵做对角化——找到一组新的正交坐标轴,让数据在新轴第一方向上方差最大、其余方向依次减小。丢掉方差小的方向,就完成了"降维":人脸识别、数据压缩、去噪,第一步往往就是 PCA。你手机相册的人脸聚类,背后也是这套协方差对角化的数学。

② 线性回归:最小二乘找最贴的直线

归是什么:让所有点到直线的误差平方和最小

回归直线方程:ŷ = b x + a。其中斜率 b = Σ(xᵢ−x̄)(yᵢ−ȳ) / Σ(xᵢ−x̄)²,截距 a = ȳ − b x̄。原理(最小二乘法):找一条直线,使每个数据点到它的竖直偏差的平方和最小——平方把正负误差都变正,谁也别抵消谁。这条线必过点 (x̄, ȳ)(数据的"重心")。

用途:知道 x 代入方程预测 ŷ。注意:回归直线只在数据范围内有效,往外瞎推(外推)很不靠谱。

③ 独立性检验:卡方判断两件事有没有关联

验是什么:2×2 列联表 + 卡方统计量

列联表:把样本按两个特征各分两类,数进格子:

2×2 列联表
特征 A非 A合计
特征 Baba+b
非 Bcdc+d
合计a+cb+dn=a+b+c+d

卡方统计量:χ² = n(ad − bc)² / [(a+b)(c+d)(a+c)(b+d)]。判断:算出的 χ² 越大,两个特征关联越强。常用临界值:χ² > 6.635 时有 99% 把握认为有关联;χ² > 3.841 时有 95% 把握。

④ 怎么考:看到统计案例题先想什么

思解题心法:四步反射

1

见"回归/预测"先看散点图,别上来就套公式。点大致沿一条直线散布才配用线性回归;如果明显是弯的,线性模型再准也是错的。再看相关系数 $r$:$|r|$ 越接近 $1$ 越线性,接近 $0$ 就别硬拟合。

2

斜率 $b$ 的公式拆开记:分子是 $x$、$y$ 的协方差,分母是 $x$ 的方差。$b = \frac{\sum(x_i-\bar x)(y_i-\bar y)}{\sum(x_i-\bar x)^2}$。再记一个必考点:回归直线一定过重心 $(\bar x,\bar y)$,因为 $a = \bar y - b\bar x$——这条性质常用来秒杀选择题。

3

见"有没有关系/是否有关"就用列联表 + 卡方。算完 $\chi^2$ 再比临界值:$>3.841$ 有 $95\%$ 把握,$>6.635$ 有 $99\%$ 把握。注意措辞:只能说"有关联",永远不能说"导致"。

4

在 AI / 工程里用在哪:线性回归就是最简单的监督学习。本章的 $\hat y = bx + a$,换成机器学习写法就是 $y = wx + b$;最小二乘法"让误差平方和最小",正是均方误差损失 $\mathrm{MSE} = \frac{1}{n}\sum (y_i-\hat y_i)^2$。深度学习干的事,只是把这条直线换成几亿个参数的函数——损失函数还是这一个。

⑤ 用途与案例

监督学习的第一课

给你一批"面积 → 房价"的数据,找一条线去预测新房子的价格。这就是全部的监督学习:找函数、算误差、把误差调小。后面所有模型的思路都从这里长出来。

最小二乘 = MSE 损失

"让竖直偏差的平方和最小"——这句话翻译成机器学习就是最小化 MSE。你在 PyTorch 里写的第一行 loss = ((y_pred - y) ** 2).mean(),和本章的公式一字不差。

梯度下降在找什么

本章用公式直接解出 $b$、$a$;参数多了公式解不动,就得沿着导数方向一步步挪。两条路通向同一个答案——这就是"闭式解"与"迭代优化"的区别。

A/B 实验与特征筛选

卡方检验能回答"这个特征和目标有没有关联",常被用来筛掉无用特征;新版按钮点击率是否真的更高,用的也是同一套"算统计量、比临界值"的思路。

例1:已知 x̄=2, ȳ=3, b=1.5,求回归方程并写出截距 a。
思路:用 a = ȳ − b x̄。
逐步:a = 3 − 1.5×2 = 0。回归方程 ŷ = 1.5 x。
例2:2×2 列联表 a=40, b=10, c=20, d=30,抽烟与肺癌是否有关?
思路:套卡方公式。
逐步:n = 100,ad−bc = 40×30−10×20 = 1200−200 = 1000。χ² = 100×1000² / (50×50×60×40) = 100×10⁶ / 600000 ≈ 166.7。远大于 6.635 → 有 99% 以上把握认为有关联。
例3:回归直线必过哪个点?
思路:重心点。
逐步:代入 a = ȳ − b x̄ 到 ŷ = bx+a,当 x=x̄ 时 ŷ = b x̄ + ȳ − b x̄ = ȳ,所以过 (x̄, ȳ)。
思维陷阱

相关 ≠ 因果:回归显示身高和体重相关,但"长得高"不直接"导致胖",只是一起变化。卡方"有关联"不等于"有因果":只能说统计上两特征不独立,不证明谁导致谁。外推危险:回归直线只对样本 x 范围内负责。

练习

【基础】回归方程 ŷ = 2x + 1,预测 x=5 时的 ŷ。

查看解答ŷ = 2×5+1 = 11。
做对了?很好。
错了?回到本章「代入预测」那一段。

【进阶】x̄=10, ȳ=20, b=0.5,回归方程?

查看解答a = 20 − 0.5×10 = 15 → ŷ = 0.5x + 15。
做对了?很好。
错了?回到本章「a=ȳ−bx̄」那一段。

【延伸】算出 χ² = 4.2,能不能有 95% 把握认为有关联?

查看解答4.2 > 3.841 → 能,有 95% 把握认为有关联(但够不上 99%,因为小于 6.635)。
做对了?很好。
错了?回到本章「临界值比较」那一段。
记
三句话卡片

① 回归直线 ŷ = bx + a,最小二乘,必过 (x̄, ȳ)。

② 卡方 χ² = n(ad−bc)²/[(a+b)(c+d)(a+c)(b+d)]。

③ χ² > 3.841 有 95% 把握;相关不等于因果。

费曼学习法:讲给别人听
合上书本,假装对面坐着一个高三的学生,把这三件事说清楚——说不清楚的地方,就是你没真懂。
  1. 用自己的话讲:最小二乘为什么要让"偏差平方和"最小?
  2. 举个反例:"相关为什么不等于因果?"冰淇淋卖得好和溺水人数同时上升,是因为夏天热。
  3. 哪里还卡壳:哪步要翻书才顺?圈出来。