ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

一元线性回归核心知识点全拆解:从最小二乘法到显著性检验

一元线性回归核心知识点全拆解:从最小二乘法到显著性检验 一到期末总有学生抱着《统计学》第八版来找我问第十一章一元线性回归到底该怎么复习。我的回答通常很直接这一章是全书性价比最高的一章它不仅把你前面学的均值、方差、假设检验全部串了起来而且是后面多元回归、方差分析、时间序列分析的地基。可偏偏又是这一章让很多人学得最糊涂——公式一多大家就开始背式子、背结论完全不理解背后的逻辑结果题目稍微变个形式就懵。这篇东西我就按实际教学和做数据分析的视角把一元线性回归的知识点彻底拆开讲清楚配合课后典型题的解题思路最后再聊几个我见过无数次的操作细节和易错点。内容不绕弯子直接冲着学会、做对题、能看懂回归输出这三个目标去。1. 学一元线性回归之前先想清楚它在回答什么问题1.1 从散点图到相关分析这一步不能跳一元线性回归处理的场景用大白话说就是手里有两个数值型变量一个叫自变量 (x)一个叫因变量 (y)你想知道 (x) 的变化能不能解释 (y)、能解释多少以及给定一个新的 (x) 时 (y) 大约会是多少。比如广告投入和销售额、温度和冷饮销量、学习时长和考试成绩都属于这种问题。贾俊平版教材在第十一章之前已经安排了相关分析你在那里学过相关系数 (r)它帮你回答两个变量有没有线性关系、关系有多强。但相关系数只给一个数字它不告诉你广告多投1万元销售额能涨多少也不告诉你投到8万元时销售额大概是多少。要回答后面两个问题就必须进入回归。这一步在复习里特别容易被忽略很多人直接记公式却完全不知道公式在做什么。我建议你不管基础多差先做一件事——把教材里的例题数据或者你自己找的一组数据画一张散点图横轴 (x)、纵轴 (y)。如果点大致分布在一条直线附近说明用一元线性回归建模是合理的如果点的形状像抛物线、像指数曲线或者干脆是一团乱麻那线性回归做出来就是自欺欺人。散点图不是可选项它是回归分析的前提检查。1.2 相关不等于回归更不等于因果教材里反复强调的一个考点是 (r) 接近0不代表两个变量没有关系只代表没有线性关系(r) 接近±1也不代表一个变量是另一个的原因。相关分析是对称的(x) 对 (y) 和 (y) 对 (x) 算出来的 (r) 一样而回归是有方向的因变量设得不同得到的方程就不同。这是课后选择题里最高频的陷阱题目给你一组 (r) 值和回归方程问哪个说法正确很多人把显著相关直接翻译成因果关系这就是概念没拎清。我上课时喜欢举一个例子某个地区的冰淇淋销量和溺水人数高度正相关但你不能说卖冰淇淋导致溺水。它们背后都受气温影响属于共同原因下的虚假相关。回归分析里即使方程显著、(R^2) 很高也只能说明 (x) 和 (y) 存在统计上的联系要谈因果关系你得靠实验设计或者领域知识来支撑。这一点第八版虽然在教材里没有展开大篇幅但考试和实际应用里都极其重要建议当成一条铁律记下来。2. 模型与基本假设这一章的地基错了全白搭2.1 回归方程与总体回归模型的区别教材给的一元线性回归模型长这样[ y \beta_0 \beta_1x \varepsilon ]其中 (\beta_0) 是截距(\beta_1) 是斜率(\varepsilon) 是误差项也叫随机扰动项。注意这个式子描述的是总体关系。总体里真实的 (\beta_0) 和 (\beta_1) 我们是不知道的只能靠样本去估计估计出来的记作 (b_0) 和 (b_1)于是得到样本回归方程[ \hat{y} b_0 b_1x ](\hat{y}) 读作y hat表示拟合值或预测值不是实际观测值 (y)。实际值和拟合值之间的差就是残差 (e y - \hat{y})它是总体误差 (\varepsilon) 在样本里的体现。这个总体模型和样本方程的区分是几乎每年必考的概念题。题目会问回归方程 (\hat{y} 10 2x) 中10 和 2 分别表示什么答案要答出估计的截距和估计的斜率说明它们分别是 (\beta_0)、(\beta_1) 的点估计值而不是直接一句截距是10就完了。很多人在这种1分题上丢分纯粹是因为没注意表述的严谨性。2.2 四个基本假设用大白话怎么理解一元线性回归的统计推断全部建立在一组假设之上。教材里通常列四点线性假设(y) 与 (x) 的关系在总体上确实是线性的等价地说误差项对 (x) 的条件期望为0独立性假设各次观测的误差项彼此独立同方差假设对不同的 (x)误差项的方差相同正态性假设误差项服从均值为0的正态分布。单纯背这四点很容易难的是理解。我用大白话翻译一下线性假设就是说我们拿一条直线去拟合数据而数据本质上确实有直线趋势如果真实关系是曲线你用直线硬套残差就会出现系统性的弯曲独立性就是说上一次抽样的误差不会影响下一次时间序列数据里特别容易违反同方差性是说不管 (x) 是小还是大误差的波动幅度差不多你不能用大 (x) 对应大波动、小 (x) 对应小波动的数据去硬套正态性则主要是为了后面做假设检验和区间估计时(t) 分布、(F) 分布才有效。2.3 假设不满足会怎样不深挖数学但要有感知很多同学学到这里觉得假设是纯理论、不考。大错特错。第八版教材虽然没给你一套完整的诊断工具箱但课后习题里经常会给残差图让你判断模型靠不靠谱。比如残差图呈漏斗形说明方差不恒定残差随 (x) 呈现出弯曲说明线性假设可疑有个别残差跑出两三条标准差线那大概率是异常值。这些判断在后面的多元回归章节会系统化但在一元线性回归这里你需要先建立直觉回归结果再漂亮只要残差长得不对劲都要回去检查假设。另外还有一个实际层面的提醒检验回归系数显著性的 (t) 检验依赖误差项服从正态分布这个条件。如果你手里是一个小样本误差又明显偏态那么算出来的 (p0.03) 就不要太当回事。理解了这一层你才算真的会看回归输出而不是只会抄数字。3. 参数估计最小二乘法的来龙去脉3.1 为什么叫最小二乘而不是绝对偏差最小估计 (\beta_0) 和 (\beta_1) 的方法不止一种第八版主讲最小二乘法OLS。思路不复杂我们要找一条直线使得所有实际点到这条直线的竖直距离的平方和最小。这里的竖直距离就是残差所以目标是最小化[ Q \sum_{i1}^{n}(y_i - \hat{y}i)^2 \sum{i1}^{n}(y_i - b_0 - b_1x_i)^2 ]为什么用平方而不是绝对值两个原因一是平方函数处处可导能求偏导能得到解析解二是平方放大了大残差的惩罚让大偏差更不可接受。后者既是优点也是缺点所以最小二乘对异常值比较敏感——如果有一个点离群太远回归线会被它拽过去。理解了这一点以后你在实际分析中看到稳健回归加权最小二乘这些名词就会知道它们都是在修正这个弱点。令 (Q) 对 (b_0) 和 (b_1) 的偏导数等于0解方程组就得到教材上的公式[ b_1 \frac{\sum_{i1}^{n}(x_i - \bar{x})(y_i - \bar{y})}{\sum_{i1}^{n}(x_i - \bar{x})^2} ][ b_0 \bar{y} - b_1\bar{x} ]注意这个 (b_1) 的式子分子其实是 (x) 和 (y) 的协方差乘上一个常数分母是 (x) 的方差乘上一个常数。所以斜率本质上衡量的是(x) 变动一单位时(y) 平均跟着变动的幅度而截距的作用是让回归线恰好经过点 ((\bar{x}, \bar{y}))。这个几何意义很重要——回归线总是穿过样本均值点。3.2 一个能按计算器的完整手算例子我特意用一个小数据集演示过程数据规模也贴近教材课后习题里出现的规模5个样本拿广告投入和销售额说话广告投入x万元销售额y万元1224334657先算基础量(\sum x 15)(\bar{x} 3)(\sum y 22)(\bar{y} 4.4)(\sum xy 78)(\sum x^2 55)。然后代入[ b_1 \frac{78 - 5 \times 3 \times 4.4}{55 - 5 \times 9} \frac{78 - 66}{55 - 45} \frac{12}{10} 1.2 ][ b_0 4.4 - 1.2 \times 3 0.8 ]所以回归方程为[ \hat{y} 0.8 1.2x ]它告诉你广告投入每增加1万元销售额平均增加1.2万元当广告投入为0时销售额的估计值是0.8万元。后一句常常会被追问这个截距有没有实际意义要看 (x) 的取值范围。这里数据里的 (x) 在1到5之间那么 (x0) 属于外推0.8万元只是一个数学截距不能当真实业务含义去解读。这是教材里很容易出判断或简答题的点。再算残差(e (0, 0.8, -1.4, 0.4, 0.2))。后文会用这些数字去算判定系数和检验统计量所以这个例子先存着。3.3 用Excel或科学计算器时最容易出错的细节实际做题时大多数人不会手算而是用Excel或科学计算器。Excel的操作路径是选中 (x) 和 (y) 数据插入散点图右键添加趋势线勾选显示公式和显示R平方。但要注意Excel默认不会输出检验统计量要拿完整结果需要到数据→数据分析→回归里勾选。而数据分析工具在默认安装下通常是隐藏的你得到文件→选项→加载项→转到里勾选分析工具库这一步经常有人卡住还以为是Excel坏了。用科学计算器算相关系数、回归系数时最常见的坑是计算器的求和模式没有清零把上一次的数据带进了这次。我见过的错误里十有七八是没清零导致 (\sum xy) 错得离谱然后整个回归方程全部报废。建议养成习惯每算一组数据前先按清零键再进入统计模式SD或REG模式输完数据后直接读出 (\sum x)、(\sum y)、(\sum xy)、(\sum x^2)。磨刀不误砍柴工。4. 模型评价拟合优度与显著性检验4.1 判定系数R²回归解释了变化的多少估计完参数下一步就是回答这个方程到底好不好用。教材引入判定系数 (R^2)思路是从因变量的变化出发。总离差平方和 (SST \sum(y_i - \bar{y})^2)表示 (y) 的总波动回归平方和 (SSR \sum(\hat{y}_i - \bar{y})^2)表示被回归解释了的那部分波动残差平方和 (SSE \sum(y_i - \hat{y}_i)^2)表示没被解释的波动。三者关系是[ SST SSR SSE ]于是[ R^2 \frac{SSR}{SST} 1 - \frac{SSE}{SST} ]还用上面那个小例子(\bar{y} 4.4)。算 (SST)[ (2-4.4)^2 (4-4.4)^2 (3-4.4)^2 (6-4.4)^2 (7-4.4)^2 ]结果是 (5.76 0.16 1.96 2.56 6.76 17.2)。(SSE) 按残差平方和算[ 0^2 0.8^2 (-1.4)^2 0.4^2 0.2^2 0 0.64 1.96 0.16 0.04 2.8 ]所以 (SSR 17.2 - 2.8 14.4)(R^2 14.4 / 17.2 \approx 0.8372)。这个0.8372怎么解读你可以说销售额的变化里有83.72%能被广告投入的线性关系解释剩下的16.28%来自其他因素或随机波动。这里还有一个重要的近似关系很多老师会提一下在一元回归里(R^2) 就等于样本相关系数 (r) 的平方。你可以回去验证(r \approx \sqrt{0.8372} \approx 0.915)且符号为正说明正相关。所以教材里相关系数与判定系数是互通的(r) 为0.9(R^2) 就是0.81。考试里常见的坑是(R^2) 高不等于模型一定正确(R^2) 低也不等于模型一定没用。(R^2) 衡量的是线性拟合的解释力它没有多少算高的统一标准不同领域的阈值可以天差地别。比如社会科学里 (R^2 0.3) 可能已经很好了而物理实验里 (R^2) 不到0.99都不好意思发论文。4.2 估计标准误差se回归方程的平均误差水平(R^2) 告诉你解释了多少比例但它没有告诉你预测误差具体是多大。预测误差要靠估计标准误差来度量符号一般写成 (s_e)[ s_e \sqrt{\frac{SSE}{n-2}} ]分母是 (n-2)这是自由度。为什么要减2因为回归方程估计了两个参数(b_0) 和 (b_1)在算残差时你从样本信息里已经消耗了两条信息。用上面例子里的 (SSE 2.8)、(n 5)[ s_e \sqrt{\frac{2.8}{3}} \approx 0.966 ]单位与 (y) 相同。含义可以粗糙地理解为按这个回归方程预测销售额平均偏差大概在0.97万元左右。(s_e) 越小说明点围绕回归线的散布越集中。注意 (s_e) 和 (R^2) 是从不同角度评价模型的(R^2) 是相对解释比例(s_e) 是绝对误差水平。一个模型可能 (R^2) 比较高但 (s_e) 依然很大因为数据本身的波动就大反之亦然。考试里如果让你比较两个模型不要只盯着 (R^2)还要看 (s_e) 和业务需求。4.3 回归系数的显著性检验t检验的四步逻辑教材在这里把前面章节的假设检验知识接回来了。核心问题是(b_1) 是样本算出来的即使总体斜率 (\beta_1 0)样本的 (b_1) 也会因为抽样波动而不为0。所以我们要检验[ H_0: \beta_1 0 ] [ H_1: \beta_1 \ne 0 ]如果检验结果不拒绝 (H_0)那就说明 (x) 对 (y) 没有显著的线性影响整个回归方程形同虚设。检验统计量是[ t \frac{b_1}{s_{b_1}} ]其中[ s_{b_1} \frac{s_e}{\sqrt{\sum(x_i - \bar{x})^2}} ]服从自由度 (n-2) 的 (t) 分布。用例子里的数据算一下(\sum(x_i - \bar{x})^2 (1-3)^2 (2-3)^2 (3-3)^2 (4-3)^2 (5-3)^2 41014 10)所以[ s_{b_1} \frac{0.966}{\sqrt{10}} \approx 0.3055 ][ t \frac{1.2}{0.3055} \approx 3.93 ]取显著性水平 (\alpha 0.05)自由度 (3)查 (t) 分布表得到 (t_{0.025}(3) 3.182)。因为 (|3.93| 3.182)落在拒绝域所以拒绝 (H_0)认为广告投入对销售额的线性影响显著。这是手算版的完整流程。用软件的话直接看 (p) 值(p 0.05) 就拒绝 (H_0)。做题时有的题目给 (p) 值有的给临界值两种都要会。这里我多说一句显著性检验的结论是存在统计显著的线性关系不是存在因果关系也不是预测一定准。这个表述分清楚简答题能少扣冤枉分。4.4 方差分析表与F检验第八版里的一体两面第八版教材在回归检验后面通常会给一张方差分析表ANOVA把 (SST)、(SSR)、(SSE) 整理成表格然后给出 (F) 统计量[ F \frac{SSR / 1}{SSE / (n-2)} ]在一元回归里有一个很巧的关系(F t^2)。所以 (F) 检验和 (t) 检验的结论一定一致。(F) 检验检验的是整个回归方程是否显著在一元情形下也就是检验 (\beta_1) 是否为0到了多元回归(F) 检验检验的是所有斜率是否同时为0而 (t) 检验看每个斜率各自的显著性两者各有分工。这是后面章节的伏笔也是期末多选题爱考的点。按上面例子算(F 14.4 / (2.8/3) 14.4 / 0.9333 \approx 15.43)。你看 (3.93^2 \approx 15.44)跟 (t) 检验对上了。方差分析表里的显著性F那一列就是 (p) 值。4.5 置信区间估计斜率的区间比点估计更有信息量教材还介绍了回归系数 (\beta_1) 的置信区间[ b_1 \pm t_{\alpha/2}(n-2) \times s_{b_1} ]仍用例子(b_1 1.2)(s_{b_1} \approx 0.3055)(t_{0.025}(3) 3.182)所以 (\beta_1) 的95%置信区间为[ 1.2 \pm 3.182 \times 0.3055 \approx 1.2 \pm 0.972 ]即 ((0.228, 2.172))。解释这个区间时要特别注意不能说(\beta_1) 有95%的概率落在区间里因为 (\beta_1) 是一个固定的未知常数区间才是随样本变化的随机区间。正确的说法是用这种方法构造的区间有95%的概率覆盖未知的总体斜率。考试里如果出辨析题按后面这句答。5. 预测与残差分析模型造好之后怎么用5.1 点预测与区间预测的分工回归方程的用途之一就是给定一个 (x_0) 来预测 (y_0)。点预测最简单把 (x_0) 代进 (\hat{y} b_0 b_1x_0)得到的值就是预测值。但如果想表达不确定性就要算区间。教材区分了两种区间置信区间给定 (x_0) 时预测均值(E(y_0)) 的区间预测区间给定 (x_0) 时预测单个新观测值 (y_0) 的区间。预测区间一定比置信区间宽因为它还要额外承担单个观测值的随机波动。这个区分是高频考点很多同学记反。直观理解就是要预测全班考研同学平时成绩的均值和预测某一个具体同学的成绩后者不确定性大得多。公式这里不展开但你要会看软件输出、会判断题目让你算哪一种。一般题目会说预测销售额的平均值还是预测某一个月销售额前者对应置信区间后者对应预测区间。5.2 残差图回归诊断的起点模型的隐藏毛病残差图一眼就能看出来。以 (x) 为横轴、残差 (e) 为纵轴画散点图你该怎么判断残差随机分布在0上下、没有明显形状理想状态模型基本可用残差随 (x) 变大而发散成漏斗形方差不齐说明同方差假设存疑残差呈现出U形或倒U形线性假设可能有问题可以考虑加 (x^2) 项某个点残差特别大明显远离其他点异常值要检查原始数据是否录入错误。第八版课后题里经常给一张残差图让你判断该模型是否适合继续使用。许多基础薄弱的同学去背图例其实不如学会看形状这个通用思路只要残差还留着可识别的结构就说明模型还没把信息榨干还有改进空间。5.3 外推要克制模型的射程有限一元线性回归最大的使用禁忌就是外推。教材里给出的回归方程通常是在样本观测范围内有效当你把 (x) 取到远离样本区间的地方哪怕预测区间算得出来可信度也已经大幅下降。举一个极限一点例子用成年人身高和体重的数据去预测一个身高250cm的个体预测区间会很宽且几乎没有实际意义因为它默认线性关系在这个极端区域依然成立而人体结构根本不支持这种线性外推。考试里对应的往往是简答题或讨论题问用这个回归模型预测 (x20) 是否合理你要先看样本 (x) 的取值范围。如果样本 (x) 最大只有10那么 (x20) 就是外推要说明不可靠。这类题不考计算考的是对模型使用边界的理解属于会看图就会答的题。6. 课后习题的主要题型与解题套路6.1 高频题型一览根据第八版课后练习的常见设计一元线性回归这一章可以归纳成六大类题型题型典型问法核心工具概念辨析关于 (r)、(R^2)、回归方程的说法哪个正确概念理解计算参数求回归方程、(b_0)、(b_1)公式手算或计算器拟合优度求 (R^2)、(s_e)、(SSE)公式变形显著性检验检验 (\beta_1)、给出 (t) 或 (F) 结论(t) 分布表、方差分析区间估计与预测给定 (x_0) 求预测值或区间置信区间、预测区间公式残差图与判断判断模型是否满足基本假设图形识别期末复习时建议按题型练而不是按题号练。先确保每一种题型都能独立做对一题再去做整套模拟。如果按题号一道一道刷很容易出现一种错觉我都做过了但合上书换个数字还是不会。6.2 一道典型综合题的拆解步骤教材后面经常有一道综合题给出一张数据表要求完成画散点图→求回归方程→求 (R^2) 和 (s_e)→检验斜率显著性→给定 (x_0) 预测。这题分值大但套路固定我建议用五步清单应对先标出 (n)、(\sum x)、(\sum y)、(\sum xy)、(\sum x^2)、(\sum y^2) 这些基础量缺了任何一个后面的公式都推不动手算 (b_1)、(b_0)写出方程并带上单位或文字说明用 (SST SSR SSE) 的关系求 (R^2)如果题目只给 (SSE) 或 (s_e)要通过公式反推做 (t) 检验时先写假设 (H_0) 和 (H_1)再写统计量和自由度最后对照临界值或 (p) 值下结论预测题看清是均值还是单个值选择对应的区间公式。我在批改作业时最常见的丢分点有两个一是 (t) 检验只算数字不写 (H_0/H_1)判卷时过程分被扣掉一截二是预测区间题不写 (s_e) 的公式直接抄软件输出。统计课说到底在练有逻辑地说明的能力过程比结果重要。6.3 手算结果与软件输出不一致时怎么办因为Excel默认保留位数和四舍五入的时机不同手算出来的 (b_0)、(b_1) 和软件输出可能会在小数点后一两位有差别这是正常现象。比如上面例题手算时把 (s_e) 保留到0.966那么 (s_{b_1} \approx 0.3055)(t \approx 3.93)软件用全精度计算可能输出 (t 3.928) 或 (3.932)。做题时只要统一保留到两位或三位小数结论通常一致。如果偏差较大先按这个顺序排查(\sum xy) 有没有算错(x) 和 (y) 有没有填反计算器清零了没有多数问题都出在这三处。如果题目给的是Excel输出片段让你填表里的缺失值要会用关系式反推。比如给了 (SST17.2)、(SSR14.4)那么 (SSE) 就是 (17.2-14.42.8)给了 (s_e0.966) 和 (SSE2.8)那么自由度 (n-2) 就得等于3即 (n5)。这些是选择题常藏的小机关熟练之后一眼能看破。6.4 复习顺序与心态建议最后聊一点经验层面的东西。第十一章在第八版里的位置前面是假设检验后面是多元回归。它实际上起着把散点连成线的承上启下作用均值比较、方差分析在一定条件下都可以看成回归的特例。复习时不要死记公式先把总平方和被分解成回归平方和与残差平方和这条主线抓住再往上面挂 (t) 检验、(F) 检验、区间估计这些枝节知识才容易长成一棵树而不是一堆散落的树叶。做课后题时建议每做完一道就回头问自己三个问题这个统计量回答什么问题它的自由度为什么是这个数它和前面哪个章节的知识点有联系这三个问题能答上来你掌握的就不是一堆公式而是一个能迁移的分析框架。至少在我接触的学生里能用这个方式复习的人期末成绩普遍比只刷题的人高一个档次。7. 我在教学和做题中反复遇到的那些坑前面每一章都穿插了易错点但最后我还是想集中写几个出现频率最高的错误因为它们不止一次出现在考卷上也出现在真实的数据分析里。第一个坑是符号混淆。(SST)、(SSR)、(SSE) 三个缩写很多同学一开始会颠倒 (SSR) 和 (SSE)导致 (R^2 SSR/SST) 算出来大于1或者出现负数。我建议你用名称记忆(SST) 是总离差平方和Total(SSR) 是回归平方和Regression(SSE) 是残差平方和Error。(R^2) 等于被回归解释的部分除以总变化分母是 (SST)分子是 (SSR)不是 (SSE)。第二个坑是单尾还是双尾。对 (\beta_1) 做显著性检验除非题目明确说明是否大于0或是否小于0一般都用双侧检验对应符号是 (\ne)。手算查表的时候(\alpha0.05) 的双侧检验要查 (t_{0.025})不是 (t_{0.05})。很多人栽在这个查表的小细节上。第三个坑是预测和估计混为一谈。题目问求当 (x4) 时销售额的95%置信区间还是95%预测区间这两种区间宽度不同、含义不同、公式也不同。拿不准的时候回到定义区间是关于均值还是关于新个体前者窄后者宽。第四个坑是样本量太小还非要外推结论。我见过不少同学用4个点拟合一条回归线然后断言斜率显著这基本是胡来。自由度只有 (4-22)就算 (R^2) 算出来很高也说明不了多少问题。在真实分析里样本量至少要有10组以上才勉强能看超过30组才比较稳妥。这一点教材没有刻意强调但实际做题和做项目都很重要。最后说一个我个人的习惯每做完一道回归题我会顺手把散点图和残差图都画出来哪怕题目不要求。因为很多错误比如数据录入反了、有个点录成小数点了只有看图才能最快发现。这不是浪费时间的强迫症而是统计分析里最省时间的做法。统计这东西和骑自行车一样——你在岸边看再多的游泳教程不下去游一趟永远学不会。找两三道典型题把计算器按明白把图看清楚比盯着参考答案看十遍都管用。一元线性回归作为全书承上启下的一章你把它吃透了后面学多元回归、时间序列、方差分析都会顺畅很多。
返回列表