ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

多维随机变量:联合、边缘、条件分布全解析

多维随机变量:联合、边缘、条件分布全解析 概率论的第四章经常是很多人第一次产生“我可能不适合学数学”念头的地方。前面单随机变量部分分布律、密度、期望、方差来来回回就那么几个套路做两道课后题就熟了。可一进入多维随机变量联合、边缘、条件三个词同时出现符号下标一多脑子容易乱。我自己当初在这章也绕了很久后来才慢慢总结出一条主线多个变量一起出现我们得先有“联合”描述只看其中一个变量就得从联合里做“边缘”已经知道其中一个变量的取值再来推断另一个就要用“条件”。这条主线能竖起来整章基本就通了。如果你正在学《概率论与数理统计》或者准备考研又或者刚进入数据分析领域想补数学基础下面这套内容可以直接帮上忙。往浅了说它可以当一份听课笔记往深了说贝叶斯分类、隐变量模型、以及带相关性的随机模拟底层都是这一章的思维方式。我尽量用最朴素的话把概念讲透最后再给一道完整例题带你把所有公式跑一遍。1. 多维随机变量到底在研究什么1.1 一张分布表不够关系才是重点单随机变量 $X$描述的是一个数在实数轴上怎么分布。但现实里很多事情不止一个维度。一个人有身高、体重、年龄一笔订单有金额、时间、地域一只股票有收益率和波动率。如果你想分析“身高偏高的人体重一般落在哪里”或者“年龄越大某类消费占比是不是越高”单看各自的分布是回答不了的。这就是为什么要引入多维随机变量它不是几张单变量分表的并列而是一张记录了变量之间联动关系的整体分布。多维随机变量最常见的入门形态是二维即 $(X,Y)$。你可以把二维随机变量想成在平面上撒点每个点代表一次观测点的疏密反映联合概率的大小。如果两个点云在平面上呈斜着的椭圆说明两个变量强相关如果是均匀散点则关系弱。后面所有公式本质上都是在把这种图景换成数字表达。1.2 用成绩表做全章例子为了不在抽象符号里打转我们固定一个离散例子。某班100人的语文成绩 $X$ 和数学成绩 $Y$ 都只取60、70、80三档交叉统计后得到联合概率表表中数值等于人数除以100。$X\backslash Y$607080$P_X$600.050.100.050.20700.100.250.150.50800.050.150.100.30$P_Y$0.200.500.301这张表先收好后面每一节都会用到它。注意表里每个格子是一个联合概率表示语文和数学同时取某个组合的概率最右边列合计和最下边行合计单独看就是单科的概率分布。你可能会问为什么要把行列合计单独提出来因为它们正是后面要讲的边缘分布。先把表放这儿我们往下看。2. 联合分布把“一起发生”的概率写出来2.1 离散型联合分布列与归一化离散型二维随机变量核心对象是联合分布列$$P(Xx_i,Yy_j)p_{ij}$$它要满足两条铁律每条 $p_{ij}\ge 0$所有格子的和是1。这两条和单变量分布律一样只是下标从一维变成二维。用成绩表验证最小格是0.05最大格0.25全表相加恰好是1.00。这里说一个很多初学者会忽略的点联合分布列不仅告诉你怎么求和还决定了两个变量之间能不能“拆开”。比如表中格 $(70,70)$ 是0.25而语文60和数学80同时发生的概率只有0.05这个差异本身就是相关性的体现。如果两张成绩表各自都及格、平均分都差不多但联合概率分布完全不同那它们描述的“两科关联结构”就是完全不同的两回事。所以在离散世界里拿到一张联合分布表第一件事不是盯着某个格子看而是看整个表的形状概率是不是集中在某条对角线附近是不是某一列特别高这些信息单看行和列是看不见的。2.2 连续型联合概率密度与二重积分连续型变量不能逐点定义概率所以改用概率密度函数。二维联合密度 $f(x,y)$ 可以类比成一块不均匀木板的面密度在一小块区域 $\Delta x\Delta y$ 上概率近似是 $f(x,y)\Delta x\Delta y$更准确地说事件落入区域 $D$ 的概率是二重积分$$\int\int_D f(x,y),dxdy$$密度函数值本身不是概率可能大于1就像面密度可以和厚度无关。比如密度在一个点等于100但只要面积足够小概率照样是个小数。这是很多人的第一个认知坎。做题时遇到 $P(X1,Y2)$ 就是算区域在半平面下的积分遇到整个样本空间积分必须等于1。以后凡是看到“密度”请自动想到积分而不是某点取值。还有一个容易忽略的细节联合密度的支撑区域不一定是矩形。很多题的密度表达式很简单但定义域是一个三角形、一个圆域甚至一条带状的区域。定义域变了积分上下限就全变了。所以做连续型题目第一步永远是画图第二步才是写积分。2.3 联合分布函数是从零开始的累积与一维类似联合分布函数定义是$$F(x,y)P(X\le x,Y\le y)$$几何含义是以 $(x,y)$ 为右上角的左下矩形这块区域内的全部概率。它有四个基本性质对 $x$ 或 $y$ 单调不减关于每个变量右连续当其中一个趋于 $-\infty$ 时极限为0当 $x$ 和 $y$ 同时趋于 $\infty$ 时极限为1。这些性质看起来枯燥但考试里最喜欢考“以下哪个 $F(x,y)$ 可以作为联合分布函数”的判断题。连续型中联合密度和分布函数互为正逆运算$$F(x,y)\int_{-\infty}^x\int_{-\infty}^y f(u,v),dvdu$$反过来$$f(x,y)\frac{\partial^2F(x,y)}{\partial x\partial y}$$值得注意的是分布函数可以直接通向边缘令 $y$ 趋于正无穷$F(x,\infty)$ 就是 $X$ 的边缘分布函数。这个关系是下一节入口也是很多学生到期末都没注意到的捷径。3. 边缘分布单独看一个变量怎么算3.1 离散型边缘分布一行或一列的和边缘分布就是只关心一个变量不管另一个变量取什么值。公式是$$P_X(x_i)\sum_j P(Xx_i,Yy_j)$$也就是把联合分布列按行相加。成绩表里语文成绩 $X70$ 的概率就是第二行求和$0.100.250.150.50$。同理数学 $Y70$ 的概率是第二列求和也是 $0.50$。这个细节说明从联合表到边缘表本质是一个“降维”过程——把一个二维表压成两个一维表分别保留行列信息。需要注意边缘分布已经丢掉联合表中的大部分信息。它回答的问题是“这门课的整体分布如何”但回答不了“语文和数学成绩之间有没有关系”。换句话说边缘分布就像你把全班同学的语文成绩单独拉出来画直方图这时候你已经看不到谁和谁配对也看不到某一科高的人另一科是不是也高。3.2 连续型边缘密度积分掉另一个变量连续型和离散型一一对应只是把求和换成积分。给定联合密度 $f(x,y)$$X$ 的边缘密度是$$f_X(x)\int_{-\infty}^{\infty} f(x,y),dy$$$Y$ 的边缘密度类似。以木板面密度类比边缘密度相当于把某一行宽度上的概率“压扁”累积到 $X$ 这条轴上。这时 $x$ 是固定的$y$ 被积分掉。这里最容易出错的是积分上下限。如果联合密度只在某个区域内非零积分范围不能永远写正负无穷而必须先画出支撑区域找出在给定 $x$ 时 $y$ 的取值范围。后面第6节会用整个题演示。另外边缘密度算完自己先验证归一化$$\int f_X(x),dx1$$如果不等于1多半是区域定错了或者常数没求对。3.3 边缘相同不等于联合相同很多人会有个直觉边缘分布都算出来了联合分布是不是也能拼回来答案是否定的。举个离散反例。两个不同的联合表可以拥有完全相同的边缘分布第一个表四个格子的概率是 $0.1,0.4,0.4,0.1$第二个表是 $0.3,0.2,0.2,0.3$。它们的行和、列和均为 $0.5$但联合表完全不同一个趋于负相关一个趋于正相关可边缘分布一模一样。这说明边缘分布只保留了单变量信息丢失了变量间的关联。所以在实际数据分析里不要一上来就只汇报均值、方差、单变量直方图变量之间的关系至少要画个散点图或算个相关系数。这个道理放到考研上就是为什么题目总是让你“先求联合再算边缘”而不是反过来。4. 条件分布知道一部分信息之后再预测另一部分4.1 离散条件分布固定条件后重新归一化条件分布回答的是已知一个变量的取值另一个变量的概率怎么变。离散情形直接套条件概率公式$$P(Yy_j \mid Xx_i)\frac{P(Xx_i,Yy_j)}{P(Xx_i)}$$分母是边缘概率要求大于0。用成绩表算一下。已知语文 $X60$则数学的条件分布为60分概率 $0.05/0.200.25$70分概率 $0.10/0.200.50$80分概率 $0.05/0.200.25$。已知 $X80$ 时条件分布约是 $0.167$、$0.5$、$0.333$。这两个条件分布和数学的边缘分布 $0.20,0.50,0.30$ 都不一样说明知道语文成绩后对数学成绩的预期应该调整。真正要注意的是条件分布本质仍然是个概率分布每一行的条件概率之和必须等于1。如果一个条件分布求和不等于1肯定是分母选错了。另一个容易混淆的点是条件分布可以有很多个给定 $X60$ 是一条分布给定 $X70$ 是另一条分布给定 $X80$ 又是第三条。它们的形状可能完全不同这才体现了“条件改变判断”的意义。4.2 连续条件密度切一刀再把截面变成密度连续型不能直接写 $P(Yy \mid Xx)$因为事件 $Xx$ 的概率是0。但我们可以定义条件密度$$f_{Y|X}(y \mid x)\frac{f(x,y)}{f_X(x)}$$要求 $f_X(x)0$。直观理解非常有用三维曲面在 $x$ 处切一刀得到一条截面线这条截面线的形状就是条件密度的大致轮廓但截面线本身积分不一定为1。为了让它能当概率密度用必须除以边缘密度 $f_X(x)$ 做归一化。所以条件密度等于切片的形状边缘密度等于切片对应的总量。这个视角也说明给定不同的 $x$会得到一簇不同的条件密度。它们不是同一条曲线而是随 $x$ 连续变化的切面。很多教材在这个地方直接给公式不讲图像于是学生容易把 $f_{Y|X}(y\mid x)$ 和联合密度 $f(x,y)$ 搞混。你只要记住“切片再归一化”后面再用这个公式就不容易错。4.3 条件概率的连续版本怎么用有了条件密度给定 $Xx$ 后求 $Y$ 落在某一区间的概率就是$$P(Y\in A \mid Xx)\int_A f_{Y|X}(y \mid x),dy$$很多学生卡在“为什么事件概率为0还能用”。你不妨把 $Xx$ 理解成一个固定的观测结果先测到 $X$ 的值然后在这个值附近取一个无穷小的邻域对事件在邻域内取极限。概率论教材把这个叫正则条件分布入门阶段不需要深究只要记住公式和几何意义即可。实际计算中条件密度和联合密度的定义域必须一起处理。比如区域是 $0xy1$给定 $x$ 时$y$ 只能在 $(x,1)$ 内取值条件密度的完整写法要带上这个范围。忽略定义域是这一节扣分最凶的地方。我见过太多人把条件密度算出来却没有写范围结果求概率时积分区间乱了白白丢分。5. 联合、边缘、条件如何互通独立性卡在哪里5.1 乘法公式联合分布可以由边缘和条件拼出来把边缘公式和条件公式反着用就得到乘法公式。离散型是$$P(Xx_i,Yy_j)P_X(x_i),P(Yy_j \mid Xx_i)$$连续型是$$f(x,y)f_X(x),f_{Y|X}(y \mid x)$$也可以写成 $f(x,y)f_Y(y),f_{X|Y}(x \mid y)$。这条公式不是装饰品。贝叶斯公式里$P(A \mid B)P(A)P(B \mid A)/P(B)$本质上就是由先验边缘和似然条件拼出联合再归一化得到后验条件。机器学习里的朴素贝叶斯、概率图模型也都是把联合分布拆成一系列边缘和条件的乘积来建模。所以第五章也好后面的统计推断也好都要反复回到这个三角关系。这个“三角关系”最大的用处是你不需要同时存两个方向的条件。只要知道 $X$ 的边缘分布和给定 $X$ 时 $Y$ 的条件分布联合分布就完整确定了想算给定 $Y$ 时 $X$ 的条件分布直接用乘法公式和贝叶斯公式导出即可不需要额外记太多模型。5.2 独立性不是“看起来像”而是所有格子都满足乘积如果 $X$ 和 $Y$ 独立联合分布应该等于边缘分布的乘积。离散型要求对所有 $i,j$ 都有$$p_{ij}P_X(x_i)P_Y(y_j)$$连续型要求$$f(x,y)f_X(x)f_Y(y)$$几乎处处成立。回到成绩表验证$X60$ 的边缘 $0.20$$Y60$ 的边缘 $0.20$乘积 $0.04$但联合格是 $0.05$不等因此语文和数学成绩不独立。虽然格 $(70,70)$ 中 $0.25$ 恰好等于 $0.5\times0.5$但独立性要求所有格子都满足一个格子不能代表一切。这里再提醒一次不要从“某个条件分布恰好等于边缘分布”推出独立。刚才算过$X70$ 那一行的条件分布恰好与 $Y$ 的边缘分布相同但整体仍然不独立。独立必须是一个全局性质要有证据说明“无论怎么组合联合都等于边缘乘积”。考试里常见错误就是看见某个数字相等立刻写“独立”这是要扣分的。5.3 不相关和独立别混为一谈独立性比不相关强得多。若 $X,Y$ 独立则它们的协方差为0所以不相关但不相关只是 $E[XY]E[X]E[Y]$完全可以是某种非线性关系。经典例子$X$ 在 $[-1,1]$ 上均匀分布$YX^2$。算一下$E[X]0$$E[XY]E[X^3]0$因此协方差为0但 $Y$ 和 $X$ 明显不独立因为 $Y$ 完全由 $X$ 决定。只有在二维正态分布里不相关和独立是等价的这是正态家族的特权。其他地方看到题干说“协方差为0”只能说明没有线性关系不能直接说独立。还有一类错法是看见联合密度函数能分离成只含 $x$ 的式子乘只含 $y$ 的式子就以为独立。别忘了同时检查定义域是不是矩形。第6节的例题就是这种陷阱。6. 连续型完整实战一道题打通三个概念6.1 题目三角形区域上的联合密度纸上得来终觉浅。我们把所有概念串起来做一道非常典型的考研题。设 $(X,Y)$ 的联合概率密度为$$f(x,y)kxy$$定义在区域 $0xy1$ 上。先做最重要的一件事画区域。区域 $D$ 是单位正方形里直线 $yx$ 以上、$y1$ 以下的部分也就是一个三角形。后面每个积分上下限都来自这张图。很多同学一上来就挑式子里的 $0x1,0y1$以为是个矩形后面全错。联合密度的定义域决定了一切先画图再算积分顺序不能乱。6.2 求常数、边缘密度、条件密度一步步来第一步定常数 $k$。利用全空间积分等于1$$\int_0^1\int_0^y kxy,dx,dy1$$先对 $x$ 积分$$\int_0^y kxy,dx \frac{ky^2}{2}$$再对 $y$ 积分$$\int_0^1 \frac{ky^3}{2},dy \frac{k}{8}$$所以 $k8$。这里用先 $x$ 后 $y$ 的积分顺序最方便因为给定 $y$ 时 $x$ 从 $0$ 变到 $y$。第二步算边缘密度。$X$ 的边缘密度要把 $y$ 积分掉$y$ 取值范围是 $x$ 到 $1$$$f_X(x)\int_x^1 8xy,dy4x(1-x^2),\quad 0x1$$$Y$ 的边缘密度要把 $x$ 积分掉$x$ 取值范围是 $0$ 到 $y$$$f_Y(y)\int_0^y 8xy,dx4y^3,\quad 0y1$$随手验证$$\int_0^1 4x(1-x^2)dx4\left(\frac12-\frac14\right)1$$$$\int_0^1 4y^3dy1$$两个边缘各自归一化说明常数没求错。第三步算条件密度。给定 $Xx$ 时 $Y$ 的条件密度$$f_{Y|X}(y \mid x)\frac{8xy}{4x(1-x^2)}\frac{2y}{1-x^2}$$条件定义域是 $xy1$。给定 $Yy$ 时 $X$ 的条件密度$$f_{X|Y}(x \mid y)\frac{8xy}{4y^3}\frac{2x}{y^2}$$条件定义域是 $0xy$。注意两个条件密度都依赖另一个参数。若给定 $Y0.5$$X$ 的条件密度是 $f_{X|Y}2x/0.258x$$x\in(0,0.5)$积分等于1若给定 $Y0.8$则是 $2x/0.643.125x$$x\in(0,0.8)$。条件不同密度形状完全不同。6.3 这道题最容易踩的三个坑第一个坑积分区域。如果在定 $k$ 时写成矩形 $0x1,0y1$会算出 $k4$整题全错。正确思路永远是从区域图出发对每个外层变量找到内层变量的上下限。第二个坑条件密度的定义域。求完 $f_{Y|X}(y \mid x)$很多人不写 $xy1$于是求某个区间概率时积分区域不对。比如算 $P(Y0.5\mid X0.2)$正确积分区间是 $(0.5,1)$但如果以为 $y$ 可以从 $0$ 到 $1$结果就会偏大。第三个坑判断独立。$f(x,y)8xy$ 看起来能拆成 $8x$ 乘 $y$但定义域是三角形$X$ 的取值范围受 $Y$ 影响边缘乘积 $4x(1-x^2)\cdot4y^3$ 和联合密度也不相等。所以两者不独立。这正好呼应了前面说的表达式可分离不等于随机变量独立。7. 高频错误速查与自学建议7.1 我见过太多次的错误整理成一张表错误点错误做法正确做法把密度值当概率直接说 $f(1,2)0.3$所以概率是0.3连续型必须通过积分求区域概率边缘积分上下限写错不看支撑区域一律写 $-\infty$ 到 $\infty$先画区域再按变量取值范围分段条件密度分母选错用联合密度除以一个常数分母必须是边缘密度且边缘密度大于0看见变量分离就判独立$f(x,y)g(x)h(y)$所以独立还要定义域是矩形且不随另一个变量变化算完不验证归一化直接交卷时刻检查分布律或密度积分是否为1这些错误不是学生不够努力而是概念“形状”没立起来。联合密度是一张曲面边缘密度是曲面的投影条件密度是曲面的切片。一旦脑子里有了这三个图像上面的错误大多可以避开。7.2 这套内容怎么学才不容易忘如果是自学或备考我建议的顺序是先用离散成绩表把联合、边缘、条件三件事各滚一遍确保能从表格算出来再看连续型时把离散公式和连续公式对照写把“求和”和“积分”放在同一行看最后再用第6节这类综合题查验。不要一上来就背公式公式太多会晕。做题流程固定下来第一步画联合密度非零区域第二步确定边缘积分对哪个变量积范围是什么第三步算条件密度前先确认边缘密度在条件取值处不为0第四步算完检查归一化。这套流程能覆盖绝大多数考试题。概率统计不是靠灵感是靠一套稳定动作。最后说点我自己的经验。我当年学这一章觉得最难的不是公式而是分不清该用哪个密度。后来我用一句话给自己做导航联合是“源头数据”边缘是“投影”条件是“按已知信息切片”。做题时先问自己想算什么再选对应工具。这个习惯帮我撑过了后续的方差分析、回归推导和贝叶斯统计。你要是现在还在为第四章头疼不妨也试着把符号翻译成画面把每个公式落在那个成绩表上看一眼。等你真的想通联合、边缘、条件三者之间是怎么互相换算的这门课的根基就稳了。
返回列表