ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Steve Brunton | Probability Bootcamp | 笔记 | 第四部分:高级统计 | Lecture 36 | 中心极限定理

Steve Brunton | Probability Bootcamp | 笔记 | 第四部分:高级统计 | Lecture 36 | 中心极限定理

目录

    • 前言
    • 1. 引言
    • 2. CLT 陈述(样本均值形式)
    • 3. CLT 证明(概略)
    • 4. CLT 陈述(变量和形式)
    • 5. 结语
    • 结语
    • 参考

前言

学习 Steven Brunton 讲授的概率与统计入门概述视频,本篇文章记录第三十六讲:中心极限定理,记录下个人学习笔记,和大家一起分享交流😄

video:https://www.youtube.com/playlist?list=PLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V

1. 引言

OK,今天我将为大家阐述概率论与统计学中最重要的定理之一 — 中心极限定理。

上节课我们讨论了大数定律,并利用切比雪夫不等式完成了证明,这是一个非常直观的结论:当我们从n nn个相互独立且同分布的随机变量X 1 X_1X1X n X_nXn中获取数据时,这些数据可以来自n nn次抛硬币、掷骰子,或是n nn份调查问卷,你可以收集n nn个人的各类数据,比如n nn个人的身高,这并不重要,这是从总体中抽取的n nn个独立随机变量,那么样本均值X ˉ \bar{X}Xˉ实际上就是这些数值的平均值。

当样本数量趋近于无穷大时,这n nn个样本的算术平均值将收敛于它们所属分布的期望值,这个结论非常直观,我们直觉上就能理解这个结论的合理性,当我从独立同分布(IID)的随机变量中收集越来越多的数据并计算其平均值时,该平均值将收敛于该分布的期望值。

而中心极限定理的适用范围更广,这个定理具有更强的普适性,在实际应用中也更为实用,其核心思想一以贯之,且更进一步。大数定律指出,样本均值X ˉ \bar{X}Xˉ会收敛于总体均值μ \muμ,而中心极限定理则更进一步,X ˉ \bar{X}Xˉ服从正态分布,其方差和均值均可通过计算得出。

2. CLT 陈述(样本均值形式)

接下来我来说明中心极限定理的核心表述,中心极限定理的基本前提假设与此前相同,我们设有n nn个独立同分布的随机变量,样本均值X ˉ \bar{X}Xˉ的计算公式为:

X ˉ = 1 n ∑ i = 1 n X i \bar{X} = \frac{1}{n} \sum_{i=1}^n X_iXˉ=n1i=1nXi

即对全部n nn次独立试验结果取算术平均。

这其实就是我所有数据的平均值,这将是一个服从正态分布的随机变量,该分布服从均值为μ \muμ,方差为σ 2 n \frac{\sigma^2}{n}nσ2的正态分布,即:

X ˉ ∼ N ( μ , σ 2 n ) \bar{X} \sim \mathcal{N}(\mu, \frac{\sigma^2}{n})XˉN(μ,nσ2)

这意味着其标准差(SD)为σ n \frac{\sigma}{\sqrt{n}}nσ,这样理解起来应该会更顺畅些,这意味着样本均值不仅会收敛于分布期望值μ \muμ,而且随着样本量n nn的增大,样本均值的分布会逐渐趋近于高斯随机变量,即呈现正态分布的特征。

当处理实际数据时,这能为我们提供关于样本均值估计精度的非常可靠的衡量标准,这一点至关重要。例如,当你尝试测量某个物理量,比如光速或是电子的质量这类难以精确测量的物理量时,你可能会进行约 30 次随机试验,在这 30 次不同的测量中,测得的光速或电子质量数值都会存在细微差异。

这意味着,无论这些随机变量原本服从何种分布 — 可能是均匀分布、指数分布或泊松分布等,只要将它们相加并计算平均值,这个平均值就会逐渐趋近于高斯分布,其均值等于原始分布的实际均值,而标准差随着试验次数的增加不断减小。

这一发现对实验误差建模具有深远意义,如何通过小样本均值推理总体特征,这正是中心极限定理的核心价值,该定理作为概率论与统计学中最重要的理论之一,揭示了样本均值与总体参数之间的内在联系,这正是通过样本均值表述该定理的一种方式,其理论基础正是我们先前讨论的大数定律。

我们很快将通过数值实验来验证这个结论,我们将通过实际计算来观察当n nn增大时该统计量的变化规律,我们将通过大量重复实验来验证这一规律。我们将以n = 100 n=100n=100为例,计算这些统计量的数值序列,接下来我们将这个实验重复进行约 50 次,从而观察该分布的期望方差特性。

我们将通过计算机模拟展示其收敛于正态分布的过程,并运用矩生成函数对此结论进行严格证明。这个定理的证明过程颇具挑战性,需要些时间来逐步构建证明所需的数学框架,这个证明过程虽然很有意思,但并非理解的关键。

3. CLT 证明(概略)

如果你愿意相信这个结论,并且能够掌握如何运用它,那么不一定要深究证明过程,不过这个证明确实很有意思,我稍后会为大家讲解,其基本思路建立在矩生成函数的基础上。

简单来说,矩生成函数与概率密度函数的拉普拉斯变换密切相关(相差一个符号),对于随机变量之和的矩生成函数(记作m ( t ) m(t)m(t))在给定概率分布或概率密度函数P ( x ) P(x)P(x)的情况下,若存在一组随机变量之和 — 此处的样本均值X ˉ \bar{X}Xˉ本质上就是一系列随机变量的加权和 — 则该总和的矩生成函数等于各独立试验个体矩生成函数的乘积。

因此我们将通过已知变量的矩生成函数,来逼近目标变量的矩生成函数,我们将证明这类聚合矩生成函数会收敛于正态分布的矩生成函数,后续内容敬请期待,以上就是我们运用矩生成函数的核心思路概览。

这种方法能清晰地展示该概率密度函数如何收敛至目标概率密度函数,严格来说,是前者的累积分布函数会收敛至后者的累积分布函数,我们将借助矩生成函数来证明这一结论。这个思路确实非常精妙,这虽然是个进阶课题,但我很期待尽快为大家讲解。

下面是关于样本均值的表述方式:

X ˉ = 1 n ∑ i = 1 n X i \bar{X} = \frac{1}{n} \sum_{i=1}^n X_iXˉ=n1i=1nXi

我特意这样书写是为了与大数定律建立关联。

4. CLT 陈述(变量和形式)

另一种表述方法是:将所有变量之和记作S n S_nSn

S n = ∑ k = 1 n X k S_n = \sum_{k=1}^n X_kSn=k=1nXk

这里我没有除以n nn求平均值,而是直接将这些随机变量全部相加。

我们也可以说这个总和S n S_nSn服从正态分布,是一个正态随机变量,其均值为n μ n\munμ,方差为n σ 2 n\sigma^2nσ2,即:

S n ∼ N ( n μ , n σ 2 ) S_n \sim \mathcal{N}(n \mu, n\sigma^2)SnN(nμ,nσ2)

因此这两种表述本质上是完全等价的,但有时你会看到中心极限定理直接表述为这些变量之和的分布形式。

从样本均值的分布角度来理解会更有意义,因为这有助于我们理解实验误差和实验设计,我们需要多大的样本?如果我们希望方差小于某个特定值,是否需要这样做?这其中蕴含着诸多有趣的规律,我得做多大规模的采样调查,才能准确预测选举结果?诸如此类的问题,这些概念在此至关重要,这一切都与中心极限定理中的n nnσ 2 n \frac{\sigma^2}{n}nσ2相关。

5. 结语

现在我要再次强调这个极其深刻的原理,因为它确实意义深远,无论X i X_iXi服从何种分布,只要这些变量满足独立同分布,且具有相同均值与方差,无论其具体分布形态如何都无关紧要,由此可以得出关于中心极限定理的一个非常强大的结论。

OK,我想重点说明的是:这本质上是对大数定律的重要拓展,大数定律表明,随着样本量n → ∞ n \rightarrow \inftyn,样本均值会收敛于总体均值μ \muμ,且方差会不断减小。

而中心极限定理的表述则更为深刻,它指出该变量会逐渐趋近于服从正态分布,其分布呈现出特定形态,我们都能通过其均值和方差精确计算出该分布的均值与方差,无论这些独立随机变量原本服从何种分布。

这真是个深刻而令人意外的结论,堪称概率论与统计学的基石,在进行假设检验和实验设计时,这个定理将成为我们不可或缺的工具。无论是置信区间构建,还是任何基于数据做出统计推理的场景,这个定理都发挥着根本性作用。

结语

中心极限定理(CLT)是整个概率论短期课程的终极结论,也是 L33–L36 不等式与极限定理链条的顶点。LLN 告诉我们样本均值X ˉ n \bar{X}_nXˉn收敛到μ \muμ,CLT 则进一步揭示了如何收敛X ˉ n ∼ N ( μ , σ 2 n ) \bar{X}_n \sim \mathcal{N}(\mu, \frac{\sigma^2}{n})XˉnN(μ,nσ2),即样本均值的分布在大n nn下趋近于以μ \muμ为中心、以σ / n \sigma/\sqrt{n}σ/n为标准差的正态分布。这一结论的普适性令人震撼:无论原始X i X_iXi来自何种分布—均匀、指数、泊松、伯努利,甚至任何怪异形状—只要独立同分布且具有有限方差,它们的均值就必然服从正态。这不是某个特定分布的偶然性质,而是加法本身的深层数学结构

等价地,以总和形式陈述:S n = ∑ X i ∼ N ( n μ , n σ 2 ) S_n = \sum X_i \sim \mathcal{N}(n\mu, n\sigma^2)Sn=XiN(nμ,nσ2)。两种陈述之间的转换只需乘以或除以n nnn 2 n^2n2,但样本均值形式在实践中更为常用:σ / n \sigma/\sqrt{n}σ/n直接给出了 “估计精度如何随样本量提升” 的答案—精度以n \sqrt{n}n而非n nn的速率提高(样本量翻倍,标准误仅减小约 30%)。这对实验设计有直接的工程含义:若想将估计精度提高一位小数,需要100 × 100\times100×的样本量。

证明方面,Brunton 勾勒了矩生成函数(MGF)的核心思路:独立和⇒ \RightarrowMGF 相乘,标准化后的 MGF→ n → ∞ e t 2 / 2 \xrightarrow{n\to\infty} e^{t^2/2}net2/2(标准正态的 MGF),MGF 的逐点收敛等价于分布的收敛。这一证明思路将拉普拉斯变换、特征函数与极限理论串联在一起,属于概率论 “优雅证明” 的殿堂级展示。

CLT 的现实意义贯穿整个统计推断体系:置信区间的构建假设样本均值近似正态,假设检验p pp值计算依赖正态尾概率,选举民调的误差范围(margin of error)是± 1.96 ⋅ σ / n \pm 1.96 \cdot \sigma/\sqrt{n}±1.96σ/n蒙特卡洛方法的收敛速率由 CLT 保证。从测量光速的物理实验到预测选情的统计模型,CLT 是所有这些实践背后的 “隐形操作系统”—它解释了为什么在充满复杂与混沌的世界里,钟形曲线依然无处不在 🤗。

参考

  • https://www.youtube.com/playlist?list=PLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V
返回列表