ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

Steve Brunton | Probability Bootcamp | 笔记 | 第三部分:高级概率 | Lecture 27 | 联合概率分布:边缘密度与条件密度

Steve Brunton | Probability Bootcamp | 笔记 | 第三部分:高级概率 | Lecture 27 | 联合概率分布:边缘密度与条件密度

目录

    • 前言
    • 1. 引言
    • 2. 定义边缘密度
    • 3. 练习:计算边缘分布
    • 4. 联合分布中的条件概率
    • 5. 结语
    • 结语
    • 参考

前言

学习 Steven Brunton 讲授的概率与统计入门概述视频,本篇文章记录第二十七讲:联合概率分布:边缘密度与条件密度,记录下个人学习笔记,和大家一起分享交流😄

video:https://www.youtube.com/playlist?list=PLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V

1. 引言

在上节课中,我们介绍了两个随机变量X XXY YY之间的联合概率分布概念,本质上,我们可以定义X XXY YY同时发生的概率:

P ( x , y ) = P ( X = x , Y = y ) P(x,y)=P(X=x,Y=y)P(x,y)=P(X=x,Y=y)

这类似于我们之前讨论的X XXY YY同时发生的概率,这是从条件概率中推导出来的,这一概念将帮助我们利用联合分布来计算条件密度和所谓的边缘密度,因此这些是必须掌握的重要概念。

我之所以特别喜欢本科高年级的概率统计课程,是因为它能让你真正运用微积分,因此微积分是处理概率这类函数的强大工具,边缘密度与条件密度本质上是通过对联合分布进行巧妙的微积分运算而得到的,这与先前讨论的条件概率概念密切相关,这些概念正是我们推导贝叶斯定理等理论的基础工具。

我们已经知道存在这样的联合分布:在x xxy yy轴上呈二维对称的高斯分布,其中每个随机变量X XXY YY本身都服从高斯分布。

之前我曾提到过,若对这个二维高斯概率密度函数中的X XX变量进行积分平均就会得到Y YY的高斯分布;同理,对Y YY变量的积分平均则会得到X XX的高斯分布。

2. 定义边缘密度

现在我将对此进行形式化表述,这些被称为边缘密度函数。对于连续型随机变量X XXY YY,其概率密度函数由二元函数f ( x , y ) f(x,y)f(x,y)给出,通过对该函数在任意二维区域上进行双重积分,即可计算随机变量( X , Y ) (X,Y)(X,Y)落在该区域的概率。

边缘(边际)密度的定义如下:我们常在经济学和统计学中听到 “边际” 这个概念,边缘密度本质上允许我通过f ( x , y ) f(x,y)f(x,y)这个联合概率密度函数,推导出关于X XXY YY各自的概率密度函数。

通过联合概率密度函数,我能够对Y YY变量进行积分平均,从而得到仅关于X XX的概率密度函数,因此,我可以得到仅关于变量X XX的边缘密度函数f X ( x ) f_X(x)fX(x)

f X ( x ) = ∫ − ∞ ∞ f ( x , y ) d y f_X(x) = \int_{- \infty}^{\infty} f(x,y)dyfX(x)=f(x,y)dy

这正是通过对联合分布中的Y YY变量进行积分所得到的结果,简单来说,我想知道忽略Y YY的具体取值,X XX本身的分布是怎样的?Y YY可以取所有这些可能的值,我将对Y YY方向上所有可能事件的概率进行积分,从而消除Y YY这个变量,这就是边缘化。

这个定义确实非常简单明了:本质上就是通过对变量Y YY进行积分,从而得到仅与变量X XX相关的函数。

同样地,大致来说,我们记得全概率定律的核心思想是:所有可能情况的总概率必须等于 1。随机变量Y YY必须取到其可能取值范围中的某个值,因此,当我将所有可能的Y YY值进行积分时,最终得到的就是X XX的概率分布,这相当于对Y YY所有可能取值进行了加权平均。

同理,我们也可以对变量Y YY进行同样的操作,这很简单,我们可以构建关于Y YY的边缘密度函数:

f Y ( y ) = ∫ − ∞ ∞ f ( x , y ) d x f_Y(y) = \int_{- \infty}^{\infty} f(x,y)dxfY(y)=f(x,y)dx

方法完全类似,只是这次我们需要对变量X XX进行积分消元。

对于离散型随机变量,这些概念同样适用,但当前讨论的是连续型情形,对于离散型随机变量,其处理思路与连续型情形基本一致。

因此,对于伯努利随机变量或泊松随机变量,我们可以采用相同的处理方式:若已知联合概率分布P ( x , y ) P(x,y)P(x,y)就能推导出仅关于x xx的概率分布,即通过边缘化得到P ( x ) P(x)P(x)的具体表达式:

P X ( x ) = ∑ y P ( X = x , Y = y ) P_X(x) = \sum_y P(X=x,Y=y)PX(x)=yP(X=x,Y=y)

我将对这个联合分布P ( X = x , Y = y ) P(X=x,Y=y)P(X=x,Y=y)进行处理,通过对所有Y YY的取值进行求和来消除Y YY变量.

接下来我将对y yy变量所有可能的取值状态进行概率求和,通过这种边缘化操作,最终得到仅与X XX相关的概率分布函数。

这就是边缘密度函数的核心概念,本质上是一种直接定义的概率运算,当我们掌握联合分布时,可以通过对其中一个变量进行边缘化处理,从而得到仅关于X XX的概率分布。

3. 练习:计算边缘分布

现在需要验证这个函数是否满足概率密度函数的定义条件,若从− ∞ -\infty+ ∞ +\infty+对该函数积分,结果必须等于 1,请务必确认这些函数确实符合概率密度函数的定义,并确保你能双向理解 — 既能查阅二维高斯分布的公式进行正向推导,也能从结果反推验证其性质,我理解的表达式是:

f ( x , y ) = 1 2 π exp ⁡ ( − x 2 + y 2 2 ) f(x, y) = \frac{1}{2\pi} \exp\left( -\frac{x^2 + y^2}{2} \right)f(x,y)=2π1exp(2x2+y2)

这个函数可以轻松转换为极坐标形式f ( r , θ ) f(r, \theta)f(r,θ),现在请你通过具体练习,在边缘密度与这个概率分布之间进行双向推导,请先确认这样的推导是合理的,确保你能熟练运用这些概念,之后可以尝试用更简单的分布来练习。

4. 联合分布中的条件概率

OK,最后还有一点需要说明,之前我们讨论过一个非常重要的概念 — 条件概率,因此,贝叶斯定理以及逆向统计的核心都建立在条件概率之上,也就是在已知Y YY发生的情况下推求X XX的概率,或者反过来进行推理,接下来我将通过联合分布的形式来展示这一关系。

接下来我用离散型随机变量来说明概率关系,首先考虑当随机变量Y YY取特定值时,X XX取某个值的概率,根据联合概率分布,当Y YY取特定值时X XX的条件概率可表示为:

P ( X = x ∣ Y = y ) = P ( X = x , Y = y ) P ( Y = y ) P(X = x \mid Y = y) = \frac{P(X = x, Y = y)}{P(Y = y)}P(X=xY=y)=P(Y=y)P(X=x,Y=y)

其中分母P ( Y ) P(Y)P(Y)是通过对X XX的所有可能取值求和得到的边缘概率,相信你已经理解了,建议你回顾前几讲关于条件概率与贝叶斯定理的内容,并准备一张白纸进行推导练习。

条件概率的基本公式是:

P ( X ∣ Y ) = P ( X , Y ) P ( Y ) P(X \mid Y) = \frac{P(X,Y)}{P(Y)}P(XY)=P(Y)P(X,Y)

其中P ( X , Y ) P(X,Y)P(X,Y)表示事件X XXY YY同时发生的联合概率,P ( Y ) P(Y)P(Y)是事件Y YY发生的边缘概率,这与我们之前学习的条件概率公式完全一致。

现在使用概率分布函数进行表述,使表达更加规范化,这是一个关于X XXY YY所有取值的函数,具有更广泛的适用性。

同样地,我们也可以在连续时间域中实现这一操作,对于连续型随机变量,给定X = x X=xX=xY YY的条件概率分布就等于联合概率密度函数除以X XX的边缘密度:

f Y ∣ X ( y ∣ x ) = f X , Y ( x , y ) f X ( x ) f_{Y \mid X}(y \mid x) = \frac{f_{X,Y}(x, y)}{f_X(x)}fYX(yx)=fX(x)fX,Y(x,y)

同样地,我们可以这样理解:这实际上相当于X XXY YY的联合概率除以X XX的概率,这与我们之前在条件概率中的处理方式非常相似,现在我们正在定义这些条件密度函数。

5. 结语

这些内容并不复杂,虽然信息量较大,但相信都是实用知识,通过离散型与连续型联合概率密度函数,既可推导边缘密度(通过对其中一个变量积分实现),也能建立条件密度(即在已知另一变量存在时,该变量的概率分布),假设该变量取某个特定值,这实质上是在基于先前列出的条件概率构建概率分布。

结语

本讲为 L26 的联合分布框架装配了两个核心运算接口:边缘化(marginalization)与条件化(conditioning)。边缘化是对 “无关变量” 的消除—f X ( x ) = ∫ − ∞ ∞ f ( x , y ) d y f_X(x) = \int_{-\infty}^{\infty} f(x,y)dyfX(x)=f(x,y)dy(连续)或P X ( x ) = ∑ y P ( x , y ) P_X(x) = \sum_y P(x,y)PX(x)=yP(x,y)(离散)—本质上是全概率定律在联合分布上的直接应用:Y YY必须取某值,将所有可能的Y YY加权求和/积分后,剩下的就是X XX的 “净” 分布。这与物理学中对多体系统做 “粗粒化” 处理的精神一脉相承。

条件密度f Y ∣ X ( y ∣ x ) = f ( x , y ) / f X ( x ) f_{Y|X}(y|x) = f(x,y) / f_X(x)fYX(yx)=f(x,y)/fX(x)则是贝叶斯统计的运算核心—它将联合分布 “切片” 后再归一化,回答了 “在已知X XX的前提下,Y YY服从什么分布?” 这一问题。与 L4 的离散条件概率P ( A ∣ B ) = P ( A ∩ B ) / P ( B ) P(A|B) = P(A \cap B)/P(B)P(AB)=P(AB)/P(B)相比,本讲完成了从事件到随机变量的概念升维:条件不再仅是 “给定某个事件发生”,而是 “给定随机变量取某值”,密度函数的比值自然承接了这一角色的连续化推广。

从联合 → 边缘 → 条件的三角关系来看,三者构成一个信息守恒的闭环:(1) 联合包含全部信息;(2) 边缘化丢失关联结构(积分/求和抹去了变量间的依赖细节);(3) 条件化则是在固定一维后保留另一维的分布结构。这一三角将成为后续协方差、相关系数和多元高斯分布推导的运算基础—边缘化求期望,条件化做预测,联合分布则是所有运算的源头 🤗。

参考

  • https://www.youtube.com/playlist?list=PLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V
返回列表