Skip to content

导论:不确定性的数学语言 ​

概率论是严格公理化不确定性的数学分支。它不关心某个事件“是否”发生,而关心我们在信息不完备的条件下如何对其赋予定量置信度。信息论则是概率论在信息度量和传输层面的自然延伸,它量化了“消除不确定性”所需的代价。

在机器学习中,概率论提供了建模噪声、表达置信度和设计损失函数(似然函数)的底层语言;信息论则为比较分布(KL散度)、设计正则化(最大熵)和评价编码效率(交叉熵损失)提供了精密的度量工具。深度学习模型的训练本质上是在参数空间中对数据似然函数进行最大化(MLE),或等价地最小化模型分布与经验分布之间的KL散度。


第一部分:概率论的公理体系与核心结构 ​

1.1 概率空间 (Probability Space) 的严格定义 ​

一个完整的概率模型由三元组 (Ω,F,P) 定义:

  • 样本空间 Ω:所有可能结果的非空集合。
  • 事件域 F:Ω 的子集构成的 σ-代数(即对可数并、可数交和补集运算封闭的非空集合族)。当 Ω 可数时,通常取 F=2Ω。
  • 概率测度 P:F→[0,1],满足 柯尔莫哥洛夫公理 (Kolmogorov Axioms):
    1. 非负性:对任意事件 A∈F,P(A)≥0。
    2. 正则性:P(Ω)=1。
    3. 可数可加性 (Countable Additivity):若 {Ai}i=1∞ 是两两互斥的事件序列(即 Ai∩Aj=∅,i≠j),则:P(⋃i=1∞Ai)=∑i=1∞P(Ai)

深刻理解:概率不是频率的极限,而是满足特定数学结构的测度。频率学派将概率视为客观存在的“物理属性”;贝叶斯学派则将概率视为对未知状态的主观置信度(信念强度),允许在观察数据后通过贝叶斯定理更新先验。现代深度学习的贝叶斯视角(如变分推断)正是基于后者的严格数学框架。

1.2 条件概率、独立性与链式法则 ​

  • 条件概率:在给定事件 B(且 P(B)>0)发生的条件下,事件 A 的概率定义为:

    P(A∣B)=P(A∩B)P(B)

    这本质上是将概率测度限制在子集 B 上的归零化(Renormalization)。

  • 独立性:若 P(A∩B)=P(A)P(B),则称事件 A 与 B 独立。这等价于 P(A∣B)=P(A)(后验等于先验,即观测 B 不提供关于 A 的额外信息)。

  • 链式法则(乘法法则):对任意有限个事件 A1,A2,…,An:

    P(A1∩A2∩⋯∩An)=P(A1)∏i=2nP(Ai∣A1,…,Ai−1)

    这是所有自回归模型(如 GPT)的概率论基石——它将高维联合分布分解为条件分布的乘积。

1.3 贝叶斯定理 ​

由条件概率定义直接导出:

P(A∣B)=P(B∣A)P(A)P(B)

在机器学习参数估计中,通常写为:

P(θ∣D)=P(D∣θ)P(θ)P(D)

其中 P(θ) 是先验(Prior),P(D∣θ) 是似然(Likelihood),P(θ∣D) 是后验(Posterior),P(D) 是证据(Evidence)。贝叶斯推断的灵魂在于:不寻求单一最优参数,而是计算参数的完整后验分布。


第二部分:随机变量与分布函数 ​

2.1 随机变量的严格定义 ​

随机变量 X 是从样本空间 Ω 到实数集 R 的可测函数:

X:Ω→R

“可测”意味着对任意实数 x,集合 {ω∣X(ω)≤x} 必须是 F 中的事件,从而其概率有定义。

  • 离散型:若 X 的取值空间可数,则用概率质量函数 (PMF) p(x)=P(X=x) 描述。
  • 连续型:若 X 的取值空间不可数(通常为区间),则用概率密度函数 (PDF) f(x) 描述,满足 P(X∈A)=∫Af(x)dx,且 f(x)≥0,∫−∞∞f(x)dx=1。

2.2 期望、方差与矩 ​

  • 期望(一阶原点矩):

    E[X]={∑xxp(x),离散∫−∞∞xf(x)dx,连续

    期望是线性算子:E[aX+bY]=aE[X]+bE[Y]。

  • 方差(二阶中心矩):

    Var(X)=E[(X−E[X])2]=E[X2]−(E[X])2

    方差度量分布的离散程度。标准差 Var(X) 与原始数据单位一致。

2.3 机器学习中至关重要的几个分布 ​

  1. 伯努利分布 (Bernoulli):X∈{0,1},P(X=1)=p。用于二分类标签(逻辑回归的生成假设)。
  2. 分类分布 (Categorical):多类别的单次抽奖,p(x=k)=pk,是 Softmax 层的自然分布。
  3. 高斯分布 (Gaussian / Normal):N(x∣μ,σ2)=12πσ2exp⁡(−(x−μ)22σ2)。其最大熵性质(在给定均值和方差下,熵最大的分布)解释了为何自然界和噪声中频繁出现高斯分布。高维多元高斯:N(x∣μ,Σ)=1(2π)d/2|Σ|1/2exp⁡(−12(x−μ)TΣ−1(x−μ))其中协方差矩阵 Σ 必须是正定对称矩阵。
  4. 拉普拉斯分布:f(x∣μ,b)=12bexp⁡(−|x−μ|b)。在 L1 正则化的贝叶斯解释中,它对应于参数的拉普拉斯先验(诱导稀疏性)。

第三部分:信息论——熵与不确定性度量 ​

信息论的核心问题是:量化一个随机变量包含多少“信息”。

3.1 熵 (Entropy) 的定义 ​

对于离散随机变量 X 遵循分布 P,其香农熵 (Shannon Entropy) 定义为:

H(P)=H(X)=−∑x∈XP(x)log⁡P(x)

(通常底数为 e(纳特)或 2(比特),机器学习中常用自然对数)。

严格理解:熵是编码从 P 中抽取的符号所需的最优平均编码长度(香农第一定理)。同时也是衡量分布“混乱程度”或“不确定性”的数学期望:H(X)=Ex∼P[−log⁡P(x)]。

连续情况(微分熵):

H(P)=−∫p(x)log⁡p(x)dx

注意微分熵不具备尺度不变性(改变单位会改变值),但在优化中仍有效。

3.2 联合熵与条件熵 ​

  • 联合熵:H(X,Y)=−∑x,yP(x,y)log⁡P(x,y)。
  • 条件熵:给定 Y 后,X 残留的不确定性:H(X∣Y)=−∑x,yP(x,y)log⁡P(x∣y)=H(X,Y)−H(Y)链式法则:H(X1,…,Xn)=∑i=1nH(Xi∣X1,…,Xi−1)。

3.3 互信息 (Mutual Information) ​

度量两个随机变量之间的依赖强度(不仅是线性相关,而是任意非线性相关性):

I(X;Y)=H(X)−H(X∣Y)=H(Y)−H(Y∣X)=∑x,yP(x,y)log⁡P(x,y)P(x)P(y)

互信息是非负的,且等于 0 当且仅当 X 与 Y 独立。在表征学习中,常将互信息作为下游任务性能的代理指标(InfoNCE 损失即为互信息的下界估计)。


第四部分:机器学习损失函数的概率论与信息论根源 ​

4.1 交叉熵 (Cross-Entropy) ​

交叉熵衡量用分布 Q(预测分布)去编码服从分布 P(真实分布)的数据所需的平均额外编码长度:

H(P,Q)=−Ex∼P[log⁡Q(x)]=−∑xP(x)log⁡Q(x)

在分类任务中,真实标签 y 是 one-hot 向量(退化的 P,仅在真实类处为 1),交叉熵退化为负对数似然:L=−log⁡Q(ytrue∣x)。这是 Softmax 回归的标准损失函数。

4.2 KL 散度 (Kullback-Leibler Divergence) ​

KL 散度(也称为相对熵)是两个概率分布 P 和 Q 之间的非对称性度量:

DKL(P∥Q)=Ex∼P[log⁡P(x)Q(x)]=∑xP(x)log⁡P(x)Q(x)

它满足:

  • 非负性(吉布斯不等式):DKL(P∥Q)≥0,等号成立当且仅当 P=Q 几乎处处成立。
  • 非对称性:DKL(P∥Q)≠DKL(Q∥P)。因此它不是真正的“距离”,而是“不匹配程度的定向度量”。

深刻关联:最大似然估计 (MLE) 等价于最小化 DKL(Pdata∥Pmodel)。因为 DKL(Pdata∥Pmodel)=Ex∼Pdata[−log⁡Pmodel(x)]+const。这就是为什么深度学习中的交叉熵损失本质上是在做 KL 散度最小化。

4.3 变分推断中的 ELBO ​

在贝叶斯深度学习(变分自编码器 VAE)中,我们无法计算真实后验 P(z∣x),于是用变分分布 Q(z∣x) 近似。证据下界 (Evidence Lower Bound, ELBO) 定义为:

LELBO=EQ(z∣x)[log⁡P(x∣z)]−DKL(Q(z∣x)∥P(z))

严格推导:

log⁡P(x)=DKL(Q∥P(⋅∣x))+LELBO

由于 KL 散度非负,ELBO 是对数证据 log⁡P(x) 的下界。最大化 ELBO 既鼓励模型重构数据(第一项),又通过 KL 惩罚迫使变分后验贴近先验(第二项——充当正则化器)。

4.4 最大熵原理 (MaxEnt Principle) ​

在只掌握部分约束信息(如均值和方差)时,应当选择熵最大的分布,以免引入额外的无根据假设。这直接推导出高斯分布(给定一阶矩和二阶矩下)和指数族分布。在强化学习中,最大熵强化学习(SAC)在奖励函数中加入策略熵项 H(π),显式鼓励探索,防止策略过早坍缩到确定性动作。


结语:概率与信息视角下的机器学习 ​

理解概率论与信息论,意味着你不再将损失函数视为工程拼凑的公式,而是看到它们背后的统计决策论内核:

  • 监督学习 = 条件密度估计 P(Y∣X);
  • 无监督学习 = 边缘密度估计 P(X) 或隐变量推断 P(Z∣X);
  • 强化学习 = 最优控制下的序列决策概率优化;
  • 正则化 = 先验信念的注入(贝叶斯视角)或信息瓶颈约束(信息论视角)。

从柯尔莫哥洛夫严格公理出发,到 KL 散度诱导的分布匹配,再到 ELBO 驱动的变分自编码,概率与信息论为机器学习提供了无法绕过的公理化基石。当模型的参数量膨胀到千亿级,我们本质上依然在做一件事:在高维概率测度空间中,寻找一个与数据生成分布最为贴近的、参数化了的计算逼近。