Skip to content

导论:线性代数的本质 ​

线性代数是研究向量空间及其上的线性映射的数学分支。它绝非矩阵运算的技巧合集,而是对结构化线性关系的系统化研究。在机器学习中,线性代数提供了描述高维数据流形、参数空间和优化地形的通用语言。深度学习模型的每一个权重更新、每一次前向传播,本质上都是大规模线性变换(穿插非线性激活函数)的复合。


一、核心结构:向量空间(线性空间) ​

1.1 严格定义 ​

设 V 是一个非空集合,F 是一个域(通常取实数域 R 或复数域 C)。若在 V 上定义两种运算:

  • 加法:+:V×V→V,记作 (u,v)↦u+v
  • 数乘:⋅:F×V→V,记作 (λ,v)↦λv

且满足以下八条公理(对任意 u,v,w∈V,任意 λ,μ∈F):

  1. 加法交换律:u+v=v+u
  2. 加法结合律:(u+v)+w=u+(v+w)
  3. 加法单位元:存在 0∈V,使得 v+0=v
  4. 加法逆元:存在 −v∈V,使得 v+(−v)=0
  5. 数乘对向量加法的分配律:λ(u+v)=λu+λv
  6. 数乘对域加法的分配律:(λ+μ)v=λv+μv
  7. 数乘与域乘法的相容性:λ(μv)=(λμ)v
  8. 数乘单位元:1F⋅v=v

则称 (V,+,⋅) 为域 F 上的向量空间。V 中的元素称为向量。

深刻理解:向量不仅仅是带箭头的线段或坐标列表。多项式、连续函数、矩阵本身都可以构成向量空间(例如所有次数 ≤ n 的多项式构成 R 上的 n+1 维向量空间)。抽象化是线性代数的第一要义。

1.2 线性组合、张成空间与基 ​

  • 线性组合:对于向量组 {v1,…,vk}⊂V,形如 ∑i=1kcivi(其中 ci∈F)的表达式称为线性组合。
  • 张成空间(Span):所有线性组合的集合 span{v1,…,vk} 是 V 的一个子空间。
  • 线性无关:若 ∑i=1kcivi=0 当且仅当所有 ci=0,则称该向量组线性无关。
  • 基(Basis):若一个向量组既是线性无关的,又能张成整个空间 V,则称其为 V 的一组基。
  • 维数(Dimension):基中向量的个数,记作 dim⁡(V)。这是向量空间唯一的基数不变量。

二、结构的保持者:线性映射与矩阵 ​

2.1 线性映射的严格定义 ​

设 V,W 是域 F 上的向量空间。映射 T:V→W 称为线性映射(或线性变换),当且仅当对任意 u,v∈V,任意 λ∈F:

T(u+λv)=T(u)+λT(v)

这等价于同时满足加法可加性和齐次性。线性映射的本质是保持向量加法和数乘结构。

2.2 矩阵作为线性映射的具体表示 ​

选定 V 的基 B={v1,…,vn} 和 W 的基 C={w1,…,wm} 后,线性映射 T 唯一对应一个 m×n 矩阵 A=[T]C←B。其第 j 列是 T(vj) 在基 C 下的坐标。

核心洞见:矩阵不是数字表格,而是特定基底下线性映射的坐标化表达。改变基底,矩阵表示随之改变(相似变换),但背后的线性映射是客观不变的。

2.3 四大基本子空间与秩-零化度定理 ​

对于矩阵 A∈Rm×n(视作 Rn→Rm 的线性映射):

  • 列空间(像空间):Col(A)={Ax∣x∈Rn}⊂Rm,维数 = 秩 r。
  • 零空间(核):Null(A)={x∣Ax=0}⊂Rn,维数 = 零化度 n−r。
  • 行空间:Row(A)=Col(AT)⊂Rn,维数 = r。
  • 左零空间:Null(AT)⊂Rm,维数 = m−r。

秩-零化度定理(Rank-Nullity Theorem):

dim⁡(Col(A))+dim⁡(Null(A))=n

即 r+(n−r)=n。该定理揭示了定义域维度在映射过程中,一部分被压缩至零(核),剩余部分则完整投射到像空间中。在机器学习中,当 n>m(过参数化)时,零空间非平凡,意味着存在无数个解——这正是深度学习中欠定系统和正则化必要性的数学根源。


三、度量结构与对偶性:内积、范数与对偶空间 ​

3.1 内积空间 ​

在内积空间 (V,⟨⋅,⋅⟩) 中,内积是一个双线性(或共轭双线性)形式,满足:

  1. 正定性:⟨v,v⟩≥0,等号成立当且仅当 v=0。
  2. 对称性(实数域):⟨u,v⟩=⟨v,u⟩。
  3. 第一变元线性:⟨λu+μv,w⟩=λ⟨u,w⟩+μ⟨v,w⟩。

标准欧几里得内积为 ⟨x,y⟩=xTy=∑xiyi。

3.2 范数 ​

由内积诱导的范数定义为 ∥v∥=⟨v,v⟩,满足三角不等式 ∥u+v∥≤∥u∥+∥v∥。

在机器学习中,Lp 范数族广泛使用:

  • L1 范数:∥x∥1=∑|xi|(诱导稀疏性,用于Lasso回归)。
  • L2 范数(欧氏范数):∥x∥2=∑xi2(旋转不变性,用于权重衰减正则化)。
  • L∞ 范数:∥x∥∞=maxi|xi|。

3.3 对偶空间 ​

向量空间 V 上的所有线性泛函(即线性映射 f:V→F)构成对偶空间 V∗。里斯表示定理(Riesz Representation Theorem)指出,在有限维内积空间中,任何线性泛函 f 都唯一对应一个向量 vf∈V,使得:

f(x)=⟨x,vf⟩,∀x∈V

这对理解梯度(作为线性泛函)和参数更新方向至关重要——机器学习中的损失函数梯度,本质上是对偶空间中的一个元素,它通过内积指示了函数的最陡上升方向。


四、特征理论:线性变换的内在不变量 ​

4.1 特征值与特征向量 ​

设 A∈Cn×n。若存在非零向量 v∈Cn 和标量 λ∈C,使得:

Av=λv

则 λ 称为特征值,v 称为属于 λ 的特征向量。

特征值通过特征多项式 p(λ)=det(λI−A) 求解。代数量数(特征多项式中根的重数) ≥ 几何重数(对应特征子空间的维数)。

4.2 对角化与谱定理 ​

若矩阵 A 有 n 个线性无关的特征向量,则可对角化:

A=PDP−1

其中 D 为对角矩阵,对角元为特征值。

实对称矩阵的谱定理(机器学习中最重要的定理之一):若 A∈Rn×n 且 A=AT,则:

  • 所有特征值均为实数。
  • 存在一组标准正交特征向量,构成 Rn 的一组标准正交基。
  • 可正交对角化:A=QΛQT,其中 Q 是正交矩阵(QTQ=I),Λ 是对角矩阵。

含义:实对称矩阵对应二次型 xTAx。谱定理将二次型化简为主轴形式 ∑λiyi2,使得凸性(正定性)判断一目了然。PCA(主成分分析)的本质就是对协方差矩阵(实对称、半正定)做特征分解,取最大特征值对应的特征向量作为主成分方向。


五、线性代数的巅峰:奇异值分解(SVD) ​

5.1 严格定义 ​

对于任意矩阵 A∈Rm×n(不要求方阵,不要求满秩),存在正交矩阵 U∈Rm×m,V∈Rn×n,以及一个 m×n 的矩形对角矩阵 Σ,使得:

A=UΣVT

其中:

  • U=[u1,…,um] 的列称为左奇异向量,它们是 AAT 的特征向量。
  • V=[v1,…,vn] 的列称为右奇异向量,它们是 ATA 的特征向量。
  • Σ 的对角元 σ1≥σ2≥⋯≥σmin(m,n)≥0 称为奇异值,且 σi=λi,其中 λi 是 ATA 的非零特征值。

5.2 几何直观 ​

SVD 揭示了任意线性变换的几何本质:A 将 Rn 中的单位球面映射为 Rm 中的超椭球体。VT 先进行旋转/反射,Σ 沿主轴方向缩放(拉伸或压缩),U 再进行旋转/反射。

5.3 摩尔-彭罗斯伪逆 ​

对于非方阵或奇异矩阵,标准逆不存在。伪逆定义为:

A+=VΣ+UT

其中 Σ+ 通过将非零奇异值取倒数并转置得到。伪逆给出了最小二乘问题 minx∥Ax−b∥2 的最小范数解:x∗=A+b。这是线性回归、逻辑回归等所有线性模型参数估计的数学统一框架。

5.4 低秩逼近(Eckart-Young 定理) ​

设保留前 k 个最大奇异值,其余置零,得到 Σk,则:

Ak=UΣkVT

Eckart-Young 定理指出:在所有秩不超过 k 的矩阵中,Ak 在弗罗贝尼乌斯范数(Frobenius norm)和谱范数下都是对 A 的最佳逼近。即:

∥A−Ak∥F=∑i=k+1min(m,n)σi2

机器学习意义:这是推荐系统(矩阵填充)、词嵌入降维(GloVe)、模型压缩(低秩分解)、扩散模型去噪网络设计的数学基石。大规模预训练模型常利用 SVD 截断来压缩权重矩阵,以极小的精度损失换取巨大的存储和计算收益。


六、张量:高维线性代数的自然延伸 ​

虽然矩阵是二阶张量,但现代机器学习(特别是 Transformer 和 Attention 机制)高度依赖于高阶张量运算。张量 T∈RI1×I2×⋯×IN 是向量(一阶)和矩阵(二阶)的推广。其核心运算是 张量缩并(Tensor Contraction),即对指定维度求和。

在注意力机制中,Q(查询)、K(键)、V(值)矩阵的乘法本质上是批量矩阵乘法(Batched Matmul),在批次维度和头数维度上进行并行缩并。理解张量的模展开(Matricization) 和 模乘(Mode-n Product) 是读懂前沿论文中复杂张量公式的前提。


结语:线性代数的地位 ​

线性代数不是机器学习的“工具集”,而是它的语法。所有的数据(图像、文本、音频)在进入模型之前都被张量化;所有的参数更新都在向量空间中进行梯度下降;所有的网络结构(MLP、CNN、RNN、Transformer)都是精心设计的线性变换的复合与约束。深入掌握从抽象空间、线性映射、谱分解到SVD的完整逻辑链条,意味着你不再是被动调用 torch.linalg.svd 的使用者,而是能够从线性变换的不变量视角设计新架构、分析梯度消失与爆炸根源、并驾驭高维流形几何的思考者。