前言:博主在跌跌撞撞跟随人工智能发展的脚步过程中,越来越发现数学基础的重要性,然而AI领域的迭代速度实在太快,难以沉下心来深耕纯粹的数理知识。学校里的课程知识要么过于枯燥要么难以理解找不到和自己想做的工作之间的关系。所以计划和大模型进行沟通,梳理出自己认为学习LLM,VLM和Agent相关的数学知识,方便自己随时回顾。

一、从向量到矩阵,再由矩阵到张量

(一)向量Vector:空间的坐标与语义的方向

向量与向量空间在AI中无处不在。一段文字、一张图片、一个token在模型内部都是高维向量。

  • 数学定义:一维排列的一组数字,记作 x = [ x 1 , x 2 , . . . , x n ] T x=[x_1,x_2,...,x_n]^T x=[x1​,x2​,...,xn​]T。在几何上代表从原点指向某个坐标点的有向线段。
  • AI直觉:Token Embedding(词嵌入)
    • 在LLM中,每个词都会被映射为一个高维向量(如LLaMA3 的维度为4096)。向量的方向代表语义,向量的长度代表语义的强度。在 4096 维的空间里,“国王”和“皇后”这两个向量的方向会非常接近。

(二)矩阵Matrix:空间变换的实体与权重的集合

  • 数学定义:二维排列的数字阵列,有行和列,记作 A ∈ R m × n A\in \mathbb{R}^{m\times n} A∈Rm×n
  • AI 直觉:Model Weights(模型权重矩阵)
    • 矩阵是一组向量的集合,但更本质地,矩阵代表一个空间映射/变换。矩阵是把整个空间“揉捏变形”的机器。矩阵的行列式就是精确地告诉你这个变换把面积放大或缩小了多少倍,当 d e t = 0 det=0 det=0时,空间被压扁,矩阵就不可逆了。
    • 一个 4096 × 4096 4096 \times 4096 4096×4096的权重矩阵,本质上是把输入的4096维embedding向量,旋转、拉伸并投影到另一个4096维的新语义空间。

(三)张量Tensor:多维数据的终极载体

  • 数学定义:几何代数中定义的广义多维阵列。标量是 0 维张量,向量是 1 维张量,矩阵是 2 维张量,3 维及以上称为高维张量。
  • AI 直觉:数据的批处理流(Batch Data Flow)
    • 0D张量:标量,如loss值
    • 1D张量:向量,如一个token的 embedding
    • 2D张量:矩阵,如权重矩阵 W W W,或者单张灰度图片
    • 3D张量:在LLM中通常是 [ b a t c h _ s i z e , s e q u e n c e _ l e n g t h , h i d d e n _ d i m ] [batch\_size, sequence\_length, hidden\_dim] [batch_size,sequence_length,hidden_dim],代表一个批次句子的特征表示,(即:一次处理几句话 × \times × 每句话有几个字 × \times × 每个字由多少维向量表示)。
    • 4D张量:在VLM中处理图像时,通常是 [ b a t c h _ s i z e , c h a n n e l , h e i g h t , w i d t h ] [batch\_size, channel, height, width] [batch_size,channel,height,width]

二、运算篇:向量的运算

向量的运算是大模型计算相似度和特征聚合的基础。

(一) 向量加法(线性叠加)

  • 公式: u + v = [ u 1 + v 1 , u 2 + v 2 , … , u n + v n ] T \mathbf{u} + \mathbf{v} = [u_1+v_1, u_2+v_2, \dots, u_n+v_n]^T u+v=[u1​+v1​,u2​+v2​,…,un​+vn​]T
  • AI直觉:残差连接
    • 在Transformer中,每一层Attention后面都有一个 X n e w = X + A t t e n t i o n ( X ) X_{new}=X+Attention(X) Xnew​=X+Attention(X)。从几何上看,就像是在原始语义向量上,加上一个微调方向的”修正向量“,从而确保深层网络信息不丢失。

(二)向量内积/点积

  • 公式: u ⋅ v = ∑ i = 1 n u i v i = u T v \mathbf{u} \cdot \mathbf{v} = \sum_{i=1}^n u_i v_i = \mathbf{u}^T \mathbf{v} u⋅v=∑i=1n​ui​vi​=uTv
  • 几何意义: u ⋅ v = ∥ u ∥ ∥ v ∥ cos ⁡ θ \mathbf{u} \cdot \mathbf{v} = \|\mathbf{u}\| \|\mathbf{v}\| \cos\theta u⋅v=∥u∥∥v∥cosθ,即两个向量的模长乘以它们夹角的余弦值
  • AI 直觉:注意力机制的相似度计算。(点积如果越大,说明两个向量在几何方向上越接近,代表两个词的语义关联度越高。
    A t t e n t i o n ( Q , K ) = s o f t m a x ( Q K T d k ) Attention(Q,K)=softmax(\frac{QK^T}{\sqrt{d_k}}) Attention(Q,K)=softmax(dk​ ​QKT​)
    从几何上看, Q K T QK^T QKT是两个向量矩阵的内积。内积的本质就是衡量向量之间的余弦相似度与长度乘积。Attention机制实际上就是计算:在当前的语义空间中,token i i i 与token j j j 的方向有多接近。

(三)向量外积

  • 公式: u ⊗ v = u v T \mathbf{u} \otimes \mathbf{v} = \mathbf{u}\mathbf{v}^T u⊗v=uvT
  • AI直觉:低秩动态权重的生成。
    • 如果 u \mathbf{u} u 是一个 4096 × 1 4096 \times 1 4096×1 的向量, v \mathbf{v} v 是一个 1 × 4096 1 \times 4096 1×4096 的向量,它们的外积会直接生成一个 4096 × 4096 4096 \times 4096 4096×4096 的完整矩阵。这种“用两个低维向量构造高维矩阵”的方法,是很多轻量化微调和注意力机制变体的数学底层。

三、运算篇:矩阵的运算

(一)矩阵与向量乘法

  • 公式:矩阵的每一行与向量进行点积,组合成一个新向量。
  • AI 直觉:前向传播的单步投影。当一个 Token 向量 x x x 输入进网络,遇到线性层 W W W,计算 W v Wv Wv。这实际上是将向量 x x x 放入以 W W W 的列向量为基底的新坐标系中去。

(二)矩阵与矩阵乘法

假设 A ∈ R m × k A \in \mathbb{R}^{m \times k} A∈Rm×k, B ∈ R k × n B \in \mathbb{R}^{k \times n} B∈Rk×n,则 C ∈ R m × n C \in \mathbb{R}^{m \times n} C∈Rm×n。

  • 公式: C i j = ∑ l = 1 k A i l B l j C_{ij} = \sum_{l=1}^k A_{il} B_{lj} Cij​=∑l=1k​Ail​Blj​( A A A 的第 i i i 行与 B B B 的第 j j j 列做点积)。
  • 矩阵乘法 Y = W X Y=WX Y=WX:将输入空间 X X X中的向量,投影/变换到输出空间 Y Y Y。权重矩阵 W W W决定了空间如何旋转和拉伸。
  • 大模型痛点:计算复杂度 O ( m ⋅ n ⋅ k ) O(m \cdot n \cdot k) O(m⋅n⋅k)
    • 这就是为什么大模型极其消耗算力。以 Transformer 的 Self-Attention 为例: Q ∈ R B × N × D , K ∈ R B × N × D Q \in \mathbb{R}^{B \times N \times D}, \quad K \in \mathbb{R}^{B \times N \times D} Q∈RB×N×D,K∈RB×N×D计算 Q K T QK^T QKT 时,由于序列长度 N N N(上下文窗口)在长文本任务中极大(如 32k、128k),矩阵乘法的开销随 N N N 呈平方级 ( O ( N 2 ) O(N^2) O(N2)) 爆炸。这就是为什么现在业界都在狂热研究 FlashAttention、Linear Attention 或者 State Space Models (SSM,如 Mamba) 的原因——全是在向这个矩阵乘法的复杂度开刀。

(三)矩阵的转置

  • 定义:将矩阵的行列互换,记作 A T A^T AT。满足 ( A B ) T = B T A T (AB)^T = B^T A^T (AB)T=BTAT。
  • AI 直觉:变换映射的方向。在计算注意力时, Q K T Q K^T QKT 中对 K K K 进行转置,就是为了让行向量变成列向量,从而能够和 Q Q Q 进行批量的点积运算。

三、矩阵的性质

(一)行列式Determinant, det ⁡ ( A ) \det(A) det(A) 或 ∣ A ∣ |A| ∣A∣

行列式只针对方阵( n × n n \times n n×n)定义。

  • 几何直觉:空间体积的缩放因子。前面提到矩阵实际上代表一个空间映射/变换。那么假设我们在 2D 空间中有一个单位正方形(面积为 1)。当我们用矩阵 A A A 去作用于这个空间的所有点时,这个正方形会被拉伸或扭曲成一个平行四边形。这个新平行四边形的面积,就是 det ⁡ ( A ) \det(A) det(A)。如果是 3D 空间,对应的就是平行六面体的体积。

  • AI关键特征:

    • det ⁡ ( A ) > 1 \det(A) > 1 det(A)>1:空间被放大了(信号前向传播时可能导致梯度爆炸)。
    • 0 < det ⁡ ( A ) < 1 0 < \det(A) < 1 0<det(A)<1:空间被缩小了(信号可能衰减)。
    • det ⁡ ( A ) = 0 \det(A) = 0 det(A)=0:空间被压扁了!比如 3D 空间被压成了一个 2D 平面(体积变为 0)。这意味着有些维度的信息被彻底抹杀,永远无法恢复。

大模型映射:Normalizing Flows(正规化流)与 Rectified Flow(流匹配)
在图像生成或一些前沿的流匹配生成模型中,需要计算概率密度的变换。根据多元变量换元公式,变换后的概率密度需要乘以变换矩阵的雅可比矩阵的行列式(Jacobian Determinant)。它精确地量化了生成模型在将噪声样本拉伸映射为真实图片时,空间密度的变化率。

(二)逆矩阵Inverse Matrix, A − 1 A^{-1} A−1

如果一个方阵 A A A 满足 A A − 1 = A − 1 A = I A A^{-1} = A^{-1} A = I AA−1=A−1A=I( I I I 为单位矩阵),则 A − 1 A^{-1} A−1 是 A A A 的逆矩阵。

  • 几何直觉:时空倒流 / 空间变换的“撤销键”。
    矩阵 A A A 把向量 x x x 变换到了 y y y(即 A x = y Ax = y Ax=y),那么逆矩阵 A − 1 A^{-1} A−1 的作用就是把 y y y 完美地还原回 x x x(即 A − 1 y = x A^{-1}y = x A−1y=x)。
  • 可逆的充要条件: det ⁡ ( A ) ≠ 0 \det(A) \neq 0 det(A)=0。
    结合上面的几何直觉:如果 det ⁡ ( A ) = 0 \det(A) = 0 det(A)=0,说明空间已经被压扁(比如三维塌陷成一条线)。你把无数个点的投影压在了一条线上,你就再也无法知道这些点原本在三维空间的哪个位置。因此,塌陷的空间不可逆。

在大模型后量化(PTQ)中,为了补偿某一层权重参数量化后的误差,数学推导出的最优补偿公式里包含激活值协方差矩阵的逆矩阵( H − 1 H^{-1} H−1,即海森矩阵的逆)。由于层维度(如 4096)很大,直接求逆非常慢,GPTQ 算法的核心工程贡献之一就是利用了 Cholesky 分解 和 逆矩阵递推更新(Woodbury 公式),把求逆的复杂度降了下来,这才让百亿、千亿参数大模型的量化在几小时内完成。

(三)矩阵的秩Rank, rank ( A ) \text{rank}(A) rank(A)

矩阵的秩适用于任何矩阵(不限于方阵)。

  • 数学定义:矩阵中线性无关的行向量(或列向量)的最大数量。
  • 几何直觉:矩阵变换后,输出空间的真正“有效维度”。
    一个 4096 × 4096 4096 \times 4096 4096×4096 的矩阵,名义上有 4096 维。但如果它的 rank ( A ) = 2 \text{rank}(A) = 2 rank(A)=2,说明它的 4096 个列向量里,只有 2 个是独立的,其余 4094 个列向量都可以由这两个向量通过拉伸和相加(线性组合)表示。这个矩阵无论怎么乘以输入,输出的结果都只能死死地缩在全空间里的一个 2D 超平面 上。
  • 满秩与低秩:
    • 满秩(Full Rank): rank ( A ) = min ⁡ ( m , n ) \text{rank}(A) = \min(m, n) rank(A)=min(m,n)。空间没有塌陷,信息量最大。
    • 低秩(Low Rank): rank ( A ) ≪ min ⁡ ( m , n ) \text{rank}(A) \ll \min(m, n) rank(A)≪min(m,n)。矩阵虽然看起来很大,但内部充满冗余(大量参数在做重复的工作)。

矩阵的秩最经典的应用场景就是LoRA微调了:我们在微调 LLM 时,原模型权重 W 0 W_0 W0​ 是满秩的(充满预训练学到的海量知识)。但研究发现,针对特定任务的权重更新量 Δ W \Delta W ΔW(形状如 4096 × 4096 4096 \times 4096 4096×4096),其内在的秩非常低。LoRA 做的,就是直接把 Δ W \Delta W ΔW 定义成一个秩被硬性约束为 r r r 的低秩矩阵。通过把它拆解为: Δ W 4096 × 4096 = B 4096 × r × A r × 4096 \Delta W_{4096 \times 4096} = B_{4096 \times r} \times A_{r \times 4096} ΔW4096×4096​=B4096×r​×Ar×4096​当我们将 r r r 设为 8 时,这个矩阵相乘的结果的 rank ( Δ W ) ≤ 8 \text{rank}(\Delta W) \le 8 rank(ΔW)≤8。这代表我们只用极少量的可训练参数( B B B 和 A A A),就锁定了这 4096 维高维空间中最核心的 8 个微调方向。

四、特征值分解EVD与奇异值分解SVD

特征值分解与奇异值分解在机器学习和深度学习中被称为矩阵的“谱分析”。如果说矩阵是一张加密的复杂地图,那么 EVD 和 SVD 就是解密这幅地图、找出其中最核心方向的最强工具。它们直接衍生出了主成分分析(PCA)、大模型低秩适配(LoRA)、模型剪枝与量化重构。

(一)特征值分解EVD

1. 核心数学公式

如果一个 n × n n \times n n×n 的方阵 A A A 作用于一个非零向量 v \mathbf{v} v,其结果仅仅是对该向量进行了标量伸缩,而没有改变它的方向:
A v = λ v A\mathbf{v} = \lambda\mathbf{v} Av=λv
则 v v v是特征向量, λ \lambda λ 是特征值。

如果把矩阵 A A A 所有的特征向量组合成一个矩阵 Q Q Q,特征值放在对角矩阵 Λ \Lambda Λ 上,方阵 A A A 就可以被写为: A = Q Λ Q − 1 A = Q \Lambda Q^{-1} A=QΛQ−1

2. 几何直觉:矩阵的“本征方向”

  • 任何普通的向量在经过矩阵 A A A 变换后,通常既会改变方向,又会改变长度。
  • 但是,矩阵 A A A 拥有一些神奇的“专属通道”(特征向量)。当向量沿着这些通道运动时,矩阵 A A A 只对其进行拉伸/压缩,而绝对不扭曲它的方向。特征值 λ \lambda λ 的大小,就代表了这个方向被拉伸的剧烈程度。

3. 局限性

  • EVD只能用于方阵。但大模型里QKV的权重矩阵(如 4096 × 11008 4096\times11008 4096×11008),几乎全是长方形的。
  • 不一定总能分解。有些方阵在实数范围内甚至找不到足够的特征向量。

于是SVD出现了。

(二)奇异值分解SVD

SVD 是特征值分解在任意长方形矩阵( m × n m \times n m×n)上的推广。任何实数矩阵 A ∈ R m × n A \in \mathbb{R}^{m \times n} A∈Rm×n 都可以被完美分解为三个矩阵的乘积:
A = U Σ V T A = U \Sigma V^T A=UΣVT

1. 三个矩阵的物理含义

  • U U U( m × m m \times m m×m):左奇异向量矩阵。它的列向量是 A A T A A^T AAT 的特征向量,构成了输出空间的一组正交基。
  • V V V( n × n n \times n n×n):右奇异向量矩阵。它的列向量是 A T A A^T A ATA 的特征向量,构成了输入空间的一组正交基。
  • Σ \Sigma Σ( m × n m \times n m×n):奇异值矩阵。除了对角线,其余元素全为 0。对角线上的值 σ i \sigma_i σi​ 称为 奇异值 (Singular Value),并且它们按照从大到小严格排列: σ 1 ≥ σ 2 ≥ ⋯ ≥ ≥ 0 \sigma_1 \ge \sigma_2 \ge \dots \ge \ge 0 σ1​≥σ2​≥⋯≥≥0。

2. 几何直觉:旋转 → \rightarrow → 拉伸 → \rightarrow → 旋转

从几何变换的角度看,任何高维长方形矩阵 A A A 对一个向量的映射,都可以拆解为连续的三步:

  • V T V^T VT:在输入空间做一个旋转(不改变向量长度,只调整角度)。
  • Σ \Sigma Σ:在新的坐标轴上进行拉伸或压缩,顺便完成空间维度的升维或降维(从 n n n 维变到 m m m 维)。
  • U U U:在输出空间再做一次旋转。

3. AI直觉:能量与信息的聚集

奇异值 σ i \sigma_i σi​ 衡量了原矩阵在第 i i i 个奇异向量方向上的信息量/方差/能量。

在大语言模型(LLM)的预训练权重矩阵中,你会发现一个极为普遍的现象:前几个奇异值非常巨大,而后面的奇异值呈现断崖式下跌,迅速趋近于 0。这意味着:大模型的权重矩阵虽然名义上参数量巨大,但真正承载核心语义信息的,只有前一小部分奇异向量对应的低秩空间。

特征值与奇异值的内在联系它们两个绝非孤立存在,通过矩阵的自乘,它们可以完美统一:如果你把任意矩阵 A A A 与它的转置 A T A^T AT 相乘,会得到一个对称方阵 A T A A^T A ATA 或 A A T A A^T AAT。 A T A A^T A ATA 的特征值,正好等于 A A A 的奇异值的平方: λ i = σ i 2 \lambda_i = \sigma_i^2 λi​=σi2​。 A T A A^T A ATA 的特征向量,正好就是 A A A 的右奇异向量 V V V。 A A T A A^T AAT 的特征向量,正好就是 A A A 的左奇异向量 U U U。
直观理解:求奇异值的过程,本质上就是通过 A T A A^T A ATA 把它强行变成对称方阵,然后再去偷看它的特征值,最后开个平方根。

维度必须是基向量的关系特征向量之间不一定相互垂直左/右奇异向量内部绝对严格正交输入输出空间映射在同一个空间内发生允许映射在不同的空间(维度可变)数值特征可以是复数、负数或零必须是非负实数 ( σ ≥ 0 \sigma \ge 0 σ≥0)

特征值分解 (EVD)奇异值分解 (SVD)
适用矩阵方阵 ( n × n n \times n n×n)任意矩阵 ( m × n m \times n m×n)
几何意义变换中方向保持不变的轴及缩放倍数任意空间变换中最大拉伸方向的缩放比例
基向量的关系特征向量之间不一定相互垂直左/右奇异向量内部绝对严格正交
Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐