【2025】吴恩达LLM大模型学习笔记 (6)
·
吴恩达 2025 年 LLM 大模型教程第 6 集:Transformer 结构内容总结
一、Transformer 结构的核心地位
Transformer 是 2017 年提出的基于自注意力机制的深度学习模型架构,彻底改变了自然语言处理领域的技术格局,是现代 LLM(如 GPT、BERT)的核心基础。其核心优势在于并行处理能力和对长距离上下文的捕捉能力,解决了此前 RNN 类模型在长序列处理和计算效率上的瓶颈。
二、Transformer 的整体架构
Transformer 采用编码器 - 解码器(Encoder-Decoder)结构,两端均由多个相同的层堆叠而成,整体设计围绕 “注意力机制” 展开:
(一)编码器(Encoder)
- 由 N 个相同的编码器层组成,每个编码器层包含两个子层:
- 多头自注意力机制(Multi-Head Self-Attention):允许模型同时关注输入序列中不同位置的信息,例如在翻译 “苹果是一种水果” 时,“苹果” 既可能关联 “水果”,也可能关联上下文其他信息,多头注意力可并行捕捉这些关联。
- 前馈神经网络(Feed-Forward Network):对每个位置的信息进行独立的线性变换和非线性处理,增强模型的拟合能力。
- 编码器的输入经过词嵌入(Word Embedding)和位置编码(Positional Encoding)后进入编码器层,最终输出包含整个输入序列上下文信息的特征向量。
(二)解码器(Decoder)
- 同样由 N 个相同的解码器层组成,每个解码器层包含三个子层:
- 掩码多头自注意力机制(Masked Multi-Head Self-Attention):在训练时屏蔽未来位置的信息,确保生成序列时仅依赖已生成的内容(如语言模型生成下一个词时,不会提前看到后面的词)。
- 编码器 - 解码器注意力(Encoder-Decoder Attention):关注编码器输出的特征向量(即输入序列的上下文),使生成的内容与输入保持语义关联(如翻译时,解码器需参考编码器输出的原句信息)。
- 前馈神经网络:与编码器中的前馈网络结构相同,用于处理当前位置的信息。
三、核心组件解析
(一)自注意力机制(Self-Attention)
- 核心原理:通过计算序列中每个词与其他所有词的 “注意力分数”,确定每个词在当前位置的权重,最终生成加权求和的特征向量。公式可简化为:
plaintext
Attention(Q, K, V) = softmax(QK^T / √d_k) * V
其中 Q(Query,查询)、K(Key,键)、V(Value,值)均由输入通过线性变换得到,d_k 为缩放因子,避免分数过大导致 softmax 梯度消失。 - 多头注意力:将 Q、K、V 分割为多个子空间并行计算注意力,再将结果拼接,增强模型对不同类型关联的捕捉能力。
(二)位置编码(Positional Encoding)
- 由于 Transformer 没有循环结构,需通过位置编码向模型注入序列的位置信息,确保模型理解词的顺序。常用正弦余弦函数实现,使不同位置的编码具有明确的距离关系。
四、Transformer 的优势与影响
- 并行计算:摒弃 RNN 的串行依赖,可同时处理输入序列的所有位置,大幅提升训练和推理速度,为训练大规模模型(如千亿参数 LLM)奠定基础。
- 长距离依赖捕捉:通过注意力机制,模型能直接计算序列中任意两个位置的关联,无需像 RNN 那样逐步传递信息,更适合处理长文本(如书籍、长文档)。
- 通用性强:不仅适用于语言任务,还被广泛应用于图像、音频等领域,成为跨模态学习的核心架构之一。
更多推荐
所有评论(0)