DeepSeek注意力机制详解:MLA与DSA如何解决长文本处理难题
本文解析了DeepSeek对Transformer注意力机制的系统性改进。从V2的Multi-Head Latent Attention (MLA)通过低秩压缩解决KV Cache显存问题,到V3.2的DeepSeek Sparse Attention (DSA)引入闪电索引器和Top-k Token选择机制,将计算复杂度从O(L²)降至O(Lk)。这些创新显著提升了长文本处理效率,为大规模语言模型的长上下文任务提供了有效解决方案。
对不起,我要讲一期带公式了,点进来的都是真英雄。
注意力机制(Attention)自Transformer提出以来一直是序列建模的核心组件。标准Transformer Attention的计算复杂度为O (L²),其中L表示序列长度。这种二次时间和空间复杂度在处理长文本任务时成为瓶颈。
为了解决这一问题,DeepSeek对注意力结构进行了系统性改进,从最初的Multi-Head Latent Attention(MLA)到最新的****DeepSeek Sparse Attention(DSA),下面从理论和实现细节层面进行深入分析。
太长不看版:
- DeepSeek V2**:Multi-Head Latent Attention****(MLA)**
-
核心创新:
MLA 通过低秩压缩(Low-Rank Key-Value Joint Compression)将原本庞大的Key-Value(KV)Cache压缩为一个潜在向量(Latent Vector),极大地减少了推理显存占用,解决了KV Cache瓶颈问题。
-
存在问题:
虽然MLA解决了显存问题,但标准的Transformer注意力机制的时间复杂度仍然是O (L²),在长文本场景下,推理和训练速度会显著变慢,计算成本极高。
- DeepSeek V3.2**:DeepSeek Sparse Attention(DSA****)**
-
核心创新:
DSA 引入了闪电索引器(Lightning Indexer)和细粒度Token选择机制(Fine-grained Token Selection)。闪电索引器能以极快的速度判断对于当前正在处理的Token,序列中哪些历史Token是最重要的,随后模型只从这些最重要的 Token 中选取Top-k一小部分进行精细计算,将核心注意力的计算复杂度从 O (L²) 骤降至O (Lk),其中k是一个远小于L的固定值,在处理长文本时带来了巨大的效率提升。
-
性能提升:
DSA在保留MLA架构优势的同时,通过稀疏化解决了计算瓶颈,并且通过与MLA的精细结合和持续训练,在几乎不影响模型输出效果的前提下,实现了长文本训练和推理效率的大幅提升。
详细公式版:
1. DeepSeek V2**:Multi-Head Latent Attention****(MLA****)**
1.1****问题背景
在标准Transformer 中,注意力计算如下:

Q、K、V分别代表查询矩阵,键矩阵和值矩阵。他们都是从同一个输入,经过不同的矩阵系数变换得到的。dh是每个head内的隐藏维度。
在推理阶段,为了支持自回归生成模型,通常会缓存前序序列的K,V
(即KV Cache),导致显存开销达到O(L⋅Nh⋅dh),并在注意力计算中产生O (L²)的时间复杂度。
1.2 MLA****的核心创新:低秩压缩
DeepSeek V2 提出的**Multi-Head Latent Attention****(MLA****)**通过“低秩压缩”(Low-Rank Key-Value Joint Compression)将大的K,V投影到一个低维潜在空间,以显著减少显存占用。


如图所示,将ht先通过下投影矩阵生成尺寸很小的查询潜在向量和**键值潜在向量。这里查询潜在向量不保存,但是也做了下投影,是为了减少内存使用量。键值潜在向量保存到显存里面去,以便下一次查询时****调用。**这里Rotation也做相应的处理,然后再把潜在向量做上投影得到普通尺寸的Q、K、V, 然后进行MHA计算。
在实际的推理过程中,因为上投影矩阵可以被吸收,所以并没有引入太多的额外计算量。吸收情况如下:

最后KV Cache的尺寸对比如下:

MQA相当于group数目为1的GQA ,MLA相当于group数为2.25的GQA。普通GQA的典型group数为8,所以MLA只需要原先GQA28%的KV Cache存储空间。
-
KV Cache 的显存占用从MHA的O(L⋅Nh⋅dh)降至O(L⋅dl); 这里dl=4.5dh.
-
对长序列显存压力帮助显著。
1.3****限制与问题
尽管 MLA 在显存层面显著优化了 KV Cache,但其计算复杂度依然保持二次增长:

因此,在处理更长上下文时,MLA并没有根本解决计算瓶颈,只是在一定程度上减轻了显存压力。
2. DeepSeek V3.2**:DeepSeek Sparse Attention****(DSA****)**
为了进一步缓解Attention 的二次复杂度问题,DeepSeek在 V3 系列中提出了DeepSeek Sparse Attention****(DSA****),其核心在于“稀疏化核心注意力权重计算”。
DSA 的设计包含两个关键机制:
- 闪电索引器(Lightning Indexer**)**
- 细粒度Token选择机制(Fine-Grained Token Selection)
2.1闪电索引器与Top-k Token选取
DSA 的关键思想是:在当前正在处理的Token位置t,仅从历史序列中选取最重要的top-k个历史 Token 参与注意力计算,而不是对全部L个历史Token做完整二次计算。
设原始序列表示为:
计算当前预测位置的Query:
而历史 Keys 序列为:
DSA 通过闪电索引器快速估计每个历史Key 与当前 Query 的相关性得分:

随后选择 top-k:
这些被选中的Token 集合才真正进入注意力计算:

其中
分别是 top-k Token 的 Key 和 Value。

2.2****复杂度变换
引入稀疏化后,核心Attention 计算复杂度从O (L²) 降低到了O (Lk),K<<L.
这在长序列场景下带来了指数级加速,尤其在上下文长度变得极长时提升最为明显。
3. DSA****的实现细节与训练稳定性
DeepSeek Sparse Attention 并不是简单地将 “top-k” 用于推理,而是与MLA 的 latent 缓存机制结合,使得:
- Head 内的低秩表示依然存在
- Top-k Token 选择机制仅针对注意力计算展开
- 稀疏权重仍可以通过反向传播学习
4. V2 vs V3.2****核心差异

**5.**结语
DeepSeek从MLA到DSA的Attention 演进体现了两个核心理念:
- 从全序列Dense计算向稀疏Top-k计算过渡;
- 从显存优化向时间复杂度优化延伸。
这种逐步工程化的设计,不仅提升了长文本的推理效率,还为未来更大规模长上下文任务提供了解决思路。
最后
我在一线科技企业深耕十二载,见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事,早已在效率与薪资上形成代际优势,我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。
我整理出这套 AI 大模型突围资料包:
- ✅AI大模型学习路线图
- ✅Agent行业报告
- ✅100集大模型视频教程
- ✅大模型书籍PDF
- ✅DeepSeek教程
- ✅AI产品经理入门资料
完整的大模型学习和面试资料已经上传带到CSDN的官方了,有需要的朋友可以扫描下方二维码免费领取【保证100%免费】👇👇

为什么说现在普通人就业/升职加薪的首选是AI大模型?
人工智能技术的爆发式增长,正以不可逆转之势重塑就业市场版图。从DeepSeek等国产大模型引发的科技圈热议,到全国两会关于AI产业发展的政策聚焦,再到招聘会上排起的长队,AI的热度已从技术领域渗透到就业市场的每一个角落。

智联招聘的最新数据给出了最直观的印证:2025年2月,AI领域求职人数同比增幅突破200% ,远超其他行业平均水平;整个人工智能行业的求职增速达到33.4%,位居各行业榜首,其中人工智能工程师岗位的求职热度更是飙升69.6%。
AI产业的快速扩张,也让人才供需矛盾愈发突出。麦肯锡报告明确预测,到2030年中国AI专业人才需求将达600万人,人才缺口可能高达400万人,这一缺口不仅存在于核心技术领域,更蔓延至产业应用的各个环节。


资料包有什么?
①从入门到精通的全套视频教程⑤⑥
包含提示词工程、RAG、Agent等技术点

② AI大模型学习路线图(还有视频解说)
全过程AI大模型学习路线

③学习电子书籍和技术文档
市面上的大模型书籍确实太多了,这些是我精选出来的

④各大厂大模型面试题目详解

⑤ 这些资料真的有用吗?
这份资料由我和鲁为民博士共同整理,鲁为民博士先后获得了北京清华大学学士和美国加州理工学院博士学位,在包括IEEE Transactions等学术期刊和诸多国际会议上发表了超过50篇学术论文、取得了多项美国和中国发明专利,同时还斩获了吴文俊人工智能科学技术奖。目前我正在和鲁博士共同进行人工智能的研究。
所有的视频教程由智泊AI老师录制,且资料与智泊AI共享,相互补充。这份学习大礼包应该算是现在最全面的大模型学习资料了。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。


智泊AI始终秉持着“让每个人平等享受到优质教育资源”的育人理念,通过动态追踪大模型开发、数据标注伦理等前沿技术趋势,构建起"前沿课程+智能实训+精准就业"的高效培养体系。
课堂上不光教理论,还带着学员做了十多个真实项目。学员要亲自上手搞数据清洗、模型调优这些硬核操作,把课本知识变成真本事!


如果说你是以下人群中的其中一类,都可以来智泊AI学习人工智能,找到高薪工作,一次小小的“投资”换来的是终身受益!
应届毕业生:无工作经验但想要系统学习AI大模型技术,期待通过实战项目掌握核心技术。
零基础转型:非技术背景但关注AI应用场景,计划通过低代码工具实现“AI+行业”跨界。
业务赋能 突破瓶颈:传统开发者(Java/前端等)学习Transformer架构与LangChain框架,向AI全栈工程师转型。
👉获取方式:
😝有需要的小伙伴,可以保存图片到wx扫描二v码免费领取【保证100%免费】🆓**

更多推荐
所有评论(0)