电子科大:LLM注意力机制优化插件DSAS

📖标题:DSAS: A Universal Plug-and-Play Framework for Attention Optimization in Multi-Document Question Answering
🌐来源:arXiv, 2510.12251
🌟摘要
虽然大型语言模型 (LLM) 在各个领域都显示出相当大的前景,但它们在处理多文档问答 (Multi-doc QA) 任务方面存在显着差异。第一个挑战是远程依赖建模,其中 LLM 难以专注于长文本中的关键信息,这削弱了重要的语义连接。其次,大多数 LLM 都存在“中间丢失”问题,它们在长输入中间难以处理信息。当前的解决方案要么截断全局依赖关系,要么需要昂贵的微调,最终缺乏对这些挑战的通用和简单的解决方案。为了解决这些限制,我们提出了包含两个模块的两阶段自适应锐化 (DSAS)。(i) 上下文门加权 (CGW) 模块通过逐层注意力跟踪和位置感知加权评估段落相关性来缓解“中间丢失”。(ii) 互惠注意力抑制 (RAS) 模块通过抑制关键文本和不相关文本之间的信息交换来增强关键段落的关注,从而减轻远程依赖建模的局限性。值得注意的是,DSAS 充当即插即用的解决方案,不需要架构修改或额外的训练参数。在四个基准上的广泛实验表明,DSAS 在主流 LLM(Llama、Qwen、Mistral 和 Deepseek)上的有效性,Llama-3.1-8B-Instruct 和 Qwen2.5-14B-Instruct 上的多文档 QA 任务中的平均 F1 分数提高了 4.2%。消融研究证实了 CGW 和 RAS 模块的主要贡献。此外,附录中的详细讨论进一步验证了 DSAS 的鲁棒性和可扩展性。
🛎️文章简介
🔸研究问题:如何在多文档问答任务中优化大语言模型(LLM)的注意力机制,以解决长距离依赖建模和“丢失在中间”现象带来的挑战?
🔸主要贡献:论文提出了一个无需训练的通用插件框架DSAS,通过双阶段自适应优化注意力机制来增强多文档问答性能。
📝重点思路
🔸通过系统分析多文档问答中信息流,识别关键段落,提出上下文门控加权(CGW)来增强对重要信息的注意。
🔸引入互反注意力抑制(RAS)模块,旨在抑制关键段落与不相关内容之间的交互。
🔸在无额外训练的情况下通过插件形式集成DGAS到现有的Transformer基础架构中。
🔸进行了一系列实验证明DSAS在多个公认基准数据集上的有效性,特别是在不同规模的LLMs(如Llama和Qwen)上。
🔎分析总结
🔸DSAS在所有多文档问答基准上均取得了性能提升,F1得分提升幅度高达4.2%。
🔸中等规模的LLMs在加入DSAS后表现出更显著的性能增加,特别是在应对长文档任务时。
🔸我们的实验表明,DSAS能够有效缓解“丢失在中间”现象,从而提升模型在长上下文信息中的核心段落关注度。
🔸DSAS对于输入顺序的变化表现出较强的鲁棒性,验证了其在不同情境下的适用性。
💡个人观点
论文提出一个普适的插件,在不改变现有模型结构的基础上,通过识别上下文重要模块改进注意力机制。
🧩附录


更多推荐
所有评论(0)