注意力机制研究风向变了!从这些顶刊顶会看 attention 最新的研究趋势...
近来注意力机制顶刊顶会论文高度聚焦于三大方向:
一是注意力机制的效率优化,这是最活跃的方向,核心是解决标准Transformer中自注意力计算的二次复杂度带来的计算和内存瓶颈,让其能处理更长序列或部署在资源受限的设备上;
二是注意力机制的认知与能力边界探索,旨在理解和突破注意力模型的能力极限,探索其在认知和学习方面的可能性;
三是注意力基础架构的创新与挑战,这方向不再对现有Transformer搞些小修小补,而是尝试设计全新的基础架构,或者从固有缺陷入手。
为让大家更直观地理解当前注意力机制的研究思路与技术落地路径,我们根据上述方向,精选了183篇注意力机制前沿论文,并附有代码,篇幅有限就不一一展示了,大家可自取完整合集。
全部论文+开源代码需要的同学看文末

You Need Better Attention Priors
研究方法:该论文将自注意力机制重构为熵最优传输问题,揭示标准注意力隐含均匀先验的局限性,提出GOAT,通过将可学习的连续先验以加性形式融入注意力对数几率,实现语义与结构子空间的解耦,且完全兼容FlashAttention等优化核,既解决了注意力汇的纠缠问题,又融合了可学习位置嵌入的灵活性与固定编码的长度泛化能力,成为标准多头注意力的即插即用替代方案。

创新点:
-
从熵最优传输视角重构自注意力,将正则项推广为与任意先验的KL散度,推导出含对数先验的注意力分布公式,建立更通用的数学基础。
-
提出GOAT注意力机制,将查询和键分解为语义与结构子空间,融入傅里叶级数的相对位置先验和键专属注意力汇偏置,兼容FlashAttention且实现信息解耦。
-
基于EOT框架解释注意力汇是低信号下的自然结果,通过GOAT的键专属偏置实现对其的可控建模,解决表征纠缠问题,同时兼顾长度泛化与表征灵活性。

研究价值:论文从熵最优传输视角重构自注意力的数学基础,提出的GOAT机制以可训练先验替代标准注意力的均匀先验,解耦语义与结构信息,既从理论上解释并解决了注意力汇的表征纠缠问题,又兼顾可学习嵌入的灵活性与固定编码的长度泛化能力,且兼容FlashAttention等优化核,为Transformer的注意力机制提供了更高效、稳定且通用的即插即用改进方案,在长上下文检索、视觉、计算生物学等多模态任务中均验证了其性能优势。
Stockformer: A Price-Volume Factor Stock Selection Model Based on Wavelet Transform and Multi-Task Self-Attention Networks
研究方法:论文提出Stockformer股票选择模型,创新融合离散小波变换与多任务自注意力网络,通过小波变换将股票收益率分解为高低频分量以捕捉长短期市场动态,借助双频时空编码器整合时序注意力、扩张因果卷积与图嵌入技术,以多任务自注意力机制同时预测股票收益与趋势方向,有效建模股票间复杂时空关联,提升对市场波动及突发事件的响应与预测精度。

创新点:
-
融合离散小波变换对股票收益率进行高低频分解,分别捕捉长期市场趋势与短期波动,为后续预测提供更精准的时序特征基础。
-
设计双频时空编码器,结合时序注意力、扩张因果卷积与图嵌入技术,同时建模股票间的时空关联,通过融合注意力机制高效整合高低频特征信息。
-
采用多任务自注意力学习策略,同步预测股票收益与涨跌趋势,搭配多监督优化机制,提升模型对市场波动的适应性与预测稳健性。

研究价值:论文提出的Stockformer模型融合小波变换与多任务自注意力网络,通过高低频分解、时空关联建模及多任务学习,在A股市场多场景下实现更精准的股票收益与趋势预测,回测中展现出优于基线模型的稳定性与抗波动能力,为量化交易提供了更可靠的决策支持工具。
关注下方《学姐带你玩AI》🚀🚀🚀
回复“222”获取全部方案+开源代码
码字不易,欢迎大家点赞评论收藏
更多推荐
所有评论(0)