【深度学习知识点38】注意力机制
·
-
局部自注意力(Local Self-Attention):
- 局部自注意力机制限制了每个查询(query)只与其邻近的键(key)进行匹配,这样可以减少计算量,并且能够捕捉局部特征。
- 局部自注意力可以看作是一种折中方案,它既保留了卷积的局部感受野特性,又具有自注意力的动态特征选择能力。
- 局部自注意力通过限制感受野到每个查询的邻近像素,可以在保持效率的同时,捕捉局部特征和细节。
-
早期卷积层(Early-Stage Convolutions):
- 早期卷积层利用局部感受野和权重共享的特性,能够快速捕捉图像的局部特征,并且具有很好的平移不变性。
- 卷积神经网络(CNN)依靠局部滤波器,具有固有的归纳偏置,使得它们在数据较少时也能快速收敛,比ViT更高效。
- 早期卷积层在图像分割等任务中表现出色,因为它们能够有效地处理图像数据,并且保持对局部特征的敏感性。
-
全局注意力(Global Attention):
- 全局注意力是指模型能够关注整个输入序列中的所有元素。这种注意力机制允许模型在任意位置的标记上都考虑到序列中所有其他标记的信息。
- 全局注意力通常集中在自定义位置的几个标记上,例如在分类任务中,全局注意力可能用于[CLS]标记,在问答任务中,全局注意力可能用于所有问题标记。
- 全局注意力的计算复杂度通常为O(n),因为它需要考虑序列中所有元素之间的关系。
-
多头注意力(Multi-Head Attention):
- 多头注意力是自注意力的扩展,它通过并行地执行多次自注意力来捕捉序列中不同子空间的信息。每个“头”捕获序列中不同方面的信息,然后将所有头的输出拼接起来,通过一个线性层进行整合。
- 多头注意力允许模型同时从多个表示子空间获取信息,增强了模型的表达能力。
-
自注意力(Self-Attention):
- 自注意力机制是一种在序列内部进行特征提取的机制,通过计算序列中每个元素对于序列中其他元素的注意力分数来工作,这些分数表示了元素间的关联度。
- 自注意力机制的查询(Query)和键(Key)都来自于同一组元素,即它们是同源的,这与注意力机制不同,后者的查询和键是不同来源的。
自注意力机制的“动态特征选择能力”指的是模型在处理输入序列时,能够根据序列中不同位置元素之间的相关性动态地调整对每个元素的关注程度,从而捕捉序列内部的复杂依赖关系。这种能力使得模型能够更加灵活地关注那些对于当前任务更为重要的特征,而不是平等地对待所有输入特征。以下是几个关键点来解释这一能力:
-
并行处理与长距离依赖:自注意力机制能够并行处理输入序列的元素,并直接关注输入序列中所有位置的元素,这使得模型具备了建模长距离依赖关系的能力。
-
注意力得分:通过计算序列中不同位置元素之间的相关性得分,自注意力机制生成新的序列表示。这种得分机制允许模型动态地选择关注哪些输入特征。
-
查询(Query)、键(Key)、值(Value):在自注意力机制中,输入序列经由线性变换得到查询、键和值三个向量。模型通过计算查询与键的点积,然后通过softmax函数归一化得到每个元素的注意力分数,从而实现动态特征选择。
-
加权平均计算输出:最后,模型使用注意力权重与值向量相乘以获得最终输出,这一过程体现了模型根据注意力得分动态选择特征的能力。
-
局部自注意力与动态特征选择:局部自注意力机制限制了每个查询只与其邻近的键进行匹配,这样可以减少计算量,并且能够捕捉局部特征和细节。这种机制结合了卷积的局部感受野特性和自注意力的动态特征选择能力。
更多推荐
所有评论(0)