注意力机制视角:探索LLM对图结构数据的处理
钟官 ∘12{ }^{\circ} 12∘12 李康 Wu∘123\mathrm{Wu}^{\circ}{ }^{123}Wu∘123 郝克 Zhao 123{ }^{123}123 明 He 4{ }^{4}4 建平 Fan 4{ }^{4}4
摘要
注意力机制是大型语言模型(LLMs)成功的关键,推动了多个领域的显著进步。然而,对于需要强调拓扑连接的图结构数据,它们在固定链接上的消息传递机制(如图神经网络GNNs所采用的机制)面前表现不足。这引发了一个问题:“在自然语言环境下,注意力机制是否对图数据失效?”受此观察的启发,我们从注意力机制的角度出发,进行了实证研究,以探索LLM如何处理图结构数据。目标是深入了解LLM在图结构上的注意力行为。我们发现了LLM在应用注意力到图结构数据时的独特现象,并分析了这些发现以改进LLM对这类数据的建模能力。我们的主要研究结果如下:1) 虽然LLM可以识别图数据并捕捉文本-节点交互,但由于其固有的架构限制,难以建模图结构内的节点间关系。2) LLM在图节点上的注意力分布与理想的结构模式不一致,表明未能适应图拓扑的细微差别。3) 完全连接的注意力和固定连接都不是最优的;每种方法在其应用场景中都有特定的局限性。相反,中间状态的注意力窗口可以提高LLM训练性能,并在推理过程中无缝过渡到完全连接的窗口。源代码:LLM4Exploration
1. 引言
LLM引起了广泛关注,在语言处理方面取得了显著成功,并展示了向其他领域有效迁移的能力(Goyal等人,2024;Ouyang等人,2022;Pi等人,2024;Singh等人,2023;Wu等人,2024;Zhao等人,2024;Wu等人,2023)。这一趋势激励了图机器学习社区深入研究LLM在其领域中的应用(He等人,2024;Chen等人,2024b;Huang等人,2024;Kong等人,2024;He和Hooi,2024;Liu等人,2025;Guan等人,2024)。然而,最近的研究表明,现有的用于图的LLM在图结构数据上无法提供令人满意的性能,指出了阻碍LLM在此背景下部署的未发现挑战(Luo等人,2024)。
注意力机制是LLM成功的关键组成部分,有效地将标记连接起来,使模型能够理解复杂的上下文和领域特定知识(Xiao等人,2024;Hsieh等人,2024;Yu等人,2024)。尽管注意力机制潜力巨大,但对其在图结构数据上的应用研究仍处于初级阶段,缺乏系统分析。因此,我们从注意力分析的角度展开调查,旨在揭示LLM在图数据结构上的独特现象,并验证我们关于LLM在此类数据上的行为假设。我们的工作旨在填补这一研究空白,并为未来该领域的研究建立明确方向。
在本文中,我们基于以下假设进行了研究,并发现了新的问题和现象。
Q1: 在微调前后,LLM的注意力分布是否发生变化?LLM能否正确利用图结构?
我们首先比较了LLM训练前后节点标记和文本标记的注意力得分分布曲线。然后进行假设检验,以澄清以下几点:对节点标记的注意力是否发生了变化;对文本标记的注意力是否发生了变化;以及节点标记和文本标记之间的注意力分布是否一致。
0{ }^{0}0 等量贡献 1{ }^{1}1 天津大学管理与经济学部,中国天津 2{ }^{2}2 天津大学复杂管理系统计算与分析实验室,中国天津 3{ }^{3}3 ai-deepcube 4AI{ }^{4} \mathrm{AI}4AI 联想研究院AI实验室,中国北京。联系人:郝克 Zhao <<< hongke@tju.edu.cn >>>。
第 42nd 42^{\text {nd }}42nd 国际机器学习会议论文集,加拿大温哥华。PMLR 267, 2025。版权所有2025由作者所有。
结果显示,经过训练后,LLM对节点标记的注意力确实发生了显著变化。这表明LLM已经初步具备了识别图结构数据的能力。同时,我们的假设检验显示,LLM在节点内的注意力分布表现出极端倾向。然而,在后续实验中,当我们扰乱连接信息时,我们发现即使拓扑连接信息被随机打乱,这对LLM的性能几乎没有任何影响。这表明LLM没有有效利用正确的连接信息。
Q2: LLM是否能按照图的结构属性分配注意力给不同类型的图节点?
当处理图数据输入时,LLM计算节点标记之间的注意力得分,以衡量不同节点之间的相对重要性。通过我们的可视化实验,我们发现LLM中不同节点标记之间的注意力得分不足以匹配图结构。具体来说,在顺序条件下,节点标记的注意力分布呈现出U形或长尾分布,偏离了我们的理想化假设。理想情况下,模型应更多关注中心节点,并按层次递减的方式分配注意力。
同时,我们的分析显示,文本标记对节点标记的注意力更接近我们的理想期望。这表明当前LLM的限制不在于文本和节点之间的交互,而在于节点之间的连接建模。
Q3: 对于LLM的图结构任务,是LLM的完全连接视角还是GNN的固定链接视角更适合?
我们引入一个具体的指标,全局链接视野(GLH),来衡量LLM中节点之间的可见范围。通过广泛调整GLH的实验,我们发现LLM的完全连接视角和GNN的固定链接视角都不代表LLM的最佳注意力视角。
包含某些拓扑链接信息的中间视角在训练期间表现出优越性能,并在仅用于推理时产生意外改进。具体来说,用较小链接视野训练的模型可以在较大的链接视野下有效部署。这种从小到大的可转移性解决了实际部署挑战,同时增强了模型性能。
在这项工作中,我们的主要目标是识别独特现象并探索这些现象的原因和潜在影响,旨在为社区提供新视角,指导未来发现如何LLM处理图结构数据。
我们在本工作中的贡献总结如下:
- 我们对LLM在图结构数据上的注意力进行了可视化和分析。据我们所知,这是首次从注意力角度对LLM在图机器学习中的应用进行的经验研究。
-
- 我们的分析显示,LLM未能有效利用图中的连接信息。我们通过检查两个主要方面对此问题进行了深入探讨:注意力得分的分布和注意力窗口的范围。
-
- 我们发现了类似于自然语言任务中的“注意力汇”问题,以及图数据特有的“偏斜线汇”现象。借鉴NLP社区的经验,我们可以探索纠正这些偏差的方法以提高模型性能。
-
- 通过一系列实验,我们确定了LLM在图机器学习应用中面临的多种现象和当前挑战。我们的工作提供了有价值的见解,并指导该领域未来的研究努力。
2. 相关工作
2.1. LLM中的注意力分析
随着LLM在各个社区中引起广泛关注,开创性的研究开始聚焦于LLM中的注意力机制及其分布(Ruan & Zhang, 2024; Acharya et al., 2024; Makkuva et al., 2024; Liang et al., 2024)。StreamLLM(Xiao et al., 2024)率先发现了“注意力汇”的现象,即语义受限的初始标记可能会获得不成比例较高的注意力得分。该研究建议在长文本推理过程中保持这些特殊标记以获得更好的性能。基于StreamLLM,Yu等人(2024)发现纠正部分注意力汇可以带来性能提升而无需额外训练。Duan等人(2024)探索了注意力与句子不确定性之间的关系,而Hsieh等人(2024)研究了RAG中的“迷失在中间”现象,重点关注检索文档排名与注意力之间的相互作用。
2.2. 注意力窗口
我们将注意力窗口定义为神经网络单层内标记之间的可见范围。在类似BERT(Kenton & Toutanova, 2019)的模型中,注意力视图是双向完全连接的,允许每个

图1. 训练前后的不同类型标记的注意力分布。左侧为Amazon-Ratings,中间为Roman-Empire,右侧为Wikics。注意力值已进行对数缩放,并作为密度分布图绘制。
标记关注所有其他标记。相比之下,在GPT系列模型(Brown et al., 2020)中,使用单向因果掩码,限制每个标记只能看到前面的标记,从而形成下三角形注意力矩阵。同样,在GNN中,可见性由固定连接定义,其中每个节点只能看到其直接相连的邻居(Kipf & Welling, 2022)。在将LLM应用于图数据挖掘的背景下,一些工作简单地将LLM适应为使用固定链接或双向完全连接的注意力窗口(Yang et al., 2024; Zhu et al., 2024b)。然而,这些适应缺乏彻底的实验分析和对注意力窗口对模型性能影响的更深入探索。
3. 实证研究
我们的实验和分析总结基于多个数据集。除了展示部分外,一些详细设置和结果可在附录中查看。
A1. 注意力分布的变化
经过微调的LLM(LLaGA (Chen et al., 2024b)) 在图任务上显示出相对改进。为了研究LLM是否能够区分图结构数据和自然语言数据,并有效利用图结构信息(Q1),我们比较了训练前后的标记注意力焦点变化。
设置。H0\boldsymbol{H}_{0}H0 : 微调前后对节点标记的注意力不变。H1\boldsymbol{H}_{1}H1 : 微调前后对文本标记的注意力变化。H2\boldsymbol{H}_{2}H2 : 节点标记和文本标记的注意力分布不一致。值得注意的是,我们遵循公认的LLaGa指南。更多信息,请参见附录J。
我们比较了训练前后节点标记和文本标记的注意力得分分布,如图1所示。
表1. 注意力得分分布的统计分析(Roman-Empire 数据集)。注意:** 表示p值<0.01,否则 t-text 和 K S 测试 p>0.05。JS 散度值如下所示。
| 比较 | T检验 | KS检验 | JS |
|---|---|---|---|
| 训练前 vs 训练后(文本) | 44.061∗∗44.061^{* *}44.061∗∗ | 0.092∗∗0.092^{* *}0.092∗∗ | 0.0064 |
| 训练前 vs 训练后(节点) | 0.461 | 0.049∗∗0.049^{* *}0.049∗∗ | 0.0099 |
| 节点 vs 文本(训练前) | −60.455∗∗-60.455^{* *}−60.455∗∗ | 0.279∗∗0.279^{* *}0.279∗∗ | 0.0753 |
| 节点 vs 文本(训练后) | −78.651∗∗-78.651^{* *}−78.651∗∗ | 0.316∗∗0.316^{* *}0.316∗∗ | 0.0791 |
我们的分析显示节点标记的注意力分布有显著变化,表明LLM开始识别节点标记。简而言之,观察到LLM倾向于使节点标记和文本标记的注意力分布对齐。
为了统计验证这些观察结果,我们对注意力得分分布进行了T检验、Kolmogorov-Smirnov (KS)检验和Jensen-Shannon散度(JS)检验,结果总结在表1中。
我们的统计分析显示,比较训练前后的注意力得分分布时,特别是对于节点标记,KS检验表明训练后注意力得分分布有显著变化,而t检验表明平均注意力得分保持不变。鉴于KS检验侧重于整体分布,而t检验强调均值,这种差异突显了注意力模式的细微变化。
此外,JS距离进一步支持这些发现,显示节点的注意力得分整体分布比文本标记变化更显著。这意味着虽然平均注意力水平保持一致,但注意力得分的分布呈现双峰趋势,表明LLM为某些节点发展出独特的注意力模式,导致
注意力分配的两极分化。
A2. 结构信息干扰实验
在发现LLM能够感知图结构数据后,我们进一步研究它们是否能有效利用这种类型的数据。为此,我们设计了具有不同程度连接信息改变的干扰实验,并观察模型性能的变化。理想情况下,随着干扰程度的增加,模型的性能应下降。此外,我们收集了模型的注意力得分,以提供其在图数据中的行为新见解。
设置。我们将干扰实验分为四个级别:(I) 交换第一级节点之间的一组子节点。(II) 交换第一级节点之间随机数量的子节点,并进一步破坏信息结构。(III) 随机打乱第一级和第二级节点的位置,甚至允许原始第二级节点成为第一级节点。(IV) 引入无关节点并执行随机替换。(Raw) 保持信息结构。
这些实验的结果如表2所示。遗憾的是,LLM在一半的数据集上对图结构连接信息的干扰没有显著反应。具体来说,在大多数情况下(Wikics、Pubmed),在干扰级别(I)和(II)下模型性能没有显著变化。只有在较高干扰级别(III)或(IV)下,我们才观察到性能下降。然而,通过WL测试的GNNs性能一直在下降。
相比之下,只有Roman数据集呈现出理想场景,即随着干扰级别的增加,模型性能逐渐恶化。这种行为符合我们的假设,即模型有效利用了图结构信息。Roman数据集性能的持续恶化表明,当图结构信息充分表示且不过度破坏时,LLM确实可以利用结构信息。在其他数据集中,模型未能表现出如此清晰的模式,表明其利用图结构的能力有限。
为了获得更深的见解,我们仔细检查了训练前后邻居节点分配给中心节点的注意力得分分布的变化,针对不同程度的扰动。结果如图2所示。图2描绘了训练前后的注意力分布,揭示了由于邻居节点对中心节点的关注减少,导致未能有效利用图结构信息的数据集中对图结构的关注减弱。相反,在Roman-Empire数据集中,观察到此类关注有所增加,表明模型学会了利用图结构信息。
总体(Q1),虽然LLM表现出对图结构数据的认识,但其当前机制限制了其有效利用这种信息的能力。
在下一小节中,我们将深入探讨注意力得分的分布,以进一步探索LLM如何处理图结构数据。
B. 注意力分布对图数据的适应性
当以自然语言形式将图结构输入到LLM中时,模型会为每个图节点分配不同的注意力得分。通过分析不同类型节点的注意力得分,我们旨在考察LLM是否能有效适应图数据结构(Q2),并评估其注意力分布是否与理想状态一致——即是否可以根据图的拓扑结构合理分配注意力。
设置。我们模仿最常用的指令构造方法(例如InstrutGLM(Ye等人,2023)和LLaGA(Chen等人,2024b))以自然语言形式描述图链接结构,如图4所示。在此过程中,每个中心节点的邻居数量各不相同,意味着输入序列中的固定位置可能被不同类型节点或文本标记占据。为消除序列长度和位置等因素对节点标记注意力得分的影响,我们引入了两种操作:填充和随机打乱。这些操作确保输入指令和节点具有固定长度和位置,如图4所示。
B1. 位置偏差干扰注意力适应
通过实验,我们记录了固定位置的不同节点的注意力得分。如图3上半部分所示,节点标记对节点标记的注意力呈现斜线趋势或U形分布,最后节点的注意力得分急剧增加。这种分布与语言模型中常见的注意力分布曲线一致。此外,我们将初始节点的注意力得分较低归因于它们在整个文本中并未位于前端。
然而,这揭示了一个问题:在图数据结构下,LLM对重要节点的注意力未能充分适应图结构。具体来说,在图机器学习的理想状态下,模型应优先考虑中心节点,并逐步减少对邻近节点的注意力。或者,如果存在超级节点,则随机排列应产生平均趋势。相反,我们得到的曲线与理想状态完全不同,中心节点的重要性明显落后于其他节点。
在探索节点标记和文本标记对文本标记的注意力是否存在不一致时,结果表明两者之间没有显著差异。注意力汇或轻微波动的位置大致一致,表明高度相似性。这表明节点标记和文本标记对文本标记表现出一致的注意力模式。
备注(Q2)。我们发现注意力机制对顺序输入的图结构数据适应不良,因为其分布不符合理想场景。与NLP任务不同,其中由于重要文本位置不确定,不匹配分布是可以接受的,图结构数据包含先验重要信息。因此,具有此问题的LLM无法匹配专注于图结构的GNN的性能。此外,一些关于RAG的研究
表明标记在不同位置的放置显著影响注意力(Hsieh等人,2024)。
B2. 节点交互注意力得分
为了更深入地了解节点标记之间注意力分布的细微差别,我们对注意力得分矩阵进行了热图可视化分析,揭示了几种新颖现象。
更确切地说,图5显示了所有节点之间的注意力交互矩阵。基于此,我们观察到了所谓的“注意力汇”现象(Xiao等人,2024),这种现象在大多数图数据集中表现为两种不同的模式。第一种模式是在图5(左)中显示的简单“注意力汇”,其中某些位置在没有显著拓扑或顺序信息的情况下持续吸引更高的注意力得分。
第二种模式在图数据中表现出独特的“对角线”特征。通常,靠近主对角线的对角线由于节点更关注其邻居而具有更高的注意力值;然而,如图5(右)所示,存在一条与其他对角线相比具有显著更高注意力得分的对角线。这种模式在文本检查中未发现,表明模型可能正在学习捕捉意外的空间模式或路径依赖性,这可能是由于图结构的固有属性引起的。鉴于其区别于简单的邻接关系,我们称这种模式为

图3. 所有标记到节点的注意力说明。x坐标指的是整个节点列表中节点标记的相对位置。我们收集了所有标记对节点标记的注意力得分,并根据节点在指令中的相对位置绘制了一条折线图。上半部分:节点(查询)到节点(键)的注意力得分的平均值。下半部分:文本(查询)到节点(键)的注意力得分的平均值。图表标注了不同层级的节点。我们的节点采样是8∗88 * 88∗8。

图4. 填充和随机打乱以确保固定序列长度和位置。这最小化了其他原因对注意力得分的干扰。
“偏斜线汇。”
“注意力汇”和“偏斜线汇”现象的出现干扰了LLM中节点之间的适当注意力分配,阻止它们有效利用图结构信息。然而,基于这些发现,我们可以更有效地与NLP社区合作以纠正这些偏差。
C. 图结构数据的注意力窗口
在近期的工作(Kim等,2022;Joshi,2020)中,已证明变压器可以被视为完全连接的图注意力模型,而当代仅解码器的LLM则作为单向完全连接的图变压器(GT)模型运作。对于给定的图结构数据,LLM的注意力窗口表现为一个低三角矩阵,表示完全连接,而GNN的注意力窗口是一个固定的链接邻接矩阵。这两种极端代表了图结构数据中注意力窗口的光谱。注意力窗口决定了模型如何捕捉节点之间的关系,是影响图结构学习效果的关键因素。在本节中,我们探讨LLM如何从不同的可见视角学习和利用图结构,寻找完全连接和固定链接视角之间的最佳链接视角(Q3)。
设置。我们引入全局链接视野kkk来表示注意力窗口下节点标记的可见范围。kkk的范围从0到2LLL,其中LLL表示从中心节点到的跳数或邻域半径。如图6所示,当采样子图时L=2L=2L=2跳:k=0k=0k=0表示所有节点只能看到自己,k=1k=1k=1表示所有节点可以看到其一级邻居,而k=4k=4k=4表示节点可以看到所有其他节点。其中,k=0k=0k=0和k=4k=4k=4代表没有有效链接信息的注意力窗口,而k=1,2,3k=1,2,3k=1,2,3包括部分图链接信息。此外,考虑到

图5. 注意力得分交互矩阵(节点)的说明。左:左面板显示所有节点之间的注意力交互矩阵(1个中心节点+8个一级节点+8∗8+8 * 8+8∗8二级节点),跨所有头和层取平均值。右:右面板显示一级和二级节点之间的注意力交互矩阵,突出显示四组选定组以进行详细分析。我们用灰框突出显示“注意力汇”,用黑框突出显示“偏斜线汇”。
表3. 四个真实世界数据集在不同kkk值下的模型性能(准确率(%)±\pm±标准差)
| k\mathbf{k}k | Wikics | Roman | Amazon | Pubmed |
|---|---|---|---|---|
| kunidi 4k_{\text {unidi }}^{4}kunidi 4 | 77.49±0.2177.49 \pm 0.2177.49±0.21 | 80.73±0.080.73 \pm 0.080.73±0.0 | 45.19±0.245.19 \pm 0.245.19±0.2 | 82.92±0.182.92 \pm 0.182.92±0.1 |
| kbidi 4k_{\text {bidi }}^{4}kbidi 4 | 67.81±0.0667.81 \pm 0.0667.81±0.06 | 81.38±0.081.38 \pm 0.081.38±0.0 | 43.79±0.443.79 \pm 0.443.79±0.4 | 82.47±0.482.47 \pm 0.482.47±0.4 |
| kunidi 3k_{\text {unidi }}^{3}kunidi 3 | 77.96±0.1377.96 \pm 0.1377.96±0.13 | 81.68±0.0281.68 \pm 0.0281.68±0.02 | 45.46±0.045.46 \pm 0.045.46±0.0 | 83.36±0.1\mathbf{8 3 . 3 6} \pm \mathbf{0 . 1}83.36±0.1 |
| kbidi 3k_{\text {bidi }}^{3}kbidi 3 | 74.93±0.2674.93 \pm 0.2674.93±0.26 | 81.61±0.081.61 \pm 0.081.61±0.0 | 45.63±0.145.63 \pm 0.145.63±0.1 | 81.98±0.181.98 \pm 0.181.98±0.1 |
| kunidi 2k_{\text {unidi }}^{2}kunidi 2 | 78.90±0.17\mathbf{7 8 . 9 0} \pm \mathbf{0 . 1 7}78.90±0.17 | 82.87±0.0282.87 \pm 0.0282.87±0.02 | 44.67±0.044.67 \pm 0.044.67±0.0 | 82.89±0.382.89 \pm 0.382.89±0.3 |
| kbidi 2k_{\text {bidi }}^{2}kbidi 2 | 77.42±0.1977.42 \pm 0.1977.42±0.19 | 82.05±0.0282.05 \pm 0.0282.05±0.02 | 45.18±0.245.18 \pm 0.245.18±0.2 | 82.67±0.182.67 \pm 0.182.67±0.1 |
| kunidi 1k_{\text {unidi }}^{1}kunidi 1 | 78.15±0.0278.15 \pm 0.0278.15±0.02 | 83.12±0.0\mathbf{8 3 . 1 2} \pm \mathbf{0 . 0}83.12±0.0 | 45.95±0.145.95 \pm 0.145.95±0.1 | 80.49±0.280.49 \pm 0.280.49±0.2 |
| kbidi 1k_{\text {bidi }}^{1}kbidi 1 | 78.43±0.0978.43 \pm 0.0978.43±0.09 | 83.05±0.0183.05 \pm 0.0183.05±0.01 | 46.17±0.0\mathbf{4 6 . 1 7} \pm \mathbf{0 . 0}46.17±0.0 | 79.81±0.279.81 \pm 0.279.81±0.2 |
由于LLM大多是单向解码器,而GNN链接是双向的,我们在实证研究中结合了单向(kunidi k_{\text {unidi }}kunidi )和双向(kbidi k_{\text {bidi }}kbidi )链接。
C1. 最优可见视角
我们进行了多次不同kkk值的实验,结果汇总在表3中。从表中可以看出,当训练和推理的kkk值保持不变时,LLM的完全连接视图(k=4k=4k=4)无法实现最佳性能。相反,包含某些拓扑链接信息的中间视图(k=2,3k=2,3k=2,3)表现更好。固定链接视图
(k=1k=1k=1)也被认为表现良好。
然而,k≠4k \neq 4k=4的设置需要预标注节点标记并修改注意力窗口,这在现实场景中带来了部署挑战。因此,我们继续探索。
C2. 单向与双向注意力
为了进一步研究单向和双向注意力的影响,我们在表4中进行了对比实验。单向和双向注意力之间的相互转换很难取得更好的结果,且随kkk值增大,转换造成的损失也增加。
C3. 不同可见视角间的可转移性
我们还在表4中测试了在一个kkk值下训练并在其他kkk值下推理的模型的转移能力。
小到大:令人惊讶的是,从小的kkk值切换到大的kkk值不会削弱模型性能,反而增强了它。具体来说,通过在k=2k=2k=2或k=3k=3k=3下训练模型,我们可以在推理时使用k=4\mathrm{k}=4k=4达到更好的性能,这比直接在k=4k=4k=4下训练更好。由于k=4\mathrm{k}=4k=4是LLM的完全连接视图,在实际推理中不需要修改,解决了C1小节提到的部署困难。

图6. 不同全局链接视野k的说明。从左到右,图像代表k=1\mathrm{k}=1k=1到4。为了演示GNN的视野,k=1\mathrm{k}=1k=1的图像以双向形式描绘,其余以单向形式显示。
表4. 不同kkk值下模型的转移性能。行表示训练时使用的kkk值。列代表测试时使用的kkk值。每个kkk值转移的最佳性能用灰色突出显示,整体最佳性能加粗。正常窗口(kunidi 4)\left(k_{\text {unidi }}^{4}\right)(kunidi 4)条件下的LLM测试最佳结果用下划线表示。
| 测试 | kbidi 4k_{\text {bidi }}^{4}kbidi 4 | kundi 4k_{\text {undi }}^{4}kundi 4 | kbidi 3k_{\text {bidi }}^{3}kbidi 3 | kundi 3k_{\text {undi }}^{3}kundi 3 | kbidi 2k_{\text {bidi }}^{2}kbidi 2 | kundi 2k_{\text {undi }}^{2}kundi 2 | kbidi 1k_{\text {bidi }}^{1}kbidi 1 | kundi 1k_{\text {undi }}^{1}kundi 1 |
|---|---|---|---|---|---|---|---|---|
| 训练 | ||||||||
| kbidi 4k_{\text {bidi }}^{4}kbidi 4 | 67.81±0.0667.81 \pm 0.0667.81±0.06 | 66.87±0.1966.87 \pm 0.1966.87±0.19 | 68.09±0.3468.09 \pm 0.3468.09±0.34 | 65.95±0.0465.95 \pm 0.0465.95±0.04 | 67.45±0.1367.45 \pm 0.1367.45±0.13 | 66.72±0.1366.72 \pm 0.1366.72±0.13 | 65.10±0.2165.10 \pm 0.2165.10±0.21 | 64.82±0.2364.82 \pm 0.2364.82±0.23 |
| kundi 4k_{\text {undi }}^{4}kundi 4 | 61.02±0.2361.02 \pm 0.2361.02±0.23 | 77.49±0.2177.49 \pm 0.2177.49±0.21 | 72.43±0.0272.43 \pm 0.0272.43±0.02 | 78.41±0.0678.41 \pm 0.0678.41±0.06 | 74.75±0.3874.75 \pm 0.3874.75±0.38 | 78.19±0.2378.19 \pm 0.2378.19±0.23 | 77.00±0.3677.00 \pm 0.3677.00±0.36 | 77.87±0.3477.87 \pm 0.3477.87±0.34 |
| kbidi 3k_{\text {bidi }}^{3}kbidi 3 | 74.63±1.1574.63 \pm 1.1574.63±1.15 | 72.17±0.6672.17 \pm 0.6672.17±0.66 | 74.93±0.2674.93 \pm 0.2674.93±0.26 | 72.75±0.2672.75 \pm 0.2672.75±0.26 | 75.87±0.0475.87 \pm 0.0475.87±0.04 | 72.83±0.1772.83 \pm 0.1772.83±0.17 | 72.66±0.1772.66 \pm 0.1772.66±0.17 | 71.23±0.1171.23 \pm 0.1171.23±0.11 |
| kundi 3k_{\text {undi }}^{3}kundi 3 | 57.73±0.4957.73 \pm 0.4957.73±0.49 | 77.82±0.3077.82 \pm 0.3077.82±0.30 | 72.55±0.1972.55 \pm 0.1972.55±0.19 | 77.96±0.1377.96 \pm 0.1377.96±0.13 | 76.48±0.1176.48 \pm 0.1176.48±0.11 | 79.22±0.1579.22 \pm 0.1579.22±0.15 | 77.38±0.6677.38 \pm 0.6677.38±0.66 | 77.74±0.0477.74 \pm 0.0477.74±0.04 |
| kbidi 2k_{\text {bidi }}^{2}kbidi 2 | 64.03±0.3464.03 \pm 0.3464.03±0.34 | 73.71±0.4973.71 \pm 0.4973.71±0.49 | 75.14±0.2175.14 \pm 0.2175.14±0.21 | 74.88±0.3474.88 \pm 0.3474.88±0.34 | 77.42±0.1977.42 \pm 0.1977.42±0.19 | 75.22±0.4775.22 \pm 0.4775.22±0.47 | 76.59±0.5176.59 \pm 0.5176.59±0.51 | 74.48±0.4174.48 \pm 0.4174.48±0.41 |
| kundi 2k_{\text {undi }}^{2}kundi 2 | 52.58±0.0452.58 \pm 0.0452.58±0.04 | 74.97±0.6874.97 \pm 0.6874.97±0.68 | 68.80±0.5368.80 \pm 0.5368.80±0.53 | 77.51±0.0277.51 \pm 0.0277.51±0.02 | 73.30±0.5673.30 \pm 0.5673.30±0.56 | 78.90±0.1778.90 \pm 0.1778.90±0.17 | 76.08±0.3876.08 \pm 0.3876.08±0.38 | 76.33±0.0976.33 \pm 0.0976.33±0.09 |
| kbidi 1k_{\text {bidi }}^{1}kbidi 1 | 49.17±0.3049.17 \pm 0.3049.17±0.30 | 74.33±0.0474.33 \pm 0.0474.33±0.04 | 69.20±0.0969.20 \pm 0.0969.20±0.09 | 75.22±0.3475.22 \pm 0.3475.22±0.34 | 75.25±0.0275.25 \pm 0.0275.25±0.02 | 76.78±0.4576.78 \pm 0.4576.78±0.45 | 78.32±0.4978.32 \pm 0.4978.32±0.49 | 78.43±0.0978.43 \pm 0.0978.43±0.09 |
| kundi 1k_{\text {undi }}^{1}kundi 1 | 34.05±0.0134.05 \pm 0.0134.05±0.01 | 72.08±0.7972.08 \pm 0.7972.08±0.79 | 55.75±0.2155.75 \pm 0.2155.75±0.21 | 74.63±0.2674.63 \pm 0.2674.63±0.26 | 66.19±0.0266.19 \pm 0.0266.19±0.02 | 76.91±0.2876.91 \pm 0.2876.91±0.28 | 75.50±0.5375.50 \pm 0.5375.50±0.53 | 78.15±0.0278.15 \pm 0.0278.15±0.02 |
大到小:从更宽的窗口转换到更窄的窗口会提高模型性能(例如,从4到3,或从3到2)。我们将这种现象归因于从更宽的视角训练LLM更具挑战性,模型必须应对更多的上下文和潜在噪声。当切换到更窄的视角时,模型受益于复杂性降低和干扰减少,从而表现更好。
总体(Q3),我们的实证研究表明,带有连接信息的注意力窗口显著影响LLM对图结构的理解。在包含某些拓扑链接信息的非完全连接视图下训练有助于LLM理解图结构,并促进从小到大视角的转移学习。
其他附录中的工作
详细的设置描述见附录A,数据集信息见附录B。附录C讨论了其他相关工作。其他数据集(基础LLM)的注意力图和实验结果见附录H、G、I和F。
4. 发现与结论
发现。我们发现尽管LLM在训练过程中逐渐意识到图数据,但未能有效利用这些图中的连接信息。还发现微调后的LLM具备捕捉节点与文本之间关系的能力,但缺乏建模节点间关系的能力。这种局限性在注意力交互中表现为“注意力汇”和“偏斜线汇”现象。
此外,我们发现LLM的完全连接注意力窗口不适合训练图数据。更好的方法是在包含图拓扑信息的小视角下进行训练,然后进行转移学习。
结论与局限性。我们探索了LLM在图数据上的注意力机制,发现了许多现象,为图学习社区的进一步研究提供了方向性指导。同时,由于篇幅和资源的限制,我们只分析了部分发现的现象。还有大量的未探索现象有待研究社区进一步调查。
影响声明
本文的目标是推进机器学习领域的发展。我们的工作有许多潜在的社会影响,但我们认为没有必要在这里特别强调任何一项。
5. 致谢
本研究得到了国家自然科学基金(72471165)和天津市自然科学基金(No. 24JCQNJC01560)的部分资助。
参考文献
Acharya, S., Jia, F., and Ginsburg, B. Star attention: Efficient llm inference over long sequences. arXiv preprint arXiv:2411.17116, 2024.
Brown, T., Mann, B., Ryder, N., Subbiah, M., Kaplan, J. D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al. Language models are few-shot learners. Advances in neural information processing systems, 33: 1877-1901, 2020.
Chen, R., Zhao, T., Jaiswal, A., Shah, N., and Wang, Z. Llaga: Large language and graph assistant. arXiv preprint arXiv:2402.08170, 2024a.
Chen, R., Zhao, T., JAISWAL, A. K., Shah, N., and Wang, Z. Llaga: Large language and graph assistant. In Forty-first International Conference on Machine Learning, 2024b.
Duan, J., Cheng, H., Wang, S., Zavalny, A., Wang, C., Xu, R., Kailkhura, B., and Xu, K. Shifting attention to relevance: Towards the predictive uncertainty quantification of free-form large language models. In Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 50505063, 2024.
Goyal, S., Rastogi, E., Rajagopal, S. P., Yuan, D., Zhao, F., Chintagunta, J., Naik, G., and Ward, J. Healai: A
healthcare llm for effective medical documentation. In Proceedings of the 17th ACM International Conference on Web Search and Data Mining, pp. 1167-1168, 2024.
Guan, Z., Zhao, H., Wu, L., He, M., and Fan, J. Langtopo: aligning language descriptions of graphs with tokenized topological modeling. arXiv preprint arXiv:2406.13250, 2024.
He, X., Bresson, X., Laurent, T., Perold, A., LeCun, Y., and Hooi, B. Harnessing explanations: Llm-to-lm interpreter for enhanced text-attributed graph representation learning. In The Twelfth International Conference on Learning Representations, 2023.
He, X., Bresson, X., Laurent, T., Perold, A., LeCun, Y., and Hooi, B. Harnessing explanations: Llm-to-lm interpreter for enhanced text-attributedgraph representation learning. In The Twelfth International Conference on Learning Representations, 2024.
He, Y. and Hooi, B. Unigraph: Learning a cross-domain graph foundation model from natural language. arXiv preprint arXiv:2402.13630, 2024.
Hsieh, C.-Y., Chuang, Y.-S., Li, C.-L., Wang, Z., Le, L. T., Kumar, A., Glass, J., Ratner, A., Lee, C.-Y., Krishna, R., et al. Found in the middle: Calibrating positional attention bias improves long context utilization. arXiv preprint arXiv:2406.16008, 2024.
Huang, X., Han, K., Yang, Y., Bao, D., Tao, Q., Chai, Z., and Zhu, Q. Can gnn be good adapter for llms? In Proceedings of the ACM on Web Conference 2024, pp. 893-904, 2024.
Joshi, C. Transformers are graph neural networks. The Gradient, 12:17, 2020.
Kenton, J. D. M.-W. C. and Toutanova, L. K. Bert: Pretraining of deep bidirectional transformers for language understanding. In Proceedings of naacL-HLT, volume 1, pp. 2. Minneapolis, Minnesota, 2019.
Kim, J., Nguyen, D., Min, S., Cho, S., Lee, M., Lee, H., and Hong, S. Pure transformers are powerful graph learners. Advances in Neural Information Processing Systems, 35: 14582-14595, 2022.
Kipf, T. N. and Welling, M. Semi-supervised classification with graph convolutional networks. In International Conference on Learning Representations, 2022.
Kong, L., Feng, J., Liu, H., Huang, C., Huang, J., Chen, Y., and Zhang, M. Gofa: A generative one-for-all model for joint graph language modeling. arXiv preprint arXiv:2407.09709, 2024.
Liang, Y., Liu, H., Shi, Z., Song, Z., Xu, Z., and Yin, J. Conv-basis: A new paradigm for efficient attention inference and gradient computation in transformers. arXiv preprint arXiv:2405.05219, 2024.
Liu, Z., Wu, L., He, M., Guan, Z., Zhao, H., and Feng, N. Multi-view empowered structural graph wordification for language models. In Proceedings of the AAAI Conference on Artificial Intelligence, volume 39, pp. 24714-24722, 2025.
Luo, Y., Shi, L., and Wu, X.-M. Classic gnns are strong baselines: Reassessing gnns for node classification. arXiv e-prints, pp. arXiv-2406, 2024.
Makkuva, A. V., Bondaschi, M., Nagle, A., Girish, A., Kim, H., Jaggi, M., and Gastpar, M. Attention with markov: A curious case of single-layer transformers. In ICML 2024 Workshop on Mechanistic Interpretability, 2024.
Mernyei, P. and Cangea, C. Wiki-cs: A wikipedia-based benchmark for graph neural networks. arXiv preprint arXiv:2007.02901, 2020.
Ouyang, L., Wu, J., Jiang, X., Almeida, D., Wainwright, C., Mishkin, P., Zhang, C., Agarwal, S., Slama, K., Ray, A., et al. Training language models to follow instructions with human feedback. Advances in neural information processing systems, 35:27730-27744, 2022.
Pi, R., Yao, L., Gao, J., Zhang, J., and Zhang, T. Perceptiongpt: Effectively fusing visual perception into llm. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp. 27124-27133, 2024.
Platonov, O., Kuznedelev, D., Diskin, M., Babenko, A., and Prokhorenkova, L. A critical look at the evaluation of gnns under heterophily: Are we really making progress? In The Eleventh International Conference on Learning Representations, 2023.
Qiao, Y., Ao, X., Liu, Y., Xu, J., Sun, X., and He, Q. Login: A large language model consulted graph neural network training framework. arXiv preprint arXiv:2405.13902, 2024.
Ruan, T. and Zhang, S. Towards understanding how attention mechanism works in deep learning. arXiv preprint arXiv:2412.18288, 2024.
Singh, I., Blukis, V., Mousavian, A., Goyal, A., Xu, D., Tremblay, J., Fox, D., Thomason, J., and Garg, A. Progprompt: Generating situated robot task plans using large language models. In 2023 IEEE International Conference on Robotics and Automation (ICRA), pp. 11523-11530. IEEE, 2023.
Sun, S., Ren, Y., Ma, C., and Zhang, X. Large language models as topological structure enhancers for text-attributed graphs. arXiv preprint arXiv:2311.14324, 2023.
Touvron, H., Martin, L., Stone, K., Albert, P., Almahairi, A., Babaei, Y., Bashlykov, N., Batra, S., Bhargava, P., Bhosale, S., et al. Llama 2: Open foundation and finetuned chat models. arXiv preprint arXiv:2307.09288, 2023.
Wu, L., Zhao, H., Li, Z., Huang, Z., Liu, Q., and Chen, E. Learning the explainable semantic relations via unified graph topic-disentangled neural networks. ACM Transactions on Knowledge Discovery from Data, 17(8):1-23, 2023.
Wu, L., Zheng, Z., Qiu, Z., Wang, H., Gu, H., Shen, T., Qin, C., Zhu, C., Zhu, H., Liu, Q., et al. A survey on large language models for recommendation. World Wide Web, 27(5):60, 2024.
Xiao, G., Tian, Y., Chen, B., Han, S., and Lewis, M. Efficient streaming language models with attention sinks. In The Twelfth International Conference on Learning Representations, 2024.
Yang, H., Wang, X., Tao, Q., Hu, S., Lin, Z., and Zhang, M. Gl-fusion: Rethinking the combination of graph neural network and large language model. arXiv e-prints, pp. arXiv-2412, 2024.
Yang, J., Liu, Z., Xiao, S., Li, C., Lian, D., Agrawal, S., Singh, A., Sun, G., and Xie, X. Graphformers: Gnn-nested transformers for representation learning on textual graph. Advances in Neural Information Processing Systems, 34:28798-28810, 2021.
Ye, R., Zhang, C., Wang, R., Xu, S., and Zhang, Y. Natural language is all a graph needs. arXiv preprint arXiv:2308.07134, 2023.
Yu, Z., Wang, Z., Fu, Y., Shi, H., Shaikh, K., and Lin, Y. C. Unveiling and harnessing hidden attention sinks: Enhancing large language models without training through attention calibration. arXiv preprint arXiv:2406.15765, 2024.
Zhang, S., Zheng, D., Zhang, J., Zhu, Q., Adeshina, S., Faloutsos, C., Karypis, G., Sun, Y., et al. Hierarchical compression of text-rich graphs via large language models. arXiv preprint arXiv:2406.11884, 2024.
Zhao, H., Wu, L., Shan, Y., Jin, Z., Sui, Y., Liu, Z., Feng, N., Li, M., and Zhang, W. A comprehensive survey of large language models in management: Applications, challenges, and opportunities. Challenges, and Opportunities (August 14, 2024), 2024.
Zhao, J., Qu, M., Li, C., Yan, H., Liu, Q., Li, R., Xie, X., and Tang, J. Learning on large-scale text-attributed graphs via variational inference. arXiv preprint arXiv:2210.14709, 2022.
Zhu, X., Xue, H., Zhao, Z., Jin, M., Xu, W., Huang, J., Wang, Q., Zhou, K., and Zhang, Y. Llm as gnn: Graph vocabulary learning for graph foundation model. openreview, 2024a.
Zhu, Y., Wang, Y., Shi, H., and Tang, S. Efficient tuning and inference for large language models on textual graphs. arXiv preprint arXiv:2401.15569, 2024b.
A. 实现细节
在实验过程中,我们以LLama2-7B(Touvron等人,2023)作为基础模型,并使用了8×88 \times 88×8的邻居采样方案。对于每个数据集,在实验过程中,我们使用基础模型处理数据集中的原始文本,作为节点的嵌入特征,将每个节点视为类似于LLama中的标记。关于如A.1所述收集的数据,我们收集了不同层和头对每个节点的注意力得分,并使用对数函数进行缩放。对于A.2中受干扰的数据:(II) 我们在两个节点之间执行随机交换,连续重复此过程十次。(IV) 我们在同一批次内执行节点的随机交换以引入无序。更多详细信息见表5。
表5. Roman-Empire、Amazon-Ratings和Pubmed、Wikics的超参数。
| 超参数 | Amazon-Ratings | Pubmed | Wikcis | Roman |
|---|---|---|---|---|
| 学习率 | 1e−41 \mathrm{e}-41e−4 | 1e−41 \mathrm{e}-41e−4 | 1e−41 \mathrm{e}-41e−4 | 1e−41 \mathrm{e}-41e−4 |
| 预热 | 0.05 | 0.05 | 0.05 | 0.05 |
| 梯度累积步数 | 8 | 8 | 8 | 8 |
| 批量大小 | 4 | 4 | 4 | 4 |
| 迭代次数 | 1 | 1 | 1 | 1 |
| num_beams | 2 | 2 | 2 | 2 |
| use_embedding | True | True | False | False |
B. 数据集
选择数据集时,我们考虑了广泛的范围,选择了异构图数据集Amazon-Rating(Platonov等人,2023)和Roman-Empire(Platonov等人,2023),以及同构图数据集Pubmed和WikiCS(Mernyei & Cangea,2020)。各数据集的统计指标如下表6所示。
表6. 数据集统计
| Roman-Empire | Amazon-Ratings | Wikics | Pubmed | |
|---|---|---|---|---|
| 节点 | 22,662 | 24,492 | 11,701 | 19,717 |
| 边 | 32,927 | 93,050 | 216,123 | 44,338 |
| 平均度 | 2.91 | 7.60 | 36.89 | 4.49 |
| 节点特征 | 4096 | 4096 | 4096 | 4096 |
| 类别 | 18 | 5 | 10 | 3 |
| 边同质性 | 0.05 | 0.38 | - | - |
| 调整后的同质性 | -0.05 | 0.14 | - | - |
C. 其他相关工作
最近的进展深入研究了在图结构领域中利用大型语言模型(LLMs)。例如GLEM(Zhao等人,2022),以及其他作品(Yang等人,2021)探讨了通过联合训练框架整合LLMs和图神经网络(GNNs)。He等人(2023)采用的方法是利用LLMs预测节点排名分类,并提供全面见解以丰富GNN嵌入的质量。同时,Sun等人(2023)利用LLMs生成伪标签,旨在增强图拓扑表示。此外,还强调了推进LLMs直接处理文本图的能力。例如,InstructGLM(Ye等人,2023)开创性地基于LLMs的指令微调来表达图结构和节点特性,有效解决了图相关任务。Qiao等人(2024)也提出了LLMs和GNNs的交互融合。尽管这些进步,LLMs在处理转换为自然语言的结构化数据时面临挑战,通常导致次优结果。为解决这一问题,LLaGA(Chen等人,2024a)重新制定节点链接信息为序列数据,从而应用指令微调,增强了LLMs的理解能力,同时保留了结构化节点信息。UniGraph(He & Hooi,2024)实施了一种掩码策略,共同训练LLMs和GNNs,实现了跨不同图和数据集的强大泛化。
此外,Kong等人(2024)研究了创建结合LLMs与GNNs的图基础模型。GraphAdapter(Huang等人,2024)利用GNN模型作为适配器与LLMs协同工作,用于TAG任务,通过外部访问辅助特定任务的微调。
此外,近期的努力越来越多地专注于从更全面的角度设计模块以实现更好的性能。在Zhu等人(2024a)的背景下,通过指令模仿GNNs的聚合过程迫使LLMs学习如何有效地聚合节点信息。Zhang等人(2024)的工作利用LLMs分层压缩长篇原始文本,最终将其浓缩为适合图任务的少量标记。这种分层压缩允许以易于图模型处理的形式高效表示复杂的文本数据。
Zhang等人(2024)的方法在对其自身文本中的标记进行注意力计算时,结合来自邻近节点的信息,同时减少标记数量。在最终推理阶段,它通过重新评估周围的邻近节点来细化预测,从而提高结果的准确性和相关性。
D. 其他基础模型的干扰性能
表7. 干扰性能。四个真实世界数据集在五个干扰级别下的节点分类结果(准确率(%)±\pm±标准差)。使用的模型是Vicuna-7B,节点采样配置为8×88 \times 88×8。
| 数据集 | 原始 | (I) | (II) | (III) | (IV) |
|---|---|---|---|---|---|
| Wikics | 0.7899±0.0040.7899 \pm 0.0040.7899±0.004 | 0.7898±0.0020.7898 \pm 0.0020.7898±0.002 | 0.7919±0.0010.7919 \pm 0.0010.7919±0.001 | 0.7773±0.0020.7773 \pm 0.0020.7773±0.002 | 0.7101±0.0050.7101 \pm 0.0050.7101±0.005 |
| Pubmed | 0.8322±0.0020.8322 \pm 0.0020.8322±0.002 | 0.8345±0.0010.8345 \pm 0.0010.8345±0.001 | 0.8300±0.0010.8300 \pm 0.0010.8300±0.001 | 0.7434±0.0030.7434 \pm 0.0030.7434±0.003 | 0.7453±0.0010.7453 \pm 0.0010.7453±0.001 |
| Amazon-Ratings | 0.4541±0.0010.4541 \pm 0.0010.4541±0.001 | 0.4544±0.0010.4544 \pm 0.0010.4544±0.001 | 0.4498±0.0020.4498 \pm 0.0020.4498±0.002 | 0.4135±0.0010.4135 \pm 0.0010.4135±0.001 | 0.3943±0.0010.3943 \pm 0.0010.3943±0.001 |
| Roman-Empire | 0.8094±0.0010.8094 \pm 0.0010.8094±0.001 | 0.8001±0.0010.8001 \pm 0.0010.8001±0.001 | 0.7883±0.0030.7883 \pm 0.0030.7883±0.003 | 0.6543±0.0010.6543 \pm 0.0010.6543±0.001 | 0.6016±0.0010.6016 \pm 0.0010.6016±0.001 |
表8. 干扰性能。四个真实世界数据集在五个干扰级别下的节点分类结果(准确率(%)±\pm±标准差)。使用的模型是LLama3-7B,节点采样配置为8×88 \times 88×8。
| 数据集 | 原始 | (I) | (II) | (III) | (IV) |
|---|---|---|---|---|---|
| Wikics | 0.7988±0.0010.7988 \pm 0.0010.7988±0.001 | 0.7981±0.0060.7981 \pm 0.0060.7981±0.006 | 0.7988±0.0050.7988 \pm 0.0050.7988±0.005 | 0.7487±0.0020.7487 \pm 0.0020.7487±0.002 | 0.7209±0.0010.7209 \pm 0.0010.7209±0.001 |
| Pubmed | 0.8448±0.0010.8448 \pm 0.0010.8448±0.001 | 0.8449±0.0030.8449 \pm 0.0030.8449±0.003 | 0.8442±0.0030.8442 \pm 0.0030.8442±0.003 | 0.8067±0.0030.8067 \pm 0.0030.8067±0.003 | 0.7753±0.0020.7753 \pm 0.0020.7753±0.002 |
| Amazon-Ratings | 0.4515±0.0010.4515 \pm 0.0010.4515±0.001 | 0.4523±0.0020.4523 \pm 0.0020.4523±0.002 | 0.3985±0.0030.3985 \pm 0.0030.3985±0.003 | 0.3889±0.0020.3889 \pm 0.0020.3889±0.002 | 0.3744±0.0050.3744 \pm 0.0050.3744±0.005 |
| Roman-Empire | 0.8108±0.0020.8108 \pm 0.0020.8108±0.002 | 0.8007±0.0020.8007 \pm 0.0020.8007±0.002 | 0.7922±0.0020.7922 \pm 0.0020.7922±0.002 | 0.6324±0.0010.6324 \pm 0.0010.6324±0.001 | 0.5618±0.0020.5618 \pm 0.0020.5618±0.002 |
E. 注意力得分分布的统计分析
可以看出大多数结果与我们的展示和结论一致。
表9. 注意力得分分布的统计分析。注意:** 表示p值<0.01,否则 t检验和KS检验 p>0.05。JS散度值按原样提供。
| 比较 | Amazon | WikiCS | ||||
|---|---|---|---|---|---|---|
| T检验 | KS检验 | JS | T检验 | KS检验 | JS | |
| 训练前 vs 训练后(文本) | 95.066∗∗95.066^{* *}95.066∗∗ | 0.118∗∗0.118^{* *}0.118∗∗ | 0.0066 | 61.764∗∗61.764^{* *}61.764∗∗ | 0.107∗∗0.107^{* *}0.107∗∗ | 0.0038 |
| 训练前 vs 训练后(节点) | 69.334∗∗69.334^{* *}69.334∗∗ | 0.116∗∗0.116^{* *}0.116∗∗ | 0.0113 | 118.293∗∗118.293^{* *}118.293∗∗ | 0.216∗∗0.216^{* *}0.216∗∗ | 0.0307 |
| 节点 vs 文本(训练前) | −337.116∗∗-337.116^{* *}−337.116∗∗ | 0.428∗∗0.428^{* *}0.428∗∗ | 0.1423 | −268.998∗∗-268.998^{* *}−268.998∗∗ | 0.362∗∗0.362^{* *}0.362∗∗ | 0.0766 |
| 节点 vs 文本(训练后) | −318.054∗∗-318.054^{* *}−318.054∗∗ | 0.438∗∗0.438^{* *}0.438∗∗ | 0.1123 | −184.605∗∗-184.605^{* *}−184.605∗∗ | 0.285∗∗0.285^{* *}0.285∗∗ | 0.0264 |
F. 干扰注意力得分
在图2中,我们在不改变结构信息的情况下,展示了训练前后邻居节点到中心节点的注意力得分。这里,我们显示了在各种扰动条件下的邻居节点到中心节点的注意力得分。
表10. 干扰注意力得分(Amazon-Ratings)。邻居节点到中心节点的注意力得分以平均值和标准差的形式呈现,采样比率为1:8。
| 节点 | 1\mathbf{1}1 | 2\mathbf{2}2 | 3\mathbf{3}3 | 4\mathbf{4}4 | 5\mathbf{5}5 | 6\mathbf{6}6 | 7\mathbf{7}7 | 8\mathbf{8}8 |
|---|---|---|---|---|---|---|---|---|
| (raw) | 0.017±0.0250.017 \pm 0.0250.017±0.025 | 0.018±0.0250.018 \pm 0.0250.018±0.025 | 0.012±0.0190.012 \pm 0.0190.012±0.019 | 0.008±0.0110.008 \pm 0.0110.008±0.011 | 0.007±0.0110.007 \pm 0.0110.007±0.011 | 0.006±0.0090.006 \pm 0.0090.006±0.009 | 0.004±0.0050.004 \pm 0.0050.004±0.005 | 0.004±0.0050.004 \pm 0.0050.004±0.005 |
| (I) | 0.018±0.0250.018 \pm 0.0250.018±0.025 | 0.018±0.0250.018 \pm 0.0250.018±0.025 | 0.012±0.0200.012 \pm 0.0200.012±0.020 | 0.008±0.0120.008 \pm 0.0120.008±0.012 | 0.007±0.0100.007 \pm 0.0100.007±0.010 | 0.006±0.0080.006 \pm 0.0080.006±0.008 | 0.004±0.0050.004 \pm 0.0050.004±0.005 | 0.004±0.0050.004 \pm 0.0050.004±0.005 |
| (II) | 0.017±0.0240.017 \pm 0.0240.017±0.024 | 0.017±0.0250.017 \pm 0.0250.017±0.025 | 0.012±0.0190.012 \pm 0.0190.012±0.019 | 0.008±0.0100.008 \pm 0.0100.008±0.010 | 0.007±0.0100.007 \pm 0.0100.007±0.010 | 0.006±0.0090.006 \pm 0.0090.006±0.009 | 0.004±0.0050.004 \pm 0.0050.004±0.005 | 0.004±0.0050.004 \pm 0.0050.004±0.005 |
| (III) | 0.019±0.0260.019 \pm 0.0260.019±0.026 | 0.018±0.0260.018 \pm 0.0260.018±0.026 | 0.013±0.0200.013 \pm 0.0200.013±0.020 | 0.008±0.0110.008 \pm 0.0110.008±0.011 | 0.007±0.0100.007 \pm 0.0100.007±0.010 | 0.006±0.0080.006 \pm 0.0080.006±0.008 | 0.004±0.0050.004 \pm 0.0050.004±0.005 | 0.004±0.0050.004 \pm 0.0050.004±0.005 |
| (IV) | 0.017±0.0250.017 \pm 0.0250.017±0.025 | 0.018±0.0250.018 \pm 0.0250.018±0.025 | 0.012±0.0190.012 \pm 0.0190.012±0.019 | 0.008±0.0110.008 \pm 0.0110.008±0.011 | 0.007±0.0110.007 \pm 0.0110.007±0.011 | 0.006±0.0090.006 \pm 0.0090.006±0.009 | 0.004±0.0050.004 \pm 0.0050.004±0.005 | 0.004±0.0050.004 \pm 0.0050.004±0.005 |
表11. 干扰注意力得分(Wikics)。邻居节点到中心节点的注意力得分以平均值和标准差的形式呈现,采样比率为1:8。
| 节点 | 1\mathbf{1}1 | 2\mathbf{2}2 | 3\mathbf{3}3 | 4\mathbf{4}4 | 5\mathbf{5}5 | 6\mathbf{6}6 | 7\mathbf{7}7 | 8\mathbf{8}8 |
|---|---|---|---|---|---|---|---|---|
| (raw) | 0.017±0.0210.017 \pm 0.0210.017±0.021 | 0.012±0.0170.012 \pm 0.0170.012±0.017 | 0.009±0.0140.009 \pm 0.0140.009±0.014 | 0.006±0.0110.006 \pm 0.0110.006±0.011 | 0.006±0.0110.006 \pm 0.0110.006±0.011 | 0.005±0.0100.005 \pm 0.0100.005±0.010 | 0.004±0.0090.004 \pm 0.0090.004±0.009 | 0.004±0.0090.004 \pm 0.0090.004±0.009 |
| (I) | 0.018±0.0220.018 \pm 0.0220.018±0.022 | 0.013±0.0180.013 \pm 0.0180.013±0.018 | 0.009±0.0150.009 \pm 0.0150.009±0.015 | 0.007±0.0130.007 \pm 0.0130.007±0.013 | 0.006±0.0120.006 \pm 0.0120.006±0.012 | 0.005±0.0120.005 \pm 0.0120.005±0.012 | 0.004±0.0110.004 \pm 0.0110.004±0.011 | 0.004±0.0100.004 \pm 0.0100.004±0.010 |
| (II) | 0.017±0.0200.017 \pm 0.0200.017±0.020 | 0.012±0.0160.012 \pm 0.0160.012±0.016 | 0.008±0.0130.008 \pm 0.0130.008±0.013 | 0.006±0.0100.006 \pm 0.0100.006±0.010 | 0.006±0.0100.006 \pm 0.0100.006±0.010 | 0.005±0.0090.005 \pm 0.0090.005±0.009 | 0.004±0.0080.004 \pm 0.0080.004±0.008 | 0.004±0.0070.004 \pm 0.0070.004±0.007 |
| (III) | 0.016±0.0190.016 \pm 0.0190.016±0.019 | 0.011±0.0130.011 \pm 0.0130.011±0.013 | 0.007±0.0090.007 \pm 0.0090.007±0.009 | 0.005±0.0060.005 \pm 0.0060.005±0.006 | 0.005±0.0060.005 \pm 0.0060.005±0.006 | 0.004±0.0050.004 \pm 0.0050.004±0.005 | 0.003±0.0040.003 \pm 0.0040.003±0.004 | 0.003±0.0030.003 \pm 0.0030.003±0.003 |
| (IV) | 0.018±0.0220.018 \pm 0.0220.018±0.022 | 0.013±0.0180.013 \pm 0.0180.013±0.018 | 0.009±0.0150.009 \pm 0.0150.009±0.015 | 0.007±0.0120.007 \pm 0.0120.007±0.012 | 0.006±0.0120.006 \pm 0.0120.006±0.012 | 0.005±0.0110.005 \pm 0.0110.005±0.011 | 0.004±0.0100.004 \pm 0.0100.004±0.010 | 0.004±0.0100.004 \pm 0.0100.004±0.010 |
G. 注意力得分矩阵(标记)
G.1. 标记到标记

图7. Wikics中的注意力得分交互矩阵(节点)。

图8. Roman-Empire中的注意力得分交互矩阵(节点)。

图9. Amazon-Ratings中的注意力得分交互矩阵(节点)。
G.2. 文本到文本
ALL文本注意力得分交互矩阵Wikics

节点相对位置
图10. Wikics中的注意力得分交互矩阵(文本)。

节点相对位置
图11. Roman-Empire中的注意力得分交互矩阵(文本)。

节点相对位置
图12. Amazon-Ratings中的注意力得分交互矩阵(文本)。
H. 第一节点之间的注意力得分(带子节点)

图13. Amazon-Ratings中第一节点(带子节点)的平均注意力可视化((1+8)∗2)((1+8)^{*} 2)((1+8)∗2)。

图14. Roman-Empire中第一节点(带子节点)的平均注意力可视化((1+8)*2)。

图15. Wikics中第一节点(带子节点)的平均注意力可视化((1+8)∗2)((1+8)^{*} 2)((1+8)∗2)。
I. 不同层的第一节点与子节点之间的注意力得分
中心节点和一级节点的注意力得分

图16. Amazon-Ratings中中心节点和一级节点的平均注意力可视化。

图17. Roman-Empire中中心节点和一级节点的平均注意力可视化。

图18. Wikics中中心节点和一级节点的平均注意力可视化。
J. 提示语
在这里,我们列出了本文在不同数据集上使用的所有提示语,我们使用以下提示:
- Roman-Empire: " <<< 用户 >>> : 在一篇文章中,具有依赖关系的单词(其中一个单词依赖于另一个单词)相连,形成一个依赖图。根据单词之间的连接,确定每个单词的句法角色。给定一个单词 [] 连接 [], 该单词 [] 的句法角色是什么?< 助手 >: "
-
- Amazon-Ratings: " <<< 用户 >>> : 在产品图数据集中,边连接经常一起购买的产品。根据产品(书籍、音乐CD、DVD、VHS磁带)之间的连接,预测评论者对产品的平均评分。给定一个产品 [] 连接 [], 该产品 [] 的评分是多少?<助手>: "
-
- Pubmed: " <<< 用户 >>> : 在医学论文数据集中,相互引用的论文形成一种链接关系。基于论文之间的链接关系,可以预测医学论文的研究方向。给定一篇论文 [] 连接 [], 该论文 [] 的类别是什么?<助手>:: "
-
- Wikics: " <<< 用户 >>> : 在论文数据集中,相互引用的论文形成一种链接关系。基于论文之间的链接关系,可以预测论文的研究方向。给定一篇论文 [] 连接 [], 该论文 [] 的类别是什么?<助手>:: "
K. 不同模板
我们设计了各种模板进行分析和讨论,灵感来自于论文(TALK LIKE A GRAPH)。
干扰实验的结果如下。从表K可以看出,虽然不同的模板有不同的模型性能,但总体趋势是一致的,在Roman数据集上具体表现出利用链接信息,而在大多数其他数据集上链接信息没有发挥作用。我们最初的模板(1)仍然是表现最好的,并且最有效地利用了链接信息。
表13. 不同模板下不同数据集的比较。
| 数据集 | 原始 | (I) | (II) | (III) | (IV) |
|---|---|---|---|---|---|
| (1) | |||||
| Wikics | 0.7862±0.0070.7862 \pm 0.0070.7862±0.007 | 0.7847±0.0040.7847 \pm 0.0040.7847±0.004 | 0.7907±0.00350.7907 \pm 0.00350.7907±0.0035 | 0.7670±0.0030.7670 \pm 0.0030.7670±0.003 | 0.7087±0.0050.7087 \pm 0.0050.7087±0.005 |
| Pubmed | 0.8367±0.0030.8367 \pm 0.0030.8367±0.003 | 0.8363±0.0010.8363 \pm 0.0010.8363±0.001 | 0.8364±0.0020.8364 \pm 0.0020.8364±0.002 | 0.7698±0.0030.7698 \pm 0.0030.7698±0.003 | 0.7835±0.0010.7835 \pm 0.0010.7835±0.001 |
| Amazon-Ratings | 0.4486±0.0020.4486 \pm 0.0020.4486±0.002 | 0.3980±0.0030.3980 \pm 0.0030.3980±0.003 | 0.3977±0.0020.3977 \pm 0.0020.3977±0.002 | 0.3915±0.0030.3915 \pm 0.0030.3915±0.003 | 0.3813±0.0010.3813 \pm 0.0010.3813±0.001 |
| Roman-Empire | 0.8089±0.0010.8089 \pm 0.0010.8089±0.001 | 0.7918±0.0010.7918 \pm 0.0010.7918±0.001 | 0.7910±0.0020.7910 \pm 0.0020.7910±0.002 | 0.6290±0.0020.6290 \pm 0.0020.6290±0.002 | 0.5784±0.0020.5784 \pm 0.0020.5784±0.002 |
| (2) | |||||
| Wikics | 0.7795±0.0060.7795 \pm 0.0060.7795±0.006 | 0.7789±0.0050.7789 \pm 0.0050.7789±0.005 | 0.7778±0.0030.7778 \pm 0.0030.7778±0.003 | 0.7512±0.0040.7512 \pm 0.0040.7512±0.004 | 0.6871±0.0060.6871 \pm 0.0060.6871±0.006 |
| Pubmed | 0.8112±0.0040.8112 \pm 0.0040.8112±0.004 | 0.8108±0.0020.8108 \pm 0.0020.8108±0.002 | 0.8050±0.0010.8050 \pm 0.0010.8050±0.001 | 0.7745±0.0020.7745 \pm 0.0020.7745±0.002 | 0.7783±0.0020.7783 \pm 0.0020.7783±0.002 |
| Amazon-Ratings | 0.4231±0.0030.4231 \pm 0.0030.4231±0.003 | 0.4038±0.0020.4038 \pm 0.0020.4038±0.002 | 0.3923±0.0030.3923 \pm 0.0030.3923±0.003 | 0.3869±0.0020.3869 \pm 0.0020.3869±0.002 | 0.3768±0.0020.3768 \pm 0.0020.3768±0.002 |
| Roman-Empire | 0.7932±0.0020.7932 \pm 0.0020.7932±0.002 | 0.7961±0.0020.7961 \pm 0.0020.7961±0.002 | 0.7935±0.0010.7935 \pm 0.0010.7935±0.001 | 0.7228±0.0030.7228 \pm 0.0030.7228±0.003 | 0.6130±0.0010.6130 \pm 0.0010.6130±0.001 |
| (3) | |||||
| Wikics | 0.7806±0.0070.7806 \pm 0.0070.7806±0.007 | 0.7793±0.0040.7793 \pm 0.0040.7793±0.004 | 0.7851±0.00350.7851 \pm 0.00350.7851±0.0035 | 0.7618±0.0030.7618 \pm 0.0030.7618±0.003 | 0.7025±0.0050.7025 \pm 0.0050.7025±0.005 |
| Pubmed | 0.8315±0.0030.8315 \pm 0.0030.8315±0.003 | 0.8310±0.0010.8310 \pm 0.0010.8310±0.001 | 0.8312±0.0020.8312 \pm 0.0020.8312±0.002 | 0.7643±0.0030.7643 \pm 0.0030.7643±0.003 | 0.7781±0.0010.7781 \pm 0.0010.7781±0.001 |
| Amazon-Ratings | 0.4438±0.0020.4438 \pm 0.0020.4438±0.002 | 0.3932±0.0030.3932 \pm 0.0030.3932±0.003 | 0.3929±0.0020.3929 \pm 0.0020.3929±0.002 | 0.3867±0.0030.3867 \pm 0.0030.3867±0.003 | 0.3765±0.0010.3765 \pm 0.0010.3765±0.001 |
| Roman-Empire | 0.8030±0.0010.8030 \pm 0.0010.8030±0.001 | 0.7864±0.0010.7864 \pm 0.0010.7864±0.001 | 0.7856±0.0020.7856 \pm 0.0020.7856±0.002 | 0.6234±0.0020.6234 \pm 0.0020.6234±0.002 | 0.5728±0.0020.5728 \pm 0.0020.5728±0.002 |
| (4) | |||||
| Wikics | 0.7811±0.0060.7811 \pm 0.0060.7811±0.006 | 0.7833±0.0050.7833 \pm 0.0050.7833±0.005 | 0.7812±0.00300.7812 \pm 0.00300.7812±0.0030 | 0.7665±0.0040.7665 \pm 0.0040.7665±0.004 | 0.7092±0.0060.7092 \pm 0.0060.7092±0.006 |
| Pubmed | 0.8325±0.0040.8325 \pm 0.0040.8325±0.004 | 0.8322±0.0020.8322 \pm 0.0020.8322±0.002 | 0.8317±0.0010.8317 \pm 0.0010.8317±0.001 | 0.7897±0.0020.7897 \pm 0.0020.7897±0.002 | 0.7064±0.0020.7064 \pm 0.0020.7064±0.002 |
| Amazon-Ratings | 0.4379±0.0030.4379 \pm 0.0030.4379±0.003 | 0.4085±0.0020.4085 \pm 0.0020.4085±0.002 | 0.4072±0.0030.4072 \pm 0.0030.4072±0.003 | 0.3978±0.0020.3978 \pm 0.0020.3978±0.002 | 0.3885±0.0020.3885 \pm 0.0020.3885±0.002 |
| Roman-Empire | 0.8091±0.0020.8091 \pm 0.0020.8091±0.002 | 0.7915±0.0020.7915 \pm 0.0020.7915±0.002 | 0.7913±0.0010.7913 \pm 0.0010.7913±0.001 | 0.6285±0.0030.6285 \pm 0.0030.6285±0.003 | 0.5788±0.0010.5788 \pm 0.0010.5788±0.001 |
L. 不同k值模型的转移性能。
表14. 不同k值模型的转移性能(Roman)。行表示训练时使用的k值,列表示测试时使用的k值。每个k值转移的最佳性能用灰色突出显示,整体最佳性能加粗。
| k=4\mathbf{k = 4}k=4 | k=3\mathbf{k = 3}k=3 | k=2\mathbf{k = 2}k=2 | k=1\mathbf{k = 1}k=1 | |||||
|---|---|---|---|---|---|---|---|---|
| bidi | unidi | bidi | unidi | bidi | unidi | bidi | unidi | |
| kbidi 4k_{\text {bidi }}^{4}kbidi 4 | 81.38±0.0081.38 \pm 0.0081.38±0.00 | 73.72±0.0473.72 \pm 0.0473.72±0.04 | 80.96±0.0280.96 \pm 0.0280.96±0.02 | 73.84±0.0473.84 \pm 0.0473.84±0.04 | 79.82±0.0179.82 \pm 0.0179.82±0.01 | 74.28±0.0674.28 \pm 0.0674.28±0.06 | 79.10±0.0079.10 \pm 0.0079.10±0.00 | 73.91±0.0473.91 \pm 0.0473.91±0.04 |
| kundi 4k_{\text {undi }}^{4}kundi 4 | 68.51±0.0468.51 \pm 0.0468.51±0.04 | 80.73±0.0080.73 \pm 0.0080.73±0.00 | 70.51±0.0470.51 \pm 0.0470.51±0.04 | 80.37±0.0180.37 \pm 0.0180.37±0.01 | 73.04±0.0473.04 \pm 0.0473.04±0.04 | 79.66±0.0179.66 \pm 0.0179.66±0.01 | 72.48±0.0172.48 \pm 0.0172.48±0.01 | 79.73±0.0179.73 \pm 0.0179.73±0.01 |
| kbidi 3k_{\text {bidi }}^{3}kbidi 3 | 80.96±0.0280.96 \pm 0.0280.96±0.02 | 75.96±0.0575.96 \pm 0.0575.96±0.05 | 81.61±0.0081.61 \pm 0.0081.61±0.00 | 75.67±0.0175.67 \pm 0.0175.67±0.01 | 80.80±0.0280.80 \pm 0.0280.80±0.02 | 75.60±0.0175.60 \pm 0.0175.60±0.01 | 78.64±0.0278.64 \pm 0.0278.64±0.02 | 74.93±0.0874.93 \pm 0.0874.93±0.08 |
| kundi 3k_{\text {undi }}^{3}kundi 3 | 67.41±0.0667.41 \pm 0.0667.41±0.06 | 81.79±0.0181.79 \pm 0.0181.79±0.01 | 69.50±0.0569.50 \pm 0.0569.50±0.05 | 81.68±0.0281.68 \pm 0.0281.68±0.02 | 72.62±0.0172.62 \pm 0.0172.62±0.01 | 81.60±0.0181.60 \pm 0.0181.60±0.01 | 72.74±0.0372.74 \pm 0.0372.74±0.03 | 81.59±0.0281.59 \pm 0.0281.59±0.02 |
| kbidi 2k_{\text {bidi }}^{2}kbidi 2 | 78.65±0.0178.65 \pm 0.0178.65±0.01 | 76.09±0.0376.09 \pm 0.0376.09±0.03 | 79.70±0.0079.70 \pm 0.0079.70±0.00 | 76.10±0.0076.10 \pm 0.0076.10±0.00 | 82.05±0.0282.05 \pm 0.0282.05±0.02 | 75.76±0.0175.76 \pm 0.0175.76±0.01 | 81.26±0.0081.26 \pm 0.0081.26±0.00 | 75.94±0.0175.94 \pm 0.0175.94±0.01 |
| kundi 2k_{\text {undi }}^{2}kundi 2 | 67.75±0.0367.75 \pm 0.0367.75±0.03 | 82.66±0.0182.66 \pm 0.0182.66±0.01 | 69.71±0.0469.71 \pm 0.0469.71±0.04 | 82.63±0.0282.63 \pm 0.0282.63±0.02 | 74.37±0.0274.37 \pm 0.0274.37±0.02 | 82.87±0.0182.87 \pm 0.0182.87±0.01 | 76.54±0.0376.54 \pm 0.0376.54±0.03 | 82.11±0.0282.11 \pm 0.0282.11±0.02 |
| kbidi 1k_{\text {bidi }}^{1}kbidi 1 | 77.30±0.0477.30 \pm 0.0477.30±0.04 | 77.26±0.0177.26 \pm 0.0177.26±0.01 | 78.25±0.0378.25 \pm 0.0378.25±0.03 | 77.44±0.0277.44 \pm 0.0277.44±0.02 | 79.92±0.0279.92 \pm 0.0279.92±0.02 | 77.37±0.0077.37 \pm 0.0077.37±0.00 | 83.05±0.0183.05 \pm 0.0183.05±0.01 | 77.89±0.0477.89 \pm 0.0477.89±0.04 |
| kundi 1k_{\text {undi }}^{1}kundi 1 | 64.81±0.0564.81 \pm 0.0564.81±0.05 | 82.54±0.0182.54 \pm 0.0182.54±0.01 | 66.55±0.0166.55 \pm 0.0166.55±0.01 | 82.56±0.0082.56 \pm 0.0082.56±0.00 | 71.17±0.0171.17 \pm 0.0171.17±0.01 | 82.78±0.0182.78 \pm 0.0182.78±0.01 | 73.53±0.0073.53 \pm 0.0073.53±0.00 | 83.12±0.0183.12 \pm 0.0183.12±0.01 |
表15. 不同k值模型的转移性能(Amazon-Ratings)。行表示训练时使用的k值,列表示测试时使用的k值。每个k值转移的最佳性能用灰色突出显示,整体最佳性能加粗。
| k=4\mathbf{k = 4}k=4 | k=3\mathbf{k = 3}k=3 | k=2\mathbf{k = 2}k=2 | k=1\mathbf{k = 1}k=1 | |||||
|---|---|---|---|---|---|---|---|---|
| bidi | unidi | bidi | unidi | bidi | unidi | bidi | unidi | |
| kbidi 4k_{\text {bidi }}^{4}kbidi 4 | 43.79±0.4343.79 \pm 0.4343.79±0.43 | 35.99±0.5135.99 \pm 0.5135.99±0.51 | 42.26±0.1142.26 \pm 0.1142.26±0.11 | 35.19±0.1135.19 \pm 0.1135.19±0.11 | 38.81±0.1638.81 \pm 0.1638.81±0.16 | 32.81±0.2132.81 \pm 0.2132.81±0.21 | 30.08±0.0730.08 \pm 0.0730.08±0.07 | 28.98±0.0728.98 \pm 0.0728.98±0.07 |
| kundi 4k_{\text {undi }}^{4}kundi 4 | 41.27±0.1641.27 \pm 0.1641.27±0.16 | 45.19±0.2045.19 \pm 0.2045.19±0.20 | 44.36±0.0844.36 \pm 0.0844.36±0.08 | 44.95±0.0844.95 \pm 0.0844.95±0.08 | 45.43±0.1945.43 \pm 0.1945.43±0.19 | 44.59±0.1844.59 \pm 0.1844.59±0.18 | 44.47±0.0744.47 \pm 0.0744.47±0.07 | 42.97±0.3642.97 \pm 0.3642.97±0.36 |
| kbidi 3k_{\text {bidi }}^{3}kbidi 3 | 45.28±0.0145.28 \pm 0.0145.28±0.01 | 39.31±0.3339.31 \pm 0.3339.31±0.33 | 45.63±0.0845.63 \pm 0.0845.63±0.08 | 38.46±0.4738.46 \pm 0.4738.46±0.47 | 43.56±0.0243.56 \pm 0.0243.56±0.02 | 35.24±0.5235.24 \pm 0.5235.24±0.52 | 35.55±0.2535.55 \pm 0.2535.55±0.25 | 29.10±0.2029.10 \pm 0.2029.10±0.20 |
| kundi 3k_{\text {undi }}^{3}kundi 3 | 43.20±0.0643.20 \pm 0.0643.20±0.06 | 45.66±0.0145.66 \pm 0.0145.66±0.01 | 44.64±0.0944.64 \pm 0.0944.64±0.09 | 45.46±0.0445.46 \pm 0.0445.46±0.04 | 45.30±0.0145.30 \pm 0.0145.30±0.01 | 45.11±0.1645.11 \pm 0.1645.11±0.16 | 44.78±0.0244.78 \pm 0.0244.78±0.02 | 42.83±0.0942.83 \pm 0.0942.83±0.09 |
| kbidi 2k_{\text {bidi }}^{2}kbidi 2 | 44.31±0.1044.31 \pm 0.1044.31±0.10 | 44.40±0.0444.40 \pm 0.0444.40±0.04 | 45.09±0.0545.09 \pm 0.0545.09±0.05 | 44.24±0.0344.24 \pm 0.0344.24±0.03 | 45.18±0.2045.18 \pm 0.2045.18±0.20 | 43.66±0.0443.66 \pm 0.0443.66±0.04 | 42.78±0.1142.78 \pm 0.1142.78±0.11 | 41.42±0.1641.42 \pm 0.1641.42±0.16 |
| kundi 2k_{\text {undi }}^{2}kundi 2 | 40.45±0.1640.45 \pm 0.1640.45±0.16 | 44.33±0.1244.33 \pm 0.1244.33±0.12 | 41.24±0.0341.24 \pm 0.0341.24±0.03 | 44.40±0.2044.40 \pm 0.2044.40±0.20 | 42.84±0.2842.84 \pm 0.2842.84±0.28 | 44.67±0.0544.67 \pm 0.0544.67±0.05 | 43.46±0.1043.46 \pm 0.1043.46±0.10 | 43.01±0.0643.01 \pm 0.0643.01±0.06 |
| kbidi 1k_{\text {bidi }}^{1}kbidi 1 | 32.02±0.0932.02 \pm 0.0932.02±0.09 | 42.30±0.1142.30 \pm 0.1142.30±0.11 | 37.66±0.1137.66 \pm 0.1137.66±0.11 | 44.63±0.0744.63 \pm 0.0744.63±0.07 | 40.68±0.0340.68 \pm 0.0340.68±0.03 | 45.14±0.0045.14 \pm 0.0045.14±0.00 | 46.17±0.0346.17 \pm 0.0346.17±0.03 | 45.30±0.3445.30 \pm 0.3445.30±0.34 |
| kundi 1k_{\text {undi }}^{1}kundi 1 | 41.73±0.1541.73 \pm 0.1541.73±0.15 | 42.96±0.0942.96 \pm 0.0942.96±0.09 | 42.63±0.1042.63 \pm 0.1042.63±0.10 | 44.33±0.1744.33 \pm 0.1744.33±0.17 | 43.08±0.1943.08 \pm 0.1943.08±0.19 | 44.76±0.0244.76 \pm 0.0244.76±0.02 | 46.27±0.0846.27 \pm 0.0846.27±0.08 | 45.95±0.0645.95 \pm 0.0645.95±0.06 |
参考论文:https://arxiv.org/pdf/2505.02130
更多推荐

所有评论(0)