介绍的这篇论文,题目是 Towards Structure-Aware Model for Multi-Modal Knowledge Graph Completion。我想先把结论放在最前面:这篇论文最大的贡献不是提出了一个多复杂的网络结构,而是一套很清晰的实证研究,系统地证明了:在多模态知识图谱补全里,“结构模态”才是决定性信息,图像和文本更多是辅助信息,而且最好被“拉回”到结构空间里去用。

1. 任务背景:多模态知识图谱补全到底在做什么?

知识图谱用三元组(头实体、关系、尾实体)表达事实,但现实里实体往往还带有图片、文本描述等信息,所以出现了多模态知识图谱(MMKG):既有结构三元组,也有视觉与文本属性。
多模态知识图谱补全(MMKGC)要做的就是:在图谱不完整的情况下,利用结构+图像+文本去预测缺失的链接,比如给定(h, r, ?)预测正确的尾实体。

2. 最大贡献:一套实证实验结论: 结构模态最关键,且必须保持“主导地位”

论文指出,以往很多MMKGC方法虽然引入了图片与文本,但经常忽略一个更根本的问题:结构模态(也就是图谱三元组)在推理中应该是“骨架”,其他模态只能辅助。如果把结构信息弱化,模型很容易被多模态噪声带偏。

作者做了一个非常“狠”的验证实验:选取两种典型开源MMKGC模型(MyGO、OTKGE),把结构模态信息完全移除,然后观察 MRR、Hits@1 的变化。结果是:性能出现戏剧性下滑,说明如果没有结构模态支撑,很多所谓“多模态推理”实际上站不住。

这组实验其实回答了一个行业里经常被含糊带过的问题:

  • 图片与文本能提升效果,但它们不是“推理的主心骨”;
  • 真正稳定、可泛化的关系约束来自结构模态;
  • 多模态融合如果不以结构为锚点,很容易引入噪声、破坏统一表示。

3. 由实证结论推出设计原则:TSAM 要做两件事

既然结构模态最关键,那么模型设计就要围绕两个原则展开:

原则A:多模态交互要更细,不能只做粗糙拼接。
很多方法把图片/文本压成一个向量再拼起来,会丢掉大量细节,跨模态的对应关系也难以学到。

原则B:融合时结构必须保持主导,其他模态要“对齐结构”,而不是喧宾夺主。
图片/文本可能含有与关系推理无关的信息,直接融合会带来噪声,因此需要一种机制把它们拉向结构空间。

基于这两个原则,论文提出 TSAM,核心由两块组成:
1)FgMAF:细粒度模态感知融合(解决原则A)
2)SaCL:结构感知对比学习(解决原则B)

4. 模块一:FgMAF:把“图片/文本”拆细,做更细粒度的交互与融合

FgMAF 的关键做法是:先把视觉与文本都变成 token 序列,再在统一空间里编码与融合

  • 视觉侧:把实体图片切成 patch,并用视觉预训练模型得到一串视觉 token(每个 token 对应局部语义)。
  • 文本侧:把实体描述分词并编码成一串文本 token。
  • 统一空间:用线性投影把视觉 token 与文本 token 映射到同一维度。
  • Transformer 编码:分别对视觉序列与文本序列编码,得到更“懂上下文”的模态表示。
  • 模态注意力融合:把结构表示、视觉表示、文本表示一起做注意力加权,让模型自动学会在不同实体/不同关系下该更信谁。

这一步的意义是:模型不再是“把三种模态硬凑在一起”,而是能在更细粒度层面完成感知与融合。

5. 模块二:SaCL: 结构作为“锚点”,把其他模态拉回结构空间

论文最体现“结构主导”思想的,是 SaCL(结构感知对比学习)

即使做了注意力融合,不同模态之间仍然可能存在语义鸿沟:图片/文本的向量空间与结构空间天然不同,直接融合会漂移,甚至引入噪声。
SaCL 的做法是:以结构模态为中心做两次对比学习

  • 结构—视觉对比学习:同一实体的结构表示与视觉表示是正样本;batch里其他实体作为负样本。
  • 结构—文本对比学习:同理,把文本表示也拉向结构表示。

直观理解:结构是“骨架坐标系”,视觉与文本都要对齐到这个坐标系里,才能在补全任务中稳定发挥作用,同时减少无关噪声。

6. 训练与预测:TSAM 怎么做链接预测?

TSAM 最终还是做经典链接预测:给定头实体与关系,预测尾实体。训练目标由两部分组成:

  1. 预测损失:用融合后的实体表示 + 关系表示,经 Transformer 解码器输出尾实体分布,用交叉熵训练。
  2. 对比学习损失:结构-视觉、结构-文本两条对齐损失共同作用。

7. 实验设置:数据集与指标

论文使用了三个常用多模态知识图谱数据集:DB15K、MKG-W、MKG-Y。每个数据集都包含:结构三元组、实体图片、实体文本描述。

评价指标使用:MRR、Hits@1、Hits@3、Hits@10,属于链接预测任务最常见的一组指标。

8. 主结果:TSAM 的整体效果

论文将 TSAM 与多种单模态KGE模型以及多个MMKGC强基线做对比。总体结论是:

  • 单模态模型因为只用结构信息,整体指标偏低;
  • 多模态模型普遍优于单模态;
  • TSAM 在多个数据集的大多数指标上取得最佳结果,并且作者强调提升幅度大约在 1%到10%之间,尤其在 MRR 和 Hits@1 这类“更强调准确排序”的指标上提升更明显。

9. 进一步分析:评分函数、解码器、关键参数的影响

不同结构评分函数(KGE)对效果的影响

TSAM可以搭配不同KGE评分函数来学习结构表示。论文对比发现:使用 TuckER 的版本整体最好,RotatE 与 TransE 相对弱一些。

不同Transformer解码器的影响

作者对比了多种解码器(不同规模/不同模型),观察到:

  • BERT-large 通常最好;
  • 同一系列里,大模型往往优于小模型;
  • LLaMA-7B 并没有在该任务上体现出预期优势,反而不如很多传统预训练语言模型。

10.案例与可视化:为什么说TSAM“更懂结构、更抗噪”?

论文给了几个案例:在一些结构关系非常明确的三元组上,TSAM能把正确尾实体排到第1名,而某些基线模型甚至会排到非常靠后。这说明 TSAM 在强调结构主导、降低多模态噪声后,预测更稳定。

此外,论文还用 t-SNE 对小批量三元组嵌入做降维可视化:同一个三元组的头尾实体点会更靠近,并且一些语义相关的实体(例如同类型电影相关实体)会在空间中聚集,体现模型学到了更一致的语义结构。

12. 总结与展望

最后总结一下,这篇论文的贡献可以用三句话概括:

  1. 提出 TSAM,把多模态KGC里“细粒度交互”和“结构主导”两件事同时抓住。
  2. 用 FgMAF 做 token 级别的模态感知融合,提高跨模态交互质量。
  3. 用 SaCL 以结构模态为锚点做对比学习,让视觉/文本对齐结构空间,从而减少融合噪声,并在多个数据集上取得领先表现。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

在这里插入图片描述

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐