【深度好文】2025年必收藏:多模态RAG与OntoMetric知识图谱构建全解析
文章详述两大前沿技术:一是组合式多模态RAG,涵盖54种模态组合、四大核心流程及三类训练策略;二是OntoMetric知识图谱构建法,采用"分割+抽取+验证"三步策略,通过结构感知分割、本体引导LLM提取和双重验证机制,有效解决ESG政策文档中复杂信息的自动提取与知识构建难题。
继续看技术进展,看RAG进展,看一个组合式多模态RAG总结性梳理,看看这块有哪些思路。
另一个是知识图谱构建进展,看看一个分割+抽取+验证做知识图谱构建思路-OntoMetric
多总结,多归纳,**多从底层实现分析逻辑,**会有收获。
一、组合式多模态RAG总结性梳理
RAG作为一种范式,可以灵活扩展,可以来个暴力组合,写综述。变成从文本RAG到多模态输入-文本输出,再到多模态输入-多模态输出的一个演进。
这块,看一个技术总结,如《A Comprehensive Survey on Multimodal RAG: All Combinations of Modalities as Input and Output》,https://doi.org/10.36227/techrxiv.176341513.38473003/v2,https://github.com/INTREBID/Awesome-MM-RAG,所有可能使用的模态组合作为输入和输出,包括文本、图像、音频、视频、代码、表格、知识图谱、3D 对象等。一共54个。

看几个点。
1、看不同输入输出组合的代表方案

2、看核心流程
如下所示,看看几个核心流程:

预检索阶段,关键操作是知识库准备(4种组织方式:单模态嵌入、成对存储、统一嵌入、图构建)和查询准备(5种优化技术:扩展、改写、转换、dropout、多查询);
检索阶段,关键操作是检索器选择(稀疏、密集、其他3类)、策略制定(混合、分层等)和时机控制(单次、迭代、自适应3种),常用方法包括BM25、CLIP、混合检索;
增强阶段,关键操作是上下文处理(重排序、选择、压缩)和优化(噪声注入、融合),常用方法有FiE(编码器内融合)、FiD(解码器内融合);
生成阶段,关键操作是生成器构建(5大组件)和增强(提示工程、MLLM微调),常用方法包括StableDiffusion(图像生成)、LoRA微调。
3、看训练策略
训练策略分为两类。

一类是参数冻结策略:直接复用现成模块,无参数更新,适用场景为快速部署、数据标注不足或低计算资源环境,代表研究有PICa、VideoRAG,优势是训练成本低、组件复用性强,劣势是任务适配性有限;
一类是参数可训练策略:包含模块化训练(独立优化各组件,适用场景为需针对性提升特定组件性能的场景,代表研究有VisRAG、RACC,优势是灵活度高、易维护,劣势是组件协同性不足)和端到端训练(联合优化检索器与生成器,适用场景为追求最优系统性能的场景,代表研究有RA-VQA、ReVeaL,优势是性能最优,劣势是计算成本高、部署灵活度差)。
二、分割+抽取+验证做知识图谱构建思路-OntoMetric
继续看一个知识图谱构建的思路,背景是SASB、TCFD、IFRSS2等框架要求企业报告大量ESG指标,相关规则嵌入长文本、非结构化PDF,包含定义、公式、单位等复杂信息,但是人工提取耗时、易错、难以应对框架更新。传统自动化关键词匹配/手工规则缺乏语义覆盖,无法处理复杂依赖。
无约束LLM提取容易出现实体不一致、关系幻觉、缺失溯源,验证失败率高,现有ESG本体又仅含形式化schema,缺乏自然语言描述。
所以,可以细分下实现,拆成多步。
具体的看这个工作《OntoMetric: An Ontology-Guided Framework for Automated ESG Knowledge Graph Construction》(https://arxiv.org/pdf/2512.01289),搞了一套“自动把ESG政策文档变成规整可用的知识图谱”的流程,核心是用“先拆分、再提取、后校验”的思路解决“文档乱、提取不准、没法审计”的问题。

1、结构感知分割,基于目录(TOC)边界划分文档
ESG政策文档(比如SASB、TCFD)都是几百页的PDF,直接扔给AI提取容易乱。

所以先按文档自带的“目录”拆分,比如“绿色气体排放”“数据安全”这些章节,each章节作为一个“小块”。每个小块都记着自己来自文档的哪几页、原来的标题,方便后续追溯来源。

具体实现上,步骤为:step1.识别目录页面与标题,确定自然分割边界;->step2.合并跨页表格,清理布局冗余;->step3.保留片段标题、页面范围、sectionID等元数据;->step4.确保片段为完整概念单元(如指标定义、公式)
2、本体引导LLM提取
抽取上,如下:

先告诉AI要提取5类信息(实体):行业(比如银行业)、披露框架(比如SASB)、分类(比如环境类指标)、具体指标(比如碳排放强度)、计算模型(比如碳排放怎么算);也就是一个是ESGMKGschema,包括5类实体(Industry、ReportingFramework、Category、Metric、Model)、5类关系谓词、7条结构规则;再定好这些信息之间的关系(比如“银行业”用“SASB框架”,“SASB框架”包含“环境类指标”);

给一个固定模板,让它把提取的信息填成结构化的JSON(比如指标名称、单位、描述都按固定字段填),一个是提示词设计,含系统上下文、本体连接图、实体定义等9个组件;
提取时记着每个信息来自哪个小块、哪一页,避免后续找不到源头。
最后把所有小块的提取结果合并,去掉重复的信息,解析JSON、添加溯源元数据、跨片段整合(ID解析+实体/关系去重)。
3、两阶段验证
为了解决实体不一致、关系幻觉、缺失溯源、验证失败率高的问题,缓解思路是语义验证+规则化schema验证来实现。

两阶段验证层:先通过LLM校验实体类型匹配度,再用6条规则检查结构合规性,剔除幻觉内容;同时全程保留片段/页面级溯源,解决溯源缺失问题。
拆开来看这个验证问题:
两阶段验证分为语义验证(Phase1)和schema验证(Phase2),两阶段结合使验证后的知识图谱同时满足语义正确性与结构有效性。
一个是语义验证,由LLM执行,核心作用是校验每个实体的标签和描述是否与其分配的ESGMKG类型匹配,直接剔除类型错误的实体及依赖关系,解决“实体类型幻觉”问题,减少后续无效校验,例如确认提取的“碳排放强度”确实是ESG指标,而不是财务指标(比如净利润),防止类型认错;
一个是schema验证,基于6条预定义规则执行,核心作用是保障结构合规性,具体包括:

1)实体验证,实体ID必须全局唯一;
2)实体验证,实体需包含类型特定的必填字段;
3)属性验证,指标的代码(code)和单位(unit)不可为空;
4)属性验证,模型(Model)需至少包含一个有效输入变量;
5)关系验证,仅允许ESGMKG定义的5类关系谓词
6)关系验证,每个计算型指标(CalculatedMetric)需精确关联一个模型(Model)
如下:

AI时代,未来的就业机会在哪里?
答案就藏在大模型的浪潮里。从ChatGPT、DeepSeek等日常工具,到自然语言处理、计算机视觉、多模态等核心领域,技术普惠化、应用垂直化与生态开源化正催生Prompt工程师、自然语言处理、计算机视觉工程师、大模型算法工程师、AI应用产品经理等AI岗位。

掌握大模型技能,就是把握高薪未来。
那么,普通人如何抓住大模型风口?
AI技术的普及对个人能力提出了新的要求,在AI时代,持续学习和适应新技术变得尤为重要。无论是企业还是个人,都需要不断更新知识体系,提升与AI协作的能力,以适应不断变化的工作环境。
因此,这里给大家整理了一份《2025最新大模型全套学习资源》,包括2025最新大模型学习路线、大模型书籍、视频教程、项目实战、最新行业报告、面试题等,带你从零基础入门到精通,快速掌握大模型技术!
由于篇幅有限,有需要的小伙伴可以扫码获取!

1. 成长路线图&学习规划
要学习一门新的技术,作为新手一定要先学习成长路线图,方向不对,努力白费。这里,我们为新手和想要进一步提升的专业人士准备了一份详细的学习成长路线图和规划。

2. 大模型经典PDF书籍
书籍和学习文档资料是学习大模型过程中必不可少的,我们精选了一系列深入探讨大模型技术的书籍和学习文档,它们由领域内的顶尖专家撰写,内容全面、深入、详尽,为你学习大模型提供坚实的理论基础。(书籍含电子版PDF)

3. 大模型视频教程
对于很多自学或者没有基础的同学来说,书籍这些纯文字类的学习教材会觉得比较晦涩难以理解,因此,我们提供了丰富的大模型视频教程,以动态、形象的方式展示技术概念,帮助你更快、更轻松地掌握核心知识。

4. 大模型项目实战
学以致用 ,当你的理论知识积累到一定程度,就需要通过项目实战,在实际操作中检验和巩固你所学到的知识,同时为你找工作和职业发展打下坚实的基础。

5. 大模型行业报告
行业分析主要包括对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。

6. 大模型面试题
面试不仅是技术的较量,更需要充分的准备。
在你已经掌握了大模型技术之后,就需要开始准备面试,我们将提供精心整理的大模型面试题库,涵盖当前面试中可能遇到的各种技术问题,让你在面试中游刃有余。

为什么大家都在学AI大模型?
随着AI技术的发展,企业对人才的需求从“单一技术”转向 “AI+行业”双背景。企业对人才的需求从“单一技术”转向 “AI+行业”双背景。金融+AI、制造+AI、医疗+AI等跨界岗位薪资涨幅达30%-50%。
同时很多人面临优化裁员,近期科技巨头英特尔裁员2万人,传统岗位不断缩减,因此转行AI势在必行!

这些资料有用吗?
这份资料由我们和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。


大模型全套学习资料已整理打包,有需要的小伙伴可以
微信扫描下方CSDN官方认证二维码,免费领取【保证100%免费】

更多推荐
所有评论(0)