利用大模型构建骨架材料知识图谱及其应用 - 北京工大&华东理工等

《Construction of a knowledge graph for framework material enabled by large language models and its application》。
代码和测试集可在https://github.com/MontageBai/KGFM访问
摘要
骨架材料(FMs)已受到广泛研究,大量文献记录了它们的独特性质和潜在应用。尽管如此,这一新兴领域的全面知识图谱尚未构建。在本研究中,通过利用大型语言模型(LLMs)的自然语言处理能力,我们建立了一个全面的知识图谱(KG-FM)。它涵盖了包括金属有机骨架(MOFs)、共价有机骨架(COFs)和氢键有机骨架(HOFs)在内的骨架材料的合成、性质、应用等方面。该知识图谱通过分析超过100,000篇文章构建而成,共有253万个节点和401万个关系。随后,探索了其应用于增强数据检索、挖掘以及开发复杂问答系统的潜力。特别是当将知识图谱与大型语言模型集成时,所得到的Qwen2-KG不仅在问答任务上达到了91.67%的更高准确率,还提供了精确的信息来源。
核心速览
研究背景
- 研究问题
这篇文章要解决的问题是为骨架材料(Framework Materials, FMs)构建一个全面的知识图谱(Knowledge Graph, KG),并探索其在信息检索、数据挖掘和复杂问答系统中的应用。

- 研究难点
该问题的研究难点包括:骨架材料种类繁多,文献信息碎片化且非结构化,如何高效地提取和组织这些信息以构建知识图谱。
- 相关工作
该问题的研究相关工作包括对金属有机骨架(MOFs)、共价有机骨架(COFs)和氢键有机骨架(HOFs)的研究,但尚未有综合性的知识图谱被构建。
研究方法
这篇论文提出了利用大型语言模型(LLMs)的自然语言处理能力来构建骨架材料知识图谱的方法。具体来说,
- 文献信息收集
:首先,从Web of Science数据库中检索并收集了截至2024年5月8日的相关文献,使用以下搜索查询:
TS=(MOF\text{ OR MOFs OR"Metal Organic Framework" OR"Metal- Organic Framework")TS=(COF\text{ OR COFs OR"Covalent Organic Framework" OR"Covalent- Organic Framework")
2. 摘要信息提取:使用Qwen2-72B模型将摘要文本转换为包含逻辑关系的JSON格式。模型的任务和输出格式在提示中定义。

3. 知识图谱构建:使用Neo4j软件构建知识图谱,通过Python接口导入LLM生成的出版信息和JSON文件。构建的知识图谱包括2.53百万个节点和4.01百万个关系。

4.
LLMs与知识图谱的集成:采用检索增强生成(RAG)过程,分为三个步骤:生成Cypher查询、执行查询并检索数据、制定答案。整个过程的代码可以在GitHub上找到。
实验设计
- 数据收集
:从Web of Science数据库中检索并收集了超过100,000篇相关文献,存储为多个txt文件。
- 样本选择
:选择了MOFs、COFs和HOFs的相关文献,分别有68,400篇、21,776篇和15,203篇。
- 参数配置
:使用了Qwen2-72B、Meta-Llama-3-70B、GLM-4-9b-chat等多种LLMs模型,并通过Neo4j 5.12.0进行知识图谱的构建和可视化。
结果与分析
-
知识图谱构建结果:构建的知识图谱包括2.53百万个节点和4.01百万个关系,涵盖了框架材料的基本信息、性质、应用和来源。

-
信息检索与数据挖掘:通过Neo4j平台的图形界面,可以方便地进行文献查询。例如,查询Li等人关于BUT-55的研究,结果显示该论文聚焦于材料BUT-55及其在苯痕量吸附中的应用。

-
LLMs性能评估:设计了一个包含150个问题的测试集,评估了不同LLMs模型的性能。Qwen2-KG模型的准确率为91.67%,显著高于现有模型(如GPT-4的33.33%)。

总体结论
这篇论文展示了利用LLMs构建骨架材料知识图谱的潜力,并将其应用于信息检索、数据挖掘和复杂问答系统。通过集成知识图谱,LLMs在骨架材料领域的问答准确性显著提高,达到了91.67%。该研究为未来在各个研究领域构建综合性知识图谱提供了重要的参考和方法论支持。
论文评价
优点与创新
- 构建全面知识图谱
通过利用大型语言模型(LLMs)的自然语言处理能力,成功构建了一个包含2.53百万节点和4.01百万关系的全面知识图谱(KG-FM),涵盖了金属有机骨架(MOFs)、共价有机骨架(COFs)和氢键有机骨架(HOFs)的合成、性质、应用等方面。
- 数据规模庞大
分析了超过100,000篇文章,生成了大量的结构化数据,显著提升了知识图谱的覆盖面和详细程度。
- 高准确率的问答系统
将知识图谱与LLMs(如Qwen2-KG)结合,实现了高达91.67%的问题回答准确率,显著优于现有模型(如GPT-4的33.33%)。
- 增强链式思维推理
知识图谱在LLMs的链式思维(CoT)推理任务中提供了丰富的背景信息,显著提升了推理质量和可解释性。
- 多领域应用
知识图谱不仅用于信息检索和数据挖掘,还应用于复杂问题的回答,展示了其在材料科学及相关领域的广泛应用潜力。
- 自动化构建过程
:利用LLMs自动提取、语义分析和解释文献内容,减少了人工整理和整合信息的劳动强度,提高了知识图构建的效率。
不足与反思
- 局限性
尽管知识图谱在多个方面表现出色,但仍存在一定的局限性,例如在某些情况下,LLMs可能无法完全理解复杂的背景信息,导致回答不够准确。
- 下一步工作
未来的研究可以进一步优化知识图谱的构建过程,提升LLMs在处理复杂问题和跨学科链接方面的能力,进一步推动AI在科学研究中的应用。
关键问题及回答
问题1:在构建骨架材料知识图谱的过程中,如何利用大型语言模型(LLMs)进行摘要信息的提取?
- 任务和输出格式定义
首先,定义Qwen2-72B模型的任务和输出格式。任务是将摘要文本转换为包含逻辑关系的JSON格式。
- 数据预处理
将从Web of Science数据库中检索到的文献摘要文本保存为TXT文件,便于后续处理。
- 信息提取
使用Qwen2-72B模型对摘要文本进行处理,识别关键信息(如研究方法、实验结果、理论概念等),并将其组织成节点和关系。
- 验证和调整
手动检查提取的结果,确保信息的准确性和完整性。根据验证结果调整模型的提示和参数,以提高提取质量。
通过上述步骤,Qwen2-72B模型能够有效地从摘要文本中提取关键信息,并将其转换为结构化的JSON格式,为知识图谱的构建提供高质量的数据输入。
问题2:知识图谱构建过程中使用了哪些工具和技术?具体的构建流程是怎样的?
- 数据收集和预处理
从Web of Science数据库中检索并收集了超过100,000篇相关文献,存储为多个txt文件。
- 信息提取
使用Qwen2-72B模型将摘要文本转换为包含逻辑关系的JSON格式。
- 知识图谱构建
- 数据导入
通过Python接口将LLM生成的出版信息和JSON文件导入Neo4j图数据库。
- 关系映射
将提取的节点和关系数据与Neo4j中的节点进行手动定义的关系映射,如"Derived from"、"Published in(Journal)"、"Published at(Date)"等。
- 可视化和分析
使用Neo4j Docker进行数据可视化和分析。
具体的构建流程包括以下几个关键步骤:
-
数据收集和预处理:检索并整理文献数据。
-
信息提取:使用LLM提取摘要中的关键信息。
-
知识图谱构建:将提取的数据导入Neo4j并进行关系映射。
-
可视化和分析:通过Neo4j平台进行数据可视化和分析。
问题3:在评估LLMs与知识图谱集成性能的实验中,设计了一个包含150个问题的测试集,这些问题的设计是如何进行的?
- 问题来源
:测试集的问题主要来源于骨架材料领域的研究,涵盖了材料的基本信息、性质、应用等多个方面。
- 问题类型
:问题类型包括选择题、填空题和简答题等,旨在全面评估LLMs在不同类型问题上的表现。
- 标准答案
:每个问题都配有标准答案,由两位领域专家进行判断。答案的正确性基于信息的准确性和相关性。
- 评估标准
:答案的正确性由领域专家根据答案的内容和准确性进行评判。正确答案必须提供准确无误的信息,无任何误导性内容。
通过上述设计,测试集能够全面评估LLMs在骨架材料领域的知识掌握情况和问题解决能力,验证了知识图谱集成对LLMs性能的提升效果。
如何学习AI大模型 ?
这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。
我在一线互联网企业工作十余年里,指导过不少同行后辈。帮助很多人得到了学习和成长。
我意识到有很多经验和知识值得分享给大家,故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。【保证100%免费】🆓
这份完整版的 AI 大模型学习资料已经上传CSDN,朋友们如果需要可以扫描下方二维码&点击下方CSDN官方认证链接免费领取 【保证100%免费】

读者福利: 👉👉CSDN大礼包:《最新AI大模型学习资源包》免费分享 👈👈
(👆👆👆安全链接,放心点击)
对于0基础小白入门:
如果你是零基础小白,想快速入门大模型是可以考虑的。
一方面是学习时间相对较短,学习内容更全面更集中。
二方面是可以根据这些资料规划好学习计划和方向。
要学习一门新的技术,作为新手一定要先学习成长路线图,方向不对,努力白费。
对于从来没有接触过AI大模型的同学,我们帮你准备了详细的学习成长路线图&学习规划。可以说是最科学最系统的学习路线,大家跟着这个大的方向学习准没问题。(全套教程文末领取哈)

很多朋友都不喜欢晦涩的文字,我也为大家准备了视频教程,每个章节都是当前板块的精华浓缩。


这套包含640份报告的合集,涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师,还是对AI大模型感兴趣的爱好者,这套报告合集都将为您提供宝贵的信息和启示。(全套教程文末领取哈)

光学理论是没用的,要学会跟着一起做,要动手实操,才能将自己的所学运用到实际当中去,这时候可以搞点实战项目来学习。(全套教程文末领取哈)

随着人工智能技术的飞速发展,AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型,如GPT-3、BERT、XLNet等,以其强大的语言理解和生成能力,正在改变我们对人工智能的认识。 那以下这些PDF籍就是非常不错的学习资源。(全套教程文末领取哈)

截至目前大模型已经超过200个,在大模型纵横的时代,不仅大模型技术越来越卷,就连大模型相关的岗位和面试也开始越来越卷了。为了让大家更容易上车大模型算法赛道,我总结了大模型常考的面试题。(全套教程文末领取哈)

只要你是真心想学AI大模型,我这份资料就可以无偿分享给你学习,我国在这方面的相关人才比较紧缺,大模型行业确实也需要更多的有志之士加入进来,我也真心希望帮助大家学好这门技术,如果日后有什么学习上的问题,欢迎找我交流,有技术上面的问题,我是很愿意去帮助大家的!
这份资料由我和鲁为民博士共同整理,鲁为民博士先后获得了北京清华大学学士和美国加州理工学院博士学位,在包括IEEE Transactions等学术期刊和诸多国际会议上发表了超过50篇学术论文、取得了多项美国和中国发明专利,同时还斩获了吴文俊人工智能科学技术奖。目前我正在和鲁博士共同进行人工智能的研究。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。


这份完整版的 AI 大模型学习资料已经上传CSDN,朋友们如果需要可以扫描下方二维码&点击下方CSDN官方认证链接免费领取 【保证100%免费】

(👆👆👆安全链接,放心点击)
更多推荐
所有评论(0)