本文介绍了Graph RAG这一基于知识图谱的检索增强生成新范式,重点分析了GraphRAG(层次化社区发现)、LightRAG(双层级检索与动态更新)和PathRAG(关联路径剪枝)三种代表性方法。这些方法通过引入知识图谱增强传统RAG的全局推理能力,各有侧重,共同推动了复杂知识推理任务的发展。


Graph RAG:基于知识图谱的检索增强生成新范式

一、简介

随着大语言模型(LLM)在自然语言处理中的广泛应用,传统检索增强生成(RAG)方法在面对需要全局理解的复杂查询时显露出局限性。这类“全局感知查询”(sensemaking queries)要求系统能够理解大规模文本集中实体间的复杂关系,而基于向量检索的RAG方法往往只能返回局部相关的文本片段,缺乏对整体语料的全局推理能力。近年来,结合知识图谱的Graph RAG方法通过显式建模实体关系、构建图结构索引,显著提升了全局推理能力。本文以GraphRAG和LightRAG为代表,从知识图谱构建策略和实体关系建模方法两个角度,解读这一新兴技术方向的进展与创新。

二、GraphRAG:基于层次化社区发现的全局推理框架

GraphRAG的核心贡献在于提出了一个基于知识图谱层次化社区发现的全局推理框架,其方法显著拓展了RAG在全局感知类任务上的能力边界。

2.1 知识图谱构建与分层社区发现

GraphRAG首先使用LLM从原始语料中抽取实体及其关系,构建一个大规模知识图谱。节点对应语料中的关键实体,边则表征实体间的语义关系。这一构建过程充分利用了LLM的语义理解能力,能够识别并规范化跨文档的实体指代,并推断出隐含的语义关系。与传统基于规则或统计的图谱构建方法不同,LLM驱动的构建策略能够更好地处理多样化的语言表达和隐含语义关系。

在图谱构建完成后,GraphRAG采用社区检测算法将图谱划分为多个层次化的社区结构。底层社区由紧密关联的实体簇组成,高层社区则通过合并底层社区形成更大的语义单元。这种层次化结构为后续的分层摘要生成提供了基础,使得系统能够从局部到全局逐步理解整个知识库的语义结构。

2.2 社区摘要生成与查询处理

基于分层社区结构,GraphRAG采用自底向上的方式生成社区摘要。底层社区摘要首先由LLM生成,描述该社区内实体及其关系的核心语义。高层社区摘要则通过综合其子社区摘要生成,形成层次化的摘要体系。这种设计使得高层摘要能够保持对底层细节的感知,同时提供更加整合的全局视角。

在处理查询时,GraphRAG采用map-reduce框架:首先将查询映射到各个社区摘要,并行生成局部答案;然后通过reduce阶段整合这些局部答案,形成最终的全局响应。这种方法不仅提高了处理效率,而且确保了对整个知识库的全面覆盖,能够有效回答需要全局理解的复杂查询。

2.3 实验效果

实验一 GraphRAG在全面性、多样性和效率上均显著优于传统RAG。

实验二 事实性验证下,GraphRAG全面性与多样性持续领先SS。

三、LightRAG:高效双层级检索与动态更新机制

LightRAG专注于解决Graph RAG系统的效率与可扩展性问题,提出了一个轻量化的图索引与检索框架,在保持全局推理能力的同时显著提升了系统性能。

3.1 图索引与双层级检索框架

LightRAG创新性地设计了双层级检索机制,将检索过程分为低层级实体关系检索和高层级主题概念检索。低层级检索专注于特定实体及其直接关系,确保答案的精确性和事实准确性;高层级检索则关注更广泛的主题和概念关联,提供全局语境和跨领域洞察。

这种双层级检索通过统一的图索引结构实现。LightRAG首先使用LLM从文本中提取实体和关系,构建知识图谱。与GraphRAG不同的是,LightRAG的图谱构建更加注重检索效率,采用了轻量化的实体消歧和关系提取策略。图谱中的每个节点都关联到原始文本片段,既保持了语义丰富性,又支持高效检索。

3.2 动态更新与效率优化

针对现实应用中数据不断更新的需求,LightRAG提出了增量式图谱更新算法。新数据到来时,系统只需更新受影响的部分图谱结构,无需重新构建整个图谱,大大降低了计算成本。这种设计使得LightRAG能够快速适应动态变化的知识库,保持系统的时效性。

在检索效率方面,LightRAG结合了向量检索和图遍历的优势。首先使用向量检索快速定位相关实体,然后通过图遍历探索实体间的关系路径,最后综合两者结果进行排序和选择。这种混合检索策略在保持图谱推理能力的同时,实现了接近传统向量检索的响应速度。

3.3 实验效果

LightRAG 的实验结果表明,其在大规模跨域语料上的表现显著优于传统 RAG 基线方法,并在多维度评估中展现出独特优势。

消融实验表明,低层次与高层次检索的结合显著提升了答案的全面性与多样性,语义图索引在无原始文本时仍保持较好性能。

在成本与适应性上,LightRAG相比GraphRAG显著减少了检索所需tokens与API调用,并能高效适应增量数据更新。

四、PathRAG:使用关联路径对基于图的检索增强生成进行剪枝

考虑到在Graph RAG中,对于检索信息不加筛选地直接使用可能引入噪音,PathRAG提出了 使用关联路径的方法对检索信息进行剪枝以减少噪音,同时用推理路径显示指导大模型,以提升模 型的性能。

4.1 基于流量的路径剪枝算法

Graph RAG直接使用检索节点的一阶子图作为检索信息,该信息可能会存在噪音,且子图信 息并列拼接提供给大模型,导致缺失了潜在关联信息。针对这些问题,PathRAG提出了基于流量的 路径剪枝算法。

核心点在于,针对任意两个基于query检索得到的检索节点,将其交替作为流量的起点与终 点,进行初始流量的分发与最终流量的汇聚。在这个过程中,每个节点都将获取上游节点沿边传递 而来的流量,也就继续向下游节点沿边进行流量的传递,边上也设置了磨损率来模拟信息的传递损 失。之后,使用边上的均值流量对路径进行重要性排序,选取topk个路径提供给大模型进行问题的 回答。 该方法不仅能有效减少“与检索节点相关而与问题回答无关”的噪音,还对检索信息进行了重 要性排序,筛选出了更重要的信息帮助大模型进行回答,并额外关联到了一阶子图外的节点、边信 息,提高了模型的性能。

4.2 基于路径的prompt模板

考虑到直接并列拼接检索信息,会缺乏信息之间的潜在关联,导致大模型无法很好地使用检 索信息进行高质量的回答。PathRAG将检索信息以路径的形式显式地提供给大模型,指导其进行信 息使用与问题回答。 同时考虑到大模型常见的“lost in the middle”现象,依照此前的重要性排序,将更为重要的 信息放置于末尾能有效提高模型的性能。

4.3 实验效果

PathRAG沿用了GraphRAG与LightRAG的评估体系及数据集,并在更多的评估维度和数据集上相较 基线有着更为出色的性能

消融实验上也证明了基于流量的排序与基于路径的prompt模板的有效性

五、总结

本文从知识图谱构建与应用的视角,介绍了以GraphRAG、LightRAG和PathRAG为代表的Graph RAG新兴技术方向。这三项研究均通过引入知识图谱来增强传统RAG的全局推理能力,但各有侧重:

  • GraphRAG通过层次化社区发现实现深层次语义聚合,擅长处理复杂的全局查询;
  • LightRAG则通过双层级检索与动态更新机制,在保持推理能力的同时显著提升了效率与实用性;
  • PathRAG进一步通过关联路径剪枝与推理引导,有效减少了信息噪音,提升了答案的精准度。

这些进展共同表明,融合知识图谱与LLM的检索增强生成技术,在解决复杂知识推理任务方面具有重要的应用价值和广阔的发展前景。

大模型未来如何发展?普通人能从中受益吗?

在科技日新月异的今天,大模型已经展现出了令人瞩目的能力,从编写代码到医疗诊断,再到自动驾驶,它们的应用领域日益广泛。那么,未来大模型将如何发展?普通人又能从中获得哪些益处呢?

通用人工智能(AGI)的曙光:未来,我们可能会见证通用人工智能(AGI)的出现,这是一种能够像人类一样思考的超级模型。它们有可能帮助人类解决气候变化、癌症等全球性难题。这样的发展将极大地推动科技进步,改善人类生活。

个人专属大模型的崛起:想象一下,未来的某一天,每个人的手机里都可能拥有一个私人AI助手。这个助手了解你的喜好,记得你的日程,甚至能模仿你的语气写邮件、回微信。这样的个性化服务将使我们的生活变得更加便捷。

脑机接口与大模型的融合:脑机接口技术的发展,使得大模型与人类的思维直接连接成为可能。未来,你可能只需戴上头盔,心中想到写一篇工作总结”,大模型就能将文字直接投影到屏幕上,实现真正的心想事成。

大模型的多领域应用:大模型就像一个超级智能的多面手,在各个领域都展现出了巨大的潜力和价值。随着技术的不断发展,相信未来大模型还会给我们带来更多的惊喜。赶紧把这篇文章分享给身边的朋友,一起感受大模型的魅力吧!

那么,如何学习AI大模型?

在一线互联网企业工作十余年里,我指导过不少同行后辈,帮助他们得到了学习和成长。我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑。因此,我坚持整理和分享各种AI大模型资料,包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频。在这里插入图片描述

学习阶段包括:

1.大模型系统设计
从大模型系统设计入手,讲解大模型的主要方法。包括模型架构、训练过程、优化策略等,让读者对大模型有一个全面的认识。

在这里插入图片描述

2.大模型提示词工程
通过大模型提示词工程,从Prompts角度入手,更好发挥模型的作用。包括提示词的构造、优化、应用等,让读者学会如何更好地利用大模型。

在这里插入图片描述

3.大模型平台应用开发
借助阿里云PAI平台,构建电商领域虚拟试衣系统。从需求分析、方案设计、到具体实现,详细讲解如何利用大模型构建实际应用。

在这里插入图片描述

4.大模型知识库应用开发
以LangChain框架为例,构建物流行业咨询智能问答系统。包括知识库的构建、问答系统的设计、到实际应用,让读者了解如何利用大模型构建智能问答系统。
在这里插入图片描述

5.大模型微调开发
借助以大健康、新零售、新媒体领域,构建适合当前领域的大模型。包括微调的方法、技巧、到实际应用,让读者学会如何针对特定领域进行大模型的微调。
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

6.SD多模态大模型
以SD多模态大模型为主,搭建文生图小程序案例。从模型选择、到小程序的设计、到实际应用,让读者了解如何利用大模型构建多模态应用。
在这里插入图片描述

7.大模型平台应用与开发
通过星火大模型、文心大模型等成熟大模型,构建大模型行业应用。包括行业需求分析、方案设计、到实际应用,让读者了解如何利用大模型构建行业应用。

在这里插入图片描述
在这里插入图片描述

学成之后的收获👈

全栈工程实现能力:通过学习,你将掌握从前端到后端,从产品经理到设计,再到数据分析等一系列技能,实现全方位的技术提升。

解决实际项目需求:在大数据时代,企业和机构面临海量数据处理的需求。掌握大模型应用开发技能,将使你能够更准确地分析数据,更有效地做出决策,更好地应对各种实际项目挑战。

AI应用开发实战技能:你将学习如何基于大模型和企业数据开发AI应用,包括理论掌握、GPU算力运用、硬件知识、LangChain开发框架应用,以及项目实战经验。此外,你还将学会如何进行Fine-tuning垂直训练大模型,包括数据准备、数据蒸馏和大模型部署等一站式技能。

提升编码能力:大模型应用开发需要掌握机器学习算法、深度学习框架等技术,这些技术的掌握将提升你的编码能力和分析能力,使你能够编写更高质量的代码。

学习资源📚

  1. AI大模型学习路线图:为你提供清晰的学习路径,助你系统地掌握AI大模型知识。
  2. 100套AI大模型商业化落地方案:学习如何将AI大模型技术应用于实际商业场景,实现技术的商业化价值。
  3. 100集大模型视频教程:通过视频教程,你将更直观地学习大模型的技术细节和应用方法。
  4. 200本大模型PDF书籍:丰富的书籍资源,供你深入阅读和研究,拓宽你的知识视野。
  5. LLM面试题合集:准备面试,了解大模型领域的常见问题,提升你的面试通过率。
  6. AI产品经理资源合集:为你提供AI产品经理的实用资源,帮助你更好地管理和推广AI产品。

👉获取方式: 😝有需要的小伙伴,可以保存图片到wx扫描二v码免费领取【保证100%免费

在这里插入图片描述

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐