Interview: GraphRAG相比传统向量RAG的核心优势在哪?什么场景下差异最大?


题目解析

微软提出的GraphRAG将文档集构建为实体-关系知识图谱,然后基于图结构做社区检测和层次化摘要。这与传统的基于向量相似度的RAG在信息组织和检索方式上有根本区别。理解两者的适用场景边界对于技术选型至关重要。

解答思路

传统向量RAG擅长:局部事实查找(“X的定义是什么”)——因为答案通常包含在单个chunk中,向量相似度能有效定位。GraphRAG擅长:1)全局性问题(“这个数据集的主要主题是什么”)——需要综合多个文档的信息,传统RAG无法一次检索到所有相关内容;2)多跳推理(“A公司CEO的母校和B公司CTO的母校哪个排名更高”)——需要沿着关系链检索,向量检索无法表达这种路径关系;3)概念对比(“X和Y的区别”)——需要同时理解两个概念及其关系。

关键要点

  1. GraphRAG的构建成本远高于向量RAG——需要LLM提取实体和关系,处理100页文档可能需要数千次API调用
  2. 社区检测(Leiden算法)将图分割为语义社区,每个社区生成多层次摘要
  3. Local Search(图邻域检索)适合精确问答,Global Search(社区摘要聚合)适合开放性问题
  4. GraphRAG对文档更新不友好——新增文档需要重新提取实体并更新图结构

加分回答

可以讨论LightRAG和nano-GraphRAG等轻量级替代方案——它们简化了图构建过程但保留了多跳检索能力。还可以分析混合架构:对事实性问题用传统向量RAG(快且便宜),对综合性问题用GraphRAG(慢但准确),通过查询分类器自动路由。另一个值得提的是RAPTOR——通过递归摘要构建树形索引,是向量RAG和GraphRAG之间的折中方案。

常见踩坑

  1. 对简单事实查询使用GraphRAG——大材小用,成本高且效果不一定好
  2. 实体提取质量不高导致图谱中存在大量噪声节点和错误关系
  3. 忽略了GraphRAG的索引构建时间——大型文档集可能需要数小时到数天