RAG评估框架(Ragas等)


一句话总结

RAG评估框架通过多维度指标系统化地评估检索质量和生成质量,是持续优化RAG系统的核心工具。

核心概念

Ragas框架定义了核心评估指标:Faithfulness(忠实度,生成是否基于检索内容)、Answer Relevancy(答案相关性,回答是否切题)、Context Precision(上下文精确率,检索结果中相关文档的排序质量)、Context Recall(上下文召回率,是否检索到所有必要信息)。其他框架包括ARES、TruLens等。评估方式分为基于规则、基于模型(LLM-as-Judge)和人工评估。

为什么重要

没有评估就无法系统性优化。RAG系统涉及多个环节(分块、检索、生成),需要分别评估定位瓶颈。主观感受不可靠,需要量化指标指导迭代。

实践要点

建立标注数据集(问题-答案-相关文档三元组)。分别评估检索和生成两个阶段。使用LLM自动评估降低标注成本但需校验可靠性。关注端到端效果而非单一指标。建立评估流水线实现自动化回归测试。定期用人工评估校准自动指标。

常见误区

只看最终回答质量不分析检索质量。评估数据集太小或不具代表性。过度依赖LLM自动评估而不做人工校验。优化单一指标忽视整体平衡。忽视评估指标本身的局限性。