MODULE m7 · 10.0 HOURS
自动化评估框架(Ragas)应用
已完成 0%
LEARNING OBJECTIVES
本模块目标
- 理解RAG流水线的核心评估维度(检索及生成质量)。
- 学习如何使用Ragas框架进行无引用(reference-free)的RAG性能自动化评估。
- 通过定量指标分析并缓解幻觉(hallucination)风险。
RAG评估的挑战与Ragas
RAG系统由检索模块和基于LLM的生成模块组成 [S3, S4]。评估这种结构是一项挑战,因为必须同时考虑检索系统识别相关上下文(context)的准确度、LLM利用所提供上下文的忠实度(faithfulness)以及回答的质量 [S4]。
传统的评估方式依赖于人工编写答案并进行对比,但这不仅成本高昂,而且耗时,不适合快速迭代周期 [S3, S4]。
Ragas框架
Ragas (Retrieval Augmented Generation Assessment) 是一个无需基准数据集即可评估RAG流水线的框架 [S3, S4]。Ragas会自动评估以下核心维度:
- 检索质量 (Retrieval Quality): 衡量检索到的上下文与问题的相关性(Context Relevance),以及是否包含所有必要信息(Context Recall)。
- 生成质量 (Generation Quality): 衡量生成的回答是否基于检索到的上下文(Faithfulness),以及是否与问题相关(Answer Relevance)。
这些指标通过利用LLM作为“评估者(judge)”,实现了无需基准答案即可进行评估,有助于缩短RAG的开发周期 [S3, S4]。
WORKED EXAMPLES
讲解示例
- 案例 1:Context Relevance 计算。Ragas利用LLM从检索到的上下文(Context)中提取回答问题实际所需的句子,并通过所需句子占整个上下文的比例来计算得分。
- 案例 2:Faithfulness 评估。由LLM判断生成的回答中的每一项主张是否都能在检索到的上下文中找到支撑。无法得到支撑的主张越多,幻觉得分就越高。
LAB PROTOCOL
使用Ragas进行RAG性能定量评估实践
- 1
准备评估数据集(问题、检索到的上下文、生成的回答)。
- 2
在Python环境中安装 `ragas` 库。
- 3
将评估数据集转换为 `ragas` 的 Dataset 对象。
- 4
调用 Ragas 的 `evaluate` 函数来计算上下文相关性(Context Relevance)、忠实度(Faithfulness)等指标。
- 5
可视化结果并分析得分较低的查询。
安全检查
- 确认评估使用的文档语料库中不包含个人信息或非公开数据。
- 为防止API使用成本过高,在测试时请积极使用本地模型或缓存。
- 自动化评估结果是衡量可靠性的辅助指标,实际模型质量的确定应结合人工样本审核进行交叉验证。
实验提交物
- 包含指标得分的评估结果数据框(Dataframe)
- 低分查询类型的分析日志
ASSIGNMENT
RAG流水线性能对比报告
提交物
评分标准
- 是否正确实现了Ragas指标(Context Relevance, Faithfulness等)?
- 评估结果是否进行了定量对比并包含了逻辑解释?
- 是否分类了至少 3 种幻觉类型并提出了改进方案?
KNOWLEDGE CHECK
理解检查
FIELD CHECK
完成标准
- 使用 Ragas 库成功计算至少 10 个查询的 4 种以上指标
- 定期将实操笔记本提交至 Git 仓库
- 性能比较报告中至少包含 3 个错误分类案例
MODULE SOURCES
本模块参考资料
- [2309.15217] Ragas: Automated Evaluation of Retrieval ... Ragas: Automated Evaluation of Retrieval Augmented Generation RAGAS: Automated Evaluation of Retrieval Augmented Generation RAGAs: Automated Evaluation of Retrieval Augmented Generation RAGAS: Automated Evaluation of Retrieval Augmented Generation RAGAS: Automated Evaluation of Retrieval Augmented Generationarxiv.org · paper
- Ragas: Automated Evaluation of Retrieval Augmented Generationarxiv.org · paper