MODULE m9 · 10.0 HOURS
样本人工审核与对照
已完成 0%
LEARNING OBJECTIVES
本模块目标
- 理解自动化 RAG 评估指标与实际事实性之间的差距。
- 设计人工审核模型生成回答的事实一致性(Factual Consistency)的协议。
- 识别 LLM 评估的局限性,并分析 TrueTeacher 等合成数据技术的意义 [S5]。
- 掌握系统化分类错误类型及管理可信度数据集的方法。
自动化评估的局限性与人工审核的必要性
在评估检索增强生成(RAG)系统的质量时,Ragas 等工具虽然能快速提供定量指标,但在捕捉模型生成回答的微妙事实错误方面存在局限。特别是在复杂的语境下,很难区分 LLM 是在知识范围内进行推理,还是依赖于学习过的数据产生了幻觉(Hallucination)。
事实一致性评估
最近的研究利用自然语言推理(NLI)模型或大语言模型(LLM)来评估摘要或回答的事实性。然而,现有方法依赖于人工编写的摘要数据集,这可能与实际模型生成的输出特性存在差异 [S5]。TrueTeacher 等方法试图通过利用 LLM 从模型生成数据中构建合成的事实性评估数据,来克服这些局限性 [S5]。
人工审核(Human-in-the-Loop)的作用
无论自动化评估流水线多么先进,最终的可靠性验证仍离不开人工审核。人工审核的作用如下:
- 验证自动化评估指标: 识别某些回答虽被评估为“相关”但实际上并非事实的情况。
- 幻觉类型分类: 诊断系统结构性缺陷(检索错误 vs. 生成模型错误)。
- 校准回归测试集: 基于人工审核的数据持续提升评估集的质量。
WORKED EXAMPLES
讲解示例
- 示例 1:自动化评估指标(如 Faithfulness)得分很高,达到 0.9,但人工审核发现回答中包含了检索文档中不存在的内容。分析:将其归类为模型使用了非检索信息(即内部权重中包含的过去信息)产生的幻觉,并记录在系统错误日志中。
- 示例 2:设计使用 TrueTeacher 模型使系统自行评估回答的事实性。人工抽样调查 LLM 评为“正确”的部分回答,以衡量 LLM 评估器的错误率(误报率,False Positive),并将其在评估报告中注明 [S5]。
LAB PROTOCOL
样本人工审核与错误分析执行
- 1
通过自动化评估流水线(Ragas 等)导出 100 个回答的忠实度(Faithfulness)得分。
- 2
随机抽取得分最低的 10 个、中等水平的 10 个及得分最高的 10 个样本,建立审核集。
- 3
通过对照回答、检索文档(Context)和标准答案(Ground Truth),人工记录是否存在“检索遗漏”、“信息失真”、“幻觉生成”。
- 4
对比记录的人工判断与自动化评估得分,执行相关性分析。
安全检查
- 务必确认待审核的数据集中不包含实际个人信息或敏感的非公开文档。
- 审核完成的数据安全保存在本地存储中,严禁上传至未经验证的外部 API。
实验提交物
- 包含至少 30 条人工审核记录的错误分类表(CSV/Excel)
- 分析自动化指标与人工评估一致性的总结报告
ASSIGNMENT
RAG 可信度分析报告撰写
提交物
评分标准
- 错误类型分类是否系统化?
- 是否结合具体示例逻辑性地叙述了自动化评估指标的局限性?
- 人工审核数据是否被恰当地用作可信度分析的依据?
KNOWLEDGE CHECK
理解检查
FIELD CHECK
完成标准
- 需编写至少 30 个数据样本的人工审核日志。
- 需提交包含自动化评估结果与人工审核结果比较分析的报告。
- 需通过错误分类明确定义当前系统的脆弱点。
MODULE SOURCES