MODULE m5 · 8.0 HOURS
證據忠實度評估
已完成 0%
LEARNING OBJECTIVES
本模組目標
- 理解證據忠實度(Faithfulness)的概念,並掌握其在RAG系統中的重要性。
- 利用Ragas框架,定量評估生成的答案是否基於檢索到的上下文(Context)。
- 利用自動化評估指標,分析幻覺(Hallucination)風險。
證據忠實度 (Faithfulness) 評估
RAG(Retrieval-Augmented Generation)系統的核心是LLM利用從外部知識資料庫中檢索到的資訊來生成答案。證據忠實度(Faithfulness)是指生成的答案是否忠實地反映了檢索到的上下文中所描述的資訊 [S3]。
1. 為何評估證據忠實度?
LLM傾向於根據預先學習的知識來回答,這可能會生成與檢索到的上下文無關的資訊,或扭曲上下文。這被稱為「幻覺(Hallucination)」,透過證據忠實度評估可以定量測量它 [S4]。
2. 評估框架:Ragas
Ragas提出了一個即使在沒有使用者註釋的情況下,也能在無參考基礎上(reference-free)進行評估的框架 [S3]。證據忠實度評估過程通常遵循以下步驟:
- 從答案中提取陳述:從答案中分離出可驗證的事實陳述。
- 檢索證據:確認每個陳述是從檢索到的上下文的哪個部分得出的。
- 驗證:判斷提取的陳述是否與上下文資訊一致。
Ragas使用LLM作為評估者來自動化此過程 [S4]。
WORKED EXAMPLES
講解範例
- 範例1:若上下文為「蘋果富含維生素C」,而答案為「蘋果富含維生素C,對免疫力有益」,則「對免疫力有益」是上下文中沒有的資訊,因此證據忠實度分數會降低。
- 範例2:若上下文為「我們公司的創立日是2020年5月1日」,而答案為「本公司成立於2020年5月」,則資訊一致,因此具有較高的證據忠實度分數。
LAB PROTOCOL
利用Ragas測量生成答案的證據忠實度
- 1
準備評估資料集(問題、檢索到的上下文、生成的答案)。
- 2
安裝Ragas庫並匯入`Faithfulness`指標。
- 3
將準備好的資料集轉換為Ragas的資料結構。
- 4
組態基於LLM的評估器,計算資料集的證據忠實度分數。
- 5
抽樣分析低分答案,並透過人工審查分析其與檢索到的上下文的差異。
安全檢查
- 不將包含非公開文件或個人資訊的資料集傳輸到外部LLM API。
- 確認API請求次數限制,並使用快取(Cache)來控制成本。
- 在人工審查時保持樣本資料的安全性。
實驗繳交成果
- 整個資料集的平均證據忠實度分數報告
- 針對低分答案的分析資料集
- 自動評估結果與人工審查結果的比較分析
ASSIGNMENT
RAG管線可靠性評估報告
繳交成果
評分標準
- 證據忠實度指標的實現是否正確?
- 是否準確分類生成答案中的幻覺案例?
- 是否確保了自動評估結果與人工審查的定性一致性?
KNOWLEDGE CHECK
理解檢查
FIELD CHECK
完成標準
- 能夠使用 Ragas 函式庫定量測量生成答案的事實性。
- 在評估結果中,能夠分類至少 3 種幻覺發生類型。
- 能夠驗證自動化評估管道的結果與實際答案的一致性。
MODULE SOURCES
本模組參考資料
- [2309.15217] Ragas: Automated Evaluation of Retrieval ... Ragas: Automated Evaluation of Retrieval Augmented Generation RAGAS: Automated Evaluation of Retrieval Augmented Generation RAGAs: Automated Evaluation of Retrieval Augmented Generation RAGAS: Automated Evaluation of Retrieval Augmented Generation RAGAS: Automated Evaluation of Retrieval Augmented Generationarxiv.org · paper
- Ragas: Automated Evaluation of Retrieval Augmented Generationarxiv.org · paper