MODULE m3 · 8.0 HOURS
建立問題-答案評估集
已完成 0%
LEARNING OBJECTIVES
本模組目標
- 理解為 RAG 系統評估建立高品質問題-答案(QA)評估集的必要性。
- 掌握利用合成資料生成技術(Synthetic Data Generation)建立評估集的原理。
- 學習透過 TrueTeacher 等方法論評估模型生成答案的事實一致性之邏輯。
- 設計一個能在保持評估集品質的同時,生成對領域變更具備穩健性的資料集之流程。
為 RAG 評估建立問題-答案(QA)評估集
為了可靠地衡量 RAG(檢索增強生成)系統的效能,精心設計的評估集是必不可少的。僅依賴人類編寫的問題和答案,在大規模評估時,在成本和可擴展性方面存在局限。
合成資料生成的必要性
根據最新的研究,TrueTeacher 方法論指出,可以利用 LLM 來生成模型產生的各種答案,並進行註釋以創建合成訓練資料 [S5]。此方法具有以下優點:
- 成本效益: 無需依賴人類直接編寫的摘要或答案,即可生成大規模資料集(例如:1.4M 範例)[S5]。
- 多語言與可擴展性: 不限於特定語言,並且對領域轉換(Domain-shift)表現出穩健性 [S5]。
- 事實一致性評估: 通過合成資料訓練的小型模型,可以成功地將大型 LLM 教師模型的知識進行蒸餾(Distillation),並用作高效的事實性評估工具 [S5]。
資料集構成策略
在建立評估集時,不應僅僅創建問題-答案對,還應構建能夠衡量「檢索結果是否包含推導答案所需的依據?」以及「模型是否無偏差地引用了這些依據?」的評估集。為此,在生成資料集時,必須系統地標記或驗證問題的複雜度、與檢索結果的相關性以及答案的事實一致性。
WORKED EXAMPLES
講解範例
- 範例 1:從文件語料庫中提取關鍵片段。構成一個管線,該管線使用 LLM 從給定文件中提取語境上重要的事實句子,並以此為基礎生成「可回答的問題」和「虛假問題(Negative Sample)」。
- 範例 2:事實性驗證提示設計。一個精煉評估用真實值(Ground Truth)的過程,該過程指示 LLM 根據檢索到的文件回答問題,並判斷答案是否在事實上一致(True/False),此判斷基於生成的問題和檢索到的文件。
LAB PROTOCOL
合成評估集生成實踐
- 1
載入準備好的開放授權文件語料庫,並將其分割為文字區塊。
- 2
使用 LLM API 為每個區塊生成至少 100 組獨特的問答對。
- 3
針對生成的問句,模擬搜尋系統以檢索前 k 個文件。
- 4
建立一個評估管線,用於判斷檢索到的文件與生成的答案之間的事實一致性。
- 5
將結果數據以 JSONL 格式儲存,並手動審查樣本 30 件以記錄數據品質。
安全檢查
- 在建立評估集過程中,使用外部 API 時必須設定費用上限(API Key Limit)。
- 利用正規表達式過濾生成的數據集中是否包含原始文件的敏感資訊或個人資訊。
- 不盲目相信模型評估結果,務必同時進行樣本的手動比對。
實驗繳交成果
- 已建立 100 題以上的問答評估集 (JSONL 檔案)
- 包含數據集生成與驗證程式碼的 Jupyter Notebook
- 包含人工審查記錄的品質分析報告
ASSIGNMENT
RAG 可靠性評估集迴歸報告
繳交成果
評分標準
- 評估集是否均勻反映了整個文件語料庫的內容?
- 合成數據生成管線是否以可重現的形式撰寫?
- 錯誤類型分類是否具備具體且定量的依據?
- 是否透過人工審查證明了自動評估指標的有效性?
KNOWLEDGE CHECK
理解檢查
FIELD CHECK
完成標準
- 100 題以上問答評估集數據集建立完成
- 提交數據集品質分析及人工審查記錄
- 實作 RAG 管線效能評估的筆記本並撰寫結果報告
- 在 CI/CD 環境中配置可重新執行的評估套件
MODULE SOURCES