MODULE m3 · 8.0 HOURS

質問-正解評価セットの構築

0% 完了

LEARNING OBJECTIVES

このモジュールの目標

  1. RAGシステム評価のための高品質な質問-正解 (QA) 評価セットの必要性を理解する。
  2. 合成データ生成手法 (Synthetic Data Generation) を活用して評価セットを構築する原理を把握する。
  3. TrueTeacherのような手法を通じ、モデルが生成した回答の事実的一貫性を評価する論理を習得する。
  4. 評価セットの品質を維持しながら、ドメインの変化に堅牢なデータセットを生成するプロセスを設計する。

RAG評価のための質問-回答(QA)評価セットの構築

RAG(Retrieval-Augmented Generation)システムの性能を信頼性を持って測定するためには、精巧に設計された評価セットが不可欠です。単純に人間が作成した質問と回答にのみ依存する方式は、大規模評価を行う際にコストと拡張性の面で限界があります。

合成データ生成の重要性

最新の研究であるTrueTeacher方法論によると、LLMを活用してモデルが生成した多様な回答を注釈処理することで、合成訓練データを生成できます [S5]。この方式には以下のような利点があります:

  1. コスト効率: 人間が直接作成した要約や回答に依存しないため、大規模データセット(例: 1.4M例)の生成が可能です [S5]。
  2. 多言語および拡張性: 特定の言語に限定されず、ドメイン転換(Domain-shift)に対しても頑健性を示します [S5]。
  3. 事実的一貫性評価: 合成データを通じて学習された小型モデルは、大型LLM教師モデルの知識を成功裏に蒸留(Distillation)し、効率的な事実性評価ツールとして活用できます [S5]。

データセット構成戦略

評価セットを構築する際は、単に質問-回答のペアを作ることを超えて、「検索結果が回答を導き出すために必要な根拠を含んでいるか?」と「モデルが該当する根拠を歪曲なく参照しているか?」を測定できるように構成しなければなりません。このために、データセット生成時に質問の複雑度、検索結果との関連性、回答の事実的一貫性を体系的にラベリング、または検証する必要があります。

WORKED EXAMPLES

解説例

  1. 例 1: 文書コーパスから核心的な節を抽出する。与えられた文書からLLMを使用して文脈上重要な事実文を抽出し、これに基づいて「回答可能な質問」と「誤った質問(Negative Sample)」を生成するパイプラインを構成する。
  2. 例 2: 事実性検証プロンプトの設計。生成された質問と検索された文書をもとに、LLMに対して「検索された文書に基づいて質問に回答し、回答が事実的に一貫しているかTrue/Falseで判断せよ」と指示し、評価用正解地(Ground Truth)を精緻化する過程。

LAB PROTOCOL

合成評価セット生成実習

  1. 1

    準備されたオープンライセンス文書コーパスをロードし、テキストチャンク単位に分割する。

  2. 2

    LLM APIを使用して、各チャンクから抽出可能な固有の質問-回答ペアを 100件以上生成する。

  3. 3

    生成された質問に対して検索システムをシミュレーションし、上位k個の文書を検索する。

  4. 4

    検索された文書と生成された回答間の事実的一貫性を判断する評価パイプラインを構築する。

  5. 5

    結果データをJSONL形式で保存し、サンプル 30件を手動で検討してデータ品質を記録する。

安全確認
  • 評価セット構築過程で外部APIを使用する場合、コスト上限(API Key Limit)を必ず設定する。
  • 生成されたデータセット内に原本文書の機密情報や個人情報が含まれていないか、正規表現でフィルタリングする。
  • モデル評価結果のみを盲信せず、標本に対する手動照合を必ず併行する。

実習提出物

  • 構築された 100問以上の質問-回答評価セット(JSONLファイル)
  • データセット生成および検証コードが含まれたJupyter Notebook
  • 人間による検討記録が含まれた品質分析レポート

ASSIGNMENT

RAG信頼性評価セット回帰レポート

提出物

評価基準

  • 評価セットが文書コーパス全体のの内容を均等に反映しているか?
  • 合成データ生成パイプラインが再現可能な形式で作成されているか?
  • エラータイプの分類が具体的で定量的な根拠を備えているか?
  • 人間による検討を通じて、自動評価指標の妥当性を立証したか?

KNOWLEDGE CHECK

理解度チェック

1TrueTeacher方法論が従来の合成データ生成方式と差別化される点は何ですか?
2RAG評価セット構築時、モデルの自動評価のみで事実性を確定しない理由は何ですか?

FIELD CHECK

完了基準

  • 100問以上の質問-回答評価セットデータセット構築完了
  • データセット品質分析および人間による検討記録の提出
  • RAGパイプラインの性能評価のためのノートブック実装および結果レポート作成
  • CI/CD環境で再実行可能な形式の評価パッケージ構成

MODULE SOURCES

このモジュールの根拠

  1. [2305.11171] TrueTeacher: Learning Factual Consistency ... TrueTeacher: Learning Factual Consistency Evaluation with ... TrueTeacher: Generating Synthetic Data for Factual ... (PDF) TrueTeacher: Learning Factual Consistency Evaluation ... (PDF) TrueTeacher: Learning Factual Consistency Evaluation ... [PDF] TrueTeacher: Learning Factual Consistency Evaluation ...arxiv.org · paper