MODULE m4 · 8.0 HOURS
検索品質指標(Recall @k, MRR, nDCG)
0% 完了
LEARNING OBJECTIVES
このモジュールの目標
- 検索拡張生成(RAG)パイプラインにおいて検索段階の重要性を理解する。
- Recall @k, MRR, nDCG指標の概念と、RAGシステム評価における意味を学習する。
- 検索されたコンテキストの関連性が、その後の回答生成品質に与える影響を分析する。
RAG検索品質評価の重要性
RAGシステムは、外部データベースから関連情報を検索し、それをLLMに伝えて回答を生成する [S3]。そのため、検索段階で関連性が高く集中したコンテキストを特定できなければ、いかに強力なLLMであっても正確な回答を生成することは困難である [S3]。検索品質を評価することは、RAGアーキテクチャの全体的な性能を改善するための第一歩である。
主要検索評価指標
- Recall @k(再現率): 検索された上位k個の結果に、実際の正解が含まれているかを測定する。つまり、必要な情報が検索システムによって捕捉されたかを確認する指標である。
- MRR(平均逆順位): ユーザーの質問に対する正解(関連文書)が、検索結果リストの何番目に位置しているかを測定する。最も最初の位置に関連文書が登場するほどMRR値は1に近づき、高いスコアとなる。
- nDCG(正規化割引累積利得): 検索結果の順序を考慮する指標であり、関連性の高い文書が上部に位置するほど高いスコアを付与する。単純な包含有無(Recall)よりも、検索結果の「順位精度」をより精密に評価する。
これらの指標は、参照データ(Ground Truth)がある場合、システム改善のために必須であり、Ragasのようなフレームワークは、これらの側面を定量的に分析できるツールを提供する [S3, S4]。
WORKED EXAMPLES
解説例
- 質問に対してシステムが[DocB, DocA, DocC]の順で返却し、正解関連文書がDocAである場合? MRR計算: DocAは 2番目なのでReciprocal Rankは 1/2 = 0.5である。
- k=3のとき、上位 3個の検索結果に正解文書が含まれていればRecall @3 = 1、含まれていなければRecall @3 = 0である。
LAB PROTOCOL
検索品質指標の定量測定実習
- 1
評価セット(質問、正解文書)を使用して 50個のサンプルデータを用意する。
- 2
検索モジュールを実行して、各質問に対する上位k(k=3, 5, 10)個の文書を返却してもらう。
- 3
Recall @k, MRR, nDCG関数をPythonで直接実装するか、ライブラリを使用して計算する。
- 4
質問別指標結果をデータフレームに整理して可視化する。
安全確認
- 個人情報や非公開文書が含まれたデータセットを外部APIに伝送しない。
- 実験時にAPIコスト制限を設定し、キャッシュを活用してリクエスト数を最適化する。
実習提出物
- 各質問別のRecall @k, MRR, nDCG値が含まれた結果データフレームのCSV
- 指標分布を示すヒストグラムおよびボックスプロット画像
ASSIGNMENT
検索機(Retriever)性能比較レポート
提出物
評価基準
- Recall @k, MRR, nDCG指標を正確に計算したか?
- 検索性能差を統計的に有意に解釈したか?
- 失敗タイプを体系的に分類したか?
KNOWLEDGE CHECK
理解度チェック
FIELD CHECK
完了基準
- Recall @k, MRR, nDCG計算コードを完成させ、サンプルデータに適用した。
- 二つの検索戦略を比較し、定量的な分析結果を導き出した。
- 検索失敗タイプを少なくとも 3種類以上分類してレポートに記載した。
MODULE SOURCES
このモジュールの根拠
- [2309.15217] Ragas: Automated Evaluation of Retrieval ... Ragas: Automated Evaluation of Retrieval Augmented Generation RAGAS: Automated Evaluation of Retrieval Augmented Generation RAGAs: Automated Evaluation of Retrieval Augmented Generation RAGAS: Automated Evaluation of Retrieval Augmented Generation RAGAS: Automated Evaluation of Retrieval Augmented Generationarxiv.org · paper
- Ragas: Automated Evaluation of Retrieval Augmented Generationarxiv.org · paper