CURRICULUM 1.0.0+40bb735b5f50 · intermediate

AI・ソフトウェア

RAG評価と信頼性実験

学習者はRAGパイプラインの検索・生成段階を分離して評価し、Ragasなどの自動評価ツールを活用してハルシネーション(幻覚)を低減させ、事実性を検証する定量的な回帰テストフレームワークを設計できる。

  • retrieval-augmented-generation
  • rag-evaluation
  • information-retrieval
  • llm-reliability
TIME96.0h
MODULES10
BUDGET₩0–100000
REVIEWED2026-08-30

YOUR FIELD LOG

学習進捗

0% 完了

固定ドキュメントセットと質問・正解評価セットを作成し、検索品質、根拠忠実度、引用精度、失敗タイプを定量測定して、再現可能なRAG回帰評価レポートを完成させる。

学習者はRAGパイプラインの検索・生成段階を分離して評価し、Ragasなどの自動評価ツールを活用してハルシネーション(幻覚)を低減させ、事実性を検証する定量的な回帰テストフレームワークを設計できる。

STUDY MAP

カリキュラム

1

RAG基礎およびデータセット構築

  1. RAGアーキテクチャの理解8.0 時間 · RAG (Retrieval-Augmented Generation) アーキテクチャの主要構成要素を理解する。
  2. 評価用ドキュメントコーパスのキュレーション8.0 時間 · RAG評価のための固定ドキュメントコーパスの重要性を理解する。
  3. 質問-正解評価セットの構築8.0 時間 · RAGシステム評価のための高品質な質問-正解 (QA) 評価セットの必要性を理解する。
2

検索および生成品質評価

  1. 検索品質指標(Recall @k, MRR, nDCG)8.0 時間 · 検索拡張生成(RAG)パイプラインにおいて検索段階の重要性を理解する。
  2. 根拠忠実度評価8.0 時間 · 根拠忠実度(Faithfulness)の概念を理解し、RAGシステムにおける重要性を把握する。
  3. 引用の正確性および出典追跡8.0 時間 · RAGシステムにおいて、回答が検索されたドキュメントの内容をどれだけ忠実に反映しているかを理解する。
  4. 自動評価フレームワーク(Ragas)の適用10.0 時間 · RAGパイプラインの主要な評価次元(検索および生成品質)を理解する。
3

信頼性検証およびレポーティング

  1. 失敗タイプの分類およびエラー分析10.0 時間 · RAGシステムで発生する失敗タイプを識別し、分類できる。
  2. サンプルに対する人間によるレビューおよび照合10.0 時間 · 自動化されたRAG評価指標と実際の事実性との間のギャップを理解する。
  3. 再現可能な回帰評価レポーティング18.0 時間 · RAGシステムの再現可能な回帰評価フレームワークを理解する。

FINAL BUILD

RAGシステム信頼性回帰評価報告書

提出物

評価基準

  • 評価セットのソース追跡可能性および質問-文書対応の精密さ
  • 検索および生成品質指標の定量的測定の妥当性
  • 自動評価結果と人間による検討結果間の定性的整合性の分析
  • 失敗タイプ(検索失敗 vs 生成失敗)の明確な分類および分析
  • レポートの再現性および回帰評価フレームワークのCI統合可能性

安全基準

  • 評価過程における個人情報漏洩防止措置の遵守
  • プロンプトインジェクションに対する安全なデータハンドリング
  • 事実性検証のための人間による検討プロセスの並行実施
  • コストおよびリクエスト数の制限を通じた安全なAPI使用

RESEARCH LEDGER

根拠資料

  1. Stanford CS 224N | Natural Language Processing with Deep Learningweb.stanford.edu · university · 2026-08-30
  2. Natural Language Processing with Deep Learning CS224N/Ling284web.stanford.edu · university · 2026-08-30
  3. [2309.15217] Ragas: Automated Evaluation of Retrieval ... Ragas: Automated Evaluation of Retrieval Augmented Generation RAGAS: Automated Evaluation of Retrieval Augmented Generation RAGAs: Automated Evaluation of Retrieval Augmented Generation RAGAS: Automated Evaluation of Retrieval Augmented Generation RAGAS: Automated Evaluation of Retrieval Augmented Generationarxiv.org · paper · 2026-08-30
  4. Ragas: Automated Evaluation of Retrieval Augmented Generationarxiv.org · paper · 2026-08-30
  5. [2305.11171] TrueTeacher: Learning Factual Consistency ... TrueTeacher: Learning Factual Consistency Evaluation with ... TrueTeacher: Generating Synthetic Data for Factual ... (PDF) TrueTeacher: Learning Factual Consistency Evaluation ... (PDF) TrueTeacher: Learning Factual Consistency Evaluation ... [PDF] TrueTeacher: Learning Factual Consistency Evaluation ...arxiv.org · paper · 2026-08-30