変更要約: 初版: ドメイン5(テスト・検証・トラブルシュート)の2節を作成
5.1GenAI の評価システム
FM 出力の品質を体系的に評価する方法を学びます。Bedrock Model Evaluations、RAG 評価、LLM-as-a-Judge、Bedrock Agent evaluations、A/B・カナリア、関連性/事実性/一貫性/流暢性メトリクス、回帰テストを扱います。
GenAI は従来 ML の精度指標だけでは測れません。関連性・事実性・一貫性・流暢性など多面的に評価し、自動評価と人手評価を組み合わせて品質を担保します。
5.1.1評価の手段
- Bedrock Model Evaluations:モデル/構成を体系的に評価し、最適な設定を特定する(自動指標+人手)。
- LLM-as-a-Judge:別の FM を評価者として、出力品質を大規模に自動採点する。
- RAG 評価/Agent 評価:RAG 評価 で検索+生成の質、Bedrock Agent evaluations でタスク完了率/ツール利用/推論品質を測る。
- A/B・カナリア・回帰:A/B/カナリアで本番比較、デプロイ前後の回帰テストと品質ゲート、ユーザーフィードバック/評価で継続改善。
「モデル/構成の体系的評価=Bedrock Model Evaluations」「大規模な自動採点=LLM-as-a-Judge」「検索+生成の質=RAG 評価」「エージェントのタスク完了率=Agent evaluations」「本番での安全な比較=A/B・カナリア」 は頻出です。評価軸は関連性/事実性/一貫性/流暢性。
評価は「指標・自動化・本番検証」を組み合わせます。出力品質は関連性・事実性・一貫性・流暢性などの多面メトリクスで定義し、モデル/構成の比較は Bedrock Model Evaluations(自動指標+人手評価)で体系化。大規模には LLM-as-a-Judge(評価用 FM が採点)でスケールさせ、人手は SageMaker Ground Truth 等のアノテーションで補完します。RAG は RAG 評価(取得の関連性+生成の忠実性)、エージェントは Bedrock Agent evaluations(タスク完了率・ツール利用の有効性・多段推論の質)で測ります。本番反映は A/B テスト/カナリア で安全に比較し、デプロイ前後の回帰テストと自動品質ゲートで劣化を止め、合成ユーザーフロー(CloudWatch Synthetics など)で AI 固有の出力検証(ハルシ率・意味的ドリフト)を行います。ステークホルダー向けには可視化レポート/モデル比較で結果を伝えます。継続改善はユーザーフィードバック/評価を取り込み、評価→改善のループを回します。
| 対象 | 使うもの | 測るもの |
|---|---|---|
| モデル/構成の比較 | Bedrock Model Evaluations | 自動指標+人手 |
| 大規模な品質採点 | LLM-as-a-Judge | 関連性/事実性/一貫性 |
| RAG の質 | RAG 評価 | 取得の関連性+忠実性 |
| エージェントの質 | Agent evaluations | タスク完了率/ツール利用 |
ひっかけ: 「正解率(accuracy)だけで GenAI の品質は測れる」は誤りです。生成は関連性・事実性・一貫性・流暢性など多面で評価します。また「LLM-as-a-Judge は人手評価を完全に置き換える」も誤り(自動化でスケールするが、重要判断は人手評価/Ground Truth で補完)。
5.1.2この節のまとめ
- 体系評価=Model Evaluations/大規模採点=LLM-as-a-Judge/RAG=RAG 評価/エージェント=Agent evaluations
- 本番=A/B・カナリア+回帰テスト+品質ゲート/軸=関連性/事実性/一貫性/流暢性
進捗の記録にはログインが必要です。
理解度チェック
(軽い確認用)Q1. 複数の FM と構成のどれが自社ユースケースに最適かを、自動指標と人手評価の両方で体系的に比較したい。最適なのは?
Q2. 数万件の生成回答の品質(関連性・事実性など)を、人手だけに頼らず大規模かつ一貫して自動採点したい。最適な手法は?
Q3. 新しいプロンプト版を本番へ反映する際、既存ユーザーへの影響を抑えつつ実トラフィックで品質を比較・検証したい。最適なのは?

