変更要約: 初版: ドメイン5(テスト・検証・トラブルシュート)の2節を作成
5.1GenAI の評価システム
FM 出力の品質を体系的に評価する方法を学びます。Bedrock Model Evaluations、RAG 評価、LLM-as-a-Judge、Bedrock Agent evaluations、A/B・カナリア、関連性/事実性/一貫性/流暢性メトリクス、回帰テストを扱います。
GenAI は従来 ML の精度指標だけでは測れません。関連性・事実性・一貫性・流暢性など多面的に評価し、自動評価と人手評価を組み合わせて品質を担保します。
5.1.1評価の手段
- Bedrock Model Evaluations:モデル/構成を体系的に評価し、最適な設定を特定する(自動指標+人手)。
- LLM-as-a-Judge:別の FM を評価者として、出力品質を大規模に自動採点する。
- RAG 評価/Agent 評価:RAG 評価 で検索+生成の質、Bedrock Agent evaluations でタスク完了率/ツール利用/推論品質を測る。
- A/B・カナリア・回帰:A/B/カナリアで本番比較、デプロイ前後の回帰テストと品質ゲート、ユーザーフィードバック/評価で継続改善。
「モデル/構成の体系的評価=Bedrock Model Evaluations」「大規模な自動採点=LLM-as-a-Judge」「検索+生成の質=RAG 評価」「エージェントのタスク完了率=Agent evaluations」「本番での安全な比較=A/B・カナリア」 は頻出です。評価軸は関連性/事実性/一貫性/流暢性。
評価は「指標・自動化・本番検証」を組み合わせます。出力品質は関連性・事実性・一貫性・流暢性などの多面メトリクスで定義し、モデル/構成の比較は Bedrock Model Evaluations(自動指標+人手評価)で体系化。大規模には LLM-as-a-Judge(評価用 FM が採点)でスケールさせ、人手は SageMaker Ground Truth 等のアノテーションで補完します。RAG は RAG 評価(取得の関連性+生成の忠実性)、エージェントは Bedrock Agent evaluations(タスク完了率・ツール利用の有効性・多段推論の質)で測ります。本番反映は A/B テスト/カナリア で安全に比較し、デプロイ前後の回帰テストと自動品質ゲートで劣化を止め、合成ユーザーフロー(CloudWatch Synthetics など)で AI 固有の出力検証(ハルシ率・意味的ドリフト)を行います。ステークホルダー向けには可視化レポート/モデル比較で結果を伝えます。継続改善はユーザーフィードバック/評価を取り込み、評価→改善のループを回します。

