Instiq
第4章 · GenAI アプリの運用効率と最適化·v1.0.0·更新 2026/6/22·読了目安 約11分

変更要約: 初版: ドメイン4(運用効率と最適化)の3節を作成

4.3GenAI アプリケーションのモニタリング

この節の要点

FM アプリの可観測性を学びます。CloudWatch でのトークン使用/ハルシ率/応答品質、Bedrock Model Invocation Logs、異常検知、ツール呼び出しのオブザーバビリティ、golden dataset による幻覚検出を扱います。

GenAI は従来 ML にない固有の故障モード(幻覚・応答ドリフト・トークン急増)を持ちます。運用メトリクスに加え、品質・コストの GenAI 特化メトリクスを監視します。

4.3.1可観測性の構成要素

  • 運用+GenAI メトリクスCloudWatch でレイテンシ/エラーに加え、トークン使用・プロンプト有効性・ハルシ率・応答品質を追跡。
  • Model Invocation LogsBedrock Model Invocation Logs で各リクエスト/レスポンスを詳細分析する。
  • 異常検知:トークンのバースト/応答ドリフトの異常検知、コスト異常検出、パフォーマンスベンチマーク。
  • GenAI 固有のトラブルシュートgolden dataset で幻覚検出、出力 diff で応答一貫性、推論経路トレースで論理エラーを特定。
試験ポイント

「リクエスト/レスポンスの詳細ログ=Bedrock Model Invocation Logs」「幻覚を継続検出=golden dataset との比較」「トークン使用/ハルシ率を監視=CloudWatch カスタムメトリクス」「ツール呼び出しの可観測性」 は頻出です。X-Ray は分散トレースに使えます。

監視は「運用」と「GenAI 固有」を重ねます。基本は CloudWatch でレイテンシ・エラー・スループットを見つつ、GenAI 特化メトリクス(トークン使用量・プロンプト有効性・ハルシネーション率・応答品質・コスト)をカスタムメトリクス/ダッシュボードで可視化し、ビジネス影響メトリクスも併記します。詳細分析は Bedrock Model Invocation Logs(各呼び出しの入出力を S3/CloudWatch Logs へ)で行い、X-Ray でサービス境界をまたいでトレース。異常はトークンのバーストパターン応答ドリフトの異常検知、コスト異常検出 で捕捉します。GenAI 固有の故障は golden dataset(期待回答セット)との比較で幻覚を検出、出力 diff で応答一貫性を確認、推論経路トレースで論理エラーを特定。エージェントはツール呼び出しのオブザーバビリティ(呼び出しパターン/多エージェント協調)を、ベクトルストアは検索性能/データ品質を監視します。フォレンジック用途の監査ログも残します。

続きは無料登録で読めます

冒頭を無料で公開中。無料登録でこの節の全文と、第4章以降を含む全参考書・全問題集が読めます。