変更要約: Professional Machine Learning Engineer 第6章を新規作成(ドメイン6「監視」: 安全な AI システム(窃取/汚染対策)・Google Responsible AI(バイアス監視)・公平性/準備状況評価・Vertex Explainable AI(特徴量アトリビューション)、Vertex AI Model Monitoring による継続的評価・訓練/サービングスキュー・特徴量アトリビューションドリフト・ベースライン/単純モデル/時間軸との性能比較・よくある訓練/サービングエラー監視)。
6.2監視とトラブルシュート
継続的評価メトリクスの確立(Vertex AI Model Monitoring・Explainable AI)、訓練/サービングスキューの監視、特徴量アトリビューションのドリフト監視、ベースライン/より単純なモデル/時間軸に対するモデル性能の監視、よくある訓練/サービングエラーの監視を理解します。
本番のモデルは静かに劣化します。継続的に監視し、スキューやドリフトを早期に検知して、再訓練や是正につなげます。
6.2.1継続的評価とスキュー/ドリフト
本番モデルは Vertex AI Model Monitoring で 継続的評価 します。代表的な監視対象は二つ:訓練/サービングスキュー(訓練時とサービング時で入力データの分布がずれる)と 特徴量アトリビューション/予測ドリフト(時間とともに入力分布や寄与が変化する)。スキューは「訓練データ vs サービングデータ」を比較し、ドリフトは「過去のサービングデータ vs 現在」を比較して検知します。しきい値を超えたらアラートし、再訓練 をトリガーします。「訓練 vs 本番入力のズレ=訓練/サービングスキュー」「本番入力の時間変化=ドリフト」を結びます。
6.2.2性能監視とエラー
モデルの性能は、ベースライン(前バージョンや単純なルール/モデル)や 時間軸 と比較して監視します=新モデルが本当に改善しているか、時間とともに劣化していないかを継続確認します。ラベルが遅れて付く場合は、Explainable AI のアトリビューション変化を代理指標に使えます。よくある訓練/サービングエラー も監視します=入力スキーマ不一致・欠損/異常値・レイテンシ急増・依存サービス障害など。「新旧/単純モデルと比較して改善を確認=ベースライン比較」「本番の入出力異常を検知=エラー監視」を押さえます。

