変更要約: Professional Machine Learning Engineer 第5章を新規作成(ドメイン5「パイプライン」: データ/モデル検証・訓練/サービング一貫前処理・MLFlow ホスティング・コンポーネント/パラメータ/トリガー/Cloud Build/Cloud Run・オーケストレーション(Kubeflow Pipelines/Gemini Enterprise Agent Platform Pipelines/Cloud Composer)・ハイブリッド/マルチクラウド・TFX/Kubeflow DSL、再訓練ポリシー・CI/CD(Cloud Build/Jenkins)・Experiments on Agent Platform/Vertex ML Metadata・モデル/データのバージョニング・リネージ)。
5.2再訓練とメタデータ追跡
適切な再訓練ポリシーの決定、CI/CD によるモデルデプロイ(Cloud Build・Jenkins)、モデルの成果物とバージョンの追跡/比較(Experiments on Agent Platform・Vertex ML Metadata)、モデル/データセットのバージョニング連携、モデルとデータの系統(リネージ)を理解します。
モデルは作って終わりではありません。劣化に合わせて再訓練し、CI/CD で安全に届け、すべての成果物を追跡して再現性と監査性を保ちます。
5.2.1再訓練ポリシーと CI/CD
モデルは時間とともに劣化(ドリフト)するため、再訓練ポリシー を決めます:定期(スケジュール)再訓練か、性能/ドリフトの 監視に基づくトリガー 再訓練かを、コストと劣化速度で選びます。再訓練したモデルは CI/CD(Cloud Build や Jenkins)でテスト・検証・デプロイし、継続的トレーニング(CT)として自動化します。デプロイは A/B/カナリアで安全に切り替えます。「劣化に応じて再学習=監視ベースのトリガー再訓練」「モデルのテスト/デプロイを自動化=CI/CD(Cloud Build/Jenkins)」を結びます。
5.2.2メタデータ・バージョニング・リネージ
再現性と監査のため、すべての 成果物 を追跡します。実験のパラメータ/メトリクスの比較は Experiments on Agent Platform、パイプラインが生成する成果物・実行・系統の記録は Vertex ML Metadata を使います。モデルとデータセットのバージョニング を連携させ、「どのデータ・どのコード・どのパラメータからこのモデルが生まれたか」の リネージ(系統) を辿れるようにします。これにより問題発生時の原因特定や規制対応が可能になります。「成果物/実行/系統の記録=Vertex ML Metadata」「モデルの出自を辿る=リネージ」を押さえます。
「要件 → 手段」が頻出。例:「モデルの劣化に応じて再訓練を自動起動」=監視ベースのトリガー再訓練(CT)、「再訓練モデルをテストして自動デプロイ」=CI/CD(Cloud Build/Jenkins)、「パイプラインの成果物/実行/系統を記録」=Vertex ML Metadata、「このモデルが何から作られたか追跡」=リネージ、「実験のパラメータ/メトリクスを比較」=Experiments on Agent Platform。
混同に注意:
①Experiments on Agent Platform(実験の記録/比較)と Vertex ML Metadata(パイプライン成果物/系統の記録)は役割が補完的。
②再訓練ポリシーはコスト vs 劣化速度のトレードオフ=常に頻繁が最適とは限らない。
③リネージがないと監査・原因特定ができない=メタデータを必ず記録。
5.2.3この節のまとめ
- 再訓練=定期 or 監視ベースのトリガー(コスト vs 劣化速度)、CI/CD で自動テスト/デプロイ
- 成果物/実行/系統の記録=Vertex ML Metadata、実験比較=Experiments on Agent Platform
- モデル/データのバージョニングを連携しリネージを辿れるようにする(監査/原因特定)
進捗の記録にはログインが必要です。
理解度チェック
(軽い確認用)Q1. モデルの性能劣化(ドリフト)を検知したら自動で再訓練を起動したい。最適なポリシーはどれですか?
Q2. 再訓練したモデルを、テスト・検証を通して自動でデプロイするパイプラインを組みたい。最適なのはどれですか?
Q3. パイプラインが生成した成果物・実行・系統(リネージ)を記録し、後から辿れるようにしたい。最適なのはどれですか?
Q4. 「このモデルはどのデータセット・どのコード・どのパラメータから生まれたか」を監査のために追跡したい。何が必要ですか?
Q5. 再訓練ポリシーの設計として最も適切な考え方はどれですか?

