変更要約: Professional Machine Learning Engineer 第5章を新規作成(ドメイン5「パイプライン」: データ/モデル検証・訓練/サービング一貫前処理・MLFlow ホスティング・コンポーネント/パラメータ/トリガー/Cloud Build/Cloud Run・オーケストレーション(Kubeflow Pipelines/Vertex AI Pipelines/Cloud Composer)・ハイブリッド/マルチクラウド・TFX/Kubeflow DSL、再訓練ポリシー・CI/CD(Cloud Build/Jenkins)・Vertex AI Experiments/Vertex ML Metadata・モデル/データのバージョニング・リネージ)。
5.1エンドツーエンド ML パイプライン
データとモデルの検証、訓練とサービングで一貫した前処理、サードパーティパイプライン(MLFlow)のホスティング、コンポーネント/パラメータ/トリガー/コンピュート(Cloud Build・Cloud Run)の特定、オーケストレーションフレームワーク(Kubeflow Pipelines・Vertex AI Pipelines・Cloud Composer)、ハイブリッド/マルチクラウド戦略、TFX コンポーネントや Kubeflow DSL によるシステム設計を理解します。
MLOps の核心が、手作業をなくすエンドツーエンドのパイプラインです。データ取得→検証→訓練→評価→デプロイを自動化し、再現可能にします。
5.1.1オーケストレーションと検証
ML パイプラインは オーケストレーション フレームワーク で自動化します。Google マネージドでサーバーレスに ML パイプラインを実行するなら Vertex AI Pipelines(Kubeflow Pipelines / TFX を実行)、汎用のワークフロー/データオーケストレーション(Airflow ベース)なら Cloud Composer を使います。パイプラインには データ検証(スキーマ/分布の異常検出)と モデル検証(基準を満たすか)を組み込み、品質を担保します。訓練とサービングで一貫した前処理 を保つことが 訓練/サービングスキュー の防止に不可欠で、TFX の Transform などで前処理を共有します。「マネージドな ML パイプライン=Vertex AI Pipelines」「汎用ワークフローのスケジュール/依存=Cloud Composer(Airflow)」を結びます。
5.1.2コンポーネントとトリガー
パイプラインは コンポーネント(前処理/訓練/評価/デプロイの各ステップ)・パラメータ・トリガー(スケジュール/イベント/コード変更)・コンピュート要件 に分解して設計します。CI 的なビルド/コンテナ化は Cloud Build、軽量なステップやサービングは Cloud Run を使えます。システム設計は TFX コンポーネント や Kubeflow DSL で記述し、必要なら MLFlow などサードパーティのパイプラインも Google Cloud 上でホストします。要件次第で ハイブリッド/マルチクラウド 戦略も取ります。「パイプラインを部品化=コンポーネント/DSL」「コード変更で自動起動=トリガー(Cloud Build)」を押さえます。

