変更要約: Professional Machine Learning Engineer 第4章を新規作成(ドメイン4「サービング」: バッチ/オンライン推論(Agent Platform/Dataflow/BigQuery ML/Dataproc)・フレームワーク(PyTorch/XGBoost)・Model Registry on Gemini Enterprise Agent Platform・A/B テスト(トラフィック分割)、Feature Store on Gemini Enterprise Agent Platform オンラインサービング・公開/限定公開エンドポイント・ハードウェア(CPU/GPU/TPU/エッジ)・Vertex AI Prediction 自動スケール/コンテナ化サービング・量子化/蒸留/プルーニングによるレイテンシ/スループット最適化)。
4.2オンラインサービングのスケール
Feature Store on Gemini Enterprise Agent Platform、Agent Platform の公開/限定公開エンドポイント、適切なハードウェア(CPU/GPU/TPU/エッジ)の選択、スループットに応じたサービングバックエンドのスケール(Vertex AI Prediction・コンテナ化サービング)、本番での訓練/サービング向けのモデルチューニング(単純化・性能/レイテンシ/メモリ/スループット最適化)を理解します。
オンラインサービングは「速く・安く・落ちずに」スケールさせるのが核心です。エンドポイント・特徴量・ハードウェア・最適化を組み合わせます。
4.2.1エンドポイントと特徴量
オンライン推論は Agent Platform エンドポイント にデプロイします。インターネット経由なら 公開エンドポイント、VPC 内に閉じて低遅延/非公開にするなら 限定公開エンドポイント(Private Service Connect/プライベート)を選びます。リアルタイム推論で最新の特徴量を低遅延に取得するには Feature Store on Gemini Enterprise Agent Platform の オンラインサービング を使い、訓練と同じ特徴量を使ってスキューを防ぎます。「VPC 内に閉じた低遅延推論=限定公開エンドポイント」「推論時に最新特徴量を低遅延取得=Feature Store オンラインサービング」を結びます。
4.2.2スケールと最適化
サービングは スループットに応じてスケール します=Vertex AI Prediction の自動スケール(最小/最大レプリカ・同時実行)や コンテナ化サービング(カスタムコンテナ)で需要に追従します。ハードウェアは推論負荷で CPU/GPU/TPU/エッジ を選びます。さらに本番のレイテンシ/コストを下げるには モデルの最適化=量子化・蒸留・プルーニング などの 単純化技法、バッチング、適切なアクセラレータ選択で、性能/レイテンシ/メモリ/スループット を最適化します。「需要に追従して自動スケール=Vertex AI Prediction」「レイテンシ/コスト削減=量子化/蒸留/プルーニング」を押さえます。
「要件 → 手段」が頻出。例:「推論を VPC 内に閉じて低遅延/非公開」=限定公開エンドポイント、「推論時に最新特徴量を低遅延取得」=Feature Store オンラインサービング、「需要に応じて自動スケール」=Vertex AI Prediction の自動スケール、「レイテンシ/モデルサイズを下げる」=量子化/蒸留/プルーニング、「カスタム依存を含めてサービング」=コンテナ化サービング。
混同に注意:
①公開エンドポイント(インターネット)と限定公開エンドポイント(VPC 内)をセキュリティ/遅延で選ぶ。
②Feature Store のオンライン(低遅延・推論用)とオフライン(一括・訓練用)を取り違えない。
③精度とレイテンシ/コストはトレードオフ=単純化技法で釣り合いを取る。
4.2.3この節のまとめ
- エンドポイント=公開/限定公開(VPC 内・低遅延/非公開)、推論時の特徴量=Feature Store オンラインサービング
- 需要に追従=Vertex AI Prediction 自動スケール/コンテナ化サービング、ハードは負荷で選ぶ
- レイテンシ/コスト最適化=量子化/蒸留/プルーニングなどの単純化技法
進捗の記録にはログインが必要です。
理解度チェック
(軽い確認用)Q1. オンライン推論を VPC 内に閉じて、インターネットに公開せず低遅延で提供したい。最適なのはどれですか?
Q2. リアルタイム推論で、最新の特徴量を低レイテンシに取得し、訓練と同じ値を使ってスキューを防ぎたい。最適なのはどれですか?
Q3. 推論リクエスト数の増減に応じて、サービングバックエンドを自動でスケールさせたい。最適なのはどれですか?
Q4. 本番で推論レイテンシとモデルサイズを下げたい。代表的な単純化技法はどれですか?
Q5. 独自の依存ライブラリやカスタムの前後処理を含めてモデルをサービングしたい。最適なのはどれですか?

