Instiq
第4章 · モデルのサービングとスケール·v1.0.0·更新 2026/7/30·読了目安 約14分

変更要約: Professional Machine Learning Engineer 第4章を新規作成(ドメイン4「サービング」: バッチ/オンライン推論(Agent Platform/Dataflow/BigQuery ML/Dataproc)・フレームワーク(PyTorch/XGBoost)・Model Registry on Gemini Enterprise Agent Platform・A/B テスト(トラフィック分割)、Feature Store on Gemini Enterprise Agent Platform オンラインサービング・公開/限定公開エンドポイント・ハードウェア(CPU/GPU/TPU/エッジ)・Vertex AI Prediction 自動スケール/コンテナ化サービング・量子化/蒸留/プルーニングによるレイテンシ/スループット最適化)。

4.2オンラインサービングのスケール

この節の要点

Feature Store on Gemini Enterprise Agent Platform、Agent Platform の公開/限定公開エンドポイント、適切なハードウェア(CPU/GPU/TPU/エッジ)の選択、スループットに応じたサービングバックエンドのスケール(Vertex AI Prediction・コンテナ化サービング)、本番での訓練/サービング向けのモデルチューニング(単純化・性能/レイテンシ/メモリ/スループット最適化)を理解します。

オンラインサービングは「速く・安く・落ちずに」スケールさせるのが核心です。エンドポイント・特徴量・ハードウェア・最適化を組み合わせます。

4.2.1エンドポイントと特徴量

オンライン推論は Agent Platform エンドポイント にデプロイします。インターネット経由なら 公開エンドポイント、VPC 内に閉じて低遅延/非公開にするなら 限定公開エンドポイント(Private Service Connect/プライベート)を選びます。リアルタイム推論で最新の特徴量を低遅延に取得するには Feature Store on Gemini Enterprise Agent Platformオンラインサービング を使い、訓練と同じ特徴量を使ってスキューを防ぎます。「VPC 内に閉じた低遅延推論=限定公開エンドポイント」「推論時に最新特徴量を低遅延取得=Feature Store オンラインサービング」を結びます。

4.2.2スケールと最適化

サービングは スループットに応じてスケール します=Vertex AI Prediction の自動スケール(最小/最大レプリカ・同時実行)や コンテナ化サービング(カスタムコンテナ)で需要に追従します。ハードウェアは推論負荷で CPU/GPU/TPU/エッジ を選びます。さらに本番のレイテンシ/コストを下げるには モデルの最適化量子化蒸留プルーニング などの 単純化技法、バッチング、適切なアクセラレータ選択で、性能/レイテンシ/メモリ/スループット を最適化します。「需要に追従して自動スケール=Vertex AI Prediction」「レイテンシ/コスト削減=量子化/蒸留/プルーニング」を押さえます。

試験ポイント

要件 → 手段」が頻出。例:「推論を VPC 内に閉じて低遅延/非公開」=限定公開エンドポイント、「推論時に最新特徴量を低遅延取得」=Feature Store オンラインサービング、「需要に応じて自動スケール」=Vertex AI Prediction の自動スケール、「レイテンシ/モデルサイズを下げる」=量子化/蒸留/プルーニング、「カスタム依存を含めてサービング」=コンテナ化サービング。

注意

混同に注意:
公開エンドポイント(インターネット)と限定公開エンドポイント(VPC 内)をセキュリティ/遅延で選ぶ。
Feature Store のオンライン(低遅延・推論用)とオフライン(一括・訓練用)を取り違えない。
精度とレイテンシ/コストはトレードオフ=単純化技法で釣り合いを取る。

公開/限定公開エンドポイント、Feature Store on Gemini Enterprise Agent Platform オンラインサービングで最新特徴量、Vertex AI Prediction 自動スケール/コンテナ化、量子化/蒸留/プルーニングでレイテンシ/コスト削減を示す図。
速く安く落ちずに

4.2.3この節のまとめ

  • エンドポイント=公開/限定公開(VPC 内・低遅延/非公開)、推論時の特徴量=Feature Store オンラインサービング
  • 需要に追従=Vertex AI Prediction 自動スケール/コンテナ化サービング、ハードは負荷で選ぶ
  • レイテンシ/コスト最適化=量子化/蒸留/プルーニングなどの単純化技法

進捗の記録にはログインが必要です。

理解度チェック

(軽い確認用)

Q1. オンライン推論を VPC 内に閉じて、インターネットに公開せず低遅延で提供したい。最適なのはどれですか?

Q2. リアルタイム推論で、最新の特徴量を低レイテンシに取得し、訓練と同じ値を使ってスキューを防ぎたい。最適なのはどれですか?

Q3. 推論リクエスト数の増減に応じて、サービングバックエンドを自動でスケールさせたい。最適なのはどれですか?

Q4. 本番で推論レイテンシとモデルサイズを下げたい。代表的な単純化技法はどれですか?

Q5. 独自の依存ライブラリやカスタムの前後処理を含めてモデルをサービングしたい。最適なのはどれですか?

理解度を確認第4章「モデルのサービングとスケール」の問題を解く

学習の記録を残しませんか

参考書はすべて無料で読めます。無料登録すると、問題集での演習・既読と進捗の記録・間違えた問題の復習・ハイライトが使えます。