Instiq
第4章 · モデルのサービングとスケール·v1.0.0·更新 2026/6/15·読了目安 約14分

変更要約: Professional Machine Learning Engineer 第4章を新規作成(ドメイン4「サービング」: バッチ/オンライン推論(Vertex AI/Dataflow/BigQuery ML/Dataproc)・フレームワーク(PyTorch/XGBoost)・Vertex AI Model Registry・A/B テスト(トラフィック分割)、Vertex AI Feature Store オンラインサービング・公開/限定公開エンドポイント・ハードウェア(CPU/GPU/TPU/エッジ)・Vertex AI Prediction 自動スケール/コンテナ化サービング・量子化/蒸留/プルーニングによるレイテンシ/スループット最適化)。

4.2オンラインサービングのスケール

この節の要点

Vertex AI Feature Store、Vertex AI の公開/限定公開エンドポイント、適切なハードウェア(CPU/GPU/TPU/エッジ)の選択、スループットに応じたサービングバックエンドのスケール(Vertex AI Prediction・コンテナ化サービング)、本番での訓練/サービング向けのモデルチューニング(単純化・性能/レイテンシ/メモリ/スループット最適化)を理解します。

オンラインサービングは「速く・安く・落ちずに」スケールさせるのが核心です。エンドポイント・特徴量・ハードウェア・最適化を組み合わせます。

4.2.1エンドポイントと特徴量

オンライン推論は Vertex AI エンドポイント にデプロイします。インターネット経由なら 公開エンドポイント、VPC 内に閉じて低遅延/非公開にするなら 限定公開エンドポイント(Private Service Connect/プライベート)を選びます。リアルタイム推論で最新の特徴量を低遅延に取得するには Vertex AI Feature Storeオンラインサービング を使い、訓練と同じ特徴量を使ってスキューを防ぎます。「VPC 内に閉じた低遅延推論=限定公開エンドポイント」「推論時に最新特徴量を低遅延取得=Feature Store オンラインサービング」を結びます。

4.2.2スケールと最適化

サービングは スループットに応じてスケール します=Vertex AI Prediction の自動スケール(最小/最大レプリカ・同時実行)や コンテナ化サービング(カスタムコンテナ)で需要に追従します。ハードウェアは推論負荷で CPU/GPU/TPU/エッジ を選びます。さらに本番のレイテンシ/コストを下げるには モデルの最適化量子化蒸留プルーニング などの 単純化技法、バッチング、適切なアクセラレータ選択で、性能/レイテンシ/メモリ/スループット を最適化します。「需要に追従して自動スケール=Vertex AI Prediction」「レイテンシ/コスト削減=量子化/蒸留/プルーニング」を押さえます。

続きは無料登録で読めます

冒頭を無料で公開中。無料登録でこの節の全文と、第4章以降を含む全参考書・全問題集が読めます。