3プロトタイプの ML モデルへのスケール
- 3.1モデルの構築と訓練
ML フレームワークとモデルアーキテクチャの選択、解釈可能性要件に応じたモデリング手法、訓練データの整理(表/テキスト/音声/画像/動画)、各種ファイル取り込み(CSV/JSON/画像/Hadoop/DB)、各種 SDK での訓練(Vertex AI カスタム訓練・GKE 上の Kubeflow・AutoML・Tabular Workflows)、信頼性ある分散訓練、ハイパーパラメータ調整、訓練失敗のトラブルシュート、基盤モデルのファインチューニングを理解します。
- 3.2訓練ハードウェアの選択
コンピュートとアクセラレータの選択(CPU・GPU・TPU・エッジデバイス)、TPU と GPU による分散訓練(Vertex AI の Reduction Server・Horovod)を理解します。

