変更要約: DP-100 第2章を深掘り(図ja化・比較表/シナリオ/FAQ/ひっかけ/深掘り段落を全節に追加)
2.2AutoML とハイパーパラメーター調整
モデルを自動探索する AutoML、ハイパーパラメーター調整(スイープジョブ)——探索空間・サンプリング・早期終了——、評価指標とモデル選択を理解します。最適なモデルを効率よく見つけます。
良いモデルを得るには、アルゴリズム選択とハイパーパラメーターの調整が重要です。Azure ML は AutoML(自動探索)とスイープジョブ(調整)を提供します。
2.2.1AutoML とスイープ
- AutoML:タスク(分類/回帰/予測)を指定し、複数アルゴリズムと前処理を自動試行して最良モデルを選ぶ。
- スイープジョブ:探索空間を定義し、サンプリング(グリッド/ランダム/ベイズ)でハイパーパラメーターを調整する。
- 早期終了:見込みの低い試行を早期に打ち切り、コストを節約する。
- 主要メトリック:精度・AUC・RMSE などの主要メトリックで最良モデル/構成を選ぶ。
「アルゴリズム/前処理を自動探索=AutoML」「ハイパーパラメーター調整=スイープジョブ(探索空間+サンプリング)」「無駄な試行を打ち切り=早期終了」「最良の選択=主要メトリック」 は DP-100 で頻出です。サンプリングはグリッド/ランダム/ベイズの違いを押さえましょう。
ベイズサンプリングは過去の試行結果を踏まえて次の候補を選ぶため効率的ですが、早期終了との併用に制約がある場合があります。
AutoML はタスク(分類・回帰・予測、画像/NLP も)を指定すると、特徴量化・アルゴリズム・ハイパーパラメーターを自動探索し、主要メトリック でリーダーボード化して最良モデルを選びます(実験のタイムアウト/試行数・特徴量化の自動/カスタム・許可/ブロックするアルゴリズム・アンサンブル を設定可)。手動の スイープジョブ では 探索空間 を choice/uniform/loguniform/normal 等で定義し、サンプリング を選びます:グリッド(離散の全組合せ・小規模向け)/ランダム(広い空間を効率的に・大規模向け)/ベイズ(過去結果から次を選ぶ・高効率だが早期終了と相性に制約)。無駄を削る 早期終了ポリシー は Bandit(最良からの差=slack で打ち切り)/中央値停止/切り捨て選択 があり、max_total_trials・max_concurrent_trials で並列度とコストを制御。過学習を避けるため 交差検証 や検証セットで評価し、主要メトリック(正解率・AUC・RMSE・正規化 RMSE 等)で選定します。「自動で広く探索=AutoML」「特定モデルのHP最適化=スイープ」「広い空間=ランダム、賢く=ベイズ、全網羅=グリッド」と判断します。
| サンプリング | 仕組み | 向く場面 |
|---|---|---|
| グリッド | 離散値の全組合せ | 小さな探索空間 |
| ランダム | ランダムに抽出 | 広い空間を効率的に |
| ベイズ | 過去結果から次を選ぶ | 高効率(早期終了に制約) |
シナリオ: 表形式データで分類モデルを素早く作りたいが、コスト上限内で最良を狙いたい。→ まず AutoML でタスク=分類・主要メトリック=AUC・試行数/タイムアウト上限を設定して自動探索。特定アルゴリズムをさらに詰めるならスイープジョブで探索空間を定義し、ランダムサンプリング+Bandit 早期終了、max_concurrent_trials で並列度とコストを調整します。
FAQ: Q. グリッド/ランダム/ベイズの使い分けは? → A. 小さな離散空間はグリッド、広い空間はランダム、賢く絞るならベイズ(早期終了と相性に制約あり)。Q. AutoML とスイープの違いは? → A. AutoML はアルゴリズムも含め自動探索、スイープは指定モデルのハイパーパラメーターを探索空間で調整します。
ひっかけ: 「広大な探索空間にはグリッドサンプリングが最適」は誤りです。全組合せのグリッドは小空間向けで、広い空間はランダムやベイズが効率的。また「早期終了は最良モデルを必ず取り逃す」も誤り(見込みの低い試行のみ打ち切る・しきい値で制御)。
2.2.2この節のまとめ
- AutoML=自動でモデル探索、スイープ=ハイパーパラメーター調整
- 効率化=早期終了、選択=主要メトリック
進捗の記録にはログインが必要です。
理解度チェック
(軽い確認用)Q1. タスクを指定するだけで複数アルゴリズムと前処理を自動試行し最良モデルを選ぶのはどれですか?
Q2. ハイパーパラメーターを探索空間とサンプリングで調整する Azure ML のジョブはどれですか?
Q3. 見込みの低い試行を途中で打ち切ってコストを節約する仕組みはどれですか?

