Instiq
第2章 · ML モデルの開発·v2.1.0·更新 2026/6/28·読了目安 約9分

変更要約: in-scope サービス網羅: モデル開発/AIサービス(SageMaker AI/Bedrock/Q/Comprehend/Kendra/Personalize/Fraud Detector/Rekognition/Polly/Lookout/HealthLake/A2I/CodeGuru)を追加

2.3モデルの評価指標

この節の要点

分類(精度・適合率/再現率・F1・AUC)と回帰(RMSE・MAE・決定係数)の評価指標、混同行列、不均衡データでの指標選択を理解します。

モデルが「良い」かは問題の種類に合った指標で測ります。分類と回帰で使う指標は異なり、不均衡データでは特に注意が必要です。

2.3.1問題タイプ別の指標

分類(精度・適合率/再現率・F1・AUC/ROC・不均衡では F1/AUC)、回帰(RMSE・MAE・決定係数・誤差の大きさ)、混同行列(TP/FP/TN/FN・適合率と再現率・しきい値でのトレードオフ)の3つを示し、不均衡では精度より適合率/再現率/F1 を重視する旨を表した図。
問題タイプ別の評価指標
  • 分類:精度(accuracy)、適合率(precision)/再現率(recall)、F1、AUC/ROC。混同行列(TP/FP/TN/FN)で把握。
  • 回帰:RMSE・MAE(誤差の大きさ)、決定係数(R²)。
  • 不均衡データ:精度は誤解を招くため、適合率/再現率/F1/AUC を重視する。
  • 適合率 vs 再現率:見逃しを減らす(再現率)か誤検知を減らす(適合率)か、用途で重視を変える。
試験ポイント

「不均衡な分類で精度は不適切=F1/AUC や 適合率/再現率」「見逃しを減らす=再現率(recall)重視」「誤検知を減らす=適合率(precision)重視」「回帰=RMSE/MAE」 は MLA で頻出です。

評価は「問題タイプに合った指標」を選ぶのが鉄則です。分類は 混同行列(TP/FP/TN/FN) が基礎で、適合率(precision=予測陽性のうち正解)再現率(recall=実際の陽性のうち捕捉)はトレードオフ、両者の調和平均が F1。しきい値を動かしたときの性能曲線が ROC(→AUC)PR 曲線(→PR-AUC) で、不均衡データでは精度(accuracy)が誤解を招くため F1/PR-AUC を見ます(全部多数派と予測しても精度は高く出る)。回帰は RMSE(大きな誤差を強く罰する)・MAE(外れ値に頑健)・決定係数 R²。用途で重視が変わり、見逃しが致命的(不正・疾患)なら 再現率誤検知のコストが高いなら 適合率。多クラスは マクロ/マイクロ平均、確率の正確さは log loss、予測(時系列)は MAPE なども使います。しきい値 の調整で precision/recall のバランスを業務要件に合わせ、最終評価は触れていないテストデータで行います。

目的指標
見逃しを減らす(不正/疾患)再現率(recall)
誤検知を減らす適合率(precision)
不均衡な分類の総合評価F1 / PR-AUC / AUC
回帰の誤差RMSE / MAE / R²

シナリオ:陽性1%の疾患スクリーニング。精度99%のモデルは本当に良い? 「全部陰性」でも精度99%なので精度は不適切。見逃し(FN)が致命的なので 再現率を最優先し、PR-AUC/F1 で総合評価。しきい値を下げて再現率を上げ、増える誤検知(適合率低下)は二次検査で吸収——業務要件に合わせて しきい値を調整します。

補足

Q. 不均衡分類で精度がダメな理由? 多数派予測でも高く出るから。代わりに F1/PR-AUC。Q. 見逃しを減らす? 再現率。Q. 誤検知を減らす? 適合率。Q. 回帰の指標? RMSE/MAE/R²。Q. precision/recall の調整? しきい値。

注意

混同に注意:
不均衡で accuracy を使うと過大評価——F1/PR-AUC を見る。
②precision と recall を取り違えない(予測基準か実陽性基準か)。
③RMSE は外れ値に敏感、MAE は頑健——目的で選ぶ。
④分類指標(F1/AUC)と回帰指標(RMSE/MAE)を混同しない。

補足

不正検知や病気の検出など「見逃しが致命的」な用途では再現率を、誤検知のコストが高い用途では適合率を優先します。F1 は両者のバランスです。

2.3.2モデル開発・AI サービスの in-scope サービス

モデル開発の中核は Amazon SageMaker AI で、データ準備・学習・チューニング・デプロイ・推論を統合し、フィーチャーストア/パイプライン/モデルレジストリで ML ライフサイクルを統制します。生成 AI は Amazon Bedrock(複数プロバイダーの基盤モデルを単一 API でサーバーレス)、コーディング/運用の AI 補助は Amazon Q を使います。 自前学習が不要な「用途特化の AI サービス」も範囲です。テキスト分析は Amazon Comprehend、エンタープライズ検索は Amazon Kendra、推薦は Amazon Personalize、オンライン不正検知は Amazon Fraud Detector、画像/映像認識は Amazon Rekognition、音声合成は Amazon Polly。異常検知は Amazon Lookout for Equipment(設備)ほか(※Lookout for Metrics・Lookout for Vision は新規利用終了・退役予定。指標異常は CloudWatch Anomaly Detection、画像欠陥は Rekognition Custom Labels 等で代替)。医療データレイクは AWS HealthLake。推論結果の人手レビューは Amazon Augmented AI(A2I)、ML によるコード品質レビューは Amazon CodeGuru を使います。

2.3.3この節のまとめ

  • 分類=精度/適合率/再現率/F1/AUC、回帰=RMSE/MAE/R²
  • 不均衡では精度を避けF1/AUC・適合率/再現率
  • 中核=SageMaker AI、生成AI=Bedrock/Q、用途特化AI=Comprehend/Kendra/Personalize/Rekognition/Lookout/A2I 他

進捗の記録にはログインが必要です。

理解度チェック

(軽い確認用)

Q1. 99% が正常・1% が異常という不均衡な分類で、モデル評価に「精度(accuracy)」が不適切なのはなぜですか?

Q2. 不正検知で「見逃し(実際は不正なのに見逃す)」を減らすことを最優先したい。重視すべき指標はどれですか?

Q3. 連続値を予測する回帰モデルの評価指標として適切なものはどれですか?

理解度を確認第2章「ML モデルの開発」の問題を解く