1データエンジニアリング
- 1.1データの収集と取り込み
ML の出発点——データソース、ストリーミング取り込み(Kinesis)、バッチ取り込み、S3 データレイク——を理解します。学習データはまず S3 に集めます。
- 1.2データの変換と特徴量の準備
使える形に整える——Glue ETL、データカタログ、Data Wrangler、特徴量エンジニアリング、Feature Store——を理解します。良い特徴量がモデルの質を決めます。
- 1.3ストレージとデータ形式
効率よく蓄える——列指向(Parquet/ORC)、パーティション、S3 ストレージクラス、SageMaker の入力モード——を理解します。形式とレイアウトがコストと速度を左右します。

