Instiq
第4章 · 分析のためのデータの準備と使用·v1.0.0·更新 2026/7/30·読了目安 約13分

変更要約: Professional Data Engineer 第4章を新規作成(ドメイン4「分析の準備と使用」: 可視化準備=Looker/Data Studio・マテリアライズドビュー/BI Engine・遅いクエリ対処・データマスキング/IAM/Cloud DLP/列・行アクセス制御、AI/ML 向け準備と共有=BigQuery ML/特徴量エンジニアリング・埋め込み/RAG・Analytics Hub)。

4.2AI/ML 向けのデータ準備と共有

この節の要点

特徴量エンジニアリングと学習・サービングのためのデータ準備(BigQuery ML)、埋め込みと検索拡張生成(RAG)のための非構造化データの準備、そしてデータ共有(共有ルール・データセット公開・Analytics Hub)を理解します。

分析の先には、AI/MLデータ共有があります。データエンジニアは、ML が使えるデータを準備し、組織内外と安全にデータを共有します。

4.2.1AI/ML 向けのデータ準備

構造化データの ML は、BigQuery 内で SQL だけでモデルを作る BigQuery ML が手軽です(特徴量エンジニアリング・学習・予測を SQL で)。生成 AI 向けには、非構造化データ(文書など)を 埋め込み(embeddings) にして、関連情報を取り出して回答に使う 検索拡張生成(RAG) の基盤を整えます。「BigQuery 上で SQL だけで ML=BigQuery ML」「非構造化を生成 AI で使う=埋め込み/RAG」と結びます。

4.2.2データの共有

データは、共有のルールを定めた上で、データセットを公開したり、レポート/可視化を共有したりします。BigQuery のデータをコピーせずに社内外の他組織と安全に共有するには Analytics Hub を使います(提供者がリスティングを公開し、受領者が購読して参照)。重複や同期の手間を避けられます。「コピーなしのデータ共有=Analytics Hub」を押さえます。

試験ポイント

要件 → 手段」が頻出。例:「BigQuery 上で SQL だけで ML」=BigQuery ML、「文書を生成 AI で検索・回答」=埋め込み+RAG、「BigQuery のデータをコピーせず他組織と共有」=Analytics Hub、「学習向けに特徴量を整える」=特徴量エンジニアリング。

注意

混同に注意:
BigQuery ML(SQL で ML)は本格的なカスタム学習(Agent Platform)とは別の手軽な選択肢。
Analytics Hub はコピーなし共有=データを複製する転送とは別。
③RAG は埋め込み+検索で最新/根拠ある回答を支える。

BigQuery ML(SQL で ML)/特徴量エンジニアリング、埋め込み/RAG(生成 AI)、Analytics Hub によるコピーなしのデータ共有を示す図。
ML と共有

4.2.3この節のまとめ

  • 構造化 ML は BigQuery ML(SQL)、生成 AI は埋め込み+RAG の基盤を準備
  • 特徴量エンジニアリングで学習・サービング向けにデータを整える
  • コピーなしのデータ共有は Analytics Hub(提供/購読)

進捗の記録にはログインが必要です。

理解度チェック

(軽い確認用)

Q1. BigQuery 上のデータに対し、データを移さず SQL だけで機械学習モデルを作りたい。最適なのはどれですか?

Q2. BigQuery のデータをコピーせずに他組織と安全に共有したい。最適なのはどれですか?

Q3. 文書などの非構造化データを生成 AI で検索・回答に使いたい。準備すべき基盤はどれですか?

Q4. 学習・サービング向けにデータを整える作業として正しいものはどれですか?

Q5. Analytics Hub の主な利点として最も適切なものはどれですか?

Q6. BigQuery ML と Agent Platform の本格的なカスタム学習の関係として正しいものはどれですか?

理解度を確認第4章「分析のためのデータの準備と使用」の問題を解く

学習の記録を残しませんか

参考書はすべて無料で読めます。無料登録すると、問題集での演習・既読と進捗の記録・間違えた問題の復習・ハイライトが使えます。