変更要約: 各節に図(figure)を追加=cert-figure-retrofit。AI-103 第6章を新規作成(Azure Content Understanding=多モーダル構造化抽出/アナライザー・スキーマ/prebuilt vs custom/構築の流れ、生成プロンプトによるエンティティ・トピック・要約抽出=構造化出力で受領/グラウンディング・評価/定型はスキーマ抽出と使い分け)
6.1Azure Content Understanding による情報抽出
ドキュメント・フォーム・画像・音声・動画から項目や要点を構造化して抽出する Azure Content Understanding の実装——アナライザーとスキーマ(抽出フィールド)の定義、prebuilt と custom、構築の流れ——を開発者の視点で理解します。
Azure Content Understanding は、ドキュメント・フォーム・画像・音声・動画といった多様なコンテンツから必要な情報を構造化して抽出するサービスです(AI-901 でも学習)。AI-103 では実装レベルで、アナライザー(抽出設定一式)を作り、スキーマ(抽出したいフィールドの名前・型)を定義し、ファイルを解析して構造化結果(JSON 等)を受け取る流れを扱います。汎用抽出は prebuilt、自社フォーム固有の項目は custom で独自フィールドを定義します。
| ステップ | 内容 |
|---|---|
| 1. アナライザー作成 | 対象コンテンツ種別に合わせて作成 |
| 2. スキーマ定義 | 抽出フィールド(名前・型)を指定 |
| 3. 解析 | ファイルを渡して解析を実行 |
| 4. 結果取得 | 各フィールドが埋まった構造化データ |
頻出:
①「請求書/フォーム/画像/音声/動画から項目を構造化抽出」=Azure Content Understanding。
②「抽出フィールドの定義」=スキーマ(アナライザーの一部)。
③汎用=prebuilt、自社フォーム固有=custom。
④流れ=アナライザー→スキーマ→解析→構造化結果。
⑤OCR(文字認識・第4章)と構造化抽出(項目を型付きで取り出す)を区別。
混同・注意:
①OCR(画像内の文字をテキスト化)と情報抽出(項目を型付きで構造化抽出)は目的が異なる。
②アナライザー(設定一式)とスキーマ(フィールド定義)——スキーマはアナライザーの一部。
③抽出品質はスキーマの明確さと入力品質に依存。
④機微情報を扱うためプライバシー配慮(第1章)。

