変更要約: AI-102 第2章を深掘り(図ja化・比較表/シナリオ/FAQ/ひっかけ/深掘り段落を全節に追加)
2.1画像分析と OCR(Azure AI Vision)
画像から情報を抽出する Azure AI Vision の画像分析(タグ・物体検出・キャプション)と OCR(Read) による文字認識を理解します。コンピュータービジョンの中核となる学習済み機能です。
画像に「何が写っているか」「どこに何があるか」「どんな文字があるか」を読み取るのが Azure AI Vision です。学習済みモデルを API で呼ぶだけで使えます。
2.1.1画像分析と OCR の機能
- 画像分析:タグ付け・物体検出(バウンディングボックス)・キャプション生成などを行う。
- OCR(Read):画像/文書から印刷・手書きの文字を抽出し、位置(座標)も返す。
- スマートクロップ/サムネイル:重要領域を判断してトリミングする。
- 学習済み:自分でモデルを訓練せず、API を呼ぶだけで使える(カスタムは次節)。
「画像のタグ/物体/キャプション=Azure AI Vision の画像分析」「画像・文書から文字抽出=OCR(Read)」「物体の位置=バウンディングボックス」 は AI-102 で頻出です。文書の構造化抽出(フォーム/表)は Document Intelligence(後の章)と区別しましょう。
OCR(Read)は印刷文字に加え手書き文字にも対応し、多言語の文字認識ができます。
現行の Azure AI Vision(v4.0/Florence 基盤モデル)は Analyze Image で複数の ビジュアル特徴(タグ・物体・キャプション・高密度キャプション・スマートクロップ・人物検出・ブランド/ランドマーク)を一括取得でき、結果には 信頼度スコア が付きます。文字は Read(OCR) API が印刷/手書きを多言語で抽出し、各行・各単語の バウンディングボックス(座標) を返します。大きな PDF/画像など長時間処理は 非同期(要求→操作 ID→結果ポーリング)で、小さい画像は同期で扱います。画像は URL かバイナリで渡し、Florence ベースの機能には 画像とテキストの埋め込み(ベクトル) による画像検索もあります。動画は Azure AI Video Indexer が別途担当します。なお「請求書や領収書のキー=バリュー・表」の構造化抽出は OCR の生テキストとは別で、後章の Document Intelligence が適任です。文字の単純抽出は Read、文書構造の理解は Document Intelligence、と役割を切り分けます。
| やりたいこと | 使う機能 | 返るもの |
|---|---|---|
| 画像が何かを説明 | 画像分析(キャプション/タグ) | 説明文・タグ+信頼度 |
| 物体の位置を知る | 物体検出 | バウンディングボックス |
| 画像/文書の文字を読む | OCR(Read) | 文字+行/単語の座標 |
| 請求書の項目を構造化 | Document Intelligence(後章) | キー=バリュー・表 |
シナリオ: アップロードされた写真に自動でタグと説明を付け、写っている看板の文字も取り出したい。→ Azure AI Vision の Analyze Image でタグ・キャプション・物体を取得し、同じ画像に Read(OCR)をかけて看板の文字と座標を抽出します。大きな画像は非同期 API で処理します。
FAQ: Q. OCR と Document Intelligence の違いは? → A. OCR(Read)は生のテキストと座標を返すだけ。請求書などのキー=バリューや表として構造化するのは Document Intelligence です。Q. 動画の分析は AI Vision? → A. いいえ、動画は Azure AI Video Indexer が担当します。
ひっかけ: 「OCR(Read)が請求書のフィールドを構造化して返す」は誤りです。Read は生テキスト+座標まで。構造化抽出は Document Intelligence。また「AI Vision で動画を分析する」も誤り(動画は Video Indexer)。
2.1.2この節のまとめ
- 画像分析=タグ・物体検出・キャプション
- OCR(Read)=印刷/手書き文字の抽出
進捗の記録にはログインが必要です。
理解度チェック
(軽い確認用)Q1. 画像に写っている物体を検出し、その位置(バウンディングボックス)やタグ、キャプションを得たい。何を使いますか?
Q2. 画像や文書から印刷・手書きの文字を抽出したい。どの機能を使いますか?
Q3. Azure AI Vision の画像分析(学習済み)の特徴として正しいものはどれですか?

