Instiq
第2章 · コンピュータービジョンの実装·v2.0.0·更新 2026/6/16·読了目安 約9分

変更要約: AI-102 第2章を深掘り(図ja化・比較表/シナリオ/FAQ/ひっかけ/深掘り段落を全節に追加)

2.1画像分析と OCR(Azure AI Vision)

この節の要点

画像から情報を抽出する Azure AI Vision の画像分析(タグ・物体検出・キャプション)と OCR(Read) による文字認識を理解します。コンピュータービジョンの中核となる学習済み機能です。

画像に「何が写っているか」「どこに何があるか」「どんな文字があるか」を読み取るのが Azure AI Vision です。学習済みモデルを API で呼ぶだけで使えます。

2.1.1画像分析と OCR の機能

入力画像が Azure AI Vision に渡され、画像分析(タグ付け・物体検出のバウンディングボックス・キャプション生成・人や成人向けコンテンツの検出)と OCR(Read:印刷/手書き文字の抽出と座標)を行い、結果を JSON で返す構成を示した図。
Azure AI Vision の機能
  • 画像分析タグ付け・物体検出(バウンディングボックス)・キャプション生成などを行う。
  • OCR(Read):画像/文書から印刷・手書きの文字を抽出し、位置(座標)も返す。
  • スマートクロップ/サムネイル:重要領域を判断してトリミングする。
  • 学習済み:自分でモデルを訓練せず、API を呼ぶだけで使える(カスタムは次節)。
試験ポイント

「画像のタグ/物体/キャプション=Azure AI Vision の画像分析」「画像・文書から文字抽出=OCR(Read)」「物体の位置=バウンディングボックス」 は AI-102 で頻出です。文書の構造化抽出(フォーム/表)は Document Intelligence(後の章)と区別しましょう。

補足

OCR(Read)は印刷文字に加え手書き文字にも対応し、多言語の文字認識ができます。

現行の Azure AI Vision(v4.0/Florence 基盤モデル)は Analyze Image で複数の ビジュアル特徴(タグ・物体・キャプション・高密度キャプション・スマートクロップ・人物検出・ブランド/ランドマーク)を一括取得でき、結果には 信頼度スコア が付きます。文字は Read(OCR) API が印刷/手書きを多言語で抽出し、各行・各単語の バウンディングボックス(座標) を返します。大きな PDF/画像など長時間処理は 非同期(要求→操作 ID→結果ポーリング)で、小さい画像は同期で扱います。画像は URL かバイナリで渡し、Florence ベースの機能には 画像とテキストの埋め込み(ベクトル) による画像検索もあります。動画は Azure AI Video Indexer が別途担当します。なお「請求書や領収書のキー=バリュー・表」の構造化抽出は OCR の生テキストとは別で、後章の Document Intelligence が適任です。文字の単純抽出は Read、文書構造の理解は Document Intelligence、と役割を切り分けます。

やりたいこと使う機能返るもの
画像が何かを説明画像分析(キャプション/タグ)説明文・タグ+信頼度
物体の位置を知る物体検出バウンディングボックス
画像/文書の文字を読むOCR(Read)文字+行/単語の座標
請求書の項目を構造化Document Intelligence(後章)キー=バリュー・表
補足

シナリオ: アップロードされた写真に自動でタグと説明を付け、写っている看板の文字も取り出したい。→ Azure AI Vision の Analyze Image でタグ・キャプション・物体を取得し、同じ画像に Read(OCR)をかけて看板の文字と座標を抽出します。大きな画像は非同期 API で処理します。

補足

FAQ: Q. OCR と Document Intelligence の違いは? → A. OCR(Read)は生のテキストと座標を返すだけ。請求書などのキー=バリューや表として構造化するのは Document Intelligence です。Q. 動画の分析は AI Vision? → A. いいえ、動画は Azure AI Video Indexer が担当します。

注意

ひっかけ: 「OCR(Read)が請求書のフィールドを構造化して返す」は誤りです。Read は生テキスト+座標まで。構造化抽出は Document Intelligence。また「AI Vision で動画を分析する」も誤り(動画は Video Indexer)。

2.1.2この節のまとめ

  • 画像分析=タグ・物体検出・キャプション
  • OCR(Read)=印刷/手書き文字の抽出

進捗の記録にはログインが必要です。

理解度チェック

(軽い確認用)

Q1. 画像に写っている物体を検出し、その位置(バウンディングボックス)やタグ、キャプションを得たい。何を使いますか?

Q2. 画像や文書から印刷・手書きの文字を抽出したい。どの機能を使いますか?

Q3. Azure AI Vision の画像分析(学習済み)の特徴として正しいものはどれですか?

理解度を確認第2章「コンピュータービジョンの実装」の問題を解く