Instiq
第4章 · コンピュータービジョンの実装·v2.1.0·更新 2026/6/11·読了目安 約13分

変更要約: 各節に図(figure)を追加=cert-figure-retrofit。AI-103 第4章を公式 skills measured(2026-04-16版)準拠に全面改稿。旧 AI-102 風(事前構築 Vision+Custom Vision)から「生成中心」へ作り直し:s1=画像・動画の生成と編集(text→image: GPT-image-1/DALL·E、インペインティング=マスク編集、参照メディア、生成・編集コントロール、text→video: Sora・非同期)、s2=マルチモーダル理解(キャプション/視覚QA/alt-text/物体・領域特定)+Content Understanding の視覚特性抽出(single-task/pro-mode・動画分析)+マルチモーダルの責任ある AI(Content Safety 画像モデレーション・画像埋め込みテキストによる間接プロンプトインジェクション・ウォーターマーク/禁止記号/ブランドの視覚ポリシー)

4.2マルチモーダル理解と責任ある AI

この節の要点

マルチモーダルモデルに画像・動画を渡して視覚的文脈を理解する(キャプション・視覚的な質問応答・アクセシビリティ向け alt-text)方法と、Azure Content Understanding による視覚特性の抽出、そしてマルチモーダル特有の責任ある AI(有害な視覚コンテンツのフィルタ・画像に埋め込まれた文字による間接プロンプトインジェクション・ウォーターマーク等の視覚ポリシー)を理解します。

生成と並ぶもう一つの柱が、画像・動画を「理解する」ことです。AI-103 では、専用の認識モデルを作る前に、まず マルチモーダルモデル(画像も入力できる生成モデル)に画像を渡し、プロンプトで柔軟に理解させるのが基本方針です。「この画像を説明して」「この図のどこが異常か」のように、認識と推論をまとめて任せられます。

4.2.1マルチモーダルモデルによる視覚理解

  • キャプション:画像の説明文を生成。簡潔/詳細を選べ、単一画像でも複数画像でもまとめて説明できる。
  • 視覚的な質問応答(visual QA):画像を根拠に質問へ回答する(画像に写っていることに基づいて答える)。
  • alt-text/拡張説明:アクセシビリティ指針に沿った代替テキストや詳しい説明を生成する。
  • 物体・構成要素・領域の特定:画像や動画の中の対象(部品・領域)を特定する。

4.2.2Content Understanding による視覚特性の抽出

マルチモーダルモデルに加え、Foundry Tools の Azure Content Understanding は、画像や動画から 視覚特性構造化して抽出します(指定したスキーマに沿った項目を返す アナライザー)。動画ではセグメントを処理・解釈する動画分析も行えます。パイプラインには single-task(1つの抽出タスク)と、より複雑な推論を多段で行う pro-mode(pro モード)があり、要件に応じて選びます。「画像を会話的に理解したい」→マルチモーダルモデル、「決まった視覚項目を安定して構造化抽出したい」→Content Understanding、という使い分けが目安です。

続きは無料登録で読めます

冒頭を無料で公開中。無料登録でこの節の全文と、第4章以降を含む全参考書・全問題集が読めます。