Instiq
第4章 · コンピュータービジョンの実装·v2.1.0·更新 2026/6/11·読了目安 約13分

変更要約: 各節に図(figure)を追加=cert-figure-retrofit。AI-103 第4章を公式 skills measured(2026-04-16版)準拠に全面改稿。旧 AI-102 風(事前構築 Vision+Custom Vision)から「生成中心」へ作り直し:s1=画像・動画の生成と編集(text→image: GPT-image-1/DALL·E、インペインティング=マスク編集、参照メディア、生成・編集コントロール、text→video: Sora・非同期)、s2=マルチモーダル理解(キャプション/視覚QA/alt-text/物体・領域特定)+Content Understanding の視覚特性抽出(single-task/pro-mode・動画分析)+マルチモーダルの責任ある AI(Content Safety 画像モデレーション・画像埋め込みテキストによる間接プロンプトインジェクション・ウォーターマーク/禁止記号/ブランドの視覚ポリシー)

4.2マルチモーダル理解と責任ある AI

この節の要点

マルチモーダルモデルに画像・動画を渡して視覚的文脈を理解する(キャプション・視覚的な質問応答・アクセシビリティ向け alt-text)方法と、Azure Content Understanding による視覚特性の抽出、そしてマルチモーダル特有の責任ある AI(有害な視覚コンテンツのフィルタ・画像に埋め込まれた文字による間接プロンプトインジェクション・ウォーターマーク等の視覚ポリシー)を理解します。

生成と並ぶもう一つの柱が、画像・動画を「理解する」ことです。AI-103 では、専用の認識モデルを作る前に、まず マルチモーダルモデル(画像も入力できる生成モデル)に画像を渡し、プロンプトで柔軟に理解させるのが基本方針です。「この画像を説明して」「この図のどこが異常か」のように、認識と推論をまとめて任せられます。

4.2.1マルチモーダルモデルによる視覚理解

  • キャプション:画像の説明文を生成。簡潔/詳細を選べ、単一画像でも複数画像でもまとめて説明できる。
  • 視覚的な質問応答(visual QA):画像を根拠に質問へ回答する(画像に写っていることに基づいて答える)。
  • alt-text/拡張説明:アクセシビリティ指針に沿った代替テキストや詳しい説明を生成する。
  • 物体・構成要素・領域の特定:画像や動画の中の対象(部品・領域)を特定する。

4.2.2Content Understanding による視覚特性の抽出

マルチモーダルモデルに加え、Foundry Tools の Azure Content Understanding は、画像や動画から 視覚特性構造化して抽出します(指定したスキーマに沿った項目を返す アナライザー)。動画ではセグメントを処理・解釈する動画分析も行えます。パイプラインには single-task(1つの抽出タスク)と、より複雑な推論を多段で行う pro-mode(pro モード)があり、要件に応じて選びます。「画像を会話的に理解したい」→マルチモーダルモデル、「決まった視覚項目を安定して構造化抽出したい」→Content Understanding、という使い分けが目安です。

やりたいこと適した手段
画像の説明文(簡潔/詳細)を生成マルチモーダルモデル
画像を根拠に質問へ回答マルチモーダルモデル(視覚QA)
アクセシビリティ向け alt-textマルチモーダルモデル
決まった視覚項目を構造化抽出Content Understanding(single-task / pro-mode)
動画セグメントの分析Content Understanding(動画分析)

4.2.3マルチモーダルの責任ある AI

視覚を扱うと、テキストにはない固有のリスクが加わります。代表は次の3つです。
有害・不許可な視覚コンテンツ——生成・入力された画像/動画を Azure AI Content Safety画像モデレーションで分類・ブロックします。
間接プロンプトインジェクション——画像の中に文字として埋め込まれた指示をマルチモーダルモデルが本来の指示として実行してしまう攻撃。画像内テキストを「命令」として扱わない・プロンプトシールド等で検出する、といった対策をします。
視覚ポリシーの遵守——生成画像への ウォーターマーク/コンテンツクレデンシャル(来歴の表示)、禁止記号の検出、ブランド利用ルールの遵守など。これらは第1章のガバナンスと一貫した設計です。

リスク内容主な対策
有害な視覚コンテンツ暴力・性的など不適切な画像/動画Azure AI Content Safety の画像モデレーション
間接プロンプトインジェクション画像に埋め込まれた文字の指示を実行画像内テキストを命令扱いしない/プロンプトシールド
視覚ポリシー違反来歴不明・禁止記号・ブランド誤用ウォーターマーク/コンテンツクレデンシャル・記号検出・ブランド規則
試験ポイント

頻出:
①「画像を会話的に理解(説明文・視覚QA・alt-text)」=マルチモーダルモデル
②「決まった視覚項目を構造化抽出/動画セグメント分析」=Content Understanding(single-task / pro-mode)
③「不適切な画像を検出・ブロック」=Content Safety の画像モデレーション
④「画像に埋め込まれた文字で指示が乗っ取られる」=間接プロンプトインジェクション
⑤生成画像の来歴=ウォーターマーク/コンテンツクレデンシャル

注意

混同・注意:
マルチモーダルモデル(柔軟な会話的理解)Content Understanding(決まった項目の構造化抽出)を取り違えない。
間接プロンプトインジェクション(画像内テキスト)と通常の(テキスト入力での)プロンプトインジェクションは経路が違う。
③有害コンテンツ(安全性=Content Safety)と視覚ポリシー(来歴/ブランド=ウォーターマーク等)は別の対策。

マルチモーダルモデルによる視覚理解、Content Understanding による視覚特性の抽出、マルチモーダルの責任ある AI を表した図。
視覚理解・抽出・責任ある AI

4.2.4この節のまとめ

  • 画像の会話的理解(キャプション・視覚QA・alt-text・物体/領域特定)=マルチモーダルモデル
  • 決まった視覚項目の構造化抽出/動画分析Content Understanding(single-task / pro-mode)
  • マルチモーダルの責任ある AI:有害視覚コンテンツ(Content Safety)/間接プロンプトインジェクション(画像内テキスト)/視覚ポリシー(ウォーターマーク・禁止記号・ブランド)

進捗の記録にはログインが必要です。

理解度チェック

(軽い確認用)

Q1. 画像を直接渡し、説明文の生成や「画像を根拠にした質問応答」を柔軟に行いたい場合に適すのはどれですか?

Q2. 画像の中に文字として埋め込まれた指示をマルチモーダルモデルが実行してしまう攻撃を何と呼びますか?

Q3. 生成・入力された画像の不適切(暴力・性的等)を検出・ブロックする Azure の仕組みはどれですか?

Q4. 決まったスキーマの視覚項目を画像・動画から「安定して構造化抽出」したい場合に最も適すのはどれですか?

理解度を確認第4章「コンピュータービジョンの実装」の問題を解く

学習の記録を残しませんか

参考書はすべて無料で読めます。無料登録すると、問題集での演習・既読と進捗の記録・間違えた問題の復習・ハイライトが使えます。