Instiq

4コンピュータービジョンの実装

問題集で演習する →用語集を見る →
  • 4.1画像・動画の生成と編集

    AI-103 のコンピュータービジョンは「認識」より「生成」が中心です。Microsoft Foundry で画像生成モデル・動画生成モデルをデプロイし、テキストプロンプトや参照メディアから画像・動画を生成し、マスクによるインペインティングなどで編集する実装を開発者の視点で理解します。

  • 4.2マルチモーダル理解と責任ある AI

    マルチモーダルモデルに画像・動画を渡して視覚的文脈を理解する(キャプション・視覚的な質問応答・アクセシビリティ向け alt-text)方法と、Azure Content Understanding による視覚特性の抽出、そしてマルチモーダル特有の責任ある AI(有害な視覚コンテンツのフィルタ・画像に埋め込まれた文字による間接プロンプトインジェクション・ウォーターマーク等の視覚ポリシー)を理解します。