6テキスト・音声・コンピュータービジョン・画像生成の実装
- 6.1テキストと音声の実装
Foundry でテキストと音声のソリューションを実装する2つの道(用途特化の Foundry Tools=Azure AI Language/Azure AI Speech と、音声を直接扱うマルチモーダルモデル)を理解し、テキスト分析・音声認識(STT)・音声合成(TTS)・音声翻訳の機能と、音声プロンプトへの応答方法を押さえます。
- 6.2コンピュータービジョンと画像生成の実装
Foundry で「画像を理解する(ビジョン入力)」と「画像を作る(画像生成)」の2つの能力を実装する方法を理解します。マルチモーダルモデルや Azure AI Vision による画像解釈・OCR と、生成モデルによるテキストからの画像生成を、用途別の使い分けとともに押さえます。

