変更要約: 各節に図(figure)を追加=cert-figure-retrofit。AI-300 第5章を新規作成(ドメイン5「生成 AI の最適化」: RAG 最適化=類似度しきい値/チャンクサイズ/検索戦略/埋め込みモデルの選択・ファインチューニング/ハイブリッド検索/関連性メトリクス・A/B テスト、高度なファインチューニング=手法/合成データ/監視・最適化/開発から本番までのライフサイクル管理)
5.2高度なファインチューニングとモデルのカスタマイズ
高度なファインチューニング手法の設計と実装、ファインチューニング用の合成データの作成と管理、ファインチューニング済みモデルの性能の監視と最適化、そして開発から本番デプロイまでのファインチューニング済みモデルの管理を理解します。
プロンプトや RAG で十分な品質が出ない場合、ファインチューニングでモデル自体を特定のタスクやドメインに適応させます。AI-300 では、ファインチューニングを運用ライフサイクルとして扱うことが問われます。
5.2.1ファインチューニング手法と合成データ
ファインチューニングは、高品質な 学習データ(入力と望ましい出力のペア)が要です。十分なデータが集まらない場合は 合成データ(生成 AI でデータを作成)を用意し、品質と多様性、偏りに注意して管理します。手法は、いつ・どの程度モデルを適応させるかを設計します。「まずプロンプト/RAG → それでも不足ならファインチューニング」という順序(コストと効果のバランス)を理解します。
5.2.2監視と本番までの管理
ファインチューニング済みモデルも 監視と最適化が必要です。汎用性能の低下(過剰適合)や、新しいデータでの劣化を監視し、必要なら再ファインチューニングします。さらに、開発で作ったモデルを 評価→登録/バージョン管理→本番デプロイ→監視という ライフサイクルで管理します。これは第2章の MLOps と同じ運用思想を、ファインチューニング済み生成 AI モデルに適用したものです。
| 段階 | 内容 | 要点 |
|---|---|---|
| 適応手法の設計 | 高度なファインチューニング手法 | どの程度適応させるか |
| データの確保 | 合成データの作成/管理 | 品質/多様性/偏りに注意 |
| 性能の維持 | 監視と最適化 | 過剰適合/劣化を検知 |
| 本番までの管理 | 評価→登録→デプロイ→監視 | MLOps と同じライフサイクル |
混同に注意:
①最適化の順序はプロンプト → RAG → ファインチューニング(コスト/効果)。
②合成データは品質・多様性・偏りの管理が必要(粗悪なデータは性能を下げる)。
③ファインチューニング済みモデルも監視と本番ライフサイクル管理が必要(作って終わりではない)。
「要件 → 手段」:例「プロンプトや RAG でも品質が不足する」=ファインチューニング、「学習データが足りない」=合成データの作成(品質管理)、「適応後の汎用性能低下を防ぐ」=監視と再ファインチューニング、「開発→本番まで一貫管理」=評価→登録→デプロイ→監視のライフサイクル。
5.2.3この節のまとめ
- 最適化の順序:プロンプト → RAG → ファインチューニング(コスト/効果)
- 合成データは品質・多様性・偏りを管理。ファインチューニングは高品質データが要
- ファインチューニング済みモデルも監視+評価→登録→デプロイ→監視のライフサイクル管理
進捗の記録にはログインが必要です。
理解度チェック
(軽い確認用)Q1. プロンプトや RAG でも十分な品質が出ない場合に、モデル自体を特定のタスク/ドメインに適応させる手法はどれですか?
Q2. ファインチューニング用の学習データが不足する場合に作成し、品質・多様性・偏りを管理すべきものはどれですか?
Q3. 生成 AI の最適化で一般に推奨される順序はどれですか?
Q4. ファインチューニング済みモデルで監視すべきリスクとして適切なものはどれですか?
Q5. ファインチューニング済みモデルを開発から本番まで管理するライフサイクルとして正しいものはどれですか?
Q6. 粗悪な合成データを使うとどうなりますか?

