第4章 · GenAI アプリの運用効率と最適化·v1.0.0·更新 2026/6/22·読了目安 約11分
変更要約: 初版: ドメイン4(運用効率と最適化)の3節を作成
4.2アプリケーションパフォーマンスの最適化
この節の要点
GenAI アプリの応答性を高める手法を学びます。レイテンシ最適化モデル、並列リクエスト、ストリーミング、temperature/top-k/top-p の調整、検索の最適化、Auto Scaling を扱います。
生成は本質的に時間がかかります。体感レイテンシを下げ、スループットを上げ、出力品質をパラメータで整えることで、ユーザー体験を最適化します。
4.2.1性能を上げる手段
- レイテンシ低減:レイテンシ最適化モデル、ストリーミング、予測可能な問い合わせの事前計算、複雑ワークフローの並列リクエスト。
- 出力パラメータ:要件に応じて temperature/top-k/top-p を調整(決定的なら低 temperature、多様性なら高め)。
- 検索の最適化:インデックス最適化・クエリ前処理・カスタムスコアのハイブリッド検索で RAG の取得を高速・高精度化。
- スループット/スケール:トークン処理の最適化、バッチ推論、同時呼び出し管理、GenAI トラフィック向け Auto Scaling。
試験ポイント
「体感を上げる=ストリーミング+レイテンシ最適化モデル」「決定的な出力=低 temperature」「多様な出力=高 temperature/top-p」「予測可能な問い合わせ=事前計算」「RAG 高速化=インデックス/クエリ前処理」 は頻出です。
性能最適化は「待たせない・速く返す・要件に合った出力」です。体感レイテンシは ストリーミング(逐次表示)と レイテンシ最適化モデル(時間制約が厳しい用途向け)で下げ、予測可能な問い合わせは事前計算、複雑なワークフローは並列リクエストで短縮します。出力品質は temperature(低=決定的/事実重視、高=創造的)・top-k/top-p(候補語のサンプリング範囲)を要件に合わせて設定し、A/B テストで検証します。RAG の遅さはインデックス最適化・クエリ前処理・カスタムスコアのハイブリッド検索で改善。スループットはトークン処理の最適化・バッチ推論・同時呼び出し管理で上げ、容量は GenAI トラフィック特性に合わせた Auto Scaling とプロビジョンドスループット最適化で確保します。API のプロファイリング(プロンプト/補完パターン)でボトルネックを特定し、LLM 推論特有のレイテンシ削減を施します。

