3サイト信頼性エンジニアリング(SRE)の実践
- 3.1SLI・SLO・SLA とエラーバジェット
サービスの信頼性を測る SLI(可用性・レイテンシ等)、目標の SLO、対外契約の SLA、変更速度と信頼性のバランスを取るエラーバジェット、信頼性のコスト(「ナイン」の数)の考え方を理解します。
- 3.2サービスライフサイクル・容量計画・インシデント緩和
サービスの計画/デプロイ/保守/廃止のライフサイクル管理、容量計画(クォータ・上限・予約・Dynamic Workload Scheduler)、オートスケーリング(マネージドインスタンスグループ・Cloud Run・GKE)、ユーザーへのインシデント影響の緩和(トラフィックのドレイン/リダイレクト・容量追加・ロールバック)を理解します。

