3Applying site reliability engineering practices
- 3.1SLIs, SLOs, SLAs, and error budgets
Understand SLIs (availability, latency, etc.) that measure reliability, SLOs (targets), SLAs (external contracts), error budgets that balance change velocity and reliability, and the cost of reliability (number of "nines").
- 3.2Service lifecycle, capacity planning, and incident mitigation
Understand service lifecycle management (plan/deploy/maintain/retire), capacity planning (quotas, limits, reservations, Dynamic Workload Scheduler), autoscaling (managed instance groups, Cloud Run, GKE), and mitigating incident impact on users (draining/redirecting traffic, adding capacity, rollback).

