Instiq
第4章 · 可観測性の実践と問題のトラブルシュート·v1.0.0·更新 2026/6/15·読了目安 約15分

変更要約: Professional Cloud DevOps Engineer 第4章を新規作成(ドメイン4「可観測性」: Ops Agent/OpenTelemetry/Managed Service for Prometheus/Cloud Audit Logs/VPC Flow Logs・ログ最適化・合成モニタ・ログベースメトリクス・Logs Explorer・BigQuery/Pub/Sub/Cloud Storage エクスポート・PII/PHI 秘匿、Metrics Explorer/PromQL ダッシュボード/アラートポリシー/PagerDuty・分散トレース Cloud Trace/OpenTelemetry・トレースとログ相関・トラブルシュート)。

4.2メトリクス・ダッシュボード・アラートと分散トレース

この節の要点

Metrics Explorer によるメトリクス分析、ダッシュボード(PromQL・共有・プレイブック)、アラートポリシー(SLI/SLO・コスト)と第三者連携(PagerDuty 等)、分散トレース(OpenTelemetry・Cloud Trace・トレースとログの相関)、インフラ/CI-CD/アプリ/性能/レイテンシのトラブルシュートを理解します。

集めたテレメトリは、見える化・気づき・原因追跡に変えて初めて価値が出ます。メトリクスを可視化し、賢くアラートし、分散トレースで遅延の原因をたどります。

4.2.1メトリクス・ダッシュボード・アラート

メトリクスは Metrics Explorer で探索し、ダッシュボード にまとめます(PromQL でクエリ、共有や プレイブック の添付も可)。アラートポリシー は症状ベース(SLI/SLO 違反、コスト超過)で設定し、過剰なノイズを避けます。通知は Webhook で PagerDuty などの第三者ツールに連携します。「複数チャートの一覧=ダッシュボード」「SLO 違反で通知=アラートポリシー」を結びます。

4.2.2分散トレースとトラブルシュート

マイクロサービスの遅延は 分散トレースCloud TraceOpenTelemetry で計装)でたどります。リクエストを スパンウォーターフォール として可視化し、どの呼び出しが遅いかを特定します。トレース ID を構造化ログと相関 させると、遅いリクエストの詳細ログへ即座に辿れます。トラブルシュートは インフラ/CI-CD/アプリ/可観測性/性能・レイテンシ の各層を、ログ・メトリクス・トレースを突き合わせて切り分けます。「マイクロサービスの遅延原因=分散トレース」を押さえます。

続きは無料登録で読めます

冒頭を無料で公開中。無料登録でこの節の全文と、第4章以降を含む全参考書・全問題集が読めます。