変更要約: Professional Data Engineer 第5章を新規作成(ドメイン5「保守と自動化」: リソース最適化と自動化=コスト最小化/Dataproc 永続・ジョブ単位クラスタ/Cloud Composer DAG/スケジュールクエリ/BigQuery Editions・予約、監視とフォールトトレランス=Cloud Monitoring/Logging/BigQuery 管理パネル・クォータ/課金/エラー切り分け・複数リージョン/ゾーン/レプリケーション/フェイルオーバー/冪等再処理/バックアップ・検証)。
5.2監視・トラブルシューティングとフォールトトレランス
データ処理の可観測性(Cloud Monitoring・Cloud Logging・BigQuery 管理パネル)、エラー/課金/クォータのトラブルシューティング、そしてフォールトトレランス(複数リージョン/ゾーンでの実行・データ破損や欠損への備え・レプリケーションとフェイルオーバー)を理解します。
データワークロードは、監視して問題を捉え、障害が起きても影響を抑えるように運用します。可観測性とフォールトトレランスが信頼性を支えます。
5.2.1監視とトラブルシューティング
データ処理は Cloud Monitoring(メトリクス/アラート)と Cloud Logging(ログ)、BigQuery の 管理パネル(admin panel) で観測します。計画した使用量を監視し、想定外の増加を捉えます。トラブルシューティングでは、エラーメッセージ・課金(請求)の問題・クォータ超過を切り分けます。ジョブ・クエリ・予約(コンピュート容量)といったワークロードを管理します。「データ処理の監視=Cloud Monitoring/Logging+BigQuery 管理パネル」「クォータ/課金/エラーを切り分け」と結びます。
5.2.2フォールトトレランスと影響の緩和
障害に備え、システムを フォールトトレラント に設計します:再起動を管理し、複数リージョン/ゾーンでジョブを実行し、データ破損や欠損に備えます(バックアップ・冪等な再処理・検証)。データベースは レプリケーションとフェイルオーバー(Cloud SQL の HA、Redis クラスタなど)で可用性を高めます。「障害に耐える=複数リージョン/ゾーン+レプリケーション/フェイルオーバー」「データ破損対策=バックアップ/検証/冪等再処理」を押さえます。

