Instiq
Chapter 4 · ML Solution Monitoring, Maintenance, and Security·v2.1.0·Updated 6/14/2026·~9 min

What's changed: In-scope coverage: monitoring/ops/cost/security services

4.1Model Monitoring and Drift

Key points

Understand drift detection with SageMaker Model Monitor, endpoint monitoring with CloudWatch, and retraining triggered by drift. The starting point for "Monitoring, Maintenance, and Security" in MLA-C01.

Production models degrade over time (drift). Continuous monitoring and retraining when needed are key operations.

4.1.1Monitoring and drift detection

Diagram of three elements: Model Monitor (data/model drift vs. training baseline; quality/bias drift), CloudWatch (latency/errors/logs; alarms; endpoint metrics), and a retrain trigger (drift → retrain via Pipelines; keep the model fresh).
Monitoring models in production
  • Model Monitor: compares production data to the training baseline to detect data drift / model-quality drift / bias drift.
  • CloudWatch: monitors endpoint latency, error rate, invocations, and raises alarms.
  • Retraining: trigger retraining/redeployment via Pipelines on drift detection or schedule.
Exam point

Common on MLA: production accuracy degrades = data/model drift (detect with Model Monitor), detect → retrain (Pipelines), endpoint latency/error monitoring = CloudWatch. Drift comes from shifting data distributions.

Production models degrade over time, so design "what to monitor and what triggers retraining." SageMaker Model Monitor builds a baseline from training data and periodically evaluates deviation to detect four drift types: data-quality drift (input distribution shift = covariate shift), model-quality drift (accuracy drop vs. ground-truth labels), bias drift (changing attribute skew), and feature-attribution drift (changing importances). Endpoint health (latency, error rate, invocations, instance utilization) is monitored with CloudWatch, and request/response capture is saved to S3 via Data Capture. On degradation, automate retraining/redeployment with EventBridgeSageMaker Pipelines to keep the model fresh (linking to the prior chapter’s MLOps). The axes: "cause of accuracy drop = drift (Model Monitor)," "detect → retrain (Pipelines)," "endpoint ops metrics = CloudWatch." Since drift’s root cause is shifting data, use proxy metrics when labels arrive late.

What to monitorUse
Input/accuracy/bias changeModel Monitor (drift)
Latency/error/utilizationCloudWatch
Capture I/OData Capture → S3
Retrain on degradationEventBridge → Pipelines
Example

Scenario: a recommender that started accurate degrades over months. The cause is data/model-quality drift from shifting user preferences. Detect it via Model Monitor baseline comparison, and watch endpoint latency/errors with CloudWatch. Catch threshold breaches with EventBridge to trigger retraining in SageMaker Pipelines, deploying the new model gradually after the evaluation step passes.

Note

Q. Cause of production accuracy drop? Data/model drift. Q. Detection? Model Monitor (baseline comparison). Q. Latency/error monitoring? CloudWatch. Q. Capture I/O? Data Capture. Q. Retrain after detection? EventBridge → Pipelines.

Warning

Watch the mix-ups: (1) Model Monitor = drift/quality, CloudWatch = endpoint ops metrics—don’t swap. (2) Model-quality drift needs ground-truth labels—use proxies/data-quality drift when labels lag. (3) Model Monitor only detects—automate retraining/rollback separately. (4) Without enabling Data Capture, you can’t analyze I/O afterward.

Note

Model Monitor builds a "baseline" from training data and periodically evaluates how far production inputs/predictions deviate from it.

4.1.2Section summary

  • Model Monitor (drift) + CloudWatch (endpoint monitoring)
  • Connect drift detection to retraining (Pipelines)

Sign in to track progress — Log in.

Quick check

(just a quick review)

Q1. A model’s accuracy gradually drops after going live. What is the most common cause and detection tool?

Q2. You want to monitor endpoint latency/error rate and raise alarms. What do you use?

Q3. You want to auto-retrain/redeploy when drift is detected. Which fits best?

Check your understandingPractice questions for Chapter 4: ML Solution Monitoring, Maintenance, and Security

Keep track of your progress

The full study guide is free to read. Sign up free to practice with the question bank, track what you have read, review your mistakes, and highlight passages.