← Cloud Service
Cloud Engineering Know-how

Observability, Monitoring & Incident Response

クラウド上のApplicationは、Load Balancer、Compute、Container、Databaseなど複数のComponentで構成され、それぞれが個別にLogやMetricを生成します。

分散したTelemetryを一元的に収集・可視化し、障害や性能劣化を早期に検知し、原因の切り分けから通知・初動対応までを一連の運用として設計します。

Design Scope

What We Design

01

Observability & Telemetry Design

  • Logs / Metrics / Traces Collection
  • Centralized Monitoring & Troubleshooting

Application、Load Balancer、Container、Databaseなど、Systemを構成する各Componentから必要なLogs、Metrics、Tracesを収集し、一元的に確認できるObservability基盤を設計します。

障害や性能劣化が発生した際に、各Serviceの管理画面やLogを個別に確認するのではなく、System全体の状態を確認しながら、問題が発生しているComponentを迅速に切り分けられる構成とします。

02

Monitoring, Alerting & Incident Response Design

  • Monitoring & Alert Design
  • Alert Routing & Escalation
  • Incident Response & Runbook

Systemの正常性を判断するMetricやEventを整理し、障害や性能劣化をEnd Userからの連絡より前に検知できるMonitoringを設計します。

単純にAlarmを増やすのではなく、重要度、継続時間、Systemへの影響を考慮してAlert条件を設定し、不要な通知やAlarm Floodを抑えます。

検知したIncidentについて、Severity、通知先、Escalation、初動確認項目、Runbookなどを整理し、担当者が速やかに状況を確認して対応を開始できる運用Flowを設計します。

Technology Map

Technologies / Keywords

Common

OpenTelemetry / Prometheus / Grafana / Datadog / New Relic

AWS

Amazon CloudWatch / CloudWatch Logs / AWS X-Ray / Amazon Managed Service for Prometheus / Amazon OpenSearch Service

Azure

Azure Monitor / Log Analytics Workspace / Application Insights / Azure Monitor managed service for Prometheus

GCP

Cloud Monitoring / Cloud Logging / Cloud Trace / Managed Service for Prometheus