Amazon CloudWatch 경보가 ALARM 상태로 변경되었습니다. 모니터링되는 지표를 확인하면 CloudWatch 그래프에 위반 데이터 포인트가 표시되지 않습니다. 하지만 경보 기록에는 데이터 포인트 위반이 포함된 항목이 포함되어 있습니다. CloudWatch 경보가 시작된 원인을 알고 싶습니다.
간략한 설명
애플리케이션이 경보 평가 이후 같은 시간에 대하여 추가적인 데이터 포인트를 게시하는 경우, CloudWatch 그래프에 업데이트된 집계 값이 표시됩니다. 업데이트된 집계 값에는 지연된 데이터 포인트를 포함합니다. 경보 기록에는 평가 중에 사용 가능했던 데이터 포인트에 기반해 위반 사항이 기록되었더라도 그래프에는 해당 위반이 표시되지 않을 수 있습니다.
해결 방법
위반 데이터 포인트 찾기
다음 예제는 지연된 데이터 포인트로 인해 어떻게 CloudWatch 그래프가 경보 기록과 다르게 나타날 수 있는지 보여줍니다.
다음 예제에서는 다음과 같은 파라미터로 경보를 구성합니다.
- 네임스페이스: Web_App
- 지표: ResponseTime
- 차원: host,h_04254448d4e964956
- 통계: 평균
- 임곗값: 0.005
- ComparisonOperator: GreaterThanThreshold
- 기간: 60초(1분)
- 평가 기간: 1
경보가 12:00:00~12:01:00 UTC의 기간을 평가할 때 지표는 다음 값을 검색합니다.
Sample-1: 12:00:00 UTC, numeric value: 0.00675
Sample-2: 12:00:00 UTC, numeric value: 0.00789
Sample-3: 12:00:00 UTC, numeric value: 0.00421
이 값들의 평균이 0.006283333이므로 평균이 임곗값인 0.005초를 위반하고 경보가 ALARM 상태로 변경됩니다. 경보 내역에는 임곗값을 초과하는 집계 값이 표시됩니다.
일시적으로 성능 문제가 발생하는 호스트는 지표 게시를 담당하는 클라이언트 애플리케이션에 영향을 미칩니다. 따라서 호스트가 동일한 간격으로 데이터 포인트를 게시하지 못할 수 있습니다. 이 경우, 애플리케이션은 경보 평가가 진행된 이후 12:00에 대한 샘플을 게시합니다.
다음 예제는 12:00 타임스탬프의 모든 샘플을 나타냅니다.
Sample-1: 12:00:00 UTC, numeric value: 0.00675
Sample-2: 12:00:00 UTC, numeric value: 0.00789
Sample-3: 12:00:00 UTC, numeric value: 0.00421
Sample-4: 12:00:00 UTC, numeric value: 0.00002
Sample-5: 12:00:00 UTC, numeric value: 0.00007
경보로부터 알림을 받으면 CloudWatch 그래프를 생성하여 지표 동작을 검토하십시오. CloudWatch는 12:00:00~12:01:00 UTC의 샘플 5개를 검색하여 평균 0.003788로 집계합니다. 값이 이전에 계산된 값으로부터 변경되었으며 임곗값 미만입니다. 애플리케이션이 경보 평가가 발생한 이후에 추가적인 샘플을 게시하면 해당 시간 범위에 위반 데이터 포인트가 표시되지 않습니다.
경보 평가 간격 늘리기
경보를 알릴 데이터 포인트를 구성하면 평가 간격이 길어질 수 있습니다. 지연된 지표로 인해 경보가 허위 알림을 생성하면 평가 간격이 길어집니다. 길어진 평가 간격에는 경보 평가에 지연된 데이터 포인트를 포함합니다. 이렇게 하면 허위 알림 수가 줄어듭니다.
평가 간격을 늘리려면 다음 옵션 중 하나를 사용하십시오.
기간 늘리기
다음 예제에서는 기간이 5분으로 늘어났습니다.
네임스페이스: Web_App
지표: ResponseTime
차원: host,h_04254448d4e964956
통계: 평균
임곗값: 0.005
ComparisonOperator: GreaterThanThreshold
기간: 300초(5분)
평가 기간: 1
경보를 알릴 데이터 포인트 M/N개 구성
경보가 ALARM 상태로 변경되기까지 경보에 위반 데이터 포인트가 여러 개 필요하도록 구성합니다.
다음 예제에서는 N개 중 M개의 데이터 포인트가 3개 중 2개로 구성됩니다.
네임스페이스: Web_App
지표: ResponseTime
차원: host,h_04254448d4e964956
통계: 평균
임곗값: 0.005
ComparisonOperator: GreaterThanThreshold
기간: 60초(1분)
평가 기간(N): 3
경보를 알릴 데이터 포인트(M): 2
평가 기간과 경보를 알릴 데이터 포인트를 서로 다른 값으로 구성하면 경보를 M/N개 만들게 됩니다. 경보를 알릴 데이터 포인트가 M으로 설정되고 평가 기간이 N으로 설정됩니다. 예를 들어 데이터 포인트 5개 중 4개를 1분의 기간으로 구성하면 평가 간격은 5분이 됩니다. 데이터 포인트 3개 중 3개를 10분의 기간으로 구성하는 경우 평가 간격은 30분입니다.
경보를 알릴 데이터 포인트를 서로 다른 값으로 구성하면 CloudWatch 경보가 더 많은 데이터 포인트를 평가합니다. 또한 CloudWatch 경보는 데이터 포인트 세트 내에서 최소 개수의 데이터 포인트가 위반되면 경보 상태를 변경합니다. 파라미터를 사용하여 단일 데이터 포인트로 경보를 활성화되도록 하거나, 여러 개의 데이터 포인트가 누적되어야 ALARM 상태로 전환하도록 조정할 수 있습니다.
자세한 내용은 정적 임곗값을 기반으로 하는 CloudWatch 경보 만들기 및 CloudWatch 경보가 누락된 데이터를 처리하는 방법 구성을 참조하십시오
관련 정보
CloudWatch 경보 트리거에 대한 Amazon SNS 알림이 수신되지 않은 이유는 무엇입니까?
INSUFFICIENT_DATA 상태에서 CloudWatch 경보 문제를 해결하려면 어떻게 해야 합니까?
데이터 포인트가 하나라도 위반된 후 CloudWatch 경보가 알림을 보낸 이유는 무엇인가요?