내용으로 건너뛰기

Amazon RDS DB 인스턴스가 다시 시작, 복구 또는 장애 조치된 이유는 무엇입니까?

6분 분량
0

Amazon Relational Database Service(Amazon RDS) 데이터베이스 인스턴스의 다시 시작, 복구 또는 장애 조치의 근본 원인을 알고 싶습니다.

간략한 설명

Amazon RDS DB 인스턴스는 다음과 같은 조건에서 자동으로 다시 시작을 수행합니다.

DB 인스턴스에 잠재적 문제가 표시되고 Amazon RDS 상태 확인에 응답하지 못하면 Amazon RDS는 자동으로 다음 작업 중 한 가지를 수행합니다.

  • 단일 AZ 배포의 경우, Amazon RDS는 단일 AZ 복구를 시작합니다.
  • 다중 AZ 배포의 경우, Amazon RDS는 다중 AZ 배포에 대한 다중 AZ 장애 조치를 시작합니다.

그런 다음 Amazon RDS는 DB 인스턴스를 다시 시작하여 사용자가 관리자 개입 없이 최대한 빨리 데이터베이스 운영을 다시 시작할 수 있게 합니다.

해결 방법

중단의 원인을 파악하려면 DB 인스턴스의 다음 로그 및 지표를 확인하십시오. 또한 모범 사례를 따라야 합니다.

Amazon RDS 이벤트 메시지

인스턴스에서 계획하지 않은 중단이 발생한 근본 원인을 파악하려면 지난 24시간 동안의 모든 Amazon RDS 이벤트를 조회하십시오. Amazon RDS는 기본적으로 모든 이벤트를 UTC/GMT 시간으로 등록합니다. 이벤트를 더 오랜 기간 저장하려면 Amazon RDS 이벤트를 Amazon CloudWatch Events로 전송하십시오. 인스턴스가 다시 시작될 때, Amazon RDS 이벤트에 다음 중 한 가지 메시지가 표시됩니다.

고객이 RDS 인스턴스를 수정함

이 RDS 이벤트 메시지는 RDS 인스턴스 수정으로 인해 장애 조치가 시작되었다는 의미입니다.

데이터베이스 인스턴스 클래스에 수정 사항 적용 중

이 RDS 이벤트 메시지는 DB 인스턴스 클래스 유형이 배포 유형에 따라 변경되었다는 의미입니다.

  • 이 스케일링 작업 중에는 단일 AZ 배포를 몇 분 동안 사용할 수 없게 됩니다.
  • 다중 AZ 배포의 경우, 인스턴스가 장애 조치하는 데 걸리는 시간 동안 사용할 수 없습니다. 이 기간은 보통 약 60초입니다. 이 지연은 새로 크기가 조정된 데이터베이스에 장애 조치가 발생하기 전에 대기 데이터베이스가 업그레이드되었기 때문에 발생합니다. 이후 데이터베이스가 다시 시작되고 엔진은 복구를 수행하여 데이터베이스가 일관된 상태를 유지하게 합니다.

사용자가 DB 인스턴스 장애 조치를 요청함

이 메시지는 사용자가 재부팅 또는 장애 조치로 재부팅 옵션을 사용하여 DB 인스턴스의 수동 재부팅을 시작했다는 의미입니다.

RDS 다중 AZ 인스턴스의 주 호스트가 비정상임
이 이유는 일시적인 기본 하드웨어 문제로 인해 주 인스턴스에 대한 통신이 끊겼다는 의미입니다. RDS 모니터링 시스템이 상태 확인을 수행하기 위해 RDS 인스턴스와 통신하지 못했기 때문에 이 문제가 인스턴스를 비정상으로 표시할 수 있습니다.

네트워크 연결이 끊겨서 RDS 다중 AZ 인스턴스의 주 호스트에 연결할 수 없음

이 이유는 다중 AZ 배포의 주 호스트에 영향을 미치는 일시적인 네트워크 문제로 인해 다중 AZ 장애 조치 및 데이터베이스 인스턴스가 다시 시작되었다는 의미입니다. 내부 모니터링 시스템이 이 문제를 감지하고 장애 조치를 시작했습니다.

RDS 다중 AZ 주 인스턴스가 사용 중이고 응답이 없으며 다중 AZ 인스턴스 활성화가 시작되었거나 다중 AZ 인스턴스 활성화가 완료됨

이벤트 로그에 이 메시지가 표시되는 상황은 다음과 같습니다.

  • 주 DB 인스턴스가 응답하지 않습니다.
  • 데이터베이스에서 과도한 메모리 사용 이후 메모리 부족이 발생하여 Amazon RDS 모니터링 시스템이 기본 호스트에 접속하지 못했습니다. 모니터링 시스템이 예방 조처로 데이터베이스를 다시 시작합니다.
  • DB 인스턴스에서 기본 호스트와의 간헐적 네트워크 문제가 발생했습니다.
  • 인스턴스에 데이터베이스 로드가 발생했습니다. 이 경우 CloudWatch 지표 CPUUtilization, DatabaseConnections, IOPS metricsThroughput details가 급증한 것을 확인할 수 있습니다. 또한 Freeablememory가 소진된 것도 확인할 수 있습니다.

데이터베이스 인스턴스 패치됨

이 메시지는 DB 인스턴스가 유지 관리 기간 중에 마이너 버전 업그레이드를 진행했다는 의미입니다. 이 메시지가 발생하는 이유는 해당 인스턴스에 대하여 자동 마이너 버전 업그레이드 설정이 활성화되어 있기 때문입니다.

CloudWatch 지표

데이터베이스 로드 문제로 중단이 발생했는지 확인하려면 Amazon RDS 인스턴스의 CloudWatch 지표를 검토하십시오. 다음과 같은 주요 지표가 급증했다면 RDS 인스턴스의 가용성 및 상태에 문제가 있다는 의미일 수 있습니다.

  • DatabaseConnections
  • CPUUtilization
  • FreeableMemory
  • WriteIOPS
  • ReadIOPS
  • ReadThroughput
  • WriteThroughput
  • DiskQueueDepth

향상된 모니터링

Amazon RDS는 향상된 모니터링의 지표를 Amazon CloudWatch Logs 계정으로 전송합니다. 이 기능은 DB 인스턴스가 실행되는 운영 체제에 대한 지표를 실시간으로 제공합니다. DB 인스턴스의 모든 시스템 지표 및 프로세스 정보는 콘솔에서 조회할 수 있습니다.

Database Insights

CloudWatch Database Insights 대시보드에는 성능 문제를 분석하고 해결하는 데 사용할 수 있는 데이터베이스 성능 관련 정보가 포함됩니다. Database Insights 대시보드를 사용하여 쿼리의 통계를 분석하십시오. 대시보드의 정보를 사용하여 쿼리 성능을 조정하고 워크로드를 최적화하는 것이 좋습니다. 자세한 내용은 CloudWatch Database Insights의 데이터베이스 인스턴스 대시보드 보기를 참조하십시오.

참고: 문제 수를 줄이려면 이 변경 사항을 적용할 때 데이터베이스 관리자와 협력하는 것이 좋습니다.

RDS 데이터베이스 로그

DB 인스턴스의 중단 원인을 해결하려면 Amazon Aurora 및 RDS 콘솔 또는 Amazon RDS API 작업을 사용하여 데이터베이스 로그 파일을 조회, 다운로드 또는 모니터링할 수 있습니다. 또한 데이터베이스 테이블에 로드되는 데이터베이스 로그 파일을 쿼리할 수도 있습니다. 자세한 내용은 Amazon RDS 로그 파일 모니터링을 참조하십시오.

RDS 인스턴스 중단에 대처할 때 염두에 두어야 할 모범 사례:

관련 정보

Amazon RDS에서 가동 중지 시간 또는 데이터베이스 성능에 영향을 미치는 요인은 무엇입니까?

Amazon RDS DB 인스턴스가 장애 조치된 이유는 무엇입니까?

필요한 Amazon RDS 유지 관리 중에 가동 중지 시간을 어떻게 최소화합니까?

Amazon RDS for PostgreSQL 또는 Aurora PostgreSQL DB 인스턴스의 실행 중인 쿼리를 확인하고 리소스 소비 문제를 진단하려면 어떻게 해야 합니까?

AWS 공식업데이트됨 6달 전