내용으로 건너뛰기

Amazon Aurora PostgreSQL 호환 클러스터가 장애 조치된 이유는 무엇입니까?

4분 분량
0

Amazon Aurora PostgreSQL 호환 버전 데이터베이스(DB) 클러스터에서 장애 조치 이벤트가 발생하는 원인을 알고 싶습니다.

간략한 설명

다음 이벤트 중 하나가 발생하면 Aurora PostgreSQL 호환이 자동으로 리더 인스턴스로 장애 조치됩니다.

  • 라이터 인스턴스에 인프라 문제가 있습니다. 여기에는 물리적 호스트 또는 클러스터 볼륨에 대한 네트워크 연결 끊김 또는 물리적 컴퓨팅 리소스 관련 문제가 포함됩니다.
  • 라이터 인스턴스에 연결할 수 없습니다. 이 문제는 과도한 워크로드로 인해 성능 병목 현상과 리소스 경합이 있을 때 발생합니다.
  • DB 인스턴스 수직적 스케일링으로 인해 라이터의 DB 인스턴스 클래스 유형이 변경됩니다.
  • 라이터의 기본 호스트가 특정 유지 관리 기간 동안 소프트웨어 패칭, 하드웨어 유지 관리 또는 운영 체제(OS) 업데이트를 경험합니다. 자세한 내용은 Amazon Aurora DB 클러스터 유지 관리를 참조하십시오.
  • 인스턴스가 인스턴스 수준에서 장애 조치 옵션을 사용합니다.

해결 방법

클러스터의 라이터가 상태 확인에 응답하지 못하면 클러스터가 우선순위에 따라 리더 중 하나로 장애 조치를 시작합니다. 장애 조치의 원인을 파악하려면 다음 로그 및 지표에서 Aurora PostgreSQL 호환 클러스터를 확인하십시오.

Amazon RDS 이벤트

예정되지 않은 중단의 원인을 확인하려면 장애 조치 기간의 모든 Aurora 이벤트를 확인하십시오. 지난 2주까지의 이벤트를 볼 수 있습니다. 이벤트를 더 오랫동안 저장하려면 Aurora 이벤트를 Amazon EventBridge로 전송하십시오. 자세한 내용은 Amazon Aurora 이벤트를 트리거하는 규칙 생성을 참조하십시오.

CloudWatch 지표

높은 DB 로드가 장애 조치의 원인인지 확인하려면 Amazon CloudWatch를 사용하여 Aurora DB 클러스터 지표를 확인하십시오.

클러스터의 가용성과 상태를 보여주는 다음 지표에서 스파이크가 있는지 확인하십시오.

  • DatabaseConnections
  • CPUUtilization
  • FreeableMemory
  • DiskQueueDepth
  • StorageNetworkThroughput

향상된 모니터링

향상된 모니터링을 사용하여 실시간으로 OS 지표를 확인할 수 있습니다. Amazon Aurora 인스턴스에 대한 향상된 모니터링을 활성화하려면 향상된 모니터링 설정 및 활성화를 참조하십시오. 확인 가능한 OS 지표 목록은 향상된 모니터링의 OS 지표를 참조하십시오.

성능 개선 도우미

성능 개선 도우미를 사용하여 Aurora PostgreSQL 호환 클러스터의 DB 로드를 확인할 수 있습니다. 대기, SQL 문, 호스트 또는 사용자별로 로드를 필터링할 수 있습니다. 자세한 내용은 성능 개선 도우미 대시보드를 사용한 지표 분석을 참조하십시오.

성능 개선 도우미는 DB 로드의 99%를 사용하는 쿼리와 같이 DB 로드에 가장 많이 기여하는 쿼리를 보여줍니다.

성능 개선 도우미는 다음과 같은 문제가 DB 클러스터 성능에 영향을 미칠 수 있는지 여부를 파악하는 데 도움이 됩니다.

  • I/O 작업(예: 디스크 읽기를 위한 IO:DataFileRead)
  • 잠금 경합(예: Lock:transactionidLock:Relation)
  • 버퍼 관리 문제(예: BufferPin:BufferPin)
  • 클라이언트 통신 지연(예: Client:ClientReadClient:ClientWrite)

중요: 성능 개선 도우미는 2026년 6월 30일에 서비스가 종료됩니다. 2026년 6월 30일 이전에 Database Insights의 고급 모드로 업그레이드할 수 있습니다. 업그레이드하지 않으면 성능 개선 도우미를 사용하는 DB 클러스터는 Database Insights의 표준 모드로 기본 설정됩니다. Database Insights의 고급 모드만 실행 계획과 온디맨드 분석을 지원합니다. 클러스터가 표준 모드로 기본 설정된 경우 콘솔에서 이러한 기능을 사용하지 못할 수 있습니다. 고급 모드를 활성화하려면 Amazon Relational Database Service(Amazon RDS)용 Database Insights의 고급 모드 활성화를 참조하십시오. 또한 Amazon Aurora용 Database Insights의 고급 모드 활성화를 참조하십시오.

Aurora DB 로그

온프레미스 데이터베이스에서 DB 로그는 파일 시스템에 있습니다. 파일 시스템의 DB 로그에 대한 호스트에는 액세스할 수 없으므로 대신 Amazon CloudWatch Logs에 로그를 게시하십시오.

Aurora 및 RDS 콘솔을 사용하여 DB 로그 파일을 볼 수도 있습니다.

Aurora PostgreSQL을 통한 빠른 장애 조치

장애 조치 후 정상 복제본 인스턴스로 작업을 신속하게 전환하려면 빠른 장애 조치가 가능하도록 애플리케이션을 구성하십시오.

Aurora PostgreSQL 호환에 대한 클러스터 캐시 관리를 통한 장애 조치 후 빠른 복구

DB 클러스터에서 DB 인스턴스를 빠르게 복구하려면 Aurora PostgreSQL 호환에 대한 클러스터 캐시 관리를 사용하십시오.

장애 조치 성능 향상을 위한 RDS Proxy

Amazon RDS Proxy를 사용하여 DB 인스턴스에 대한 개방형 연결 풀을 유지할 수 있습니다. 데이터베이스 장애 조치 중에도 RDS Proxy는 동일한 IP 주소의 연결을 계속 수락하고 자동으로 새 기본 DB 인스턴스로 연결을 전달합니다. 원본 DB 인스턴스를 사용할 수 없게 되면 대기 데이터베이스에 연결하지만 유휴 애플리케이션 연결을 삭제하지는 않습니다.

관련 정보

Amazon Aurora의 고가용성

Amazon Aurora 클러스터의 지표 모니터링

Aurora용 Amazon RDS 이벤트 카테고리 및 이벤트 메시지

AWS 공식업데이트됨 7달 전