Amazon SageMaker AI 엔드포인트의 오토 스케일링 문제를 해결하려고 합니다.
해결 방법
참고: AWS Command Line Interface(AWS CLI) 명령을 실행할 때 오류가 발생하면 AWS CLI의 오류 해결을 참조하십시오. 또한 최신 AWS CLI 버전을 사용하고 있는지 확인하십시오.
발생한 문제를 기반으로 SageMaker AI 엔드포인트의 오토 스케일링 문제를 해결하십시오.
리소스 제한 초과 오류
SageMaker AI 엔드포인트의 규모를 조정할 때 서비스 할당량에 도달하면 다음과 유사한 오류 메시지가 표시됩니다.
"Failed to set desired instance count to 2. Reason: The account-level service limit 'ml.p2.xlarge for endpoint usage' is 1 Instance, with current utilization of 0 Instances and a request delta of 2 Instances. Please use AWS Service Quotas to request an increase for this quota."
이 문제를 해결하려면 인스턴스 유형의 서비스 할당량을 확인합니다. 할당량에 도달한 경우에는 서비스 할당량 증가를 요청합니다.
규모 조정이 예상보다 오래 걸림
스케일링 아웃 프로세스가 길고 휴지 기간이 짧으면 규모 조정을 활성화하기 전에 Amazon CloudWatch 경보가 여러 데이터 포인트를 집계하는 중일 수 있습니다. 이 문제를 해결하려면 경보를 알릴 데이터 포인트 Amazon CloudWatch 경보 설정을 줄이십시오.
또한 다른 규모 조정 정책이나 서비스 할당량으로 인해 규모 조정 프로세스가 예상보다 오래 걸릴 수 있습니다. 따라서 구성 및 서비스 할당량을 확인하여 문제를 파악하십시오.
오토 스케일링 정책이 예상대로 인스턴스를 스케일 다운하지 않음
오토 스케일링 정책이 예상대로 인스턴스를 스케일 다운하지 않고 트래픽이 적은 경우 다음 조치를 취하십시오.
- 정책에 맞는 올바른 지표를 구성합니다. 비동기 엔드포인트의 경우 ApproximateBacklogSizePerInstance 지표를 사용하십시오. 실시간 엔드포인트의 경우 InvocationsPerInstance 지표를 사용하십시오.
- 오토 스케일링의 응답성을 높이려면 조정 임계값, 휴지 기간 및 기타 워크로드 관련 파라미터를 조정합니다.
- CPU 사용률 지표를 기반으로 정책이 규모 조정되는지 확인합니다. CPU 사용률 지표를 기반으로 규모가 조정되는 정책은 트래픽이 감소해도 스케일 다운되지 않을 수 있습니다.
- 규모 조정 정책에서 워밍업 시간을 설정하는 경우 인스턴스가 얼마나 빠르게 트래픽 변경을 관리하는지에 따라 정책을 조정합니다. 워밍업 중인 인스턴스는 규모 조정을 위해 집계된 지표에 포함되지 않습니다.
특정 조건에서는 오토 스케일링이 활성화되지 않음
다음과 같은 조건에서는 오토 스케일링이 활성화되지 않습니다.
- 선택한 가용 영역에서 인스턴스 유형을 사용할 수 없습니다.
- 선택한 인스턴스 유형의 용량이 부족합니다.
- 규모 조정 정책이 올바르게 구성되지 않았습니다.
오토 스케일링 실패 문제를 해결하려면 다음 조치를 취하십시오.
관련 정보
서비스 할당량이란 무엇입니까?
Amazon SageMaker AI 모델의 오토 스케일링
Amazon CloudWatch로 Amazon SageMaker AI를 모니터링하기 위한 지표
비동기식 추론