Amazon SageMaker AI エンドポイントでの、自動スケーリングに関する問題をトラブルシューティングしたいです。
解決策
注: AWS コマンドラインインターフェイス (AWS CLI) コマンドの実行中にエラーが発生した場合は、「AWS CLI で発生したエラーのトラブルシューティング」を参照してください。また、AWS CLI の最新バージョンを使用していることを確認してください。
発生している問題に基づいて、SageMaker AI エンドポイントの自動スケーリングをトラブルシューティングします。
リソースの制限超過エラー
SageMaker AI エンドポイントのスケーリング時にサービスクォータに達した場合、次のようなエラーメッセージが表示されます。
"必要なインスタンス数を 2 に設定できませんでした。理由: アカウントレベルのサービス制限 (ml.p2.xlarge のエンドポイント使用数) は 1 インスタンスです。現在の使用数は 0 インスタンスであり、リクエストの差分は 2 インスタンスです。AWS Service Quotas を使用して、このクォータの増加をリクエストしてください。"
この問題を解決するために、お使いのインスタンスタイプのサービスクォータを確認してください。クォータに達している場合は、サービスクォータの増加をリクエストしてください。
スケーリングに想定よりも時間がかかる
スケールアウトプロセスが長くかかっており、クールダウン期間が短い場合、スケーリングを有効にする前に Amazon CloudWatch アラームが複数のデータポイントを集約している可能性があります。この問題を解決するには、Amazon CloudWatch アラームの設定で [アラーム対象のデータポイント] を減らします。
スケーリングプロセスが予想以上に時間がかかる原因は、他のスケーリングポリシーやサービスクォータである可能性もあります。問題を特定するために、構成とサービスクォータを確認してください。
自動スケーリングポリシーがインスタンスを想定どおりにスケールダウンしない
自動スケーリングポリシーでインスタンスが期待どおりにスケールダウンされず、トラフィックが少ない場合は、次の手順を実行します。
- ポリシーに適したメトリクスを設定します。非同期エンドポイントでは、ApproximateBacklogSizePerInstance メトリクスを使用します。リアルタイムエンドポイントでは、InvocationsPerInstance メトリクスを使用します。
- 自動スケーリングの応答性を高めるには、スケーリングのしきい値、クールダウン期間、その他のワークロード関連のパラメータを調整します。
- ポリシーが CPU 使用率のメトリクスに基づいてスケーリングされているかどうかを確認します。CPU 使用率のメトリクスに基づいてスケーリングするポリシーは、トラフィックが減少してもスケールダウンしない場合があります。
- スケーリングポリシーでウォームアップ時間を設定する場合は、インスタンスがトラフィックの変化を管理する速度に合わせてポリシーを調整してください。ウォーミングアップ中のインスタンスは、スケーリングの集計メトリクスにはカウントされません。
特定の条件で自動スケーリングが有効にならない
次の条件では、自動スケーリングが有効になりません。
- 選択したアベイラビリティーゾーンではインスタンスタイプを使用できない。
- 選択したインスタンスタイプで容量が不足している。
- スケーリングポリシーが正しく設定されていない。
Auto Scaling の問題を解決するには、次の手順を実行します。
関連情報
Service Quotas とは
Amazon SageMaker AI モデルの自動スケーリング
Amazon CloudWatch での、Amazon SageMaker AI 監視用のメトリクス
非同期推論