Wie behebe ich Probleme mit dem SageMaker-KI-Multimodell-Enpunkt?
Ich möchte Probleme beheben, die auftreten, wenn ich einen Amazon SageMaker-KI-Multimodell-Endpunkt bereitstelle.
Lösung
Kaltstarts oder Latenzprobleme, die dazu führen, dass ein Endpunkt länger braucht, um Vorhersagen zu treffen, können die Leistung des Multimodell-Enpunkts beeinträchtigen. Interne Serverausnahmen können sich ebenfalls auf die Leistung auswirken.
Kaltstarts und Latenzprobleme
Wenn ein Multimodell-Endpunkt Modelle in schneller Folge aufruft, entfernt SageMaker AI die Modelle aus dem Speicher und der Festplatte des Endpunkts. Ein Kaltstart erfolgt, wenn das Modell beim nächsten Aufrufen des Modells durch den Endpunkt in den Speicherendpunkt der Instance geladen wird.
Gehe wie folgt vor, um Kaltstart- oder Latenzprobleme zu vermeiden:
-
Wenn das Modell zeitabhängig ist, verwenden Echtzeit-Inferenz mit einem einzelnen Modell.
-
Wenn das Modell nicht zeitkritisch ist, wähle einen Instance-Typ aus, der über genügend Speicher verfügt, um viele Modelle im Speicher aufzunehmen, z. B. eine R5-Instance. Oder implementiere eine automatische Skalierung, die auf der Grundlage des MemoryUtilization skaliert wird.
Beispiel:response = client.put_scaling_policy( PolicyName='MemoryUtilisation-ScalingPolicy', ServiceNamespace='sagemaker', ResourceId=resource_id, ScalableDimension='sagemaker:variant:DesiredInstanceCount', PolicyType='TargetTrackingScaling', TargetTrackingScalingPolicyConfiguration={ 'TargetValue': 80.0, 'CustomizedMetricSpecification': { 'MetricName': 'MemoryUtilization', 'Namespace': '/aws/sagemaker/Endpoints', 'Dimensions': [ {'Name': 'EndpointName', 'Value': endpoint_name }, {'Name': 'VariantName','Value': 'AllTraffic'} ], 'Statistic': 'Average', 'Unit': 'Percent' }, 'ScaleInCooldown': 600, 'ScaleOutCooldown': 300 } ) -
Bevor du die Endpunktkonfiguration bereitstellst, stelle sicher, dass du eine VolumeSizeInGB-Größe angeben, die groß genug ist, um alle Modelle aufzunehmen, auf die häufig zugegriffen wird.
-
Sende Testanforderungen an das Zielmodell, sodass einige Modelle für unbegrenzte Zeit im Speicher des Endpunkts verbleiben.
-
Um die Leistung von Multimodell-Endpunkten zu optimieren, empfiehlt es sich, Modellartefakte mit vergleichbarer Effizienz und Latenzzeiten auszuwählen. Um die Gesamtwirksamkeit und Zuverlässigkeit des Systems zu maximieren, solltest du den Datenverkehr gleichmäßig auf die Modelle verteilen.
-
Überwache wichtige Amazon CloudWatch-Metriken wie ** ModelCacheHit** und ModelLoadingWaitTime, um eine optimale Endpunktleistung zu erzielen. Wenn die ModelCacheHit-Rate hoch und die ModelLoadingWaitTime-Rate niedrig ist, verwaltet der Endpunkt Aufrufe wirksam.
Interne Serverausnahmen
Wenn ein Endpunkt mit mehreren Modellen aufgrund unzureichenden Speichers keine Modelle laden kann, tritt möglicherweise eine interne Serverausnahme auf. Wenn du beispielsweise ein 14-GB-Modell auf einer ml.t3.medium-Instance mit nur 4 GB CPU-Speicher bereitstellen, erhältst du eine Fehlermeldung. Um Fehler zu vermeiden, wähle Endpunkt-Instances mit ausreichend Arbeitsspeicher aus, um während der Laufzeit mehrere Modelle aufzunehmen.
- Themen
- Machine Learning & AI
- Tags
- Amazon SageMaker
- Sprache
- Deutsch

Relevanter Inhalt
AWS OFFICIALAktualisiert vor 2 Jahren