如何验证 SageMaker Spot 训练中的检查点是否有效?

0

【以下的问题经过翻译处理】 您好,

在启动 SageMaker Spot Training 作业之前,我们如何知道 checkpoint 是否有效?有没有办法可以强制定期将 checkpoint 保存到 s3,而不是等待 SIGTERM 信号?

谢谢

profile picture
전문가
질문됨 8달 전36회 조회
1개 답변
0

【以下的回答经过翻译处理】 Olivier 您好,

如果启用 SageMaker 检查点,它会定期将训练产物的副本保存到 S3 中。我在 pytorch 中使用过这个功能,它通过定期检查点来工作,Managed Spot Training: Save Up to 90% On Your Amazon SageMaker Training Jobs 博客也提到了同样的方法。

为了避免在训练作业中断时需要从头开始,我们强烈建议您启用检查点,定期保存正在训练中的模型。

profile picture
전문가
답변함 8달 전

로그인하지 않았습니다. 로그인해야 답변을 게시할 수 있습니다.

좋은 답변은 질문에 명확하게 답하고 건설적인 피드백을 제공하며 질문자의 전문적인 성장을 장려합니다.

질문 답변하기에 대한 가이드라인