跳至内容

为什么我的 AWS DMS 复制实例重启或失效转移?

1 分钟阅读
0

我想对我的 AWS Database Migration Service (AWS DMS) 复制实例的重启或失效转移进行故障排除。

简短描述

AWS DMS 复制实例会由于以下原因自动重启:

  • 主实例存在基础设施问题,例如网络连接中断、计算单元问题或存储问题。
  • 由于垂直扩缩活动,实例类类型发生了变化。
  • 在特定的维护时段内,实例的主机正在进行软件补丁更新。有关详细信息,请参阅使用复制引擎版本
  • 您使用 Reboot(重启)或 Reboot with planned failover(带计划失效转移的重启)选项来发起实例的手动重启

当复制实例遇到问题且无法响应 AWS DMS 运行状况检查时,AWS DMS 会自动启动恢复或失效转移。对于单可用区部署,AWS DMS 启动恢复。对于多可用区部署,AWS DMS 会启动失效转移。然后,AWS DMS 会重启复制实例,然后您才能手动恢复数据库迁移任务。

解决方法

查看 AWS DMS 事件以确定根本原因

要确定实例重启或失效转移的原因,请查看过去 24 小时的 AWS DMS 事件。打开 AWS DMS 控制台,然后选择 Events(事件)。

**注意:**默认情况下,AWS DMS 在 UTC 时区注册事件。

要长时间存储事件,请将 AWS DMS 事件发送到 Amazon EventBridge。有关详细信息,请参阅 Implement an automated approach for handling AWS DMS operational events(实施自动化方法来处理 AWS DMS 运营事件)

如果您看到事件消息 Replication instance patched,则说明复制实例进行了引擎版本升级。升级可以在实例修改后立即进行,也可以在计划维护时段内进行。

如果实例类类型发生变化,则您会看到事件消息 The replication instance class for this replication instance is being changedThe replication instance class for this replication instance has changed。在扩缩操作期间,单可用区部署在几分钟内不可用。在失效转移期间,多可用区部署不可用。失效转移通常需要 60 秒。在新大小的数据库发生失效转移之前,AWS DMS 会升级备用数据库。

由于以下原因,您可能会看到事件消息 Multi-AZ instance failover startedMulti-AZ instance failover completed

  • 主复制实例无响应。
  • 实例通过 Reboot(重启)或 Reboot with planned failover(带计划失效转移的重启)选项手动重启
  • 复制实例遇到底层主机的间歇性网络问题。

使用增强的监控控制面板监控 AWS DMS 指标

AWS DMS 将增强型监控控制面板中的指标传送到 Amazon CloudWatch Logs。查看复制实例日志,以了解性能、资源利用率和运行状况指标。

**注意:**AWS DMS 无服务器复制不支持增强监控。

启用多可用区部署以减少停机时间

要减少停机时间,请启用多可用区部署。在多可用区部署中,复制实例的备用副本可在不同的可用区中使用。有关详细信息,请参阅 AWS Database Migration Service 中的韧性

**注意:**对于使用 Amazon Simple Storage Service (Amazon S3) 作为目标的实例,AWS DMS 可能会将重复的记录写入您的 S3 存储桶。当您在重启或失效转移后恢复任务并且 TargetTablePrepMode 设置为 DO_NOTHING 时,就会发生这种情况。

相关信息

AWS Database Migration Service 的最佳实践

使用 AWS DMS 复制实例

AWS 官方已更新 1 年前