Por que minha instância de banco de dados do Amazon RDS foi reinicializada, recuperada ou sofreu failover?
Quero saber a causa raiz da reinicialização, recuperação ou failover da minha instância de banco de dados do Amazon Relational Database Service (Amazon RDS).
Breve descrição
A instância de banco de dados do Amazon RDS reinicia automaticamente nas seguintes condições:
- Não há disponibilidade na zona de disponibilidade primária ou os gargalos de desempenho e a contenção de recursos causaram um workload excessivo.
- Há um problema de infraestrutura subjacente com a instância primária. Esse problema pode ser uma perda de conectividade de rede com a instância primária ou um problema de unidade de computação ou armazenamento na instância primária.
- O tipo de classe da instância de banco de dados é alterado como parte de uma atividade de escalabilidade vertical da instância de banco de dados.
- O host subjacente da instância de banco de dados está passando por patches no sistema operacional durante uma janela de manutenção específica. Para obter mais informações, consulte Manutenção de uma instância de banco de dados e Atualizar a versão de mecanismo de uma instância de banco de dados.
- Você usou a opção Reinicializar ou Reinicializar com failover para iniciar uma reinicialização manual da instância de banco de dados.
Quando a instância de banco de dados mostra possíveis problemas e não responde às verificações de integridade do Amazon RDS, o Amazon RDS executa automaticamente uma das seguintes ações:
- Para uma implantação Single-AZ, o Amazon RDS inicia uma recuperação Single-AZ.
- Para uma implantação Multi-AZ, o Amazon RDS inicia um failover Multi-AZ para a implantação Multi-AZ.
Em seguida, o Amazon RDS reinicia a instância de banco de dados para que você possa retomar as operações do banco de dados o mais rápido possível sem intervenção administrativa.
Resolução
Para identificar a causa da interrupção, verifique os seguintes logs e métricas para sua instância de banco de dados. Além disso, certifique-se de seguir as práticas recomendadas.
Mensagens de eventos do Amazon RDS
Para identificar a causa raiz de uma interrupção não planejada em sua instância, veja todos os eventos do Amazon RDS nas últimas 24 horas. Por padrão, o Amazon RDS registra todos os eventos no horário de UTC/GMT. Para armazenar eventos por um período mais longo, envie os eventos do Amazon RDS para o Amazon CloudWatch Events. Quando sua instância é reiniciada, você vê uma das seguintes mensagens nas notificações de eventos do Amazon RDS.
A instância do RDS foi modificada pelo cliente
Essa mensagem de evento do RDS indica que uma modificação na instância do RDS iniciou o failover.
Aplicação de modificações à classe da instância do banco de dados
Essa mensagem de evento do RDS indica que o tipo de classe da instância de banco de dados foi alterado com base no tipo de implantação:
- As implantações Single-AZ ficam indisponíveis por alguns minutos durante uma operação de escalabilidade.
- As implantações Multi-AZ ficam indisponíveis durante o tempo necessário para o failover da instância. Essa duração geralmente é de cerca de 60 segundos. Esse atraso ocorre porque o banco de dados em espera é atualizado antes que o banco de dados recém-dimensionado sofra um failover. Então, seu banco de dados é reiniciado e o mecanismo executa a recuperação para garantir que seu banco de dados permaneça em um estado consistente.
O usuário solicitou um failover da instância de banco de dados
Essa mensagem indica que um usuário usou a opção Reinicializar ou Reinicializar com failover para iniciar uma reinicialização manual da instância de banco de dados.
O host principal da instância Multi-AZ do RDS não está íntegro
Esse motivo indica que um problema transitório de hardware subjacente levou à perda de comunicação com a instância primária. Esse problema pode tornar a instância não íntegra porque o sistema de monitoramento do RDS não conseguiu se comunicar com a instância do RDS para realizar verificações de integridade.
O host principal da instância Multi-AZ do RDS está inacessível devido à perda de conectividade de rede
Esse motivo indica que um problema de rede transitório que afetou o host principal de sua implantação Multi-AZ causou o failover Multi-AZ e a reinicialização da instância do banco de dados. O sistema de monitoramento interno detectou esse problema e iniciou um failover.
A instância primária Multi-AZ do RDS está ocupada e não responde, a ativação da instância Multi-AZ foi iniciada ou a ativação da instância Multi-AZ foi concluída
O log de eventos mostra essas mensagens nas seguintes situações:
- A instância de banco de dados primária não responde.
- Uma falha de memória após o consumo excessivo de memória no banco de dados impediu que o sistema de monitoramento do Amazon RDS entrasse em contato com o host subjacente. Como medida proativa, o sistema de monitoramento reinicia o banco de dados.
- A instância de banco de dados teve problemas intermitentes de rede com o host subjacente.
- A instância sofreu uma carga no banco de dados. Nesse caso, você pode notar picos nas métricas CPUUtilization, DatabaseConnections, métricas de IOPS e detalhes de throughput do CloudWatch. Você também pode notar o esgotamento da Freeablememory.
Instância de banco de dados corrigida
Essa mensagem indica que a instância de banco de dados passou por uma pequena atualização de versão durante uma janela de manutenção. Essa mensagem ocorre porque a configuração de Atualização automática da versão secundária está ativada para a instância.
Métricas do CloudWatch
Para verificar se um problema de carregamento do banco de dados causou a interrupção, revise as métricas do CloudWatch para sua instância do Amazon RDS. Os picos nas métricas principais a seguir podem indicar um problema na disponibilidade e no status de integridade da sua instância do RDS:
- DatabaseConnections
- CPUUtilization
- FreeableMemory
- WriteIOPS
- ReadIOPS
- ReadThroughput
- WriteThroughput
- DiskQueueDepth
Monitoramento avançado
O Amazon RDS fornece métricas do Monitoramento avançado em sua conta do Amazon CloudWatch Logs. Esse recurso fornece métricas em tempo real para o sistema operacional em que sua instância de banco de dados é executada. Você pode visualizar todas as métricas do sistema e as informações do processo para suas instâncias de banco de dados no console.
Database Insights
O painel do CloudWatch Database Insights contém informações relacionadas ao desempenho do seu banco de dados que você pode usar para analisar e solucionar problemas de desempenho. Use o painel do Database Insights para analisar as estatísticas de uma consulta. É uma prática recomendada usar as informações desse painel para ajustar o desempenho da consulta e otimizar seu workload. Para obter mais informações, consulte Visualizar o painel da instância de banco de dados do CloudWatch Database Insights.
Observação: para reduzir os problemas, é uma prática recomendada trabalhar com o administrador do banco de dados para fazer essas alterações.
Logs do banco de dados do RDS
Para solucionar a causa da interrupção da sua instância de banco de dados, você pode usar o console do Amazon Aurora e do RDS ou as operações da API do Amazon RDS para visualizar, baixar ou monitorar arquivos de log do banco de dados. Você também pode consultar os arquivos de log do banco de dados que são carregados nas tabelas do banco de dados. Para obter mais informações, consulte Monitorar arquivos de log do Amazon RDS.
Lembre-se das seguintes práticas recomendadas ao lidar com interrupções de instâncias do RDS:
- Para reduzir o tempo de inatividade durante uma interrupção, ative a implantação Multi-AZ para sua instância.
- Ajuste a janela de manutenção da instância de banco de dados. Se o RDS precisar aplicar alterações no sistema, a instância de banco de dados ficará indisponível durante esse período apenas pelo tempo mínimo necessário para fazer as alterações necessárias. Se você não quiser que suas instâncias passem por atualizações automáticas de versões secundárias, desative essa opção.
- Aloque recursos suficientes ao seu banco de dados para executar consultas. Com o Amazon RDS, a quantidade de recursos alocados depende do tipo de instância. Além disso, consultas específicas, como procedimentos armazenados, podem consumir uma quantidade sem precedentes de memória. Se a instância for reiniciada com frequência devido à falta de recursos, aumente verticalmente a escala da sua classe de instância de banco de dados para acompanhar as demandas da sua aplicação.
- Para evitar o controle de utilização de instâncias, configure os alarmes do Amazon CloudWatch nas principais métricas do Amazon RDS que indicam a disponibilidade e o status de integridade de suas instâncias do RDS. Por exemplo, você pode definir um alarme do CloudWatch na métrica FreeableMemory para que você receba uma notificação quando a memória disponível atingir 95%. Para obter mais informações, consulte Como filtrar os logs do Monitoramento avançado do CloudWatch para gerar métricas personalizadas automatizadas para o Amazon RDS?
- Para que o Amazon RDS notifique você quando houver um failover em sua instância do RDS, inscreva-se para receber as notificações de eventos do Amazon RDS.
- Para otimizar o desempenho do banco de dados, certifique-se de que suas consultas estejam ajustadas adequadamente para PostgreSQL e MySQL. Caso contrário, você poderá enfrentar problemas de desempenho e tempos de espera prolongados.
- Para solucionar problemas de cargas em termos de escassez de CPU, memória ou outros recursos, consulte Como soluciono problemas de alta utilização da CPU para Amazon RDS para PostgreSQL ou instâncias compatíveis com o Amazon Aurora PostgreSQL?Verifique também Como soluciono problemas e resolvo a alta utilização da CPU em uma instância de banco de dados do Amazon RDS para MySQL ou compatíveis com MySQL do Amazon Aurora?
Informações relacionadas
Quais fatores afetam meu tempo de inatividade ou desempenho do banco de dados no Amazon RDS?
Por que minha instância de banco de dados do Amazon RDS teve um failover?
Como minimizar o tempo de inatividade durante a manutenção necessária do Amazon RDS?
- Tópicos
- Database
- Idioma
- Português

Conteúdo relevante
feita há um ano
- Resposta aceita
feita há 9 meses
feita há um ano