Ir para o conteúdo

Por que minha instância de banco de dados do Amazon RDS foi reinicializada, recuperada ou sofreu failover?

9 minuto de leitura
0

Quero saber a causa raiz da reinicialização, recuperação ou failover da minha instância de banco de dados do Amazon Relational Database Service (Amazon RDS).

Breve descrição

A instância de banco de dados do Amazon RDS reinicia automaticamente nas seguintes condições:

Quando a instância de banco de dados mostra possíveis problemas e não responde às verificações de integridade do Amazon RDS, o Amazon RDS executa automaticamente uma das seguintes ações:

  • Para uma implantação Single-AZ, o Amazon RDS inicia uma recuperação Single-AZ.
  • Para uma implantação Multi-AZ, o Amazon RDS inicia um failover Multi-AZ para a implantação Multi-AZ.

Em seguida, o Amazon RDS reinicia a instância de banco de dados para que você possa retomar as operações do banco de dados o mais rápido possível sem intervenção administrativa.

Resolução

Para identificar a causa da interrupção, verifique os seguintes logs e métricas para sua instância de banco de dados. Além disso, certifique-se de seguir as práticas recomendadas.

Mensagens de eventos do Amazon RDS

Para identificar a causa raiz de uma interrupção não planejada em sua instância, veja todos os eventos do Amazon RDS nas últimas 24 horas. Por padrão, o Amazon RDS registra todos os eventos no horário de UTC/GMT. Para armazenar eventos por um período mais longo, envie os eventos do Amazon RDS para o Amazon CloudWatch Events. Quando sua instância é reiniciada, você vê uma das seguintes mensagens nas notificações de eventos do Amazon RDS.

A instância do RDS foi modificada pelo cliente

Essa mensagem de evento do RDS indica que uma modificação na instância do RDS iniciou o failover.

Aplicação de modificações à classe da instância do banco de dados

Essa mensagem de evento do RDS indica que o tipo de classe da instância de banco de dados foi alterado com base no tipo de implantação:

  • As implantações Single-AZ ficam indisponíveis por alguns minutos durante uma operação de escalabilidade.
  • As implantações Multi-AZ ficam indisponíveis durante o tempo necessário para o failover da instância. Essa duração geralmente é de cerca de 60 segundos. Esse atraso ocorre porque o banco de dados em espera é atualizado antes que o banco de dados recém-dimensionado sofra um failover. Então, seu banco de dados é reiniciado e o mecanismo executa a recuperação para garantir que seu banco de dados permaneça em um estado consistente.

O usuário solicitou um failover da instância de banco de dados

Essa mensagem indica que um usuário usou a opção Reinicializar ou Reinicializar com failover para iniciar uma reinicialização manual da instância de banco de dados.

O host principal da instância Multi-AZ do RDS não está íntegro
Esse motivo indica que um problema transitório de hardware subjacente levou à perda de comunicação com a instância primária. Esse problema pode tornar a instância não íntegra porque o sistema de monitoramento do RDS não conseguiu se comunicar com a instância do RDS para realizar verificações de integridade.

O host principal da instância Multi-AZ do RDS está inacessível devido à perda de conectividade de rede

Esse motivo indica que um problema de rede transitório que afetou o host principal de sua implantação Multi-AZ causou o failover Multi-AZ e a reinicialização da instância do banco de dados. O sistema de monitoramento interno detectou esse problema e iniciou um failover.

A instância primária Multi-AZ do RDS está ocupada e não responde, a ativação da instância Multi-AZ foi iniciada ou a ativação da instância Multi-AZ foi concluída

O log de eventos mostra essas mensagens nas seguintes situações:

  • A instância de banco de dados primária não responde.
  • Uma falha de memória após o consumo excessivo de memória no banco de dados impediu que o sistema de monitoramento do Amazon RDS entrasse em contato com o host subjacente. Como medida proativa, o sistema de monitoramento reinicia o banco de dados.
  • A instância de banco de dados teve problemas intermitentes de rede com o host subjacente.
  • A instância sofreu uma carga no banco de dados. Nesse caso, você pode notar picos nas métricas CPUUtilization, DatabaseConnections, métricas de IOPS e detalhes de throughput do CloudWatch. Você também pode notar o esgotamento da Freeablememory.

Instância de banco de dados corrigida

Essa mensagem indica que a instância de banco de dados passou por uma pequena atualização de versão durante uma janela de manutenção. Essa mensagem ocorre porque a configuração de Atualização automática da versão secundária está ativada para a instância.

Métricas do CloudWatch

Para verificar se um problema de carregamento do banco de dados causou a interrupção, revise as métricas do CloudWatch para sua instância do Amazon RDS. Os picos nas métricas principais a seguir podem indicar um problema na disponibilidade e no status de integridade da sua instância do RDS:

  • DatabaseConnections
  • CPUUtilization
  • FreeableMemory
  • WriteIOPS
  • ReadIOPS
  • ReadThroughput
  • WriteThroughput
  • DiskQueueDepth

Monitoramento avançado

O Amazon RDS fornece métricas do Monitoramento avançado em sua conta do Amazon CloudWatch Logs. Esse recurso fornece métricas em tempo real para o sistema operacional em que sua instância de banco de dados é executada. Você pode visualizar todas as métricas do sistema e as informações do processo para suas instâncias de banco de dados no console.

Database Insights

O painel do CloudWatch Database Insights contém informações relacionadas ao desempenho do seu banco de dados que você pode usar para analisar e solucionar problemas de desempenho. Use o painel do Database Insights para analisar as estatísticas de uma consulta. É uma prática recomendada usar as informações desse painel para ajustar o desempenho da consulta e otimizar seu workload. Para obter mais informações, consulte Visualizar o painel da instância de banco de dados do CloudWatch Database Insights.

Observação: para reduzir os problemas, é uma prática recomendada trabalhar com o administrador do banco de dados para fazer essas alterações.

Logs do banco de dados do RDS

Para solucionar a causa da interrupção da sua instância de banco de dados, você pode usar o console do Amazon Aurora e do RDS ou as operações da API do Amazon RDS para visualizar, baixar ou monitorar arquivos de log do banco de dados. Você também pode consultar os arquivos de log do banco de dados que são carregados nas tabelas do banco de dados. Para obter mais informações, consulte Monitorar arquivos de log do Amazon RDS.

Lembre-se das seguintes práticas recomendadas ao lidar com interrupções de instâncias do RDS:

Informações relacionadas

Quais fatores afetam meu tempo de inatividade ou desempenho do banco de dados no Amazon RDS?

Por que minha instância de banco de dados do Amazon RDS teve um failover?

Como minimizar o tempo de inatividade durante a manutenção necessária do Amazon RDS?

Como faço para verificar consultas em execução e diagnosticar problemas de consumo de recursos em minha instância de banco de dados do Amazon RDS para PostgreSQL ou do Aurora PostgreSQL?

AWS OFICIALAtualizada há 6 meses