Salta al contenuto

Perché la mia istanza database Amazon RDS è stata riavviata, ripristinata o ha eseguito il failover?

8 minuti di lettura
0

Desidero conoscere la causa principale del riavvio, del ripristino o del failover della mia istanza database Amazon Relational Database Service (Amazon RDS).

Breve descrizione

L'istanza database Amazon RDS esegue automaticamente un riavvio nelle seguenti condizioni:

Quando l'istanza database mostra potenziali problemi e non risponde ai controlli dell'integrità di Amazon RDS, Amazon RDS intraprende automaticamente una delle seguenti azioni:

  • Per una singola implementazione AZ, Amazon RDS avvia un ripristino Single-AZ.
  • Per un'implentazione Multi-AZ, Amazon RDS avvia un failover Multi-AZ per l'implementazione Multi-AZ.

Quindi Amazon RDS riavvia l'istanza database in modo da poter riprendere le operazioni del database il più rapidamente possibile senza interventi amministrativi.

Risoluzione

Per identificare la causa dell'interruzione, controlla i seguenti log e metriche per l'istanza database. Inoltre, assicurati di seguire le best practice.

Messaggi di eventi di Amazon RDS

Per identificare la causa principale di un'interruzione non pianificata nell'istanza, visualizza tutti gli eventi di Amazon RDS delle ultime 24 ore. Per impostazione predefinita, Amazon RDS registra tutti gli eventi nell'ora UTC/GMT. Per archiviare gli eventi per un periodo di tempo maggiore, invia gli eventi di Amazon RDS ad Amazon CloudWatch Events. Al riavvio dell'istanza, viene visualizzato uno dei seguenti messaggi nelle notifiche degli eventi di Amazon RDS.

L'istanza RDS è stata modificata dal cliente

Questo messaggio di evento di RDS indica che il failover è stato avviato da una modifica dell'istanza RDS.

Applicazione della modifica alla classe di istanza del database

Questo messaggio di evento di RDS indica che il tipo di classe dell'istanza database viene modificato in base al tipo di implementazione:

  • Le implementazioni Single-AZ non sono disponibili per alcuni minuti durante questa operazione di dimensionamento.
  • Le implementazioni Multi-AZ non sono disponibili durante il tempo necessario al failover dell'istanza. Questa durata è in genere di circa 60 secondi. Il ritardo si verifica perché il database in standby viene aggiornato prima che il database ridimensionato subisca un failover. Dopodiché, il database si riavvia e il motore esegue il ripristino per assicurarsi che il database rimanga in uno stato coerente.

L'utente ha richiesto un failover dell'istanza database

Questo messaggio indica che un utente ha utilizzato l'opzione Reboot (Riavvio) o Reboot with failover (Riavvio con failover) per avviare un riavvio manuale dell'istanza database.

L'host primario dell'istanza Multi-AZ RDS non è integro
Questo motivo indica che un problema hardware sottostante transitorio ha portato alla perdita di comunicazione con l'istanza primaria. Il problema potrebbe rendere l'istanza non integra perché il sistema di monitoraggio di RDS non è in grado di comunicare con l'istanza RDS per eseguire i controlli dell'integrità.

L'host primario dell'istanza Multi-AZ RDS non è raggiungibile a causa della perdita di connettività di rete

Questo motivo indica che un problema di rete transitorio che ha interessato l'host primario dell'implementazione Multi-AZ ha causato il failover Multi-AZ e il riavvio dell'istanza database. Il sistema di monitoraggio interno ha rilevato il problema e ha avviato un failover.

L'istanza primaria Multi-AZ RDS è occupata e non risponde, l'attivazione dell'istanza Multi-AZ è iniziata o l'attivazione dell'istanza Multi-AZ è stata completata

Il log degli eventi mostra questi messaggi nelle seguenti situazioni:

  • L'istanza database primaria non risponde.
  • Una riduzione della memoria dovuta a un consumo eccessivo di memoria nel database ha impedito al sistema di monitoraggio di Amazon RDS di contattare l'host sottostante. Come misura proattiva, il sistema di monitoraggio riavvia il database.
  • L'istanza database ha riscontrato problemi di rete intermittenti con l'host sottostante.
  • L'istanza ha subito un caricamento del database. In questo caso, potresti notare picchi nelle metriche di CloudWatch CPUUtilization, DatabaseConnections, IOPS metrics e Throughput details. Potresti anche notare l'esaurimento di Freeablememory.

Istanza database con patch

Questo messaggio indica che l'istanza database è stata sottoposta a un aggiornamento di versione minore durante una finestra di manutenzione. Il messaggio viene visualizzato perché per l'istanza è attivata l'impostazione Aggiornamento a una versione secondaria automatico.

Metriche di CloudWatch

Per verificare se un problema di caricamento del database ha causato l'interruzione, consulta le metriche di CloudWatch per l'istanza Amazon RDS. I picchi nelle seguenti metriche chiave potrebbero indicare un problema nella disponibilità e nello stato di integrità dell'istanza RDS:

  • DatabaseConnections
  • CPUUtilization
  • FreeableMemory
  • WriteIOPS
  • ReadIOPS
  • ReadThroughput
  • WriteThroughput
  • DiskQueueDepth

Monitoraggio avanzato

Amazon RDS fornisce le metriche di Monitoraggio avanzato nell'account Amazon CloudWatch Logs. Questa funzionalità fornisce metriche in tempo reale per il sistema operativo su cui viene eseguita l'istanza database. Puoi visualizzare tutte le metriche di sistema e le informazioni di processo per le istanze database sulla console.

Database insights

La Dashboard di CloudWatch Database Insights contiene informazioni relative alle prestazioni del database che puoi utilizzare per analizzare e risolvere i problemi di prestazioni. Utilizza la Dashboard di Database Insights per analizzare le statistiche relative a una query. È consigliabile utilizzare le informazioni contenute nella dashboard per ottimizzare le prestazioni della query e il carico di lavoro. Per ulteriori informazioni, consulta Visualizzazione della Dashboard delle istanze database di CloudWatch Database Insights.

Nota: per ridurre i problemi, è consigliabile collaborare con l'amministratore del database per apportare queste modifiche.

Log del database RDS

Per risolvere la causa dell'interruzione dell'istanza database, puoi utilizzare la console Amazon RDS o le operazioni API di Amazon RDS per visualizzare, scaricare o monitorare i file di log del database. Puoi inoltre eseguire query sui file di log del database caricati nelle tabelle del database. Per ulteriori informazioni, consulta Monitoraggio dei file di log di Amazon RDS.

Tieni a mente le seguenti best practice quando gestisci le interruzioni delle istanze RDS:

Informazioni correlate

Quali fattori influiscono sui tempi di inattività o sulle prestazioni del mio database in Amazon RDS?

Perché la mia istanza database Amazon RDS è fallita?

Come posso ridurre al minimo i tempi di inattività durante la manutenzione di Amazon RDS?

Come posso controllare le query in esecuzione e diagnosticare i problemi di consumo di risorse della mia istanza database Amazon RDS per PostgreSQL o Aurora PostgreSQL?

AWS UFFICIALEAggiornata 6 mesi fa