Salta al contenuto

Perché il mio processo ETL di AWS Glue rielabora i dati anche quando i segnalibri del processo sono attivati?

2 minuti di lettura
0

Ho attivato i segnalibri del processo per il mio processo AWS Glue, ma il processo continua a rielaborare i miei dati.

Risoluzione

Di seguito sono riportati i motivi comuni per cui un lavoro di estrazione, trasformazione e caricamento (ETL) rielabora i dati anche se sono stati attivati i segnalibri del processo:

  • Sono presenti più processi simultanei con segnalibri del processo e il numero massimo di simultaneità non è impostato su 1.

  • L'oggetto job.init() manca o non viene chiamato all'inizio dello script ETL di AWS Glue:

    job.init(args['JOB_NAME'], args)
  • L'oggetto job.commit () manca o non viene chiamato alla fine dello script:

    job.commit()
  • Il parametro transformation\ _ctx manca o non è univoco per ogni istanza dell'operatore ETL:

    datasource0 = glueContext.create_dynamic_frame.from_catalog(database = "db_name", table_name = "table_name", transformation_ctx = "datasource0")
  • Le chiavi primarie della tabella non sono in ordine sequenziale (solo connessioni JDBC).

  • I dati di origine sono stati modificati dopo l'ultima esecuzione del processo.

  • Il processo utilizza uno Spark DataFrame, ma la funzionalità di segnalibro del processo di AWS Glue non è supportata da Spark DataFrames.

Per ulteriori informazioni su questi problemi, consulta Error: A job is reprocessing data when job bookmarks are turned on (Errore: un processo rielabora i dati quando i segnalibri del processo sono attivati).

Informazioni correlate

Tracking processed data using job bookmarks

AWS UFFICIALEAggiornata 2 anni fa