Ho attivato i segnalibri del processo per il mio processo AWS Glue, ma il processo continua a rielaborare i miei dati.
Risoluzione
Di seguito sono riportati i motivi comuni per cui un lavoro di estrazione, trasformazione e caricamento (ETL) rielabora i dati anche se sono stati attivati i segnalibri del processo:
-
Sono presenti più processi simultanei con segnalibri del processo e il numero massimo di simultaneità non è impostato su 1.
-
L'oggetto job.init() manca o non viene chiamato all'inizio dello script ETL di AWS Glue:
job.init(args['JOB_NAME'], args)
-
L'oggetto job.commit () manca o non viene chiamato alla fine dello script:
job.commit()
-
Il parametro transformation\ _ctx manca o non è univoco per ogni istanza dell'operatore ETL:
datasource0 = glueContext.create_dynamic_frame.from_catalog(database = "db_name", table_name = "table_name", transformation_ctx = "datasource0")
-
Le chiavi primarie della tabella non sono in ordine sequenziale (solo connessioni JDBC).
-
I dati di origine sono stati modificati dopo l'ultima esecuzione del processo.
-
Il processo utilizza uno Spark DataFrame, ma la funzionalità di segnalibro del processo di AWS Glue non è supportata da Spark DataFrames.
Per ulteriori informazioni su questi problemi, consulta Error: A job is reprocessing data when job bookmarks are turned on (Errore: un processo rielabora i dati quando i segnalibri del processo sono attivati).
Informazioni correlate
Tracking processed data using job bookmarks