Mis trabajos de AWS Glue y sus marcadores no se ejecutan correctamente ni procesan los datos necesarios.
Resolución
Configuración correcta del marcador
Al configurar el marcador, haga lo siguiente:
- Active la opción Activar marcador para el trabajo.
- Establezca el número máximo de ejecuciones simultáneas para el trabajo en 1.
Despliegue correcto del marcador
En su trabajo de extracción, transformación y carga (ETL), utilice la API DynamicFrame de AWS Glue para leer los datos del origen de datos.
Nota: No utilice la API DataFrame ni Apache Spark SQL para leer los datos del origen de datos. Estos métodos no admiten la característica de marcadores de trabajos de AWS Glue.
Incluya lo siguiente en el script:
`job.init(args['JOB_NAME'], args) `
`datasource0 = glueContext.create_dynamic_frame.from_catalog(database = "db_name",table_name = "table_name", transformation_ctx = "datasource0")`
`job.commit()`
Al crear DynamicFrame, debe agregar el parámetro transformation_ctx como identificador único para la instancia del operador ETL.
Nota: No cambie el parámetro transformation_ctx cuando actualice o modifique el script.
Solución de problemas con los marcadores de los orígenes de JDBC
Si tiene problemas con un marcador de un origen de conectividad de bases de datos Java (JDBC), haga lo siguiente:
- Si el script de AWS Glue no especifica columnas para usarlas como claves de marcadores, ordene la clave principal de la tabla en orden creciente o decreciente sin brechas.
- Si el script usa marcadores definidos por el usuario como claves, ordene las claves en orden creciente o decreciente. Puede incluir brechas.
- No utilice columnas con nombres que distingan mayúsculas y minúsculas como claves de marcadores.
Información relacionada
Tracking processed data using job bookmarks