Meine AWS Glue-Jobs und ihre Lesezeichen werden nicht erfolgreich ausgeführt oder verarbeiten die erforderlichen Daten nicht.
Lösung
Dein Lesezeichen richtig konfigurieren
Gehe beim Konfigurieren deines Lesezeichens wie folgt vor:
- Aktiviere die Option Lesezeichen aktivieren für den Job.
- Lege die maximale Anzahl gleichzeitiger Durchläufe für den Job auf 1 fest.
Dein Lesezeichen korrekt implementieren
Verwende in deinem Extract, Transform, Load (ETL)-Job die AWS Glue DynamicFrame API, um Daten aus der Datenquelle zu lesen.
Hinweis: Verwende nicht die DataFrame API oder Apache Spark SQL, um Daten aus der Datenquelle zu lesen. Diese Methoden unterstützen die Funktion „Job-Lesezeichen“ von AWS Glue nicht.
Nimm Folgendes in dein Skript auf:
`job.init(args['JOB_NAME'], args) `
`datasource0 = glueContext.create_dynamic_frame.from_catalog(database = "db_name",table_name = "table_name", transformation_ctx = "datasource0")`
`job.commit()`
Wenn du den DynamicFrame erstellst, musst du den Parameter transformation_ctx als eindeutige ID für die ETL-Operator-Instance hinzufügen.
Hinweis: Ändere den Parameter transformation_ctx nicht, wenn du das Skript aktualisierst oder änderst.
Probleme mit Lesezeichen für JDBC-Quellen beheben
Wenn du Probleme mit einem Lesezeichen zu einer Java Database Connectivity (JDBC)-Quelle hast, gehe wie folgt vor:
- Wenn dein AWS Glue-Skript keine Spalten angibt, die als Lesezeichenschlüssel verwendet werden sollen, sortiere den Primärschlüssel der Tabelle in aufsteigender oder absteigender Reihenfolge ohne Lücken.
- Wenn das Skript benutzerdefinierte Lesezeichen als Schlüssel verwendet, sortiere die Schlüssel in aufsteigender oder absteigender Reihenfolge. Du kannst Lücken einbeziehen.
- Verwende keine Spalten, bei denen zwischen Groß- und Kleinschreibung unterschieden wird, als Lesezeichenschlüssel.
Ähnliche Informationen
Verfolgung der verarbeiteter Daten mithilfe von Job-Bookmarks