내용으로 건너뛰기

AWS Glue Data Quality 규칙을 생성하고 성능을 최적화하려면 어떻게 해야 합니까?

2분 분량
0

새 AWS Glue Data Quality 규칙을 생성하고 성능을 최적화하려고 합니다.

해결 방법

AWS Glue Data Quality 규칙을 구현하고 규칙 세트 생성

규칙 권장 사항 또는 Data Quality Definition Language(DQDL)를 사용하여 규칙을 만들고 정의하십시오. 그런 다음, 규칙 세트를 생성하여 규칙을 그룹화하십시오.

AWS Glue Data Quality 규칙 최적화

데이터 파이프라인을 분석하여 규칙 실행 시간, 리소스 사용률, 실패율 등과 같은 성능 지표를 수집하십시오. 자세한 내용은 추출, 전환, 적재(ETL) 파이프라인에 대한 AWS Glue Data Quality의 성능 측정을 참조하십시오.

AWS Glue Data Quality 규칙의 성능을 모니터링하는 것이 좋습니다. Amazon CloudWatch를 사용하여 AWS Glue Data Quality 경보 및 알림을 설정하십시오.

성능 지표를 검토하여 비효율성과 잠재적 병목 지점을 파악한 후 다음 작업을 수행하십시오.

  • 규칙을 단순화합니다.
  • 데이터 형식을 최적화합니다.
  • 데이터를 파티셔닝합니다.
  • 규칙을 예약합니다.

AWS Glue Data Quality 규칙을 최적화하는 방법에 대한 자세한 내용은 모범 사례를 참조하십시오.

규칙 단순화

더 많은 처리 능력이 필요할 수 있는 복잡한 규칙을 단순화하는 것이 좋습니다. 다음 단계를 완료하십시오.

  1. 기존 AWS Glue Data Quality 규칙을 검토한 후 조인, 집계 또는 여러 단계가 포함된 규칙을 기록해 둡니다.
  2. 규칙을 특정 데이터 품질 검사를 처리하는 더 작은 규칙으로 분할합니다.
  3. 단순화된 규칙을 구현한 다음, 성능을 이전 규칙과 비교합니다.

데이터 형식 최적화

데이터세트의 데이터 형식을 확인한 다음, 데이터를 Parquet과 같은 보다 효율적인 형식으로 변환하십시오. 데이터 파이프라인 또는 처리 로직을 필요에 따라 변경해야 합니다. 자세한 내용은 파일 형식 및 데이터 압축을 참조하십시오.

데이터 파티셔닝

병렬 처리를 허용하려면 열로 데이터를 분할합니다.

다음 단계를 완료하십시오.

  1. 구조 및 액세스 데이터 패턴을 분석하여 날짜, 위치 또는 제품 등과 같은 파티셔닝 기준을 파악합니다.
  2. 데이터 수집을 수정하여 파악된 기준에 따라 데이터를 열로 분할합니다.
  3. 분할된 데이터 구조를 사용하도록 AWS Glue Data Quality 규칙을 업데이트합니다.

자세한 내용은 AWS Glue에서 분할된 데이터 사용을 참조하십시오.

규칙 예약

중요도, 영향 및 리소스 요구 사항을 기준으로 우선 순위를 정하도록 데이터 품질 규칙을 예약하십시오.

관련 정보

AWS Glue Data Quality 규칙 관련 문제를 해결하려면 어떻게 해야 합니까?

AWS 공식업데이트됨 2년 전