How to add additional library i.e. databricks spark xml to a running EMR cluster and access it in Notebook

0

How to add additional library i.e. databricks spark xml to a running EMR cluster and access it in Notebook

Rajeev
質問済み 5ヶ月前207ビュー
1回答
0

Hi,

You can try the below steps to install databricks spark xml on EMR cluster.

On EMR Master node:

cd /usr/lib/spark/jars
sudo wget https://repo1.maven.org/maven2/com/databricks/spark-xml_2.11/0.9.0/spark-xml_2.11-0.9.0.jar

Make sure to select the correct jar according to your Spark version and the guidelines provided in https://github.com/databricks/spark-xml.

Then, launch your Jupyter notebook and you should be able to run the following:

df = spark.read.format('com.databricks.spark.xml').options(rootTag='objects').options(rowTag='object').load("s3://bucket-name/sample.xml")

Please feel free to reach to AWS support for any further assistance needed on the same.

Thank you!

AWS
サポートエンジニア
回答済み 5ヶ月前

ログインしていません。 ログイン 回答を投稿する。

優れた回答とは、質問に明確に答え、建設的なフィードバックを提供し、質問者の専門分野におけるスキルの向上を促すものです。

質問に答えるためのガイドライン

関連するコンテンツ