Sparkの導入

公開日: 2026-07-28 12:57 更新日: 2026-07-28 12:58 680文字 4 min read ... ページビュー

この記事では、Sparkのダウンロード、解凍環境ファイルの構成、構成の配布、クラスタの起動、SparkをYARNに適応させる手順など、Sparkクラスタのデプロイメントプロセスについて詳しく説明します。spark-env.shとyarn-site.xml設定ファイルを変更し、YARNサービスをノードに配布して再起動することで、最終的にSparkとYARNの連携を実現し、検証が成功した後、ブラウザからSpark UIインターフェイスにアクセスできます。

Sparkクラスタの導入

Sparkのインストールと設定

Sparkインストールパッケージのダウンロード

wget -P /export/software/ https://repo.huaweicloud.com/apache/spark/spark-3.4.3/spark-3.4.3-bin-hadoop3.tgz

Sparkインストールパッケージの解凍

tar -zxvf /export/software/spark-3.4.3-bin-hadoop3.tgz -C /export/servers
# 重命名:
cd /export/servers
mv /export/servers/spark-3.4.3-bin-hadoop3 /export/servers/spark

プロファイルの変更

spark/confディレクトリに移動してSparkの構成ファイルspark-env.shを変更し、spark-env.sh.template構成テンプレートファイルをコピーしてspark-env.shという名前を付けます。

cd /export/servers/spark/conf
sudo cp /export/servers/spark/conf/spark-env.sh.template /export/servers/spark/conf/spark-env.sh

spark-env.shファイルの変更

sudo vim /export/servers/spark/conf/spark-env.sh

このファイルに次の内容を追加します

#配置java环境变量
export JAVA_HOME=/export/servers/jdk
#指定Master的IP
export SPARK_MASTER_HOST=hadoop01
#指定Master的端口
export SPARK_MASTER_PORT=7077
export SPARK_MASTER_WEBUI_PORT=8082

workers.templateファイルをコピーし、名前をworkersに変更

sudo cp /export/servers/spark/conf/workers.template /export/servers/spark/conf/workers

workersプロファイルの編集

sudo vim /export/servers/spark/conf/workers
hadoop01
hadoop02
hadoop03

資料の配布

scp -r /export/servers/spark/ hadoop02:/tmp/
scp -r /export/servers/spark/ hadoop03:/tmp/

hadoop02へのアクセス

sudo cp -r /tmp/spark /export/servers
rm -r /tmp/spark

hadoop03へのアクセス

sudo cp -r /tmp/spark /export/servers
rm -r /tmp/spark

Sparkクラスタの起動

権限を個別に追加

cd /export/servers
sudo chown -R hadooper:hadooper /export/servers/spark/

Sparkを起動する

hadoop01:

cd /export/servers/spark/sbin/
/export/servers/spark/sbin/start-master.sh

hadoop02,hadoop03:

cd /export/servers/spark/sbin/
/export/servers/spark/sbin/start-slave.sh spark://hadoop01:7077

Hadoop02とHadoop03の起動時に問題がある場合は、まずホスト名が正しいかどうかを確認します。そうでない場合は、ネットワーク上のチュートリアルに従って変更してください。

入力$SPARK_HOME/sbin/start-all.sh起動上記の手順も起動であり、サーバごとに段階的に起動し、この起動命令は一括起動である、以下のように、成功、さらに検証を開くネイティブブラウザを入力(hadoop01的IP地址):8082インタフェースが正常に開いていれば成功を表す

! [] httr2.hoshi.z_img/画像 31.png

! [] httr2.hoshi.z_img/画像 32.png

SparkをYARNに適応させる

YARNを認識するためのSparkの設定

構成ディレクトリへの移動/export/servers/spark/conf spark-env.shファイルの変更

cd /export/servers/spark/conf
sudo vim /export/servers/spark/conf/spark-env.sh

次の内容を追加

# 设置Hadoop配置文件目录(请根据你的实际路径修改)
export HADOOP_CONF_DIR=/export/servers/hadoop/etc/hadoop

次の内容をコメントアウト#でコメントします。

export SPARK_MASTER_HOST=hadoop01
export SPARK_MASTER_PORT=7077
export SPARK_MASTER_WEBUI_PORT=8082

YARNの構成を調整

構成ディレクトリへの移動

cd /export/servers/hadoop/etc/hadoop

yarn-site.xmlファイルの変更

sudo vim /export/servers/hadoop/etc/hadoop/yarn-site.xml

次のように追加しますインデントはファイル内の他のコンテンツと一致するように注意してください

  <property>
        <name>yarn.nodemanager.pmem-check-enabled</name>
        <value>false</value>
    </property>
    <property>
        <name>yarn.nodemanager.vmem-check-enabled</name>
    <value>false</value>
    </property>

資料の配布

hadoop01:

scp -r /export/servers/hadoop/etc/hadoop hadoop02:/tmp/

hadoop02:

sudo rm -rf /export/servers/hadoop/etc/hadoop
sudo cp -r /tmp/hadoop /export/servers/hadoop/etc/hadoop
rm -r /tmp/hadoop

hadoop01:

scp -r /export/servers/hadoop/etc/hadoop hadoop03:/tmp/

hadoop03:

sudo rm -rf /export/servers/hadoop/etc/hadoop
sudo cp -r /tmp/hadoop /export/servers/hadoop/etc/hadoop
rm -r /tmp/hadoop

配布完了後、各ノードはYARNクラスタを再起動する必要がある 最初にsource /etc/profileロード構成を入力します。 /export/servers/spark/sbinカタログへのアクセス

cd /export/servers/spark/sbin

yarnを再起動

/export/servers/spark/sbin/stop-yarn.sh
/export/servers/spark/sbin/start-yarn.sh

気に入ったならばコメントを残してくださいね~

... ページビュー
© 2026 跨越星轨的客 @Hoshiumi
Powered by theme astro-koharu · Inspired by Shoka