Sparkクラスタの導入
Sparkのインストールと設定
Sparkインストールパッケージのダウンロード
wget -P /export/software/ https://repo.huaweicloud.com/apache/spark/spark-3.4.3/spark-3.4.3-bin-hadoop3.tgz
Sparkインストールパッケージの解凍
tar -zxvf /export/software/spark-3.4.3-bin-hadoop3.tgz -C /export/servers
# 重命名:
cd /export/servers
mv /export/servers/spark-3.4.3-bin-hadoop3 /export/servers/spark
プロファイルの変更
spark/confディレクトリに移動してSparkの構成ファイルspark-env.shを変更し、spark-env.sh.template構成テンプレートファイルをコピーしてspark-env.shという名前を付けます。
cd /export/servers/spark/conf
sudo cp /export/servers/spark/conf/spark-env.sh.template /export/servers/spark/conf/spark-env.sh
spark-env.shファイルの変更
sudo vim /export/servers/spark/conf/spark-env.sh
このファイルに次の内容を追加します
#配置java环境变量
export JAVA_HOME=/export/servers/jdk
#指定Master的IP
export SPARK_MASTER_HOST=hadoop01
#指定Master的端口
export SPARK_MASTER_PORT=7077
export SPARK_MASTER_WEBUI_PORT=8082
workers.templateファイルをコピーし、名前をworkersに変更
sudo cp /export/servers/spark/conf/workers.template /export/servers/spark/conf/workers
workersプロファイルの編集
sudo vim /export/servers/spark/conf/workers
hadoop01
hadoop02
hadoop03
資料の配布
scp -r /export/servers/spark/ hadoop02:/tmp/
scp -r /export/servers/spark/ hadoop03:/tmp/
hadoop02へのアクセス
sudo cp -r /tmp/spark /export/servers
rm -r /tmp/spark
hadoop03へのアクセス
sudo cp -r /tmp/spark /export/servers
rm -r /tmp/spark
Sparkクラスタの起動
権限を個別に追加
cd /export/servers
sudo chown -R hadooper:hadooper /export/servers/spark/
Sparkを起動する
hadoop01:
cd /export/servers/spark/sbin/
/export/servers/spark/sbin/start-master.sh
hadoop02,hadoop03:
cd /export/servers/spark/sbin/
/export/servers/spark/sbin/start-slave.sh spark://hadoop01:7077
Hadoop02とHadoop03の起動時に問題がある場合は、まずホスト名が正しいかどうかを確認します。そうでない場合は、ネットワーク上のチュートリアルに従って変更してください。
入力$SPARK_HOME/sbin/start-all.sh起動上記の手順も起動であり、サーバごとに段階的に起動し、この起動命令は一括起動である、以下のように、成功、さらに検証を開くネイティブブラウザを入力(hadoop01的IP地址):8082インタフェースが正常に開いていれば成功を表す
! [] httr2.hoshi.z_img/画像 31.png
! [] httr2.hoshi.z_img/画像 32.png
SparkをYARNに適応させる
YARNを認識するためのSparkの設定
構成ディレクトリへの移動/export/servers/spark/conf spark-env.shファイルの変更
cd /export/servers/spark/conf
sudo vim /export/servers/spark/conf/spark-env.sh
次の内容を追加
# 设置Hadoop配置文件目录(请根据你的实际路径修改)
export HADOOP_CONF_DIR=/export/servers/hadoop/etc/hadoop
次の内容をコメントアウト#でコメントします。
export SPARK_MASTER_HOST=hadoop01
export SPARK_MASTER_PORT=7077
export SPARK_MASTER_WEBUI_PORT=8082
YARNの構成を調整
構成ディレクトリへの移動
cd /export/servers/hadoop/etc/hadoop
yarn-site.xmlファイルの変更
sudo vim /export/servers/hadoop/etc/hadoop/yarn-site.xml
次のように追加しますインデントはファイル内の他のコンテンツと一致するように注意してください
<property>
<name>yarn.nodemanager.pmem-check-enabled</name>
<value>false</value>
</property>
<property>
<name>yarn.nodemanager.vmem-check-enabled</name>
<value>false</value>
</property>
資料の配布
hadoop01:
scp -r /export/servers/hadoop/etc/hadoop hadoop02:/tmp/
hadoop02:
sudo rm -rf /export/servers/hadoop/etc/hadoop
sudo cp -r /tmp/hadoop /export/servers/hadoop/etc/hadoop
rm -r /tmp/hadoop
hadoop01:
scp -r /export/servers/hadoop/etc/hadoop hadoop03:/tmp/
hadoop03:
sudo rm -rf /export/servers/hadoop/etc/hadoop
sudo cp -r /tmp/hadoop /export/servers/hadoop/etc/hadoop
rm -r /tmp/hadoop
配布完了後、各ノードはYARNクラスタを再起動する必要がある
最初にsource /etc/profileロード構成を入力します。
/export/servers/spark/sbinカタログへのアクセス
cd /export/servers/spark/sbin
yarnを再起動
/export/servers/spark/sbin/stop-yarn.sh
/export/servers/spark/sbin/start-yarn.sh
気に入ったならばコメントを残してくださいね~