一、集群規(guī)劃
這里搭建一個 3 節(jié)點的 Hadoop 集群荆残,其中三臺主機均部署 DataNode
和 NodeManager
服務(wù),但只有 hadoop001 上部署 NameNode
和 ResourceManager
服務(wù)净当。
二内斯、前置條件
Hadoop 的運行依賴 JDK,需要預(yù)先安裝像啼。其安裝步驟單獨整理至:
三俘闯、配置免密登錄
3.1 生成密匙
在每臺主機上使用 ssh-keygen
命令生成公鑰私鑰對:
ssh-keygen
3.2 免密登錄
將 hadoop001
的公鑰寫到本機和遠程機器的 ~/ .ssh/authorized_key
文件中:
ssh-copy-id -i ~/.ssh/id_rsa.pub hadoop001
ssh-copy-id -i ~/.ssh/id_rsa.pub hadoop002
ssh-copy-id -i ~/.ssh/id_rsa.pub hadoop003
3.3 驗證免密登錄
ssh hadoop002
ssh hadoop003
四、集群搭建
3.1 下載并解壓
下載 Hadoop忽冻。這里我下載的是 CDH 版本 Hadoop真朗,下載地址為:http://archive.cloudera.com/cdh5/cdh/5/
# tar -zvxf hadoop-2.6.0-cdh5.15.2.tar.gz
3.2 配置環(huán)境變量
編輯 profile
文件:
# vim /etc/profile
增加如下配置:
export HADOOP_HOME=/usr/app/hadoop-2.6.0-cdh5.15.2
export PATH=${HADOOP_HOME}/bin:$PATH
執(zhí)行 source
命令,使得配置立即生效:
# source /etc/profile
3.3 修改配置
進入 ${HADOOP_HOME}/etc/hadoop
目錄下僧诚,修改配置文件遮婶。各個配置文件內(nèi)容如下:
1. hadoop-env.sh
# 指定JDK的安裝位置
export JAVA_HOME=/usr/java/jdk1.8.0_201/
2. core-site.xml
<configuration>
<property>
<!--指定 namenode 的 hdfs 協(xié)議文件系統(tǒng)的通信地址-->
<name>fs.defaultFS</name>
<value>hdfs://hadoop001:8020</value>
</property>
<property>
<!--指定 hadoop 集群存儲臨時文件的目錄-->
<name>hadoop.tmp.dir</name>
<value>/home/hadoop/tmp</value>
</property>
</configuration>
3. hdfs-site.xml
<property>
<!--namenode 節(jié)點數(shù)據(jù)(即元數(shù)據(jù))的存放位置,可以指定多個目錄實現(xiàn)容錯湖笨,多個目錄用逗號分隔-->
<name>dfs.namenode.name.dir</name>
<value>/home/hadoop/namenode/data</value>
</property>
<property>
<!--datanode 節(jié)點數(shù)據(jù)(即數(shù)據(jù)塊)的存放位置-->
<name>dfs.datanode.data.dir</name>
<value>/home/hadoop/datanode/data</value>
</property>
4. yarn-site.xml
<configuration>
<property>
<!--配置 NodeManager 上運行的附屬服務(wù)旗扑。需要配置成 mapreduce_shuffle 后才可以在 Yarn 上運行 MapReduce 程序。-->
<name>yarn.nodemanager.aux-services</name>
<value>mapreduce_shuffle</value>
</property>
<property>
<!--resourcemanager 的主機名-->
<name>yarn.resourcemanager.hostname</name>
<value>hadoop001</value>
</property>
</configuration>
5. mapred-site.xml
<configuration>
<property>
<!--指定 mapreduce 作業(yè)運行在 yarn 上-->
<name>mapreduce.framework.name</name>
<value>yarn</value>
</property>
</configuration>
5. slaves
配置所有從屬節(jié)點的主機名或 IP 地址赶么,每行一個肩豁。所有從屬節(jié)點上的 DataNode
服務(wù)和 NodeManager
服務(wù)都會被啟動。
hadoop001
hadoop002
hadoop003
3.4 分發(fā)程序
將 Hadoop 安裝包分發(fā)到其他兩臺服務(wù)器,分發(fā)后建議在這兩臺服務(wù)器上也配置一下 Hadoop 的環(huán)境變量清钥。
# 將安裝包分發(fā)到hadoop002
scp -r /usr/app/hadoop-2.6.0-cdh5.15.2/ hadoop002:/usr/app/
# 將安裝包分發(fā)到hadoop003
scp -r /usr/app/hadoop-2.6.0-cdh5.15.2/ hadoop003:/usr/app/
3.5 初始化
在 Hadoop001
上執(zhí)行 namenode 初始化命令:
hdfs namenode -format
3.6 啟動集群
進入到 Hadoop001
的 ${HADOOP_HOME}/sbin
目錄下琼锋,啟動 Hadoop。此時 hadoop002
和 hadoop003
上的相關(guān)服務(wù)也會被啟動:
# 啟動dfs服務(wù)
start-dfs.sh
# 啟動yarn服務(wù)
start-yarn.sh
3.7 查看集群
在每臺服務(wù)器上使用 jps
命令查看服務(wù)進程祟昭,或直接進入 Web-UI 界面進行查看缕坎,端口為 50070
〈畚颍可以看到此時有三個可用的 Datanode
:
<BR/>
點擊 Live Nodes
進入谜叹,可以看到每個 DataNode
的詳細情況:
<BR/>
接著可以查看 Yarn 的情況,端口號為 8088
:
五搬葬、提交服務(wù)到集群
提交作業(yè)到集群的方式和單機環(huán)境完全一致荷腊,這里以提交 Hadoop 內(nèi)置的計算 Pi 的示例程序為例,在任何一個節(jié)點上執(zhí)行都可以急凰,命令如下:
hadoop jar /usr/app/hadoop-2.6.0-cdh5.15.2/share/hadoop/mapreduce/hadoop-mapreduce-examples-2.6.0-cdh5.15.2.jar pi 3 3
更多大數(shù)據(jù)系列文章可以參見 GitHub 開源項目: 大數(shù)據(jù)入門指南