4.4.1. # HADOOP环境搭建

平台使用hadoop的版本为2.8.5:hadoop-2.8.5.tar.gz

### 1. 将hadoop的安装包上传到/opt/software目录中

### 2. 将hadoop安装包解压到/opt/module目录下 进入/opt/software目录下,执行 tar -zxvf hadoop-2.8.5.tar.gz -C /opt/module

### 3. 将hadoop添加到环境变量

    (1)获取hadoop的安装路径
    [root@node01 hadoop-2.8.5]# cd /opt/module/hadoop-2.8.5/
[root@node01 hadoop-2.8.5]# pwd
/opt/module/hadoop-2.8.5
    (2)打开/etc/profile文件
    vim /etc/profile
    在profile文件末尾添加hadoop路径
#HADOOP_HOME
export HADOOP_HOME=/opt/module/Hadoop-2.8.5
export PATH=$PATH:$HADOOP_HOME/bin
(3)保存退出
(4)让修改的配置生效
    source  /etc/profile
    (5)分发配置信息
    scp -r /etc/profile root@bigdata.slave1:/etc/profile
scp -r /etc/profile root@bigdata.slave2:/etc/profile
    进入其他机器执行 source /etc/profile

### 4. 测试是否安装成功 执行 hadoop version

### 5. 集群配置

    修改hadoop的配置文件,配置文件路径为/opt/module/hadoop-2.8.5/etc/hadoop
(1)配置core-site.xml
vim core-site.xml
在该配置文件中添加如下配置根据实际情况配置主机名):
<!-- 指定HDFS中NameNode的地址 -->
<property>
        <name>fs.defaultFS</name>
    <value>hdfs://bigdata.master:9000</value>
</property>

<!-- 指定Hadoop运行时产生文件的存储目录 -->
<property>
        <name>hadoop.tmp.dir</name>
        <value>/opt/module/hadoop-2.8.5/data/tmp</value>
</property>

(2)配置hadoop-env.sh vim Hadoop-env.sh export JAVA_HOME=/opt/module/jdk1.8.0_181 # 配置hadoop服务线程的路径,默认在/tmp目录下 export HADOOP_PID_DIR=$HADOOP_HOME/app/pids

(3)配置hdfs-site.xml vim hdfs-site.xml 在该配置文件添加如下信息(根据实际情况配置主机名):

<property>
        <name>dfs.namenode.secondary.http-address</name>
        <value>bigdata.master:9001</value>
    </property>
    <property>
        <name>dfs.namenode.name.dir</name>
        <value>file:/opt/module/hadoop-2.8.5/dfs/name</value>
    </property>
    <property>
        <name>dfs.datanode.data.dir</name>
        <value>file:/opt/module/hadoop-2.8.5/dfs/data</value>
    </property>
    <property>
        <name>dfs.replication</name>
        <value>3</value>
    </property>
    <property>
    <name>dfs.support.append</name>
    <value>true</value>
</property>

(4)配置yarn-env.sh vim yarn-env.sh export JAVA_HOME=/opt/module/jdk1.8.0_181

(5)配置yarn-site.xml vim yarn-site.xml 在该配置文件添加如下信息:

<!-- Reducer获取数据的方式 -->
<property>
        <name>yarn.nodemanager.aux-services</name>
        <value>mapreduce_shuffle</value>
</property>

<!-- 指定YARN的ResourceManager的地址 -->
<property>
        <name>yarn.resourcemanager.hostname</name>
        <value>bigdata.master</value>
</property>

(6)配置mapred-env.sh vim mapred-env.sh export JAVA_HOME=/opt/module/jdk1.8.0_181

(7)配置mapred-site.xml vim mapred-site.xml 在该配置文件添加如下信息:

<!-- 指定MR运行在Yarn上 -->
<property>
        <name>mapreduce.framework.name</name>
        <value>yarn</value>
</property>

(8)配置slaves bigdata.slave1 bigdata.slave2

### 6. 分发配置信息到各个机器 scp -r /opt/module/hadoop-2.8.5 root@bigdata.slave1:/opt/module/hadoop-2.8.5 scp -r /opt/module/hadoop-2.8.5 root@bigdata.slave2:/opt/module/hadoop-2.8.5

### 7. 启动集群

(1)第一次启动集群,需要格式化
            hadoop namenode -format
    (2)启动Hadoop集群
            进入sbin目录:执行./start-all.sh
    (3)查看集群状态
            jps
    (4)关闭集群
            进入sbin目录:执行./stop-all.sh