導航:首頁 > 配伺服器 > 如何租伺服器學習hadoop

如何租伺服器學習hadoop

發布時間：2023-03-03 14:06:08

❶ 如何部署hadoop分布式文件系統

一、實戰環境
系統版本：CentOS 5.8x86_64
java版本：JDK-1.7.0_25
Hadoop版本：hadoop-2.2.0
192.168.149.128namenode （充當namenode、secondary namenode和ResourceManager角色）
192.168.149.129datanode1 （充當datanode、nodemanager角色）
192.168.149.130datanode2 （充當datanode、nodemanager角色）

二、系統准備

1、Hadoop可以從Apache官方網站直接下載最新版本Hadoop2.2。官方目前是提供了linux32位系統可執行文件，所以如果需要在64位系統上部署則需要單獨下載src 源碼自行編譯。（如果是真實線上環境，請下載64位hadoop版本，這樣可以避免很多問題，這里我實驗採用的是32位版本）
1234 Hadoop
Java

2、我們這里採用三台CnetOS伺服器來搭建Hadoop集群，分別的角色如上已經註明。
第一步：我們需要在三台伺服器的/etc/hosts裡面設置對應的主機名如下（真實環境可以使用內網DNS解析）
[root@node1 hadoop]# cat /etc/hosts
# Do not remove the following line, or various programs
# that require network functionality will fail.
127.0.0.1localhost.localdomain localhost
192.168.149.128node1
192.168.149.129node2
192.168.149.130node3

（注* 我們需要在namenode、datanode三台伺服器上都配置hosts解析）
第二步：從namenode上無密碼登陸各台datanode伺服器，需要做如下配置:
在namenode 128上執行ssh-keygen，一路Enter回車即可。
然後把公鑰/root/.ssh/id_rsa.pub拷貝到datanode伺服器即可，拷貝方法如下：
ssh--id -i .ssh/id_rsa.pub [email protected]
ssh--id -i .ssh/id_rsa.pub [email protected]

三、Java安裝配置
tar -xvzf jdk-7u25-linux-x64.tar.gz &&mkdir -p /usr/java/ ; mv /jdk1.7.0_25 /usr/java/ 即可。
安裝完畢並配置java環境變數，在/etc/profile末尾添加如下代碼：
export JAVA_HOME=/usr/java/jdk1.7.0_25/
export PATH=$JAVA_HOME/bin:$PATH
export CLASSPATH=$JAVE_HOME/lib/dt.jar:$JAVE_HOME/lib/tools.jar:./

保存退出即可，然後執行source /etc/profile 生效。在命令行執行java -version 如下代表JAVA安裝成功。
[root@node1 ~]# java -version
java version "1.7.0_25"
Java(TM) SE Runtime Environment (build 1.7.0_25-b15)
Java HotSpot(TM) 64-Bit Server VM (build 23.25-b01, mixed mode)

（注* 我們需要在namenode、datanode三台伺服器上都安裝Java JDK版本）
四、Hadoop版本安裝
官方下載的hadoop2.2.0版本，不用編譯直接解壓安裝就可以使用了，如下：
第一步解壓:
tar -xzvf hadoop-2.2.0.tar.gz &&mv hadoop-2.2.0/data/hadoop/
（注* 先在namenode伺服器上都安裝hadoop版本即可，datanode先不用安裝，待會修改完配置後統一安裝datanode）

第二步配置變數：
在/etc/profile末尾繼續添加如下代碼，並執行source /etc/profile生效。
export HADOOP_HOME=/data/hadoop/
export PATH=$PATH:$HADOOP_HOME/bin/
export JAVA_LIBRARY_PATH=/data/hadoop/lib/native/
（注* 我們需要在namenode、datanode三台伺服器上都配置Hadoop相關變數）

五、配置Hadoop
在namenode上配置，我們需要修改如下幾個地方：
1、修改vi /data/hadoop/etc/hadoop/core-site.xml 內容為如下：
<?xml version="1.0"?>
<?xml-stylesheet type="text/xsl"href=\'#\'" Put site-specific property overrides inthisfile. -->
<configuration>
<property>
<name>fs.default.name</name>
<value>hdfs://192.168.149.128:9000</value>
</property>
<property>
<name>hadoop.tmp.dir</name>
<value>/tmp/hadoop-${user.name}</value>
<description>A base forother temporary directories.</description>
</property>
</configuration>

2、修改vi /data/hadoop/etc/hadoop/mapred-site.xml內容為如下：
<?xml version="1.0"?>
<?xml-stylesheet type="text/xsl"href=\'#\'" Put site-specific property overrides inthisfile. -->
<configuration>
<property>
<name>mapred.job.tracker</name>
<value>192.168.149.128:9001</value>
</property>
</configuration>

3、修改vi /data/hadoop/etc/hadoop/hdfs-site.xml內容為如下：
<?xml version="1.0"encoding="UTF-8"?>
<?xml-stylesheet type="text/xsl"href=\'#\'" /name>
<value>/data/hadoop/data_name1,/data/hadoop/data_name2</value>
</property>
<property>
<name>dfs.data.dir</name>
<value>/data/hadoop/data_1,/data/hadoop/data_2</value>
</property>
<property>
<name>dfs.replication</name>
<value>2</value>
</property>
</configuration>

4、在/data/hadoop/etc/hadoop/hadoop-env.sh文件末尾追加JAV_HOME變數：
echo "export JAVA_HOME=/usr/java/jdk1.7.0_25/">> /data/hadoop/etc/hadoop/hadoop-env.sh

5、修改 vi /data/hadoop/etc/hadoop/masters文件內容為如下：
192.168.149.128

6、修改vi /data/hadoop/etc/hadoop/slaves文件內容為如下：
192.168.149.129
192.168.149.130

如上配置完畢，以上的配置具體含義在這里就不做過多的解釋了，搭建的時候不明白，可以查看一下相關的官方文檔。
如上namenode就基本搭建完畢，接下來我們需要部署datanode，部署datanode相對簡單，執行如下操作即可。
1 fori in`seq 129130` ; doscp -r /data/hadoop/ [email protected].$i:/data/ ; done

自此整個集群基本搭建完畢，接下來就是啟動hadoop集群了。

❷ centos 6.5怎麼搭建hadoop2.7.3

總體思路，准備主從伺服器，配置主伺服器可以無密碼SSH登錄從伺服器，解壓安裝JDK，解壓安裝Hadoop，配置hdfs、maprece等主從關系。

1、環境，3台CentOS6.5，64位，Hadoop2.7.3需要64位Linux，操作系統十幾分鍾就可以安裝完成，
Master 192.168.0.182
Slave1 192.168.0.183
Slave2 192.168.0.184

2、SSH免密碼登錄，因為Hadoop需要通過SSH登錄到各個節點進行操作，我用的是root用戶，每台伺服器都生成公鑰，再合並到authorized_keys
(1)CentOS默認沒有啟動ssh無密登錄，去掉/etc/ssh/sshd_config其中2行的注釋，每台伺服器都要設置，
#RSAAuthentication yes
#PubkeyAuthentication yes
(2)輸入命令，ssh-keygen -t rsa，生成key，都不輸入密碼，一直回車，/root就會生成.ssh文件夾，每台伺服器都要設置，
(3)合並公鑰到authorized_keys文件，在Master伺服器，進入/root/.ssh目錄，通過SSH命令合並，
cat id_rsa.pub>> authorized_keys
ssh [email protected] cat ~/.ssh/id_rsa.pub>> authorized_keys
ssh [email protected] cat ~/.ssh/id_rsa.pub>> authorized_keys
(4)把Master伺服器的authorized_keys、known_hosts復制到Slave伺服器的/root/.ssh目錄
(5)完成，ssh [email protected]、ssh [email protected]就不需要輸入密碼了

3、安裝JDK，Hadoop2.7需要JDK7，由於我的CentOS是最小化安裝，所以沒有OpenJDK，直接解壓下載的JDK並配置變數即可
(1)下載「jdk-7u79-linux-x64.gz」，放到/home/java目錄下
(2)解壓，輸入命令，tar -zxvf jdk-7u79-linux-x64.gz
(3)編輯/etc/profile
export JAVA_HOME=/home/java/jdk1.7.0_79
export CLASSPATH=.:$JAVA_HOME/jre/lib/rt.jar:$JAVA_HOME/lib/dt.jar:$JAVA_HOME/lib/tools.jar
export PATH=$PATH:$JAVA_HOME/bin
(4)使配置生效，輸入命令，source /etc/profile
(5)輸入命令，java -version，完成

4、安裝Hadoop2.7，只在Master伺服器解壓，再復制到Slave伺服器
(1)下載「hadoop-2.7.0.tar.gz」，放到/home/hadoop目錄下
(2)解壓，輸入命令，tar -xzvf hadoop-2.7.0.tar.gz
(3)在/home/hadoop目錄下創建數據存放的文件夾，tmp、hdfs、hdfs/data、hdfs/name

5、配置/home/hadoop/hadoop-2.7.0/etc/hadoop目錄下的core-site.xml
<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://192.168.0.182:9000</value>
</property>
<property>
<name>hadoop.tmp.dir</name>
<value>file:/home/hadoop/tmp</value>
</property>
<property>
<name>io.file.buffer.size</name>
<value>131702</value>
</property>
</configuration>

6、配置/home/hadoop/hadoop-2.7.0/etc/hadoop目錄下的hdfs-site.xml
<configuration>
<property>
<name>dfs.namenode.name.dir</name>
<value>file:/home/hadoop/dfs/name</value>
</property>
<property>
<name>dfs.datanode.data.dir</name>
<value>file:/home/hadoop/dfs/data</value>
</property>
<property>
<name>dfs.replication</name>
<value>2</value>
</property>
<property>
<name>dfs.namenode.secondary.http-address</name>
<value>192.168.0.182:9001</value>
</property>
<property>
<name>dfs.webhdfs.enabled</name>
<value>true</value>
</property>
</configuration>

7、配置/home/hadoop/hadoop-2.7.0/etc/hadoop目錄下的mapred-site.xml
<configuration>
<property>
<name>maprece.framework.name</name>
<value>yarn</value>
</property>
<property>
<name>maprece.jobhistory.address</name>
<value>192.168.0.182:10020</value>
</property>
<property>
<name>maprece.jobhistory.webapp.address</name>
<value>192.168.0.182:19888</value>
</property>
</configuration>

8、配置/home/hadoop/hadoop-2.7.0/etc/hadoop目錄下的mapred-site.xml
<configuration>
<property>
<name>yarn.nodemanager.aux-services</name>
<value>maprece_shuffle</value>
</property>
<property>
<name>yarn.nodemanager.auxservices.maprece.shuffle.class</name>
<value>org.apache.hadoop.mapred.ShuffleHandler</value>
</property>
<property>
<name>yarn.resourcemanager.address</name>
<value>192.168.0.182:8032</value>
</property>
<property>
<name>yarn.resourcemanager.scheler.address</name>
<value>192.168.0.182:8030</value>
</property>
<property>
<name>yarn.resourcemanager.resource-tracker.address</name>
<value>192.168.0.182:8031</value>
</property>
<property>
<name>yarn.resourcemanager.admin.address</name>
<value>192.168.0.182:8033</value>
</property>
<property>
<name>yarn.resourcemanager.webapp.address</name>
<value>192.168.0.182:8088</value>
</property>
<property>
<name>yarn.nodemanager.resource.memory-mb</name>
<value>768</value>
</property>
</configuration>

9、配置/home/hadoop/hadoop-2.7.0/etc/hadoop目錄下hadoop-env.sh、yarn-env.sh的JAVA_HOME，不設置的話，啟動不了，
export JAVA_HOME=/home/java/jdk1.7.0_79

10、配置/home/hadoop/hadoop-2.7.0/etc/hadoop目錄下的slaves，刪除默認的localhost，增加2個從節點，
192.168.0.183
192.168.0.184

11、將配置好的Hadoop復制到各個節點對應位置上，通過scp傳送，
scp -r /home/hadoop 192.168.0.183:/home/
scp -r /home/hadoop 192.168.0.184:/home/

12、在Master伺服器啟動hadoop，從節點會自動啟動，進入/home/hadoop/hadoop-2.7.0目錄
(1)初始化，輸入命令，bin/hdfs namenode -format
注意：執行這步的時候可能會報一個錯誤：
java.net.UnknownHostException: tiancunPC: tiancunPC: unknown error
at java.net.InetAddress.getLocalHost(InetAddress.java:1505)
at org.apache.hadoop.net.DNS.resolveLocalHostname(DNS.java:264)
at org.apache.hadoop.net.DNS.<clinit>(DNS.java:57)
at org.apache.hadoop.hdfs.server.namenode.NNStorage.newBlockPoolID(NNStorage.java:982)
at org.apache.hadoop.hdfs.server.namenode.NNStorage.newNamespaceInfo(NNStorage.java:591)
at org.apache.hadoop.hdfs.server.namenode.FSImage.format(FSImage.java:157)
at org.apache.hadoop.hdfs.server.namenode.NameNode.format(NameNode.java:992)
at org.apache.hadoop.hdfs.server.namenode.NameNode.createNameNode(NameNode.java:1434)
at org.apache.hadoop.hdfs.server.namenode.NameNode.main(NameNode.java:1559)
Caused by: java.net.UnknownHostException: tiancunPC: unknown error
at java.net.Inet4AddressImpl.lookupAllHostAddr(Native Method)
at java.net.InetAddress$2.lookupAllHostAddr(InetAddress.java:928)
at java.net.InetAddress.getAddressesFromNameService(InetAddress.java:1323)
at java.net.InetAddress.getLocalHost(InetAddress.java:1500)
... 8 more
16/11/11 19:15:23 WARN net.DNS: Unable to determine address of the host-falling back to "localhost" address
java.net.UnknownHostException: tiancunPC: tiancunPC: unknown error
at java.net.InetAddress.getLocalHost(InetAddress.java:1505)
at org.apache.hadoop.net.DNS.resolveLocalHostIPAddress(DNS.java:287)
at org.apache.hadoop.net.DNS.<clinit>(DNS.java:58)
at org.apache.hadoop.hdfs.server.namenode.NNStorage.newBlockPoolID(NNStorage.java:982)
at org.apache.hadoop.hdfs.server.namenode.NNStorage.newNamespaceInfo(NNStorage.java:591)
at org.apache.hadoop.hdfs.server.namenode.FSImage.format(FSImage.java:157)
at org.apache.hadoop.hdfs.server.namenode.NameNode.format(NameNode.java:992)
at org.apache.hadoop.hdfs.server.namenode.NameNode.createNameNode(NameNode.java:1434)
at org.apache.hadoop.hdfs.server.namenode.NameNode.main(NameNode.java:1559)
Caused by: java.net.UnknownHostException: tiancunPC: unknown error
at java.net.Inet4AddressImpl.lookupAllHostAddr(Native Method)
at java.net.InetAddress$2.lookupAllHostAddr(InetAddress.java:928)
at java.net.InetAddress.getAddressesFromNameService(InetAddress.java:1323)
at java.net.InetAddress.getLocalHost(InetAddress.java:1500)
... 8 more
linux中使用hostname查看為：
[root@tiancunPC hadoop-2.7.3]# hostname
tiancunPC
查看/etc/hosts為：
[root@tiancunPC hadoop-2.7.3]# cat /etc/hosts
127.0.0.1 localhost localhost.localdomain localhost4 localhost4.localdomain4
::1 localhost localhost.localdomain localhost6 localhost6.localdomain6
難怪會映射不到，修改/etc/hosts
[root@tiancunPC hadoop-2.7.3]# cat /etc/hosts
127.0.0.1 tiancunPC localhost.localdomain localhost4 localhost4.localdomain4
::1 localhost localhost.localdomain localhost6 localhost6.localdomain6
對應修改另外兩個機器的主機名，在執行那個命令就可以了

(2)全部啟動sbin/start-all.sh，也可以分開sbin/start-dfs.sh、sbin/start-yarn.sh
執行sbin/start-all.sh 可能會有錯誤提示：
maps to localhost(IP), but this does not map back to the address
解決辦法：

修改 /etc/ssh/ssh_config
vim /etc/ssh/ssh_config
GSSAPIAuthentication no
這個時候可能還會出現這個錯誤提示：

hadoop出現namenode running as process 18472. Stop it first.，hadoopnamenode
解決辦法：重新啟動一下hadoop

(3)停止的話，輸入命令，sbin/stop-all.sh
(4)輸入命令，jps，可以看到相關信息

❸ Hadoop 請教學習順序

雖然從事Hadoop方面工作，但是不是高手，畢竟只有一年經歷而已。
分享下本人的學習經歷吧。
了解Hadoop運行機制，可以學習Hadoop權威指南或者Hadoop實戰；
了解Hadoop運行流程，看懂HADOOP_HOME/bin/下面主要執行腳本。
查看core-default.xml/hdfs-default.xml/mapred-default.xml等默認配置
文件，及core-site.xml/hdfs-site.xml/mapred-site.xml等相關文件，學會
如何進行參數優化，以及掌握如何配置讀取壓縮文件，默認的gzip，及
自定義的lzo，學會自定義Combiner/Patitioner等，掌握各種輸入輸出
格式的區別及應用場景，學會自定義輸入輸出格式，其次學習MapRece演算法，
比如In-Map-Combing，相對頻度計算，Pairs演算法，Strips演算法等。掌握好
maprece編程。
在這其中，需要好好閱讀HADOOP_HOME/src/目錄下的Hadoop源碼，
這個就是開源最大的好處。說的比較亂，但是就湊合著借鑒下吧

❹ hadoop集群搭建在阿里雲伺服器上雲伺服器配置要求是多少

如果是集群的話，我考慮需要流暢運行的話，2核4G配置是可以滿足的。因為這個集群形式，用於適用於物聯網、車聯網、監控、安全風控、即時通訊、消息存儲等行業場景，所以數據量是比較大的，所以配置太低了跑不動，會卡死的。
因為hadoop是海量數據的處理能力，所以伺服器一定不能太小配置了，跑不動了就沒實際用途了。最好使用4核8G內存及以上配置。
因為這方面內容較多，這里也寫不開那麼多內容，所以你可以留言或到我的博客上搜索相關內容，老魏有寫過教程，還不止一篇，都挺詳細的內容，可以幫助你入門。

閱讀全文

與如何租伺服器學習hadoop相關的資料

熱點內容

視頻光碟加密技術發布：2025-01-12 23:40:05 瀏覽：192

stm單片機中adc接哪個引腳發布：2025-01-12 23:39:59 瀏覽：837

流媒體伺服器有什麼用發布：2025-01-12 23:32:14 瀏覽：171

安卓怎麼禁用前置攝像頭發布：2025-01-12 23:31:31 瀏覽：48

android電視游戲發布：2025-01-12 23:15:29 瀏覽：670

得物app用什麼方式出售發布：2025-01-12 22:57:53 瀏覽：783

linuxandroid模擬器下載發布：2025-01-12 22:52:22 瀏覽：971

php類常量訪問發布：2025-01-12 22:52:20 瀏覽：586

視頻文件壓縮工具發布：2025-01-12 22:52:10 瀏覽：13

什麼什麼佳人app 發布：2025-01-12 22:50:26 瀏覽：6

施耐德cfc編程發布：2025-01-12 22:20:39 瀏覽：322

如何把pdf文件轉成圖片發布：2025-01-12 22:08:56 瀏覽：538

張劍閱讀150篇pdf 發布：2025-01-12 22:04:13 瀏覽：359

拉卡拉收款寶app叫什麼名發布：2025-01-12 21:56:09 瀏覽：340

c4d動態解壓發布：2025-01-12 21:52:19 瀏覽：712

多個pdf合並為一個發布：2025-01-12 21:50:41 瀏覽：314

程序中的編譯執行發布：2025-01-12 21:32:48 瀏覽：34

plc控制與單片機控制發布：2025-01-12 21:28:12 瀏覽：885

如何讓安卓手機操控電腦發布：2025-01-12 20:57:07 瀏覽：189

電腦電銷加密電話號碼破解發布：2025-01-12 20:51:44 瀏覽：507