Hadoop配置和使用问题记录 -

bbym010

浏览: 141340 次
性别:
来自: 北京

最近访客更多访客>>

bneliao

liao8735

longyi_java

chang1816

博主相关

博客

微博

相册

留言

关于我

文章分类

社区版块

存档分类

Hadoop配置和使用问题记录

博客分类：

分布式

Hadoop SSH Apache Eclipse ITeye

最近在本地用cygwin环境来配置和使用hadoop。
遇到了一些问题，下面的这篇文章讲的比较全。
原文地址：http://shutiao2008.iteye.com/blog/319128
如果有补充的，我会补充进去

关于hadoop如何配置的教程网上已经有不少了，配合hadoop主页上的说明，基本可以顺利在多台机器上配置好hadoop集群。这里记录的是我在实际配置和使用hadoop时遇到的问题，其中一些属于hadoop周边，如ssh配置时容易遇到的问题和解决方法，供大家参考。我目前是在windows xp里通过cygwin安装的hadoop，版本是0.17.2.1。

1. 安装cygwin。在www.cygwin.com下载网络安装包，在选择组件的时候建议直接把openssh组件选中，有些版本的cygwin似乎不会自动安装diffutils组件，所以需要手工选中一下，否则配置ssh时会提示缺少该组件包。

2. cygwin控制台里的缺省提示符不太习惯，用export PS1="\u@\w$"设一下好多了。

3. 配置sshd比较简单，可以参考这个链接http://cha.homeip.net/blog/archives/2006/04/_winxp_cygwin_s.html。在ssh-host-config时问到“Should privilege separation be used? (yes/no)”时回答no即可，如果由于安全因素要回答yes时，在启动sshd时有可能遇到“Privilege separation user sshd does not exist”的错误信息，解决方法可参考这个链接http://www.unixguide.net/comments/sun/ssh_installation.shtml/37.shtml
4. 在配置ssh使用证书方式自动验证时花了一些时间，后来觉得可能是由于机器上有两个版本的cygwin的缘故，因为在另一台机器上安装就没有出现问题。在使用ssh-keygen -t rsa命令后提示输入密码时，直接按两次回车即可。公钥的复制等过程这里不再赘述。

5. 试图在Eclipse里运行hadoop的WordCount程序时提示异常：“javax.security.auth.login.LoginException: Login failed: CreateProcess: whoami error=2”，解决方法是把c:\cygwin\bin加入系统的path环境变量，然后重启Eclipse以便改动生效。

6. 在Eclipse里运行WordCount时遇到java heap size不够的异常，在运行配置里加入-Xms200M就可以解决。（hadoop的helloworld要求的内存比较多？）

7. 当要运行的运算依赖第三方类库时，这个链接https://issues.apache.org/jira/browse/HADOOP-1622有所讨论，但暂时没看到除了在命令行里使用hadoop jar命令以外的解决方法，比如在0.17.2和0.18.1版本里我都没有看到JobConf类里有类似addJar()这样的方法，在JobConf#setJar()里使用逗号分隔多个jar文件的方式则会报找不到文件的错误。解决方式可能有两个：a)把所需要的第三方jar文件复制到每个节点机器的jre里（暂时没有试验） b)把第三方jar包和自己的类打到一个包里。

update: 在网上找到另一种方式，通过DistributedCache实现http://www.infoq.com/cn/articles/hadoop-process-develop#view_31599，原文里可能有笔误，我试验正确的方法是调用DistributedCache.addArchiveToClassPath()方法，注意其第一个参数必须是相对路径，如“/test/lib /my.jar”，而不能是像“hdfs://192.168.0.5:47110/test/lib/my.jar”这样的绝对路径。关于 DistributedCache的说明在里有一些。

8. 调试mapreduce程序的方式，在这个链接http://shutiao2008.iteye.com/blog/319128里讲得比较清楚了，因为很有用所以特意重复一次。如果文件存放在HDFS里，那么只需要调用JobConf#.set("mapred.job.tracker", "local");即可；如果文件也是存在本地的，还需要调用JobConf#set("fs.default.name", "local");方法。我通常让文件存在HDFS里调试，因为要使用本地文件要么参数需要改变，要么代码需要改变，维护两个环境很麻烦。在程序里用System.out.println()输出的内容可以在datanode的hadoop安装路径的logs/userlogs目录里找到。

9. 当使用自定义InputFormat时，特别是使用EMF模型元素作为key的时候，需要注意并不是在代码的任何地方都能得到xmi:id的值的。具体来说，在WritableComparable#write()方法里能得到（前提是该对象本来就有resource，即eobj.eResource()!=null），而在WritableComparable#readFields()里是不能得到的，在RecordWriter#write()方法里同样不能得到，因为后两者的EMF元素对象都是反序列化得到的，已经不是内存里原来的那个实例了。

10. map进行到100%后，reduce过程进行到某个数值（如16%）后就不再继续，直到被hadoop强制关闭。在tasknode的log里记录如下：

2008-11-20 11:17:06,455 INFO org.apache.hadoop.mapred.TaskTracker: task_200811191041_0015_r_000000_0 0.16666667% reduce > copy (6 of 12 at 0.00 MB/s) >
2008-11-20 11:17:09,455 INFO org.apache.hadoop.mapred.TaskTracker: task_200811191041_0015_r_000000_0 0.16666667% reduce > copy (6 of 12 at 0.00 MB/s) >
2008-11-20 11:17:15,455 INFO org.apache.hadoop.mapred.TaskTracker: task_200811191041_0015_r_000000_0 0.16666667% reduce > copy (6 of 12 at 0.00 MB/s) >
2008-11-20 11:17:18,705 FATAL org.apache.hadoop.mapred.TaskTracker: Task: task_200811191041_0015_r_000000_0 - Killed due to Shuffle Failure: Exceeded MAX_FAILED_UNIQUE_FETCHES; bailing-out.
2008-11-20 11:17:18,705 INFO org.apache.hadoop.mapred.TaskTracker: About to purge task: task_200811191041_0015_r_000000_0
2008-11-20 11:17:18,705 INFO org.apache.hadoop.mapred.TaskRunner: task_200811191041_0015_r_000000_0 done; removing files.
2008-11-20 11:17:18,705 WARN org.apache.hadoop.mapred.TaskTracker: Unknown child task finshed: task_200811191041_0015_r_000000_0. Ignored.
2008-11-20 11:17:40,845 INFO org.apache.hadoop.mapred.TaskTracker: Received 'KillJobAction' for job: job_200811191041_0015
2008-11-20 11:17:40,845 INFO org.apache.hadoop.mapred.TaskRunner: task_200811191041_0015_m_000011_0 done; removing files.
2008-11-20 11:17:40,845 INFO org.apache.hadoop.mapred.TaskRunner: task_200811191041_0015_m_000005_0 done; removing files.

在我的java application的控制台里的输入如下：

08/11/20 11:06:39 INFO mapred.JobClient: map 96% reduce 11%
08/11/20 11:06:40 INFO mapred.JobClient: map 100% reduce 11%
08/11/20 11:06:43 INFO mapred.JobClient: map 100% reduce 13%
08/11/20 11:06:47 INFO mapred.JobClient: map 100% reduce 16% (在这里停很久)
08/11/20 11:17:12 INFO mapred.JobClient: map 100% reduce 0%
08/11/20 11:17:12 INFO mapred.JobClient: Task Id : task_200811191041_0015_r_000000_0, Status : FAILED
Shuffle Error: Exceeded MAX_FAILED_UNIQUE_FETCHES; bailing-out.
08/11/20 11:17:14 WARN mapred.JobClient: Error reading task outputnode2
08/11/20 11:17:14 WARN mapred.JobClient: Error reading task outputnode2
08/11/20 11:17:25 INFO mapred.JobClient: map 100% reduce 16%
08/11/20 11:17:30 INFO mapred.JobClient: map 100% reduce 25%
08/11/20 11:17:31 INFO mapred.JobClient: map 100% reduce 100%
08/11/20 11:17:32 INFO mapred.JobClient: Job complete: job_200811191041_0015

我想找到这个问题的所在了。是secondary name node所在的机器没有配置dfs.http.address这个参数，该参数在hadoop-default.xml里的缺省值是0.0.0.0:50070，应改为name node所在机器的ip地址。参考链接

11. 一些参考链接。

http://hayesdavis.net/2008/06/14/running-hadoop-on-windows/
http://hi.baidu.com/shirdrn/blog/category/Hadoop
http://www.ibm.com/developerworks/cn/opensource/os-cn-hadoop1/index.html
http://blog.ring.idv.tw/comment.ser?i=231

补充1：运行hadoop时出现：WARN hdfs.DFSClient: org.apache.hadoop.ipc.RemoteException:java.io.IOException: File <filename> could only be replicated to 0 nodes, instead of 1
解决：
是防火墙的问题，需要把防火墙关掉。
执行
$sudo ufw disable

分享到：

bigtable介绍 | Cygwin ssh 故障总结

2011-04-27 13:20
浏览 2251
评论(0)
分类:编程语言
查看更多

发表评论

您还没有登录,请您登录后再发表评论

最近访客更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论

Hadoop配置和使用问题记录

评论

发表评论

相关推荐

最近访客 更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论

Hadoop配置和使用问题记录

评论

发表评论

相关推荐

mapreduce的shuffle，partition，combine

hive入门(转)

hive速查

hadoop相关备录

bigtable介绍

Hive学习笔记3--------Hive与数据库的异同（转自淘宝数据平台团队）

HBASE入门

[转载]Hbase和RDBMS的区别

最近访客更多访客>>