开始学习Hadoop,从今天起,想把我学习hadoop全过程记录一下。我会记录在学习过程中碰到的问题、困难以及解决方法等等,如果你也是刚学hadoop,我们可以一起讨论。
学了几天,好像入门了,在这里和大家分享,就当全程笔记的第一篇吧。
新说明一下我的开发环境
操作系统:在windows下使用wubi安装了Ubuntu 10.10
hadoop版本:hadoop-0.20
上面这个地址是最新hadoop快速入门,基本上按照里面步骤能快速入门hadoop,但这篇文档是针对hadoop 0.18写的,有些地方还是和hadoop 0.20不同。在文档“伪分布式模式的操作方法”中有下面配置说明:
配置 使用如下的 conf/hadoop-site.xml: <configuration> <property> <name>fs.default.name</name> <value>localhost:9000</value> </property> <property> <name>mapred.job.tracker</name> <value>localhost:9001</value> </property> <property> <name>dfs.replication</name> <value>1</value> </property> </configuration>在这里,你会发现在hadoop 0.20中并不存在conf/hadoop-site.xml文件,所以,如果你使用高版本的hadoop就要修改为下面的配置:
配置 使用如下的 conf/core-site.xml: <configuration> <property> <name>fs.default.name</name> <value>hdfs://localhost:9000</value> </property> </configuration> 配置 使用如下的 conf/hdfs-site.xml: <configuration> <property> <name>dfs.replication</name> <value>1</value> </property> </configuration> 配置 使用如下的 conf/mapred-site.xml: <configuration> <property> <name>mapred.job.tracker</name> <value>localhost:9001</value> </property> </configuration>只要在这里注意一下,再按照“hadoop快速入门”文档就能对hadoop快速入们了。
初学错误:
伪分布式模式下执行 bin/hadoop fs -put conf input命令,提示put: Target input/conf is a directory,是什么原因?
对策:你把conf文件夹都复制过去了,这是不对的。应该只复制conf下的.xml文件。