博客
关于我
强烈建议你试试无所不能的chatGPT,快点击我
Kettle 添加对应hadoop版本的支持
阅读量:6236 次
发布时间:2019-06-22

本文共 5738 字,大约阅读时间需要 19 分钟。

  在hdp的官网上有一个ETL工具叫做Talend Open Studio,然后我就下了,并且在群里询问了一下,突然间冒出来一群ETL高手,经高人指点认识了一款叫做Kettle的软件,经过这两天的试用,从直观感受上,Kettle更容易使用和上手,资料更多,界面更友好。。。 优点很多,这里不一一列举了,关键是它对hadoop的支持我觉得是很全面的。

  但是这里面有一个问题出现了,它不支持我现在用的版本,我用的是Hortonworks的HDP1.3,好吧,经过不懈的努力,终于被我搜索到了,哈哈,原来它可以支持的,并且官方已经提供了相应的包提供使用,只是不太好找罢了!下面把更新的过程和大家分享一下。

  先提供文中所需内容的下载地址:

  1.插件升级包

  

  2.hdp1.3的支持包

  

  

  我使用的是4.4版本的kettle,大数据插件升级到了1.3.3.1了,所以要更新一下

  1.删除plugins下的pentaho-big-data-plugin

  2.删除libext/JDBC/pentaho-hadoop-hive-jdbc-shim-1.3.0.jar

  3.把pentaho-big-data-shimtastic-1.3.3.1.zip解压到plugins目录下,可以删掉pentaho-big-data-plugin\hadoop-configurations 中不要的版本

  4. 复制pentaho-hadoop-hive-jdbc-shim-1.3.3.jar 到libext/JDBC下

  5.解压pentaho-instaview-templates-shimtastic-1.3.3.zip 到这个目录下,实际上没有这个目录,自己创建一下吧

  plugins/spoon/agile-bi/platform/pentaho-solutions/system/instaview/templates/Big Data

  更新完插件之后,我们要添加hdp1.3的支持,使用CDH4的童鞋比较幸福,不需要下载这个包,因为插件默认就带有cdh42的版本,支持最新的4.2-4.3

  1.解压pentaho-hadoop-shims-hdp13-package-1.3.4.zip放到 plugins\pentaho-big-data-plugin\hadoop-configurations下面

  2.编辑plugins/pentaho-big-data-plugin/plugin.properties文件,设置active.hadoop.configuration为该目录的名称

  初始值是active.hadoop.configuration=hadoop-20,我的目录名称为hdp13,所以修改为active.hadoop.configuratio=hdp13

  

  

  经过测试,目前Hadoop Copy Files和Oozie Job Executor能正常使用,Hadoop Job Executor不能使用,并且只支持旧的mapred的api,不支持最新的mapreduce的api,它自带的demo也运行不起来,报错了。

  详细报错如下:

  

Error executing class org.pentaho.hadoop.sample.wordcount.WordCount. java.lang.RuntimeException: java.lang.reflect.InvocationTargetException     at org.pentaho.di.job.entries.hadoopjobexecutor.JobEntryHadoopJobExecutor$1.run(JobEntryHadoopJobExecutor.java:377)     at java.lang.Thread.run(Thread.java:722) Caused by: java.lang.reflect.InvocationTargetException     at sun.reflect.NativeMethodAccessorImpl.invoke0(Native Method)     at sun.reflect.NativeMethodAccessorImpl.invoke(NativeMethodAccessorImpl.java:57)     at sun.reflect.DelegatingMethodAccessorImpl.invoke(DelegatingMethodAccessorImpl.java:43)     at java.lang.reflect.Method.invoke(Method.java:601)     at org.pentaho.di.job.entries.hadoopjobexecutor.JobEntryHadoopJobExecutor.executeMainMethod(JobEntryHadoopJobExecutor.java:660)     at org.pentaho.di.job.entries.hadoopjobexecutor.JobEntryHadoopJobExecutor$1.run(JobEntryHadoopJobExecutor.java:360)     ... 1 more Caused by: java.lang.RuntimeException: Error in configuring object     at org.apache.hadoop.util.ReflectionUtils.setJobConf(ReflectionUtils.java:93)     at org.apache.hadoop.util.ReflectionUtils.setConf(ReflectionUtils.java:64)     at org.apache.hadoop.util.ReflectionUtils.newInstance(ReflectionUtils.java:117)     at org.apache.hadoop.mapred.JobConf.getInputFormat(JobConf.java:596)     at org.apache.hadoop.mapred.JobClient.writeOldSplits(JobClient.java:1081)     at org.apache.hadoop.mapred.JobClient.writeSplits(JobClient.java:1073)     at org.apache.hadoop.mapred.JobClient.access$700(JobClient.java:179)     at org.apache.hadoop.mapred.JobClient$2.run(JobClient.java:983)     at org.apache.hadoop.mapred.JobClient$2.run(JobClient.java:936)     at java.security.AccessController.doPrivileged(Native Method)     at javax.security.auth.Subject.doAs(Subject.java:415)     at org.apache.hadoop.security.UserGroupInformation.doAs(UserGroupInformation.java:1232)     at org.apache.hadoop.mapred.JobClient.submitJobInternal(JobClient.java:936)     at org.apache.hadoop.mapred.JobClient.submitJob(JobClient.java:910)     at org.apache.hadoop.mapred.JobClient.runJob(JobClient.java:1353)     at org.pentaho.hadoop.sample.wordcount.WordCount.main(WordCount.java:79)     ... 7 more Caused by: java.lang.reflect.InvocationTargetException     at sun.reflect.NativeMethodAccessorImpl.invoke0(Native Method)     at sun.reflect.NativeMethodAccessorImpl.invoke(NativeMethodAccessorImpl.java:57)     at sun.reflect.DelegatingMethodAccessorImpl.invoke(DelegatingMethodAccessorImpl.java:43)     at java.lang.reflect.Method.invoke(Method.java:601)     at org.apache.hadoop.util.ReflectionUtils.setJobConf(ReflectionUtils.java:88)     ... 22 more Caused by: java.lang.IllegalArgumentException: Compression codec com.hadoop.compression.lzo.LzoCodec not found.     at org.apache.hadoop.io.compress.CompressionCodecFactory.getCodecClasses(CompressionCodecFactory.java:116)     at org.apache.hadoop.io.compress.CompressionCodecFactory.
(CompressionCodecFactory.java:156) at org.apache.hadoop.mapred.TextInputFormat.configure(TextInputFormat.java:38) ... 27 more Caused by: java.lang.ClassNotFoundException: com.hadoop.compression.lzo.LzoCodec at java.net.URLClassLoader$1.run(URLClassLoader.java:366) at java.net.URLClassLoader$1.run(URLClassLoader.java:355) at java.security.AccessController.doPrivileged(Native Method) at java.net.URLClassLoader.findClass(URLClassLoader.java:354) at java.lang.ClassLoader.loadClass(ClassLoader.java:423) at java.lang.ClassLoader.loadClass(ClassLoader.java:356) at java.lang.Class.forName0(Native Method) at java.lang.Class.forName(Class.java:264) at org.apache.hadoop.conf.Configuration.getClassByName(Configuration.java:810) at org.apache.hadoop.io.compress.CompressionCodecFactory.getCodecClasses(CompressionCodecFactory.java:109) ... 29 more
View Code

  这个问题可能是运行旧的mapred的api导致的,kettle自身的大数据插件上本身就支持hadoop-0.20版本以及CHD4(也是基于0.20版本的),可能是为了兼容的问题,运行hdp的程序的时候也是使用的旧的api,然后就引发了这个错误,这个错误也是报得莫名其妙,源码里面里面都没有使用压缩,我的集群本身也是配置了lzo的,例子运行的时候都能看到加载lzo的类库成功的提示信息。。。 我在hadoop里面运行新版的wordcount例子也是没问题,但是在kettle上就不行,看来只能走改源码的方法了,正好oozie的插件也有不尽如人意的地方,顺便把oozie的插件也修改一下,加上重新启动流程的功能。

  不过比较安慰的是Hadoop Copy Files和Oozie Job Executor都可以用,MapReduce我可以配置到oozie里面执行,不要它那个破玩意儿了,太让人闹心了。

  如果有用CDH4的童鞋,帮忙试一下你们的能不能用,如果有知道怎么解决这个问题的更好,感激涕零!

  最后发一下原始的地址,E文好的童鞋可以自己去看看,找到适合自己的版本!

  

  

转载地址:http://qazia.baihongyu.com/

你可能感兴趣的文章
ObjectOutputStream和ObjectInputStream
查看>>
南京大学周志华教授当选欧洲科学院外籍院士
查看>>
马士兵教学语录
查看>>
计算机网络与Internet应用
查看>>
oracle在线迁移同步数据,数据库报错
查看>>
linux性能剖析工具
查看>>
flutter中的异步
查看>>
计算机高手也不能编出俄罗斯方块——计算机达人成长之路(16)
查看>>
error LNK2001: 无法解析的外部符号 __CrtDbgReport
查看>>
【多线程】的简单理解&进程 and【你的电脑是几核的?】
查看>>
# 2017-2018-1 20155224 《信息安全系统设计基础》第七周学习总结
查看>>
scikit-learn预处理实例之一:使用FunctionTransformer选择列
查看>>
【距离GDOI:137天】 扩展KMP...字符串QAQ
查看>>
Oracle 10g 下载地址
查看>>
c# Unity依赖注入WebService
查看>>
邮件客户端导入邮件通讯录地址薄
查看>>
java中异常抛出后代码还会继续执行吗
查看>>
oracle 学习摘记
查看>>
IOS代码布局(一) UIView
查看>>
如何解决开机出现Missing operating system的故障
查看>>