AI导航网

栏目导航

公众号推荐

微信公众号搜"智元新知"关注
微信扫一扫可直接关注哦！

我正在使用Hadoop通过python进行数据处理,应使用哪种文件格式？

时间：2022-09-05分类：Hadoop作者：编程之家原文地址

我正在使用Hadoop通过python进行数据处理,应使用哪种文件格式？

我的项目中包含大量文本页面.

每个文本文件都有一些头信息,在处理过程中我需要保留这些信息.但是,我不希望标头干扰聚类算法.

我在Hadoop上使用python(或者是否有更适合的子包？)

我应该如何格式化文本文件,并将这些文本文件存储在Hadoop中进行处理？

解决方法:

1)文件

如果使用Hadoop Streaming,则必须使用基于行的文本文件,直到第一个选项卡的数据都作为键传递给映射器.

只需查看the documentation即可进行流式传输.

您也可以将输入文件放入HDFS,这对于大文件来说是值得推荐的.只需查看上面链接中的“大文件”部分.

2)元数据保存

我看到的问题是您的标头信息(元数据)将仅被视为此类数据,因此您必须自己过滤掉它(第一步).传递它比较困难,因为所有输入文件的数据都将在映射步骤之后合并.

您将必须将元数据添加到数据本身的某个位置(第二步),以便以后可以将其关联.您可以为文件的每个数据线发出(密钥,数据元数据),因此可以保留每个数据线的元数据.可能会产生巨大的开销,但是我们正在谈论MapReduce,意味着：pfffrrrr;)

现在是我不知道流与Java实现的工作有多少不同的地方.
如果流式传输为每个文件调用一个映射器,则可以避免以下麻烦,只需将map()的第一个输入作为元数据并将其(或占位符)添加到以下所有数据发布中即可.如果没有,那么接下来是关于Java作业的信息：

至少可以使用JAR映射器将数据与其输入文件关联(请参见here).但是您必须首先提取元数据,因为映射功能可能会在不包含元数据的文件分区上调用.我会提出这样的建议：

>预先创建一个元数据文件,其中包含一个占位符索引：keyx：filex,metadatax
>将此元数据索引放入HDFS
>使用JAR映射器,在setup()期间加载meta-index-file

>参见org.apache.hadoop.hdfs.DFSClient

>匹配filex,为此映射器设置keyx
>将使用过的密钥添加到map()中的每个发射数据线

版权声明：本文内容由互联网用户自发贡献，该文观点与技术仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容，请发送邮件至 [email protected] 举报，一经查实，本站将立刻删除。

相关推荐

hadoop day2-搭建

hadoop搭建准备工作三台虚拟机：master、node1、node2检查时间是否同步：date检查java的jdk是否被安装好：java-version修改主机名三台分别执行vim/etc/hostname并将内容指定为对应的主机名关闭防火墙：systemctlst...

Hadoop 二十三

文件的更名和移动: 获取文件详细信息遇到的问题：不能直接在web上上传文件。权限问题：修改后即可正常创建参考：https://blog.csdn.net/weixin_44575660/article/details/118687993

大数据Hadoop之——HDFS小文件问题与处理实战操作

目录一、背景1）小文件是如何产生的？2）文件块大小设置3）HDFS分块目的二、HDFS小文件问题处理方案1）HadoopArchive（HAR）2）Sequencefile3）CombineFileInputFormat4）开启JVM重用5）合并本地的小文件，上传到HDF...

大数据Hadoop之——Hadoop HDFS多目录磁盘扩展与数据平衡实战操作

目录一、概述二、HadoopDataNode多目录磁盘配置1）配置hdfs-site.xml2）配置详解1、dfs.datanode.data.dir2、dfs.datanode.fsdataset.volume.choosing.policy3、dfs.datanode.available-space-volume-choosing-polic...

平台搭建伪分布式

平台搭建（伪分布式）伪分布式搭建在VM中搭建std-master修改配置文件centos7-cl1.vmdkstd-master.vmx-将配置文件中vm的版本号改成自己电脑对应的vm版本修改客户端的操作系统为centos764位打开虚拟机修改虚拟机网络cd...

Harley浅谈HadoopHDFS

一、HDFS概述 1.1、HDFS产出背景及定义 1.1.1、HDFS产生背景随着数据量越来越大，在一个操作系统存不下所有的数据，那么就分配到更多的操作系统管理的磁盘中，但是不方便管理和维护，迫切需要一种系统来管...

配置workers进入hadoop/etc/hadoop 编辑workers文件然后分发给另外两个服务器准备启动集群第一次需要初始化. 初始化完成后增加了data文件，进入上面那个路径，就能看到当前服务器的版本号 ...

第六周总结8.13

这周我对ssm框架进行了更深一步的开发，加入了多用户，并对除登录外的请求进行了拦截，这样用户在未登录的时候是访问不到资源的。并且对hadoop进行了初步的学习，包括虚拟机的安装等等。下周会对hadoop进行更深一步的...

安装Hadoop2.10.1

前言通过在Hadoop1安装Hadoop,然后配置相应的配置文件，最后将Hadoop所有文件同步到其他Hadoop节点。一、集群规划#主机名‘master/hadoop1’‘slave01/hadoop2’‘slave02/hadoop3’#启动节点NamenodeNodemanagerNod...

集群崩溃处理

1.先杀死进程（先进入到hadoop版本文件里，我的是/opt/module/hadoop-3.1.3/）sbin/stop-dfs.sh2.删除每个集群上的data以及logsrm-rfdata/logs/3.格式化hdfsnamenode-format4.再启动sbin/sart-dfs.sh

小编推荐

热门标签