学位论文 > 优秀研究生学位论文题录展示
基于多核CPU的任务级数据处理研究及其在集群平台下的性能测试
作 者: 张铁军
导 师: 陈蜀宇
学 校: 重庆大学
专 业: 计算机软件与理论
关键词: 多核 集群 MapReduce Hadoop TBB
分类号: TP274
类 型: 硕士论文
年 份: 2011年
下 载: 60次
引 用: 0次
阅 读: 论文下载
内容摘要
|
随着计算机网络和信息化技术的发展,人们每天要处理的信息正在以惊人的速度增加,尤其是像Google这样的提供全球网页分析和处理的互联网公司,它每天要通过Google MapReduce对数以P级的网页,音频和视频进行处理。Google在数据处理方面的成功促使Apache社区开发了开源版的Hadoop MapReduce。开源版本用Java语言实现,它用HDFS将集群的主要实体NameNode, SecondName- Node和DataNode连接起来,NameNode是集群的管理者,它上面运行JobTracker主控程序; SecondNameNode是NameNode的backup服务器;DataNode是hadoop集群中用TaskTracker真正处理数据的计算机,当DataNode是多核计算机,且分配的数据量小于是64M时,DataNode的多核优势将不复存在,它只能利用其中一个核心的计算机,其它核心则处idle状态。为了处理这种状况,本文提出了一种任务级MapReduce模型,用它来代替传统的线程级MapReduce。本文在分析了Hadoop运行机制以及制约因素的基础上,搭建了Hadoop集群运算平台,并对集群容易出现的故障给出了相应的解决方案。详细分析了线程级MapReduce的运作机制,然后在集群上通过对比实验提出了线程级MapReduce在处理小块数据时的局限性。本文将intel用c++语言开发的TBB并行库与Hadoop MapReduce结合起来形成了任务级的MapReduce,并通过在集群上求PI的几组实验,证实了任务级MapReduce在小块数据处理方面的优势。本文还通过实验的方式综合对比了这两种级别的MapReduce的性能,并提出了核心总数,数据规模与性能之间的关系。
|
全文目录
中文摘要 3-4 英文摘要 4-8 1 绪论 8-12 1.1 研究背景 8-9 1.2 国内外研究现状 9-10 1.3 研究目的和研究内容 10 1.4 论文组织结构 10-11 1.5 本文的主要工作 11-12 2 相关技术分析 12-25 2.1 Hadoop 运行机制 12-15 2.1.1 Hadoop 实体结构 12 2.1.2 基本任务执行流程 12-14 2.1.3 高级MapReduce 14-15 2.2 HDFS 分布式文件系统 15-19 2.2.1 影响HDFS 的外在因素 16-18 2.2.2 SecondNameNode 18 2.2.3 NameNode 18 2.2.4 DataNode 18-19 2.3 MapReduce 数据模型 19-21 2.3.1 MapReduce 类型 19-20 2.3.2 MapReduce 类型设定 20 2.3.3 MapReduce 主要方法的设定 20 2.3.4 输入输出格式 20-21 2.4 Pig 21-23 2.4.1 Pig 运行方式 22 2.4.2 一个实例 22-23 2.5 HBASE 23-24 2.6 TBB 与传统线程库区别 24-25 3 基于 Hadoop 的集群平台构建 25-41 3.1 构建方法及过程 25-37 3.1.1 SSH 配置 25-28 3.1.2 配置Hadoop 28-32 3.1.3 分发安装文件到各个结点 32-35 3.1.4 配置环境变量 35-36 3.1.5 格式化NameNode 36 3.1.6 启动hdfs 和MapReduce 36-37 3.2 故障恢复 37-41 3.2.1 NameNode 故障恢复 37-38 3.2.2 DataNode 故障恢复 38 3.2.3 DataNode 退役 38-40 3.2.4 DataNode 结点的添加 40 3.2.5 误删文件恢复 40-41 4 任务级 MapReduce 研究 41-54 4.1 线程级MapReduce 分析 41-44 4.1.1 并行与并发的区别和联系 41-42 4.1.2 MapReduce 与并行 42 4.1.3 Hadoop Streaming 42-43 4.1.4 C++接口 43-44 4.2 任务级MapReduce 研究 44-48 4.2.1 TBB 与MapReduce 的契合性 44 4.2.2 TBB 适用于MapReduce 的算法 44-46 4.2.3 MapReduce+TBB 混合编程模型 46-47 4.2.4 移植性 47 4.2.5 制约因素和处理方法 47-48 4.3 性能对比实验 48-54 4.3.1 PI 的算法 48-49 4.3.2 线程级性能 49-52 4.3.3 任务级并行的优越性 52-54 5 任务级 MapReduce 在集群平台下的性能测试 54-57 5.1 线程级单核集群与任务级单核集群测试分析 54 5.2 线程级多核集群与任务级多核集群测试分析 54-55 5.3 针对不同核心总数和数据规模的性能测试分析 55-57 6 总结与展望 57-58 致谢 58-59 参考文献 59-61 附录 61 A 作者在攻读学位期间发表的论文目录 61 B 作者在攻读学位期间参与的科研项目 61
|
相似论文
- DMR集群系统高层协议的设计和研究,TN929.52
- 过敏原TBb抗原表位区及其关键氨基酸的鉴定,R284.1
- 科学发展观视阈下的湖北省白酒产业集群发展研究,F426.82
- 多核系统下并行节点复制垃圾收集算法研究,TP332
- 产业集群模式对促进服装自主品牌的作用研究,F273.2
- 电离辐射和紫杉醇诱导的多核细胞形成中SPATA5L1、Cyclin B2表达的变化,R739.8
- 基于Map/Reduce框架的分布式日志分析系统的研究及应用,TP311.52
- 跨国公司主导型产业集群的均衡分析,F224
- 产业集群中的技术创新网络研究,F062.9
- 技术类型、交易费用与一类产业集群的成因及演化趋势研究,F279.2
- 黑龙江省中小企业集群融资问题研究,F276.3
- 产业集群内企业间信任机制研究,F224
- 基于GEM模型的DY镇产业集群研究,F279.27
- 地方政府在产业集群形成中的作用研究,D625
- 多核架构下LLC很少重用块的研究,TP332
- 沈阳汽车产业集群研究,F224
- 基于多核的数据并行编程平台的研究与实现,TP332
- 采掘业产业集群集聚度的均衡水平测度分析,F224
- 我国中小企业融资方式创新研究,F276.3
- 基于Hadoop的在线购物原型系统的设计与实现,TP311.52
- 基于Hadoop的移动学习系统设计与实现,G434
中图分类: > 工业技术 > 自动化技术、计算机技术 > 自动化技术及设备 > 自动化系统 > 数据处理、数据处理系统
© 2012 www.xueweilunwen.com
|