学位论文 > 优秀研究生学位论文题录展示

基于多核CPU的任务级数据处理研究及其在集群平台下的性能测试

作 者: 张铁军
导 师: 陈蜀宇
学 校: 重庆大学
专 业: 计算机软件与理论
关键词: 多核 集群 MapReduce Hadoop TBB
分类号: TP274
类 型: 硕士论文
年 份: 2011年
下 载: 60次
引 用: 0次
阅 读: 论文下载
 

内容摘要


随着计算机网络和信息化技术的发展,人们每天要处理的信息正在以惊人的速度增加,尤其是像Google这样的提供全球网页分析和处理的互联网公司,它每天要通过Google MapReduce对数以P级的网页,音频和视频进行处理。Google在数据处理方面的成功促使Apache社区开发了开源版的Hadoop MapReduce。开源版本用Java语言实现,它用HDFS将集群的主要实体NameNode, SecondName- Node和DataNode连接起来,NameNode是集群的管理者,它上面运行JobTracker主控程序; SecondNameNode是NameNode的backup服务器;DataNode是hadoop集群中用TaskTracker真正处理数据的计算机,当DataNode是多核计算机,且分配的数据量小于是64M时,DataNode的多核优势将不复存在,它只能利用其中一个核心的计算机,其它核心则处idle状态。为了处理这种状况,本文提出了一种任务级MapReduce模型,用它来代替传统的线程级MapReduce。本文在分析了Hadoop运行机制以及制约因素的基础上,搭建了Hadoop集群运算平台,并对集群容易出现的故障给出了相应的解决方案。详细分析了线程级MapReduce的运作机制,然后在集群上通过对比实验提出了线程级MapReduce在处理小块数据时的局限性。本文将intel用c++语言开发的TBB并行库与Hadoop MapReduce结合起来形成了任务级的MapReduce,并通过在集群上求PI的几组实验,证实了任务级MapReduce在小块数据处理方面的优势。本文还通过实验的方式综合对比了这两种级别的MapReduce的性能,并提出了核心总数,数据规模与性能之间的关系。

全文目录


中文摘要  3-4
英文摘要  4-8
1 绪论  8-12
  1.1 研究背景  8-9
  1.2 国内外研究现状  9-10
  1.3 研究目的和研究内容  10
  1.4 论文组织结构  10-11
  1.5 本文的主要工作  11-12
2 相关技术分析  12-25
  2.1 Hadoop 运行机制  12-15
    2.1.1 Hadoop 实体结构  12
    2.1.2 基本任务执行流程  12-14
    2.1.3 高级MapReduce  14-15
  2.2 HDFS 分布式文件系统  15-19
    2.2.1 影响HDFS 的外在因素  16-18
    2.2.2 SecondNameNode  18
    2.2.3 NameNode  18
    2.2.4 DataNode  18-19
  2.3 MapReduce 数据模型  19-21
    2.3.1 MapReduce 类型  19-20
    2.3.2 MapReduce 类型设定  20
    2.3.3 MapReduce 主要方法的设定  20
    2.3.4 输入输出格式  20-21
  2.4 Pig  21-23
    2.4.1 Pig 运行方式  22
    2.4.2 一个实例  22-23
  2.5 HBASE  23-24
  2.6 TBB 与传统线程库区别  24-25
3 基于 Hadoop 的集群平台构建  25-41
  3.1 构建方法及过程  25-37
    3.1.1 SSH 配置  25-28
    3.1.2 配置Hadoop  28-32
    3.1.3 分发安装文件到各个结点  32-35
    3.1.4 配置环境变量  35-36
    3.1.5 格式化NameNode  36
    3.1.6 启动hdfs 和MapReduce  36-37
  3.2 故障恢复  37-41
    3.2.1 NameNode 故障恢复  37-38
    3.2.2 DataNode 故障恢复  38
    3.2.3 DataNode 退役  38-40
    3.2.4 DataNode 结点的添加  40
    3.2.5 误删文件恢复  40-41
4 任务级 MapReduce 研究  41-54
  4.1 线程级MapReduce 分析  41-44
    4.1.1 并行与并发的区别和联系  41-42
    4.1.2 MapReduce 与并行  42
    4.1.3 Hadoop Streaming  42-43
    4.1.4 C++接口  43-44
  4.2 任务级MapReduce 研究  44-48
    4.2.1 TBB 与MapReduce 的契合性  44
    4.2.2 TBB 适用于MapReduce 的算法  44-46
    4.2.3 MapReduce+TBB 混合编程模型  46-47
    4.2.4 移植性  47
    4.2.5 制约因素和处理方法  47-48
  4.3 性能对比实验  48-54
    4.3.1 PI 的算法  48-49
    4.3.2 线程级性能  49-52
    4.3.3 任务级并行的优越性  52-54
5 任务级 MapReduce 在集群平台下的性能测试  54-57
  5.1 线程级单核集群与任务级单核集群测试分析  54
  5.2 线程级多核集群与任务级多核集群测试分析  54-55
  5.3 针对不同核心总数和数据规模的性能测试分析  55-57
6 总结与展望  57-58
致谢  58-59
参考文献  59-61
附录  61
  A 作者在攻读学位期间发表的论文目录  61
  B 作者在攻读学位期间参与的科研项目  61

相似论文

  1. DMR集群系统高层协议的设计和研究,TN929.52
  2. 过敏原TBb抗原表位区及其关键氨基酸的鉴定,R284.1
  3. 科学发展观视阈下的湖北省白酒产业集群发展研究,F426.82
  4. 多核系统下并行节点复制垃圾收集算法研究,TP332
  5. 产业集群模式对促进服装自主品牌的作用研究,F273.2
  6. 电离辐射和紫杉醇诱导的多核细胞形成中SPATA5L1、Cyclin B2表达的变化,R739.8
  7. 基于Map/Reduce框架的分布式日志分析系统的研究及应用,TP311.52
  8. 跨国公司主导型产业集群的均衡分析,F224
  9. 产业集群中的技术创新网络研究,F062.9
  10. 技术类型、交易费用与一类产业集群的成因及演化趋势研究,F279.2
  11. 黑龙江省中小企业集群融资问题研究,F276.3
  12. 产业集群内企业间信任机制研究,F224
  13. 基于GEM模型的DY镇产业集群研究,F279.27
  14. 地方政府在产业集群形成中的作用研究,D625
  15. 多核架构下LLC很少重用块的研究,TP332
  16. 沈阳汽车产业集群研究,F224
  17. 基于多核的数据并行编程平台的研究与实现,TP332
  18. 采掘业产业集群集聚度的均衡水平测度分析,F224
  19. 我国中小企业融资方式创新研究,F276.3
  20. 基于Hadoop的在线购物原型系统的设计与实现,TP311.52
  21. 基于Hadoop的移动学习系统设计与实现,G434

中图分类: > 工业技术 > 自动化技术、计算机技术 > 自动化技术及设备 > 自动化系统 > 数据处理、数据处理系统
© 2012 www.xueweilunwen.com