学位论文 > 优秀研究生学位论文题录展示
基于MapReduce的分布式文本数据过滤技术研究与系统实现
作 者: 李虎
导 师: 邹鹏
学 校: 国防科学技术大学
专 业: 计算机科学与技术
关键词: 文本过滤 MapReduce 分布式计算 向量空间模型 特征扩展
分类号: TP391.1
类 型: 硕士论文
年 份: 2011年
下 载: 56次
引 用: 0次
阅 读: 论文下载
内容摘要
|
互联网的迅猛发展带来了信息的爆炸式增长,在海量的信息中准确获取有用信息显得迫切而必要。信息过滤技术根据用户的需求,将动态的信息流中不符合要求的信息过滤掉,自动筛选出有用信息。面对海量数据,传统方法已很难满足需求,分布式计算平台是未来发展的必然趋势。基于内容的文本数据过滤技术采用向量空间模型来表示文本,通过计算文本和用户兴趣模板之间的夹角余弦值来确定文本的相关程度。该方法理论成熟,简单易懂,精度较高。MapReduce模型框架能实现在大型计算机集群上的海量数据分布式并行处理。用户只需自定义map函数和reduce函数就能实现大部分的分布式计算任务。现实世界中的很多计算可以很容易地使用MapReduce模型来表示。本文以基于内容的文本数据过滤模型为基础,针对现有文本过滤系统存在的不足,研究了在MapReduce模型框架下实现海量数据实时过滤涉及到的关键技术。主要工作如下:(1)研究了基于内容的信息过滤系统所涉及到的相关理论技术,对其中的一些关键技术进行了深入的分析讨论,分析了现有方法在实际应用中优缺点。(2)深入分析了MapReduce模型框架及其相关组件的工作原理。结合示例,对基于MapReduce的分布式应用程序开发做了详细阐述。(3)设计了一种基于HowNet中文知识库的特征项扩展模型,将具有相同含义的特征项进行了合并,在降低向量表示维度的同时,提高了表示的准确度。(4)提出了一种基于MapReduce模型框架计算特征项TF-IDF值的算法,通过计算任务的分解,实现了计算任务的并行化。(5)设计实现了一个基于MapReduce模型框架的分布式文本数据过滤原型系统,通过实验证明了该方法的可行性。
|
全文目录
摘要 8-9 ABSTRACT 9-10 第一章 绪论 10-16 1.1 研究背景 10-12 1.2 研究现状 12-14 1.3 本文的主要研究内容和组织结构 14-16 1.3.1 本文的主要研究内容 14-15 1.3.2 本文的组织结构 15-16 第二章 相关知识 16-29 2.1 信息过滤 16-23 2.1.1 信息过滤流程 16-17 2.1.2 信息过滤模型 17-19 2.1.3 文本分类 19-22 2.1.4 性能评价 22-23 2.2 MapReduce 及相关组件 23-28 2.2.1 MapReduce 23-26 2.2.2 HDFS 26-27 2.2.3 HBase 27-28 2.3 本章小结 28-29 第三章 基于MapReduce 的分布式文本过滤关键技术研究 29-46 3.1 文本数据的预处理 29-33 3.1.1 网页数据的降噪处理 29-31 3.1.2 中文分词 31-33 3.2 文本数据的形式化表示 33-41 3.2.1 特征项选取 33-36 3.2.2 权重计算 36-38 3.2.3 基于HowNet 的特征项扩展 38-41 3.3 反馈学习 41-43 3.3.1 用户兴趣模板的反馈学习 41-43 3.3.2 过滤阈值的反馈学习 43 3.4 传统文本过滤技术的分布式扩展 43-45 3.4.1 分布式数据存储与索引 44 3.4.2 MapReduce 任务的优化 44-45 3.5 本章小结 45-46 第四章 基于MapReduce 的分布式文本数据过滤系统设计与实现 46-57 4.1 系统总体架构的设计 46-47 4.2 文本数据的形式化表示模块 47-50 4.2.1 数据降噪子模块 47-48 4.2.2 中文分词子模块 48 4.2.3 特征提取子模块 48-50 4.2.4 基于HowNet 的特征扩展模块 50 4.2.5 权重计算子模块 50 4.3 相似度比较模块 50 4.4 自适应学习模块 50-51 4.4.1 用户兴趣模板自适应学习子模块 51 4.4.2 过滤阈值自适应学习模块 51 4.5 实验及结果分析 51-56 4.5.1 网页数据降噪 52 4.5.2 过滤精度测试 52-53 4.5.3 初始阈值的设定 53-54 4.5.4 基于HowNet 的特征扩展 54-55 4.5.5 过滤速度测试 55-56 4.6 本章小结 56-57 第五章 结束语 57-59 致谢 59-60 参考文献 60-64 作者在学期间取得的学术成果 64-65 作者在学期间参加的科研工作 65
|
相似论文
- 基于停用词处理的汉语语音检索方法,TP391.1
- 基于SVM分类算法的主题爬虫研究,TP391.3
- 基于Map/Reduce框架的分布式日志分析系统的研究及应用,TP311.52
- 构建分布式系统的关键技术研究与实现,TP338.8
- 应用于搜索引擎的人物分类系统设计与实现,TP391.3
- 面向汽车行业的主题爬虫研究与实现,TP391.3
- 面向短消息文本的聚类技术研究与应用,TP391.1
- 高速网络环境下的入侵检测系统的研究,TP393.08
- 基于树型条件随场的特定域事件提取方法研究,TP391.1
- 数据中心Hadoop部署与追踪系统研究,TP308
- 基于Linux平台的局域网云监控系统的分析与实现,TP311.52
- 网络教育新闻文本分类系统的设计与实现,TP391.1
- 面向论坛信息文本的有效数据抽取研究,TP391.1
- SMBSDD:一种改进的非结构化P2P网络搜索机制,TP393.02
- 基于Web的社会网络搜索中人名同一性判断方法研究,TP393.09
- 云环境下MapReduce容错技术的研究,TP302.8
- Web新闻热点发现系统的设计与实现,TP393.09
- 多角色社交网络研究,TP393.09
- 基于分类模型监测电子商务违禁信息的研究与实现,TP393.09
- 一个可扩展的MapReduce原型设计与实现,TP311.52
中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 文字信息处理
© 2012 www.xueweilunwen.com
|