学位论文 > 优秀研究生学位论文题录展示
主题搜索引擎中的爬取技术研究
作 者: 姜琨
导 师: 杨岳湘
学 校: 国防科学技术大学
专 业: 计算机科学与技术
关键词: 主题爬虫 网页去噪 主题漂移 主题孤岛 隧道技术
分类号: TP391.3
类 型: 硕士论文
年 份: 2011年
下 载: 34次
引 用: 0次
阅 读: 论文下载
内容摘要
|
随着互联网的迅速发展,网络资源的信息量也急剧增长。人们发现使用普通搜索引擎搜索主题信息的及时性和准确性越来越不理想。主题搜索引擎由于只采集与某一特定领域相关的信息,以构筑某一主题的Web信息资源库为目标,因而具有很高的实用价值和广阔的应用领域。本文主要对主题搜索引擎中占有重要地位的主题爬虫进行深入分析和研究。本文首先介绍了一些搜索引擎相关的基本理论,包括普通爬虫与主题爬虫的结构、工作原理以及Web信息的分布特征等内容。为了提高主题搜索引擎的查准率,就需要对爬取的网页进行噪声去除,提取出网页的正文信息。本文在介绍文本表示模型的相关理论和深入分析现有各种网页去噪算法的优缺点之后,以降低爬虫系统的计算复杂度和提高搜索引擎的查准率为目标,提出了一种基于标签属性的网页去噪算法。针对现有爬行算法不能很好解决“主题漂移”和“主题孤岛”两类问题,本文提出了一种基于动态隧道技术的爬行算法。该爬行算法在基于内容分析的爬行算法中加入以Page Rank为主的链接分析思想,可以比较好的解决基于链接分析爬行算法中出现的主题漂移问题。另外,通过在链接预测过程中对不相关的链接进行深入处理,并动态调整在不相关链接方向上的爬行深度,使得新的爬行算法能够在一定程度上解决主题孤岛问题,从而提高主题搜索引擎的查全率。最后本文以开源软件Nutch为基础,对所提出的算法进行了设计与实现,并对基于标签属性的网页去噪算法和基于动态隧道技术的爬行算法进行了测试。测试结果表明,在采用了新的网页去噪算法和基于动态隧道技术的爬行算法之后,本文基于Internet上实现的军事主题搜索引擎的查准率和查全率都得到了明显的提高。
|
全文目录
摘要 9-10 ABSTRACT 10-11 第一章 绪论 11-17 1.1 论文背景 11-12 1.2 国内外研究现状 12-14 1.2.1 CORA 系统 12 1.2.2 IBM Focused Crawler 系统 12-13 1.2.3 北大天网主题搜索 13 1.2.4 南京大学的IDGS 13-14 1.3 论文主要工作 14-15 1.4 论文组织结构 15-17 第二章 相关理论 17-26 2.1 Web 页面的分布特征 17-19 2.1.1 H/A 特征 17-18 2.1.2 主题关联特征 18-19 2.2 爬虫结构分析 19-22 2.2.1 普通爬虫的工作流程 19-21 2.2.2 主题爬虫的工作流程 21-22 2.3 普通爬虫的爬行算法 22-25 2.3.1 深度优先爬行算法 22-23 2.3.2 广度优先爬行算法 23-24 2.3.3 链接优先级排序 24-25 2.4 本章小结 25-26 第三章 基于标签属性的网页去噪方法 26-35 3.1 基本概念 26-28 3.1.1 HTML 结构 26-27 3.1.2 TFIDF 权重 27-28 3.1.3 文本信息模型 28 3.2 去噪算法思想 28-32 3.2.1 算法依据 28-29 3.2.2 相似性计算 29-30 3.2.3 极大相容类 30-31 3.2.4 算法描述 31-32 3.3 实验分析 32-33 3.3.1 实验数据和分类器选择 32 3.3.2 评测标准 32-33 3.3.3 实验结果及分析 33 3.4 本章小结 33-35 第四章 基于动态隧道技术的爬行算法 35-46 4.1 主题爬行算法 35-37 4.1.1 基于内容分析的爬行算法 35-36 4.1.2 基于链接分析的爬行算法 36-37 4.1.3 两类爬行算法的比较 37 4.2 主题漂移问题的解决 37-39 4.2.1 BFS 算法的改进 37-38 4.2.2 新算法中的链接分析 38-39 4.3 主题孤岛问题分析 39-45 4.3.1 主题孤岛问题 39-40 4.3.2 现有爬行算法的缺陷 40-42 4.3.3 解决主题孤岛的思想 42-45 4.4 本章小结 45-46 第五章 主题爬虫设计与实现 46-60 5.1 Nutch 简要分析 46-48 5.1.1 Nutch 结构 46-47 5.1.2 Nutch 工作流程 47-48 5.2 主题搜索引擎设计与实现 48-53 5.2.1 系统总体框架 48 5.2.2 系统主要模块的设计 48-50 5.2.3 系统实现方案 50-53 5.3 实验平台与运行环境 53-54 5.3.1 系统部署 53 5.3.2 运行环境 53-54 5.4 系统测试与分析 54-59 5.4.1 测试方案 54-55 5.4.2 测试结果及分析 55-59 5.5 本章小结 59-60 第六章 总结与展望 60-62 6.1 主要工作及创新点 60 6.2 未来工作展望 60-62 致谢 62-63 参考文献 63-67 作者在学期间取得的学术成果 67
|
相似论文
- 基于SVM分类算法的主题爬虫研究,TP391.3
- 面向汽车行业的主题爬虫研究与实现,TP391.3
- 面向教育新闻的主题爬虫设计与实现,TP391.3
- 基于段落指纹的大规模近似网页检测算法研究,TP393.092
- 一种基于前缀表达式的Web信息抽取方法的关键问题的实现,TP391.1
- IPv4/IPv6协议过渡方案的研究,TP393.04
- 基于IPv6的下一代校园网设计,TP393.18
- 基于Web页面嵌套模式的包装器生成系统的设计与实现,TP393.092
- IPv4/IPv6过渡技术的研究,TP393.04
- 移动垂直搜索系统的研究,TP391.3
- 基于垂直搜索引擎的主题爬虫算法的研究,TP391.3
- 基于遗传算法的主题爬虫搜索策略研究,TP391.3
- 主题爬虫的研究与实现,TP391.3
- 基于VPN技术的校园网研究及应用,TP393.18
- 长春联通IP承载网IPv4/v6共存及过渡方案的研究,TP393.04
- 主题爬虫URL分析模型与调度技术研究,TP393.092
- 基于Groovy的分布式网络爬虫系统的设计与实现,TP391.3
- 主题爬虫系统的研究,TP391.3
- 基于MPLS VPN技术对电子政务网络改造和优化,TP393.1
- VPN技术在校园网中的应用与实现,TP393.18
中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 检索机
© 2012 www.xueweilunwen.com
|