学位论文 > 优秀研究生学位论文题录展示
一种可扩展的面向中文主题搜索引擎的研究与设计
作 者: 徐诗亮
导 师: 刘发升
学 校: 江西理工大学
专 业: 计算机应用技术
关键词: 主题搜索引擎 信息搜集 倒排索引 异步模式
分类号: TP391.3
类 型: 硕士论文
年 份: 2009年
下 载: 62次
引 用: 0次
阅 读: 论文下载
内容摘要
|
面向主题的搜索引擎是一种分类精确细致、更新及时的搜索引擎,是搜索引擎的细分和延伸。随着Web信息的爆炸增长以及信息多元化的发展,主题搜索引擎正成为研究热点与发展趋势。与通用搜索引擎相比,主题搜索引擎由于检索范围较小,查准率和查全率易于保证。本文的研究对象是Web这样的动态海量信息载体,研究的主要目的是要得到一种支持海量网页信息搜集、具有健壮的网页预处理、并提供相应规模的索引和查询接口的中文主题搜索引擎系统。本文所做的可扩展性工作主要体现在网络蜘蛛信息搜集和查询服务实现两方面。基于对网页性质及其分布的认识,本文提出一种可扩展网络蜘蛛信息搜集系统体系结构。系统可以让用户根据自己对信息的兴趣,配置用于引导系统搜集的主题导向词,以及搜集范围。同时,尽可能地使用和遵循现有的标准和协议。在不需要改动或改动很少的配置的情况下,适用不同主题的信息抓取。搜集系统力图在搜集策略、开放性、可定制性等方面得到一个很好的折衷。网络蜘蛛采用Fish搜索算法动态地调整爬行方向,从而保证了抓取网页的主题相关性。网络蜘蛛的可扩展性主要体现在种子链接发现、增量式抓取、多线程和限定抓取类型等。实验结果表明,网络蜘蛛具有较强的抓取能力,很好地解决了搜索引擎的数据来源问题。针对网络蜘蛛搜集来的主题网页进行一系列的预处理,抽取其中的网页URL、标题、正文内容、锚文本等。针对网页URL编码的不同而造成的网页乱码现象,采用统一的字符集和编码方案。设计一个中文搜索引擎,索引创建需要一个高效的倒排算法。本文从索引文件本身出发,采用分级的倒排表索引组织结构,提高了索引创建的效率。本文还结合中文分词技术,构建一定规模的词库,尝试解决中文搜索引擎存在的查准率和检索精度问题。在查询服务阶段,增量和合并的配置策略对索引进行了扩展,实现索引文档的动态更新。本文结合Lucene索引包特点,在达到索引合并阈值时,通过微调Lucene内置参数,有效避免频繁地改动和合并大索引块。同时,本文还给出基于Ajax技术的搜索引擎异步模式,这样极大地丰富了Web的表现力,也因此提高了搜索引擎的效用性。
|
全文目录
摘要 2-3 ABSTRACT 3-8 第一章 绪论 8-13 1.1 通用搜索引擎 8-10 1.1.1 通用搜索引擎的发展 8-10 1.1.2 通用搜索引擎的不足 10 1.2 主题搜索引擎 10-11 1.2.1 主题搜索引擎的产生 10-11 1.2.2 主题搜索引擎的发展前景 11 1.3 主题搜索引擎的实现难点 11-12 1.4 本文的主要工作和组织 12-13 第二章 搜索引擎相关理论 13-20 2.1 搜索引擎工作流程 13-16 2.1.1 网页的搜集 13-14 2.1.2 预处理 14-15 2.1.3 查询服务 15-16 2.2 实现搜索引擎的关键技术 16-17 2.3 搜索引擎评价原则 17-19 2.3.1 评价指标体系 17-19 2.3.2 其他评测因素 19 2.4 本章小结 19-20 第三章 中文WEB 网页的搜集方式 20-28 3.1 搜集WEB 信息 20-21 3.2 多线程 21-22 3.3 搜集策略 22-23 3.4 避免搜集镜像网页及更新策略 23-25 3.4.1 避免搜集镜像网页 23-24 3.4.2 更新策略 24-25 3.5 网络蜘蛛模型 25-27 3.5.1 网络蜘蛛原理 25-26 3.5.2 网络蜘蛛的体系结构 26-27 3.5.3 效率优化 27 3.5.4 蜘蛛访问规范 27 3.6 本章小结 27-28 第四章 面向主题的网络蜘蛛的设计 28-38 4.1 网络蜘蛛功能需求分析 28 4.2 主题网页链接发现 28-30 4.3 初始种子URL 的更新 30 4.4 搜索策略的选择 30-31 4.5 抓取主题页面 31-33 4.5.1 正则表达式 31-32 4.5.2 列表网页爬行和抓取 32 4.5.3 全网爬行和抓取 32-33 4.5.4 精确爬行和抓取 33 4.6 相应的实验设计 33-37 4.6.1 主题网页链接发现 33-35 4.6.2 主题网页抓取 35-37 4.6.3 抓取能力结果分析 37 4.6.4 指定类型页面解析 37 4.7 本章小结 37-38 第五章 中文WEB 网页预处理 38-50 5.1 信息抽取技术概述 38-39 5.1.1 信息抽取的定义 38 5.1.2 信息抽取的研究对象 38-39 5.1.3 信息抽取的评价指标 39 5.2 中文WEB 网页解析 39-42 5.2.1 Web 信息抽取 39-40 5.2.2 中文Web 网页解析 40-42 5.3 中文分词 42-45 5.3.1 中文分词的应用 44-45 5.4 建立倒排索引 45-46 5.5 实现结果与分析 46-49 5.6 本章小结 49-50 第六章 查询服务实现 50-61 6.1 全文检索工具包LUCENE 50-53 6.1.1 Lucene 简介 50 6.1.2 Lucene 的系统结构 50-51 6.1.3 Lucene 详细结构分析 51-53 6.2 索引更新 53-54 6.2.1 重构索引 53 6.2.2 合并索引 53 6.2.3 增量式更新 53 6.2.4 选择合适的索引更新策略 53-54 6.3 索引压缩 54-55 6.4 LUCENE 与中文分词技术 55-57 6.4.1 正向最大匹配算法中长词屏蔽短词的问题 55 6.4.2 未登录词的识别和处理 55-56 6.4.3 基于词库的Lucene 分词算法 56-57 6.4.4 由字构词的分词方法 57 6.5 查询接口实现的关键点 57-58 6.5.1 相关关键字的索引问题 58 6.6 增强用户体验的AJAX 技术 58-60 6.6.1 实时搜索建议 59-60 6.7 本章小结 60-61 第七章 结论与展望 61-62 7.1 本文的主要工作和贡献 61 7.2 下一步的工作和展望 61-62 参考文献 62-64 致谢 64-65 个人简历、在学期间发表的学术论文与研究成果 65-66
|
相似论文
- 基于Hadoop的倒排索引技术的研究,TP391.3
- 基于接口匹配的语义Web服务发现方法研究,TP391.1
- 基于倒排索引的压缩算法性能研究,TP391.3
- 基于Lucene的网页抓取与检索系统,TP393.092
- 移动垂直搜索系统的研究,TP391.3
- 基于内容的快速音频检索,TP391.3
- 基于Android的桌面搜索引擎的研究与实现,TP391.3
- 主题搜索引擎中相关技术的研究与实现,TP391.3
- 一种基于语义标注的个性化搜索技术的研究与实现,TP391.3
- 动态全文索引系统关键技术研究,TP391.3
- 基于语义的主题搜索引擎研究,TP391.3
- 主题搜索引擎索引技术的研究与实现,TP391.3
- 主题搜索引擎信息抽取技术研究,TP391.3
- 基于百科的中文知识搜索系统的设计与实现,TP391.3
- 面向主题的搜索引擎的设计与实现,TP391.3
- 基于关键字的模糊查询技术的研究,TP311.13
- 基于双路索引的XML查询优化研究,TP311.13
- 基于MPI的分布式搜索引擎系统研究,TP391.3
- 基于P2P的搜索引擎的关键技术研究,TP391.3
- 基于词关联度的信息检索系统,TP391.3
中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 检索机
© 2012 www.xueweilunwen.com
|