学位论文 > 优秀研究生学位论文题录展示

汉英跨语言网址搜索引擎的设计与实现

作 者: 朱培焱
导 师: 徐学洲;李波
学 校: 西安电子科技大学
专 业: 计算机技术
关键词: 信息检索 跨语言信息检索 搜索引擎 元搜索引擎 数据库全文检索
分类号: TP391.3
类 型: 硕士论文
年 份: 2010年
下 载: 38次
引 用: 0次
阅 读: 论文下载
 

内容摘要


近年来,随着信息技术的飞速发展,互联网成为人们发布和获取信息的重要渠道。但互联网用户分布于全世界,互联网用户和互联网内容存在着语种的多样性和不平衡性。互联网领域的跨语言信息检索研究正变得日益重要。调查显示目前互联网上用户最多的两个语种分别是英文和中文。中文互联网用户使用中文关键词查找国外网站网址这个需求目前商业搜索引擎尚不能兼顾。本文针对这个需求,设计并实现了一个汉英跨语言网址检索系统,称之为汉英跨语言网址搜索引擎。该系统包括元搜索引擎子系统和数据库全文检索子系统,前者利用查询翻译技术来实现跨语言网址查询;后者通过网络爬虫抓取目录类网站,以挖掘国外网站的网址信息,再通过文献翻译技术,将网址信息和翻译信息存储到数据库中,最后利用全文检索技术实现搜索功能。本系统已在我校科研系统得到了应用,为我校教师查询浏览国外网站网址提供服务,为其科研工作提供便利。本文首先研究相关的理论和关键技术,然后给出了系统的设计和实现的介绍,并对系统的查询结果进行了展示和分析,表明了系统设计方案的可行性,并介绍了系统的应用和意义,最后总结了本文工作并对未来工作做出了展望。

全文目录


摘要  3-4
Abstract  4-7
第一章 绪论  7-13
  1.1 问题的提出  7-8
  1.2 跨语言信息检索研究现状  8-9
  1.3 元搜索引擎研究现状  9-10
  1.4 本文的主要工作和意义  10
  1.5 本文的组织结构  10-13
第二章 相关理论及关键技术研究  13-31
  2.1 传统信息检索  13-16
    2.1.1 信息检索模型  13-14
    2.1.2 信息检索系统的评价机制  14-16
  2.2 跨语言信息检索  16-19
    2.2.1 跨语言信息检索技术  16-18
    2.2.2 汉英跨语言信息检索技术难点  18-19
  2.3 搜索引擎理论简介  19-23
    2.3.1 搜索引擎的发展  19-20
    2.3.2 搜索引擎原理与技术  20-23
  2.4 元搜索引擎理论  23-27
    2.4.1 元搜索引擎概念  23
    2.4.2 元搜索引擎分类  23-25
    2.4.3 元搜索引擎原理  25-27
  2.5 其他关键技术  27-31
    2.5.1 中文分词技术  27-28
    2.5.2 Spider技术  28
    2.5.3 网址挖掘判定  28-29
    2.5.4 Ajax技术  29-31
第三章 系统的设计  31-47
  3.1 总体架构设计  31-33
  3.2 数据库设计  33-40
    3.2.1 数据库持久化框架  33-36
    3.2.2 数据库表设计  36-40
  3.3 用户界面设计  40-41
  3.4 重点模块设计  41-47
    3.4.1 爬虫网址挖掘模块设计  41-43
    3.4.2 数据库全文检索模块设计  43-45
    3.4.3 元搜索模块设计  45-47
第四章 系统的实现  47-63
  4.1 系统开发环境  47-49
    4.1.1 动态开发语言Ruby  47-48
    4.1.2 MVC框架Ruby on Rails  48-49
    4.1.3 集成开发环境Netbeans IDE  49
  4.2 数据库及MODEL层实现  49-52
    4.2.1 数据库实现  49-51
    4.2.2 Model层实现  51-52
  4.3 重点模块和功能的实现  52-58
    4.3.1 中文分词功能的实现  52-53
    4.3.2 Ajax查询自动完成功能的实现  53-54
    4.3.3 爬虫网址挖掘模块的实现  54-56
    4.3.4 全文检索模块的实现  56-57
    4.3.5 元搜索模块的实现  57-58
  4.4 系统运行效果及应用  58-63
    4.4.1 系统运行效果  58-62
    4.4.2 系统应用及意义  62-63
第五章 结束语  63-65
  5.1 总结  63
  5.2 未来工作  63-65
致谢  65-67
参考文献  67-70

相似论文

  1. 生物医学领域检索系统查询扩展技术研究,TP391.3
  2. 网络搜索引擎的相关技术研究,G354
  3. 基于跨语言信息检索的企业竞争情报收集系统模型研究,TP391.3
  4. 基于语义网络的智能搜索引擎研究,TP391.3
  5. 搜索引擎服务提供商版权侵权责任认定标准探讨,D923.41
  6. 基于Web搜索和网页结构分析的IT相关主题新闻抓取研究,TP393.092
  7. 分布式搜索引擎索引安全及缓存策略研究,TP333
  8. 基于WebHarvest的中文财经新闻搜索引擎的设计与实现,TP311.52
  9. 基于稀疏非负矩阵分解的图像检索,TP391.41
  10. 数据库全文检索方法研究及其应用,TP311.13
  11. 教育培训行业互联网营销问题的研究,F49
  12. 搜索引擎侵权行为研究,D923
  13. 基于Web数据挖掘的个性化搜索引擎研究,TP391.3
  14. 基于Agent元搜索引擎的个性化研究,TP391.3
  15. 基于点击的用户聚类的研究,TP311.13
  16. 英汉跨语言问答系统中的文档语义检索,TP391.1
  17. 论搜索引擎竞价排名的法律规制,D923.43
  18. 搜索引擎悖论解读,G254
  19. 基于概率的潜在语义分析模型在搜索引擎商业文本分类系统中的应用研究,TP391.1
  20. 基于搜索引擎网页排序算法研究,TP391.3
  21. 网络下载侵权分析,D923.41

中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 检索机
© 2012 www.xueweilunwen.com