学位论文 > 优秀研究生学位论文题录展示

基于对等网络的搜索引擎关键技术研究

作 者: 孙晓静
导 师: 郭忠文
学 校: 中国海洋大学
专 业: 计算机系统结构
关键词: 搜索引擎 对等网络技术 信息检索 多关键字搜索算法
分类号: TP391.3
类 型: 硕士论文
年 份: 2010年
下 载: 44次
引 用: 0次
阅 读: 论文下载
 

内容摘要


随着互联网络的高速发展,Web上的信息量越来越大,而且这些信息本身是高度分布式的。而传统的搜索引擎大都采用集中式的搜索机制,因此很难满足用户对于搜索效率和搜索结果的要求。与此同时,对等网络(Peer-to-Peer, P2P)由于其本身的分布式体系结构以及其对于网络中硬件资源的利用能力,为解决以上问题提供了一个新的研究方向——构建基于对等网络的搜索引擎。基于对等网络的搜索引擎的优势主要体现在以下几个方面:(1)网络中的信息本身就是高度分布式的,这与对等网络的体系结构相符合;(2)由于对等网络中的节点都能够向网络提供自己的资源,包括带宽、存储和计算能力等,因此对等网络能够利用到网络中更多的硬件资源。然而,基于对等网络的搜索引擎作为一种新兴的网络应用,还有很多问题有待解决,例如现有的搜索算法效率较低,难以支持复杂查询等等。本文在分析基于对等网络的搜索技术存在的问题基础上,提出了一种基于非结构化对等网络的信息检索路由算法——基于搜索历史的多关键字搜索(History-based Multi-keywords Search, HMS)算法。HMS算法只需要每个节点为各个邻居节点保存部分历史查询信息,当节点收到一个新的查询消息时,便根据对这些历史信息的分析自动发现有几个以及具体是哪几个邻居节点有可能回复当前的查询消息。在转发查询消息时,节点只把查询消息发给那些比较有可能回复该查询消息的邻居节点。最后,本文设计并实现了一个基于非结构化对等网络的信息检索仿真系统,并利用该系统对HMS算法的搜索效率作了验证。试验结果表明HMS算法能够有效地降低网络通信开销,同时还能够保证较高水平的查询结果。

全文目录


摘要  5-6
Abstract  6-10
1 引言  10-16
  1.1 研究背景  10-12
    1.1.1 对等网络应用背景及现状  11
    1.1.2 网络信息检索技术应用背景及现状  11-12
  1.2 本文的主要研究意义  12-14
  1.3 本文主要贡献  14
  1.4 本文组织结构  14-16
2 基于对等网络的搜索引擎关键技术分析  16-36
  2.1 相关对等网络技术  16-29
    2.1.1 对等网络拓扑分类  16-23
      2.1.1.1 中心化拓扑(Centralized Topology)  18-19
      2.1.1.2 全分布式非结构化拓扑(Decentralized Unstructured Topology)  19-20
      2.1.1.3 半分布式拓扑(Partially Decentralized Topology)  20-21
      2.1.1.4 全分布式结构化拓扑(Decentralized Structured Topology)  21-22
      2.1.1.5 四种对等网络拓扑结构对比  22-23
    2.1.2 典型的非结构化对等网络路由算法  23-29
      2.1.2.1 Flooding算法  24-26
      2.1.2.2 Modified-BFS算法  26-27
      2.1.2.3 Iterative Deepening算法  27
      2.1.2.4 Random-walk算法  27-28
      2.1.2.5 Intelligent Search Mechanism算法  28-29
  2.2 相关搜索引擎技术  29-35
    2.2.1 搜索引擎的工作原理  29-30
    2.2.2 搜索引擎分类  30-31
    2.2.3 Lucene—基于Java的全文索引工具包  31-35
  2.3 本章小结  35-36
3 基于搜索历史的多关键字搜索算法设计  36-48
  3.1 算法设计背景  36-37
  3.2 算法核心设计  37-45
    3.2.1 查询消息传递机制  38-40
    3.2.2 邻居节点排序机制  40-42
    3.2.3 邻居节点选择优化机制  42-45
  3.3 使用HMS算法的信息检索示例  45-47
  3.4 本章小结  47-48
4 非结构化对等网信息检索仿真系统的设计与实现  48-63
  4.1 仿真系统设计  48-54
  4.2 仿真系统实现  54-55
  4.3 仿真试验设置  55-58
  4.4 仿真结果分析  58-62
  4.5 本章小结  62-63
5 总结与展望  63-64
参考文献  64-67
致谢  67-68
个人简历  68
发表的学术论文  68

相似论文

  1. 生物医学领域检索系统查询扩展技术研究,TP391.3
  2. 面向海量邮件的检索系统研究与实现,TP393.098
  3. 网络搜索引擎的相关技术研究,G354
  4. 基于跨语言信息检索的企业竞争情报收集系统模型研究,TP391.3
  5. 基于语义网络的智能搜索引擎研究,TP391.3
  6. 搜索引擎服务提供商版权侵权责任认定标准探讨,D923.41
  7. 基于Web搜索和网页结构分析的IT相关主题新闻抓取研究,TP393.092
  8. 基于策略Agent的个性化信息检索系统的研究与实现,TP391.3
  9. 分布式搜索引擎索引安全及缓存策略研究,TP333
  10. 基于WebHarvest的中文财经新闻搜索引擎的设计与实现,TP311.52
  11. 基于稀疏非负矩阵分解的图像检索,TP391.41
  12. 跨语言文本分类的研究,TP391.1
  13. 基于分类模型监测电子商务违禁信息的研究与实现,TP393.09
  14. 排序学习损失函数的研究,TP181
  15. 教育培训行业互联网营销问题的研究,F49
  16. 搜索引擎侵权行为研究,D923
  17. 基于Web数据挖掘的个性化搜索引擎研究,TP391.3
  18. 基于Agent元搜索引擎的个性化研究,TP391.3
  19. 基于点击的用户聚类的研究,TP311.13
  20. 英汉跨语言问答系统中的文档语义检索,TP391.1
  21. 论搜索引擎竞价排名的法律规制,D923.43

中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 检索机
© 2012 www.xueweilunwen.com