学位论文 > 优秀研究生学位论文题录展示

基于随机游走的网页协同排序算法研究

作 者: 张士军
导 师: 张宪超
学 校: 大连理工大学
专 业: 计算机应用技术
关键词: 信息检索 协同排序 随机游走
分类号: TP393.092
类 型: 硕士论文
年 份: 2010年
下 载: 98次
引 用: 0次
阅 读: 论文下载
 

内容摘要


随着万维网的高速发展,信息也出现爆炸式的增长,快速的获取想要的信息变得越来越困难,因此网页排序算法变得越来越重要。搜索引擎是目前最有效的帮助人们找到所需信息的途径,人们不仅要求搜索引擎查找的信息全面,还要求它能对相关主题进行准确查询。因此如何高效地获取用户所需信息已经成为搜索引擎面临的一个巨大挑战。近些年来提出的基于随机游走的链接分析排序算法取得了很好的效果,但是这些算法的局限在于仅考虑同一种链接结构信息或者单一的文本信息。HITS算法是基于主题的,主题相关性较大,但没有较好的反作弊能力,所以非常容易发生主题漂移的问题。PageRank可以有效的防止作弊,但是它是非查询性的,不能分辨网页在广泛意义上是权威的还是仅仅在特定的查询上是权威的。目前的网页排序精度仍然无法满足网民需求。仅仅通过链接、字体、位置等表面特征,不能真正判断搜索词和文章的相关性。本文提出一种新的应用于Web网络中的网页协同排序框架(Co-Ranking),算法随机游走于两种不同的网页权重之间,能更好的模拟用户的网页浏览行为。本文认为,在HITS算法中排序排在前列的实体,在PageRank算法中也应该获取好的排序名次。与此相同,对于相同的网页,PageRank的排名序列对其在HITS算法中的排名序列也是有影响的。在PageRank算法中,用户会从当前网页中挑选下一步要访问的链接,并且也存在以一个很小的概率c从当前页面跳到具有HITS算法中Authority值很高的页面。这样,算法既考虑了全局的重要性,又能考虑主题的权威性。实验结果表明,与其它链接分析算法相比,利用协同排序算法框架能提高排序精度7%以上。

全文目录


摘要  4-5
Abstract  5-8
1 绪论  8-15
  1.1 研究背景和意义  8-12
    1.1.1 信息检索和排序问题的背景知识  8-9
    1.1.2 网页排序的研究意义  9-11
    1.1.3 网页排序的现有问题  11-12
  1.2 研究动机  12-13
  1.3 本文工作  13-14
  1.4 文章的组织结构  14-15
2 相关工作  15-30
  2.1 搜索引擎  15-19
    2.1.1 搜索引擎原理  15-18
    2.1.2 网络链接结构表示  18-19
  2.2 网页排序常用算法  19-27
    2.2.1 相似度算法  20-21
    2.2.2 链接分析模型  21-23
    2.2.3 PageRank算法  23-25
    2.2.4 HITS算法  25-27
  2.3 随机游走相关背景  27-30
    2.3.1 随机游走  27-28
    2.3.2 图上的随机游走学习  28-30
3 基于随机游走的网页协同排序算法研究  30-42
  3.1 算法来源与启发  30-33
    3.1.1 协同训练方法  30-31
    3.1.2 水平网络中的协同排序算法  31-33
  3.2 协同网络排序框架  33-42
    3.2.1 符号与准备  33
    3.2.2 偏向向量  33-35
    3.2.3 协同排序框架  35-36
    3.2.4 算法实例化  36-42
4 实验与结果分析  42-52
  4.1 实验数据集与参数设定  42-44
  4.2 收敛性分析  44-45
  4.3 实验结果与分析  45-52
    4.3.1 实验的评测方法  45-47
    4.3.2 实验结果分析  47-52
结论  52-53
参考文献  53-55
附录A 数据集链接密度  55-57
攻读硕士学位期间发表学术论文情况  57-58
致谢  58-60

相似论文

  1. 生物医学领域检索系统查询扩展技术研究,TP391.3
  2. 面向海量邮件的检索系统研究与实现,TP393.098
  3. 基于跨语言信息检索的企业竞争情报收集系统模型研究,TP391.3
  4. 基于策略Agent的个性化信息检索系统的研究与实现,TP391.3
  5. 基于稀疏非负矩阵分解的图像检索,TP391.41
  6. 跨语言文本分类的研究,TP391.1
  7. 基于随机游走模型的个性化信息推荐,TP391.3
  8. 基于分类模型监测电子商务违禁信息的研究与实现,TP393.09
  9. 排序学习损失函数的研究,TP181
  10. 基于点击的用户聚类的研究,TP311.13
  11. 英汉跨语言问答系统中的文档语义检索,TP391.1
  12. 中美股市噪声交易比较研究,F832.51;F831.51
  13. 服装面料信息管理技术研究,TS941.15
  14. 基于全局孤立性和局部紧凑性的显著目标检测算法研究,TP391.41
  15. 基于查询扩展的油田网络舆情监控系统,TP393.09
  16. 网络社区图像检索中的排序研究,TP391.41
  17. 高精度光纤陀螺光源强度噪声抑制技术的研究,V241.5
  18. 基于网络论坛的舆论领袖发现技术研究,TP393.09
  19. 基于随机游走和聚类平滑的两阶段协同过滤算法,TP391.3
  20. 上海黄金市场的弱式有效性检验,F224
  21. 中国商品期货市场弱有效性研究,F224

中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 计算机网络 > 一般性问题 > 计算机网络应用程序 > 网络浏览器
© 2012 www.xueweilunwen.com