学位论文 > 优秀研究生学位论文题录展示

基于最大频繁项集的搜索引擎查询结果聚类方法

作 者: 苏冲
导 师: 王晓龙;陈清财
学 校: 哈尔滨工业大学
专 业: 计算机科学与技术
关键词: 搜索引擎 文本聚类 频繁项集
分类号: TP391.3
类 型: 硕士论文
年 份: 2009年
下 载: 66次
引 用: 2次
阅 读: 论文下载
 

内容摘要


随着网络信息的爆炸式增长,如何帮助用户快速准确地定位所需信息就成了一个十分紧要的问题。通过对搜索引擎查询结果进行在线聚类可以解决这个问题。然而由于查询结果在线聚类所具有实时性,标签可读性等特点,传统的聚类算法无法满足应用要求;另一方面当前大部分研究基于网页摘要聚类,聚类精度有待提高,因此本文在实验室通用搜索引擎平台上研究并设计了一种有效地基于网页全文的聚类算法。本文通过对频繁项集及其在聚类算法中应用的研究,提出了一种基于最大频繁项集的搜索引擎查询结果在线聚类算法(Maximal Frequent Itemsets Clustering, MFIC)。MFIC通过采用动态最小支持度和只挖掘最大频繁项集,突破了频繁项集在在线聚类方面应用的瓶颈,围绕频繁项集完成网页聚类,相似度计算,标签生成等工作。本文的研究内容主要包括以下几个方面:(1)结合查询结果聚类的应用需要,进行网页预处理,采用动态设定频繁项集挖掘中的最小支持度,挖掘最大频繁项集,提高了频繁项集可用性;(2)设计并实现了基于最大频繁项集的网页在线聚类系统,依据频繁项集覆盖网页集合的关系,频繁项集包含词集合关系进行相似度计算,簇的生成,合并等过程;(3)设计标签的提取算法,结合频繁项集和词语顺序出现关系挖掘短语性标签,改进了基于频繁项集聚类的标签生成效果;(4)通过与其它聚类算法的实验对比,验证了本文提出的聚类方法在网页聚类方面的优越性。本系统已成功应用在本实验中心构建的智能化网络信息检索平台中。实验结果表明,本文提出的方法能够满足在线聚类的要求,在时间复杂度和聚类精度上都达到了很好的预期效果。

全文目录


摘要  4-5
Abstract  5-9
第1章 绪论  9-17
  1.1 课题背景  9
  1.2 课题目的及意义  9-10
  1.3 国内外相关技术发展现状  10-16
    1.3.1 搜索引擎研究现状  10-12
    1.3.2 网页在线聚类技术研究现状  12-16
  1.4 本文主要研究内容  16-17
第2章 相关技术介绍  17-33
  2.1 聚类概述  17-24
    2.1.1 数据表示模型  17-18
    2.1.2 相似度量方法  18-19
    2.1.3 聚类模型  19-20
    2.1.4 聚类算法  20-24
  2.2 网页正文提取  24-26
  2.3 网页聚类的特殊之处  26-27
  2.4 频繁项集及挖掘算法  27-31
    2.4.1 频繁项集的概念  27-28
    2.4.2 频繁项集的挖掘  28-31
  2.5 本章小结  31-33
第3章 基于最大频繁项集的网页在线聚类算法  33-46
  3.1 引言  33-34
  3.2 算法总体结构  34
  3.3 预处理过程  34-35
  3.4 最大频繁项集挖掘  35-37
  3.5 聚类过程  37-44
    3.5.1 簇的生成  38-39
    3.5.2 簇的合并  39-42
    3.5.3 簇的拆分  42
    3.5.4 簇的排序和净化  42-44
    3.5.5 未覆盖网页的分类  44
  3.6 标签提取过程  44-45
  3.7 本章小结  45-46
第4章 搜索引擎在线聚类系统  46-55
  4.1 引言  46
  4.2 系统框架  46-47
  4.3 功能模块介绍  47-51
    4.3.1 离线模块  47-48
    4.3.2 在线模块  48-51
  4.4 系统运行演示  51-54
  4.5 本章小结  54-55
第5章 实验评测与分析  55-62
  5.1 实验环境  55
  5.2 实验方案  55
  5.3 实验结果分析  55-60
    5.3.1 评价标准  55-57
    5.3.2 聚类时间对比  57
    5.3.3 聚类纯度分析  57-58
    5.3.4 聚类F 值分析  58-59
    5.3.5 标签效果比较  59-60
  5.4 系统实时性分析  60-61
  5.5 本章小结  61-62
结论  62-63
参考文献  63-67
攻读学位期间发表的学术论文  67-69
致谢  69

相似论文

  1. 隐式用户兴趣挖掘的研究与实现,TP311.13
  2. 演化聚类算法及其应用研究,TP311.13
  3. 网络搜索引擎的相关技术研究,G354
  4. 基于语义网络的智能搜索引擎研究,TP391.3
  5. 基于本体的食品投诉文档文本聚类研究,TP391.1
  6. 搜索引擎服务提供商版权侵权责任认定标准探讨,D923.41
  7. 基于Web搜索和网页结构分析的IT相关主题新闻抓取研究,TP393.092
  8. 数据空间中数据资源之间关联关系发现模型研究,TP311.13
  9. 面向短消息文本的聚类技术研究与应用,TP391.1
  10. 教育新闻热点话题发现系统的设计与实现,TP391.1
  11. 分布式搜索引擎索引安全及缓存策略研究,TP333
  12. 基于WebHarvest的中文财经新闻搜索引擎的设计与实现,TP311.52
  13. Web新闻热点发现系统的设计与实现,TP393.09
  14. 教育培训行业互联网营销问题的研究,F49
  15. 关联规则算法及其在智能药房系统中的应用研究,TP311.13
  16. 搜索引擎侵权行为研究,D923
  17. 基于Web数据挖掘的个性化搜索引擎研究,TP391.3
  18. 基于Agent元搜索引擎的个性化研究,TP391.3
  19. 面向海量数据的云存储系统实现与应用研究,TP333
  20. 论搜索引擎竞价排名的法律规制,D923.43
  21. 搜索引擎悖论解读,G254

中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 检索机
© 2012 www.xueweilunwen.com