学位论文 > 优秀研究生学位论文题录展示

基于领域知识的半监督聚类算法研究

作 者: 黄海超
导 师: 赵瑞莲;程勇
学 校: 北京化工大学
专 业: 计算机应用技术
关键词: 数据挖掘 领域知识 半监督聚类 MLC-KMeans算法 属性约简
分类号: TP311.13
类 型: 硕士论文
年 份: 2009年
下 载: 164次
引 用: 2次
阅 读: 论文下载
 

内容摘要


聚类分析是数据挖掘领域的基本方法之一,它根据数据对象之间的相似性,把数据对象分割成簇。从机器学习的角度,聚类分析被看作是一种无监督的学习方法,对数据的分析不需要知道数据相关的类别信息。然而,在现实生活中,人们对所要分析数据的相关领域知识并非完全一无所知,通过这种知识能够发现数据对象标识或相互之间的约束信息。半监督聚类就是在聚类过程中引入先验知识来指导聚类过程,从而改进聚类结果。目前,半监督聚类方法已成为人们研究聚类方法的新热点。本文从约束的角度、属性的角度、规则的角度和实际应用的角度来研究半监督聚类的实现方法及实际应用效果。本文的主要工作及创新点包括:1、通过分析COP-KMeans算法,指出了其中的不足,引入按约束集分配的方法及辅助质心的概念,提出了改进的MLC-KMeans半监督聚类算法,并通过实验证明了改进算法的有效性;2、针对属性和类标识及属性和约束的相互关系,一方面采取属性约简方法,通过分析已知的标识数据对象,来消除冗余的属性,在新的属性集上进行聚类;另一方面,通过对约束对象属性范围进行限制,找到新的约束集合,来指导聚类过程。通过应用两种方法,达到了较好的聚类效果;3、利用关联规则方法,通过分析数据集中的部分标识数据,发现数据属性子集和类标识之间的关联关系,并把此规则作为先验知识,引入到聚类过程,来改进聚类效果。基于关联规则的半监督聚类方法有效地利用了规则信息,展现了利用数据挖掘方法发现的先验知识和属性子集的关联约束关系在半监督聚类中的应用;4、通过把半监督聚类的方法应用到Web用户的聚类分析之中,来检验半监督聚类的实际应用效果。本文详细描述了从Web日志获取到聚类分析的过程。

全文目录


摘要  4-6
ABSTRACT  6-16
第一章 绪论  16-22
  1.1 课题研究的背景和意义  16-17
  1.2 国内外研究现状  17-20
    1.2.1 半监督聚类算法分类及目前主要方法  17-19
    1.2.2 半监督聚类的实际应用  19-20
  1.3 本文的主要工作及组织结构  20-22
第二章 数据挖掘及聚类分析技术  22-36
  2.1 数据挖掘技术简介  22-25
    2.1.1 数据挖掘的定义、历史和发展  22-23
    2.1.2 数据挖掘的主要方法  23-25
  2.2 聚类分析技术  25-30
    2.2.1 聚类分析概述  25-27
    2.2.2 聚类分析方法分类  27-30
  2.3 基于领域知识的半监督聚类基础知识  30-34
    2.3.1 半监督学习概述  30-32
    2.3.2 领域知识的获取和表示  32-34
  2.4 本章小结  34-36
第三章 COP-KMeans及改进的MLC-KMeans算法  36-48
  3.1 COP-KMeans算法概述及其不足  36-38
    3.1.1 COP-KMeans算法概述  36-37
    3.1.2 COP-KMeans算法的不足  37-38
  3.2 MLC-KMeans半监督聚类算法  38-42
    3.2.1 MLC-KMeans算法基本思想  38-40
    3.2.2 MLC-KMeans算法描述  40-42
  3.3 MLC-KMean聚类效果实验分析  42-48
    3.3.1 试验方案  42-43
    3.3.2 实验结果  43-46
    3.3.3 实验结果分析及总结  46-48
第四章 基于属性变换的半监督聚类  48-64
  4.1 问题描述和出发点  48-50
    4.1.1 属性变换的出发点  48-49
    4.1.2 基于属性变换的半监督聚类方法描述  49-50
  4.2 属性约简方法概述  50-53
  4.3 基于属性约简的半监督聚类分析  53-58
    4.3.1 算法描述  53-55
    4.3.2 实验结果及分析  55-58
  4.4 基于约束属性范围扩展的半监督聚类  58-62
    4.4.1 算法描述  58-60
    4.4.2 实验结果及分析  60-62
  4.5 讨论与小结  62-64
第五章 基于关联规则的半监督聚类方法  64-74
  5.1 问题出发点及描述  64-65
    5.1.1 问题出发点  64-65
    5.1.2 问题描述  65
  5.2 关联规则方法及Apriori算法  65-69
    5.2.1 关联规则方法概述  65-67
    5.2.2 Apriori算法  67-69
  5.3 基于关联规则的半监督聚类  69-72
    5.3.1 算法描述  69-71
    5.3.2 实验结果及分析  71-72
  5.4 讨论与小结  72-74
第六章 半监督聚类在Web上的应用  74-86
  6.1 web数据挖掘概述  74-76
    6.1.1 Web数据的特点  74-75
    6.1.2 web数据挖掘的概念和分类  75
    6.1.3 web数据挖掘的意义  75-76
  6.2 web数据挖掘的处理流程  76-78
  6.3 半监督聚类方法在网站注册用户聚类方面的应用  78-84
    6.3.1 凤凰网注册用户的聚类分析  78-81
    6.3.2 注册用户的半监督聚类分析  81-84
  6.4 本章小结  84-86
第七章 结束语  86-88
  7.1 本文的主要工作回顾  86
  7.2 进一步的工作  86-88
参考文献  88-91
附录  91-94
致谢  94-95
攻读学位期间发表的学术论文  95-96
作者和导师简介  96-97
北京化工大学硕士研究生学位论文答辩委员会决议书  97-98

相似论文

  1. 基于数据挖掘技术的保健品营销研究,F426.72
  2. 高忠英学术思想与经验总结及运用补肺汤加减治疗呼吸系统常见病用药规律研究,R249.2
  3. 张炳厚学术思想与临床经验总结及应用地龟汤类方治疗慢性肾脏病的经验研究,R249.2
  4. Bicluster数据分析软件设计与实现,TP311.52
  5. 基于变异粒子群的聚类算法研究,TP18
  6. 融合粒子群和蛙跳算法的模糊C-均值聚类算法研究,TP18
  7. 基于遗传算法和粗糙集的聚类算法研究,TP18
  8. 基于粗糙集的城市区域交通绿时控制系统研究,TP18
  9. 基于数据挖掘的税务稽查选案研究,F812.42
  10. 面向社区教育的个性化学习系统的研究与实现,TP391.6
  11. 基于关联规则挖掘的入侵检测系统的研究与实现,TP393.08
  12. 数据仓库技术在银行客户管理系统中的研究和实现,TP315
  13. 基于Moodle的高职网络教学系统设计与实现,TP311.52
  14. 教学质量评估数据挖掘系统设计与开发,TP311.13
  15. 粗糙集的增量式属性约简研究,TP18
  16. 知识粒度的计算及其在属性约简中的应用研究,TP18
  17. 关联规则算法在高职院校贫困生认定工作中的应用,G717
  18. 基于数据挖掘技术在城市供水的分析与决策,F299.24;F224
  19. 数据挖掘技术在电视用户满意度分析中的应用研究,TP311.13
  20. Web使用挖掘与网页个性化服务推荐研究,TP311.13
  21. 数据挖掘在学校管理和学生培养中的应用,TP311.13

中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机软件 > 程序设计、软件工程 > 程序设计 > 数据库理论与系统
© 2012 www.xueweilunwen.com