学位论文 > 优秀研究生学位论文题录展示
分布式关联规则挖掘算法的研究与应用
作 者: 刘群
导 师: 贾泂
学 校: 浙江师范大学
专 业: 计算机软件与理论
关键词: 数据挖掘 关联规则 分布式挖掘 子集枚举树 全局频繁项集
分类号: TP311.13
类 型: 硕士论文
年 份: 2011年
下 载: 36次
引 用: 0次
阅 读: 论文下载
内容摘要
|
近些年来信息技术飞速发展,特别是数据库技术的更新换代,各个领域的数据都出现了爆炸性增长。与此形成鲜明对比的是,从数据中提炼出来的对人们决策有价值的知识却十分匮乏。数据挖掘正是在这一背景下诞生的一门新学科。关联规则挖掘是数据挖掘领域当前研究的主要热点之一,用于确定数据集中不同数据项或属性之间的联系,找出有价值的多个域之间的依赖关系。关联规则挖掘具有计算量大,I/O负载集中的特点,一方面,许多关联规则的实际应用涉及到海量数据,即使对算法进行了优化,在单处理机上使用串行算法进行挖掘所需要的时间可能也是无法接受的;另一方面,在实际的应用领域,业务数据存储于多个地点,各个站点之间需要共享全局规则模式,而且这些站点的数据有可能会发生一些动态地增量变化,在这种情况下,必须依靠高性能分布式关联规则挖掘来有效地完成挖掘任务。频繁项集挖掘是生成关联规则的关键步骤,其效率问题是关联规则挖掘中的一大难点和热点。在前人研究的基础上,论文基于分布式环境中的数据集,和所涉及到的算法数据结构,对全局频繁项集的挖掘问题进行了深入的分析和研究,从分布式环境挖掘中的剪枝策略、网络通信策略和增量挖掘方法等角度着手,进一步改进了全局频繁项集的挖掘算法,文章的最后还例举了算法的应用。概括一下本文工作,主要包括以下几个方面:(1)提出一种基于频繁模式树与最大频繁项集的分布式全局频繁项集挖掘算法BFM-MGFIS。该算法引入子集枚举树以实现有序挖掘与优化全局剪枝策略,有效地减小了候选项集且提高了并行性,最后,通过实验证明提出的算法是有效可行的。(2)讨论数据更新情况下规则模式的维护与更新,提出一种增量式的分布式全局频繁项集挖掘算法,该算法基于CanTree前缀树,使得频繁模式不再依赖于频繁1项目集序列,而是由用户指定的某一序列,据此对数据项进行排序,这样数据项的排序与更新无关,且树中保留了数据库的所有信息,仿真实验证明提出的方法是有效可行的。(3)围绕提出的两种算法实现了分布式关联规则挖掘模拟系统,将两种算法应用于实际的生物学数据分析中,以发现野生蘑菇的性状与其毒性的关联关系。
|
全文目录
摘要 3-5 ABSTRACT 5-7 目录 7-9 第1章 绪论 9-15 1.1 课题研究背景及其意义 9-11 1.2 课题的研究现状 11-13 1.3 课题研究的基本问题和内容组织结构 13-15 1.3.1 课题研究的基本问题 13-14 1.3.2 内容组织结构 14-15 第2章 分布式关联规则挖掘综述 15-31 2.1 引言 15 2.2 分布式关联规则挖掘的相关概念与技术 15-22 2.2.1 分布式数据挖掘的问题描述 15-16 2.2.2 多处理器关联规则挖掘的体系结构 16-19 2.2.3 分布式关联规则挖掘 19-22 2.3 分布式全局频繁项集挖掘 22-23 2.4 分布式关联规则增量更新挖掘 23-28 2.4.1 增量挖掘的相关概念与技术 23-24 2.4.2 分布式环境中的增量挖掘 24-28 2.5 分布式关联规则挖掘的应用 28-30 2.6 本章小结 30-31 第3章 一种分布式全局频繁项集挖掘算法 31-39 3.1 引言 31 3.2 相关概念与技术 31-34 3.2.1 相关定义与性质 31-33 3.2.2 分组计数技术 33-34 3.3 算法思想与算法实例 34-36 3.3.1 算法基本思想 34 3.3.2 算法实例 34-36 3.4 BFM-MGFIS算法描述 36-37 3.5 算法分析与性能测试 37-38 3.6 本章小结 38-39 第4章 基于前缀树的分布式全局频繁项集增量挖掘算法 39-48 4.1 引言 39 4.2 Canonical order tree与节点设计 39-43 4.2.1 Canonical order tree 39-41 4.2.2 节点设计 41-42 4.2.3 CanTree的构建 42-43 4.3 算法思想及其步骤 43-47 4.3.1 算法描述 44-46 4.3.2 仿真实验及其分析 46-47 4.4 本章小结 47-48 第5章 分布式关联规则挖掘模拟系统及其应用 48-59 5.1 引言 48 5.2 开发与运行环境 48 5.3 系统框架、功能与设计 48-52 5.3.1 系统框架 48-50 5.3.2 系统功能 50-51 5.3.3 系统设计 51-52 5.4 数据准备 52-54 5.4.1 数据采集 52 5.4.2 数据预处理 52-54 5.5 模拟系统的应用 54-58 5.5.1 问题的提出 54-55 5.5.2 系统的应用 55-58 5.6 本章小结 58-59 第6章 总结和展望 59-61 6.1 论文主要工作总结 59 6.2 进一步的研究工作与展望 59-61 参考文献 61-66 攻读学位期间取得的研究成果 66-67 致谢 67-69
|
相似论文
- 基于数据挖掘技术的保健品营销研究,F426.72
- 高忠英学术思想与经验总结及运用补肺汤加减治疗呼吸系统常见病用药规律研究,R249.2
- 张炳厚学术思想与临床经验总结及应用地龟汤类方治疗慢性肾脏病的经验研究,R249.2
- Bicluster数据分析软件设计与实现,TP311.52
- 基于变异粒子群的聚类算法研究,TP18
- 融合粒子群和蛙跳算法的模糊C-均值聚类算法研究,TP18
- 基于遗传算法和粗糙集的聚类算法研究,TP18
- 基于数据挖掘的税务稽查选案研究,F812.42
- 面向社区教育的个性化学习系统的研究与实现,TP391.6
- 基于关联规则挖掘的入侵检测系统的研究与实现,TP393.08
- 数据仓库技术在银行客户管理系统中的研究和实现,TP315
- 基于Moodle的高职网络教学系统设计与实现,TP311.52
- 教学质量评估数据挖掘系统设计与开发,TP311.13
- 关联规则算法在高职院校贫困生认定工作中的应用,G717
- 基于数据挖掘技术在城市供水的分析与决策,F299.24;F224
- 数据挖掘技术在电视用户满意度分析中的应用研究,TP311.13
- Web使用挖掘与网页个性化服务推荐研究,TP311.13
- 数据挖掘在学校管理和学生培养中的应用,TP311.13
- 高校毕业生就业状况监测系统研究,G647.38
- 基于数据仓库的药品监管辅助决策支持系统的设计与实现,TP311.13
- 基于关联规则的结构化浏览技术及其应用,TP391.41
中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机软件 > 程序设计、软件工程 > 程序设计 > 数据库理论与系统
© 2012 www.xueweilunwen.com
|