学位论文 > 优秀研究生学位论文题录展示
高效频繁项集发现方法与Apriori的改进
作 者: 常少春
导 师: 吴斌
学 校: 江苏科技大学
专 业: 计算机科学与技术
关键词: 频繁项集 候选项集 相关支持度 Apriori 关联规则
分类号: TP311.13
类 型: 硕士论文
年 份: 2011年
下 载: 53次
引 用: 3次
阅 读: 论文下载
内容摘要
|
随着信息技术的飞速发展,数据的产生和存储达到了空前繁荣的阶段。如何从海量的数据中提取潜在的有用信息,给传统的数据处理技术提出了严峻的考验,数据挖掘方法应运而生。在数据挖掘出现后,又围绕着如何提高信息的有效率,以及提高挖掘的效率又成为数据挖掘研究的核心。而关联规则挖掘作为数据挖掘的主要手段之一,如何提高关联规则挖掘的效率与规则的有效性也成为近些年来研究的热点之一。本文通过对Apriori关联规则挖掘算法的两个方面进行分析与研究,即频繁项集的产生与关联规则的生成,也就有两个主要方面可以去改进。在产生候选项集时会有大量的冗余项集尤其是在产生二项候选集时以及需要多次扫描数据库,这也是Apriori算法的主要瓶颈。其次是在产生关联规则时会有大量的冗余、无趣的规则,在客户的决策过程中带来迷惑甚至误导的信息。鉴于上述问题,该文在产生二项频繁项集时只需要扫描数据库一次,而且不需要去产生大量的二项候选项集,只需要对所有可能的二项组合进行统计,最后根据支持度阀值直接筛选出频繁二项集。在解决冗余关联规则时引入第三个变量——相关支持度,利用相关支持度与关联规则的两个性质来消除一定的冗余的关联规则。而因为引入相关支持度之后原先利用关联规则的性质减少的冗余规则又都要判断其相关支持度,鉴于此,本文同时又利用数学公式导出两个性质来提高关联规则生成的效率,并在第三章中给出了算法效率的实验对比。最后本文选取合适的支持度,置信度,相关支持度,利用高效的关联规则挖掘的算法对广东轻工职业技术学院网站的部分日志数据进行了关联规则挖掘。并针对挖掘的结果进行了细致的分析,最终提出了一些改进网站的意见。
|
全文目录
摘要 6-7 Abstract 7-13 第1章 绪论 13-19 1.1 前言 13 1.2 课题的意义 13-17 1.2.1 数据挖掘的研究现状 14-15 1.2.2 关联规则的国内外应用 15 1.2.3 数据挖掘面临的挑战 15-16 1.2.4 Apriori算法的不足 16-17 1.3 论文的主要工作 17 1.4 论文的安排 17-19 第2章 关联规则概述 19-32 2.1 关联规则的基本概念 19-22 2.1.1 关联规则的问题提出 19-20 2.1.2 关联规则的一些定义 20-21 2.1.3 关联规则挖掘步骤 21-22 2.2 关联规则的种类 22-24 2.3 挖掘关联规则的算法 24-25 2.3.1 Apriori算法 24 2.3.2 FP-growth算法 24 2.3.3 AIS和SETM算法 24-25 2.3.4 DHP 算法 25 2.3.5 基于划分的算法 25 2.4 Apriori算法 25-31 2.4.1 Apriori算法的描述 25-26 2.4.2 Apriori算法基本思路及示例 26-29 2.4.3 关联规则价值衡量的方法 29-30 2.4.4 Apriori算法的技术缺陷 30-31 2.5 本章小结 31-32 第3章 Apriori的分析与改进 32-45 3.1 减少事务数据数量 32-34 3.1.1 问题的描述 32 3.1.2 具体的解决措施 32-34 3.1.3 性能评价 34 3.2 减少扫描事务数据库次数 34-38 3.2.1 问题的描述 34 3.2.2 传统解决方案 34-35 3.2.3 本论文的具体解决措施 35-37 3.2.4 性能分析 37-38 3.3 提高关联规则的有效性 38-42 3.3.1 一种关联规则有趣度的提高 38 3.3.2 减少冗余的关联规则 38-39 3.3.3 产生含否定项的关联规则 39-40 3.3.4 提高在引入兴趣度度量后挖掘效率 40-42 3.4 算法改进前后的效率对比 42-44 3.4.1 实验数据 42 3.4.2 传统Apriori算法与改进后的算法性能比较实验 42-44 3.4.3 实验结果的分析与评价 44 3.5 本章小结 44-45 第4章 改进后的Apriori进行关联规则挖掘的系统设计 45-54 4.1 系统开发平台 45 4.2 系统概述 45-46 4.3 数据预处理实现 46-49 4.3.1 为什么要预处理数据 46 4.3.2 数据清理(Data Cleaning) 46-47 4.3.3 用户识别(User Identification) 47-48 4.3.4 会话识别(Identify User Session) 48-49 4.4 产生频繁项集的实现以及使用技术 49-50 4.5 关联规则生成 50-53 4.6 本章小结 53-54 第5章 实验结果分析 54-56 5.1 实验结果分析 54-55 5.2 网站改进建议 55 5.3 本章小结 55-56 第6章 总结与展望 56-57 本文总结 56 未来工作展望 56-57 参考文献 57-60 攻读硕士学位期间发表的学术论文 60-61 致谢 61-62 详细摘要 62-66
|
相似论文
- 基于数据挖掘的税务稽查选案研究,F812.42
- 关联规则算法在高职院校贫困生认定工作中的应用,G717
- Web使用挖掘与网页个性化服务推荐研究,TP311.13
- 数据挖掘在学校管理和学生培养中的应用,TP311.13
- 基于关联规则的结构化浏览技术及其应用,TP391.41
- 数据挖掘技术在独立学院教学评估中的应用研究,TP311.13
- 数据空间中数据资源之间关联关系发现模型研究,TP311.13
- 通信行为指纹研究,TP311.13
- 动态关联规则的研究,TP311.13
- 高速网络环境下的入侵检测系统的研究,TP393.08
- 基于日志分析的超级计算机错误预测方法研究,TP338
- 数据挖掘在学生评价系统中的应用,TP311.13
- 高校图书馆管理系统的个性化服务的设计与实现,TP311.52
- 面向隐私保护的关联规则挖掘研究,TP311.13
- 用户交易行为的分析与展示—在现代易货业中的应用,TP311.13
- 基于关联规则和图排序的句子情感倾向性研究,TP391.1
- 基于数据挖掘的入侵检测技术的研究,TP393.08
- 关联规则算法及其在智能药房系统中的应用研究,TP311.13
- 基于数据仓库的新农合管理系统研究,TP311.13
- 基于关联规则的地铁基坑工程施工风险监测研究,U231.3
- 基于聚类分析和关联规则的痹证医案处方用药规律研究,R255.6
中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机软件 > 程序设计、软件工程 > 程序设计 > 数据库理论与系统
© 2012 www.xueweilunwen.com
|