学位论文 > 优秀研究生学位论文题录展示

基于决策树分类算法的Web文本分类研究

作 者: 林炎钟
导 师: 吴陈
学 校: 江苏科技大学
专 业: 计算机软件与理论
关键词: 数据挖掘 决策树 C4.5算法 文本分类 特征提取
分类号: TP391.1
类 型: 硕士论文
年 份: 2011年
下 载: 59次
引 用: 0次
阅 读: 论文下载
 

内容摘要


数据挖掘的兴起对计算机算法的理论起到了推波助澜的作用,特别是进入新世纪以来,数据挖掘技术在数据库和数据仓库中发挥的作用,以及在搜索引擎方面的巨大成功都使得它成为以后计算机研究的一个重要分支。决策树分类算法的发展也在一定程度上反映了这点。最早的决策树分类算法是CLS方法。继而先后出现了ID3算法、改进ID3算法的C4.5算法、CART算法、SLIQ算法和SPRINT算法等。这些算法理论的出现和改进不断丰富着决策树方法。文本分类是Web数据挖掘中一项非常重要的任务。文本分类过程有文本表示、特征提取、构造分类器、规则抽取这几个重要步骤,特征提取和分类器的构造计算量相对比较大,选取什么方法进行特征提取和用什么方法构造分类器对整个分类过程效率起到很大影响。本文首先对几种经典的决策树分类算法进行研究和分析,并比较算法间的差异。其次对C4.5算法进行改进,利用麦克劳林公式进行替换,并对信息增益率的公式进行化简,得到新的算法公式,此公式不但大大简化了原来复杂的计算公式,而且结果不会产生偏差。C4.5算法得以实施的前提是假设属性间是无关联的,相互独立,但从实际情况看来,这个假设不一定成立,于是引入属性相关性概念和用户兴趣度,分析这两者对算法的影响。C4.5算法的一个优点就是可以处理连续值属性,本文在原来基础上提出一种改进方法,使得处理连续值属性时占用的内存和计算量大大减少,提高了算法的计算效率。把改进的C4.5算法引进到Web文本分类中,使得决策树分类算法的应用得到更大的推广。分析了特征提取中χ~2统计量方法存在的缺点,它不能反映出分词对类别贡献的正负性。本文在原来基础上作出改进,使得分词对类别的贡献更加清晰,利用改进的决策树分类算法构造分类器,最后实现规则抽取。把算法简单的应用于某县开发区OA系统的信息采编中,实验数据表明,在一定程度上减轻了信息采编者的工作量。

全文目录


摘要  6-7
Abstract  7-15
第1章 绪论  15-21
  1.1 课题的研究背景  15-17
  1.2 国内外研究现状  17-18
  1.3 本文的主要工作  18-19
  1.4 本文的组织结构  19-21
第2章 数据挖掘技术  21-31
  2.1 数据挖掘概念  21-22
  2.2 数据挖掘的步骤  22
  2.3 数据挖掘常用算法与技术  22-25
  2.4 Web 数据挖掘  25-27
    2.4.1 概念  25
    2.4.2 Web 数据挖掘分类  25-27
  2.5 Web 文本挖掘介绍  27-28
    2.5.1 Web 文本挖掘概念  27
    2.5.2 Web 文本挖掘任务  27-28
  2.6 本章小结  28-31
第3章 决策树分类算法研究  31-45
  3.1 决策树算法原理  31-34
    3.1.1 算法的发展  31-32
    3.1.2 算法实现过程归纳  32-34
  3.2 ID3 算法  34-37
    3.2.1 信息论基础  34-35
    3.2.2 ID3 算法实现过程  35-36
    3.2.3 ID3 算法优缺点  36-37
  3.3 C4.5 算法  37-40
    3.3.1 C4.5 算法原理  38
    3.3.2 C4.5 算法对连续值属性的处理  38-39
    3.3.3 C4.5 算法的剪枝  39-40
  3.4 其他决策树分类算法  40-43
    3.4.1 CART 算法  40-41
    3.4.2 SLIQ 算法  41-42
    3.4.3 SPRINT 算法  42-43
  3.5 算法小结  43
  3.6 本章小结  43-45
第4章 决策树算法的改进  45-51
  4.1 C4.5 算法简化改进  45-47
  4.2 侧重属性权值和属性相关性的研究  47-48
  4.3 对连续值属性的处理改进  48-49
  4.4 本章小结  49-51
第5章 决策树算法在Web 文本分类中的应用  51-67
  5.1 文本分类概述  51-55
    5.1.1 文本分类原理  51-52
    5.1.2 文本分类方法  52-55
    5.1.3 文本分类效果评价  55
  5.2 基于决策树算法的文本分类  55-59
    5.2.1 文本表示  55-56
    5.2.2 特征提取  56-58
    5.2.3 基于决策树的分类器  58-59
    5.2.4 规则抽取  59
  5.3 实验及结果分析  59-62
  5.4 在OA 系统中的初步应用  62-65
  5.5 本章小结  65-67
总结与展望  67-69
  总结  67-68
  下一步的工作  68-69
参考文献  69-73
攻读学位期间发表的学术论文目录  73-74
致谢  74-75
详细摘要  75-79

相似论文

  1. 基于SVM的高速公路路面浅层病害的自动检测算法研究,U418.6
  2. 空间目标ISAR成像仿真及基于ISAR像的目标识别,TN957.52
  3. 胆囊炎和肾病综合症脉象信号的特征提取与分类研究,TP391.41
  4. Q学习在基于内容图像检索技术中的应用,TP391.41
  5. 直推式支持向量机研究及其在图像检索中的应用,TP391.41
  6. 中医舌诊中舌形与齿痕的特征提取及分类研究,TP391.41
  7. 基于仿生模式识别的文本分类技术研究,TP391.1
  8. 互联网上旅游评论的情感分析及其有用性研究,TP391.1
  9. 空间交会接近视觉测量方法研究,TP391.41
  10. 图像实时采集、存储与处理方法研究,TP391.41
  11. 唇读中的特征提取、选择与融合,TP391.41
  12. 多币种纸币处理技术的研究与实现,TP391.41
  13. 基于类Harr特征和最小包含球的纸币识别方法的研究,TP391.41
  14. 基于图像的路面破损识别,TP391.41
  15. 移动机器人视觉检测和跟踪研究,TP242.62
  16. 高光谱与高空间分辨率遥感图像融合算法研究,TP751
  17. 基于支持向量机的故障诊断方法研究,TP18
  18. 基于数据挖掘技术的保健品营销研究,F426.72
  19. 高忠英学术思想与经验总结及运用补肺汤加减治疗呼吸系统常见病用药规律研究,R249.2
  20. 张炳厚学术思想与临床经验总结及应用地龟汤类方治疗慢性肾脏病的经验研究,R249.2
  21. 基于随机森林的植物抗性基因识别方法研究,Q943

中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 文字信息处理
© 2012 www.xueweilunwen.com