学位论文 > 优秀研究生学位论文题录展示
智能搜索中中文网页分类和聚类的初步研究
作 者: 高超
导 师: 俞经善
学 校: 哈尔滨工程大学
专 业: 计算机应用技术
关键词: 智能搜索 网页过滤 特征选择 自适应分类 密度聚类
分类号: TP391.3
类 型: 硕士论文
年 份: 2007年
下 载: 268次
引 用: 1次
阅 读: 论文下载
内容摘要
|
网络的发展使得世界各地越来越丰富的电子资源信息供人们使用,但是随着数字信息的爆炸性增长,快速有效地获取需要的相关信息却又变得越来越困难,因而对信息获取技术的发展提出了更高的要求。由于网络资源的复杂性,综合性的搜索引擎不能适应用户对信息检索的准确性要求,因此专业化、专题化信息搜索技术成为热点和趋势。本论文研究的是基于内容的面向数码产品领域的中文Web网页的信息获取问题,其主要任务是从众多的网页中分离和过滤出数码产品专题网页,并进一步将其分类管理,以达到为用户提供更精确信息的目的。本论文主要对中文文本自动分类和聚类的相关技术进行了研究和探讨,为开发面向数码产品领域的垂直型搜索引擎提供技术准备。论文主要工作包括以下几个方面:(1)对数码专题Web网页的时间和空间的分布规律、数码产品网页内容的特点以及用字用词情况进行了统计和分析,为进一步的研究工作提供了直接依据。并根据面向数码专题网页信息获取的特点,提出了分级建立资源词表的思想。(2)结合数码专题网页的过滤问题,对自动分类领域中不同的特征选择方法以及各种分类器的设计和性能评价方面进行了归纳,并利用真实的网页数据集合进行了比较性的实验。(3)针对数码产品网页的分布特点,提出了Improved Rocchio算法和基于增量式学习机制的网页自适应分类方法。由于网页数据存在的复杂性,在不借助人工判断的情况下,计算机很难做出准确的相关性评价,利用错误的评价结果调整分类器,就容易使分类模型恶化。本论文提出设置正反例置信区间的思想和利用动态的修订系数调整分类模型的策略,从而取得了较好的分类效果。(4)提出了基于密度与K近邻相结合的网页自动聚类方法。由于网页数据的非结构化和特征分布稀疏,作为集合中的点,网页的分布也存在复杂性:各个类内点的聚集程度(密度)不同,构成的形状不规则。Optics算法具有快速识别类的高密度区域的特点,却不能较好的处理周围低密度区域的点。因此利用它来构建初始类结构,再利用K近邻的方法,将低密度点归类,从而实现网页文档的聚类。
|
全文目录
摘要 5-7 Abstract 7-12 第1章 引言 12-20 1.1 研究目的、意义及研究背景 12-15 1.2 网页自动分类 15-16 1.3 搜索引擎 16-18 1.4 本论文的主要工作 18 1.5 论文的结构 18-20 第2章 数码相机专题网页的统计分析 20-26 2.1 数码相机Web网页的特点 20-21 2.1.1 分布的时间特性 20 2.1.2 分布的空间特性 20-21 2.2 数码相机Web网页的特点 21-22 2.3 数码相机Web网页用字、用词统计 22-24 2.4 关键词在数码相机网页两个分类阶段的作用及词表的建立 24-25 2.5 本章小结 25-26 第3章 网页自动分类技术概述 26-43 3.1 中文网页的预处理 26-28 3.2 分类模型 28-31 3.2.1 布尔模型(Boolean Model) 28-29 3.2.2 向量空间模型(Vector Space Model) 29-30 3.2.3 概率模型(Probabilistic Model) 30 3.2.4 语言模型(Language Model) 30-31 3.3 特征选择及权值计算 31-35 3.3.1 文档频率(Document Frequency,DF) 31-32 3.3.2 信息增益(Information Gain,IG) 32 3.3.3 交叉熵(Cross Entropy,CE) 32 3.3.4 互信息(Mutual Information,MI) 32-33 3.3.5 χ~2统计量(CHI) 33-34 3.3.6 文本证据权(Weight of Evidence Text,WET) 34 3.3.7 几率比(Odds Ratio,OR) 34-35 3.3.8 特征强度(Term Strength,TS) 35 3.4 分类器的设计 35-41 3.4.1 基于类中心的最小距离分类器 36 3.4.2 K近邻分类器(K-Nearest) 36-37 3.4.3 贝叶斯分类器(Bayes) 37-39 3.4.4 支持向量机分类器(SVM) 39-41 3.5 评价方法 41-42 3.6 本章小结 42-43 第4章 中文数码相机网页的过滤及实验分析 43-61 4.1 实验的总体介绍 43-45 4.1.1 实验数据的采集 43-44 4.1.2 面向数码相机Web网页过滤系统的构成 44-45 4.2 实验数据的预处理 45-46 4.3 最小距离分类器与各种特征选择方法结合的网页过滤比较 46-54 4.3.1 直接使用TF 47-48 4.3.2 文档频率(DF) 48 4.3.3 信息增益(IG) 48-49 4.3.4 交叉熵(CE) 49-50 4.3.5 互信息(MI) 50-51 4.3.6 χ~2统计量(CHI) 51 4.3.7 文本证据权(WET) 51-52 4.3.8 几率比(OR) 52 4.3.9 各种特征选择方法的比较 52-53 4.3.10 对几率比和互信息两种特征选择方法的改进 53-54 4.4 贝叶斯分类器和支持向量机的分类实验 54-59 4.4.1 朴素贝叶斯(Naive Bayes)分类器 55-58 4.4.2 支持向量机(Support Vector Machine)分类器 58-59 4.4.3 三种分类器的性能比较 59 4.5 本章小结 59-61 第5章 中文网页的自适应分类 61-73 5.1 自适应分类模型 61-64 5.1.1 检索字扩展模型——Rocchio算法 61-62 5.1.2 自适应分类模型——Improved Rocchio算法 62-64 5.2 自适应分类的实现 64-66 5.3 分类实验及结果 66-71 5.3.1 实验数据及预处理 66-67 5.3.2 分类器及评价方法 67 5.3.3 实验结果 67-71 5.4 本章小结 71-73 第6章 基于密度的中文网页聚类 73-82 6.1 网页聚类所面临的问题 73-76 6.1.1 聚类算法 73-76 6.1.2 特征的选择与提取 76 6.2 Web文档聚类的实现方法 76-78 6.3 Web文档聚类的实验结果 78-81 6.4 本章小结 81-82 结论及工作展望 82-85 1.本论文主要工作包括以下几个方面 82-83 2.对未来工作的展望 83-85 参考文献 85-88 攻读硕士学位期间发表的论文和取得的科研成果 88-89 致谢 89
|
相似论文
- 基于仿生模式识别的文本分类技术研究,TP391.1
- 唇读中的特征提取、选择与融合,TP391.41
- 语音情感识别的特征选择与特征产生,TP18
- 基于数据分布特征的文本分类研究,TP391.1
- 结合蚁群算法与基于划分的DBSCAN聚类算法的研究,TP311.13
- 车辆识别系统动态特征选择算法的研究与实现,TP391.41
- 基于AdaBoost算法的人脸识别研究,TP391.41
- 面向肺部CAD的特征提取、选择及分类方法研究,TP391.41
- 基于群体智能的医学图像特征优化算法研究,TP391.41
- 基于FSVM的数据挖掘方法及其在入侵检测中的应用研究,TP393.08
- 流形学习的方差最小化准则,TP181
- 掌纹主线特征选择方法及成像系统研究,TP391.41
- 中国民族音乐特征提取与分类技术的研究,J607
- 随机森林特征选择,TP311.13
- 面向概念查询的生物医学多文档摘要技术研究,TP391.1
- 面向互联网中文舆情信息的情感倾向分析,TP391.1
- 基于粗糙集属性约简和加权SVM的入侵检测方法研究,TP393.08
- 基于决策树的网络流量分类研究,TP393.06
- 基于内容检索的垃圾邮件过滤器研究与实现,TP393.098
- 关节式物体检测识别及应用,TP391.41
- 基于英文博客空间文本的情感分析研究,TP391.1
中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 检索机
© 2012 www.xueweilunwen.com
|