学位论文 > 优秀研究生学位论文题录展示
基于内容挖掘的中文垃圾邮件过滤技术研究
作 者: 徐丽平
导 师: 马刚
学 校: 东北财经大学
专 业: 电子商务
关键词: 垃圾邮件 贝叶斯 特征选取 互信息 Weka
分类号: TP393.098
类 型: 硕士论文
年 份: 2010年
下 载: 68次
引 用: 0次
阅 读: 论文下载
内容摘要
|
随着计算机网络与通讯技术的迅速发展,电子邮件已经成为了现代通信的重要手段之一。然而,人们在享受到电子邮件便捷服务的同时,也饱尝了垃圾邮件带来的烦恼。垃圾邮件的日益泛滥,不仅浪费网络资源,侵犯用户的个人利益,甚至破坏社会的安全与稳定,因此越来越得到社会大众和研究人员的重视与关注,垃圾邮件过滤技术已经成为当前研究的热点之一。本文首先深入研究了国内外大量反垃圾邮件的文献和数据,系统地分析了垃圾邮件问题的背景和现状;然后,进一步介绍了与电子邮件紧密相关的SMTP协议及电子邮件的工作原理,分析了电子邮件的安全缺陷及垃圾邮件泛滥的原因;最后,在对电子邮件工作原理进行研究的基础上,深入分析了基于内容的垃圾邮件过滤技术,包括邮件正文提取、中文分词处理、特征值选取、文本的表示方法这几个部分。针对垃圾邮件制造者为了逃避过滤而设计的干扰信息,在分词处理之前,进行了提取邮件纯文本的预处理,并提前做好特征词的预降维处理,从而有效地降低了特征词的维度,很大地提高了算法效率;由于一些普遍都存在的词汇和稀有的、出现次数很少的词汇对分类的贡献小,因此,本文在分词处理过程中,增加了去除停用词和稀疏词这个过程,并给出了新的分词算法流程;在利用互信息算法进行特征选取的过程中,针对互信息算法在垃圾邮件过滤中存在的不足,从频度、集中度和负相关三个方面上对传统互信息算法提出了改进的算法,加入了特征词在文档中出现的频次这一因子。最后,本文提出了采用“绝对差值”d(ti)来衡量特征词对类别贡献的大小,将所有的d(ti)值从大到小进行排序后,选择值最高的前K维作为特征子集。为验证改进后的中文分词的效果,利用武汉大学的ROSTContentMining软件,分别使用改进前后的分词算法进行中文分词处理;在分词的基础上,采用真实的邮件集在MATLAB上使用互信息算法来进行特征词的选取,结果表明,在本文改进后的互信息算法中,“绝对差值”d(ti)分布在不同的值上而没有集中在某几个值的附近,这些有较大差别的互信息值才能更大地发挥对类别的分类作用;最后,在邮件的分类部分,选择10次交叉验证法,在Weka平台上使用朴素贝叶斯分类方法进行了分类器的训练和分类过程,根据垃圾邮件过滤系统的评价指标验证改进后的算法是否提高了分类的性能。
|
全文目录
相似论文
- 词义消歧语料库自动获取方法研究,TP391.1
- 多传感器信息融合及其在可穿戴计算机上的应用,TP202
- 黄磷储罐区安全评价方法研究,TQ126.317
- 基于聚类分析的P2P流量识别算法的研究,TP393.02
- 黑麦草(Lolium perenne L.)代谢QTL定位与代谢网络构建,S543.6
- 语音信号的压缩感知研究及其在语音编码中的应用,TN912.3
- 城市轨道交通运营管理系统测试与评价方法研究,TP311.52
- 类药性和生物利用度的理论预测研究,R914
- 网络隐私权的民法保护,D913
- 基于贝叶斯理论的社会化标注主题聚类模型研究,C93
- FPSO在石油卸载过程中的风险评估,U698
- 非刚性医学图像准算法研究和实现,TP391.41
- 基于鱼眼相机的运动物体检测和跟踪,TP391.41
- 有序Probit模型的非参贝叶斯统计,O212.8
- 基于状态空间模型的赔款准备金的研究,F842.3
- 基于压缩感知的认知无线电频谱检测技术及其研究,TN925
- 认知无线电系统合作频谱感知中感知数据错误化攻击防御技术,TN925
- 基于组合及统计的图像型垃圾邮件检测研究,TP391.41
- 基于改进的非参数回归交通流量预测方法,F570
- 基于压缩感知的多径信道估计及其研究,TN925
- 基于双目立体视觉的水下三维重建,TP391.41
中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 计算机网络 > 一般性问题 > 计算机网络应用程序 > 电子邮件(E-mail)
© 2012 www.xueweilunwen.com
|