学位论文 > 优秀研究生学位论文题录展示
基于内容检索的垃圾邮件过滤器研究与实现
作 者: 王园
导 师: 龚尚福
学 校: 西安科技大学
专 业: 计算机应用技术
关键词: 垃圾邮件 特征选择 互信息 分类 贝叶斯
分类号: TP393.098
类 型: 硕士论文
年 份: 2011年
下 载: 40次
引 用: 0次
阅 读: 论文下载
内容摘要
|
信息化时代,垃圾邮件被认为是最有效和最廉价的广告形式,诱惑一些投机者采用这种新的途径传播信息。垃圾邮件严重干扰人们正常生活,浪费用户的时间、精力,更为严重的是造成信息安全隐患,损害ISP的市场形象,造成无形资产流失,而且垃圾邮件对网络资源消耗和网络安全的危害也越来越大。本文主要研究的是邮件用户代理过滤,即客户端过滤,扩展邮件代理工具Outlook的垃圾邮件过滤功能,实现用户个性化设置。目前以文字方式传播垃圾邮件还是主要的途径之一,因此本文研究的是基于内容检索的垃圾邮件过滤方法。该方法主要分两个阶段,训练阶段和分类阶段。在各个阶段中主要包括五个主要步骤:邮件预处理,文本表示,特征选择,分类预测和评价邮件过滤质量。其中重点研究了两个核心步骤——特征选择和分类预测进行研究。首先分析了八种常用的特征选择方法,如文档频率、信息增益、互信息、CHI统计法、期望交叉熵、文本证据权、优势率和相关性得分。特别是对互信息法进行深入研究后发现:当某一特征词仅在一个类别中出现时,此时互信息值彼此相等,这样导致无法区分它们之间的重要程度。从这一点出发,本文得出改进后的互信息法——利用调整后的TFIDF权重函数对这些特征词再次衡量,使得特征词有了更好的区分类别的能力。此外,本文还对两种常用分类算法进行研究:贝叶斯分类和支持向量机。在实验分析部分,本文选取常用的Ling-Spam标准邮件集。从四个方面对各种算法进行测试,即不同的特征选择方法、维数、分类算法和训练集个数,采用F1值和虚报率对结果进行评价。实验结果表明,改进后的互信息的相比其他算法的稳定性要好。最后以Outlook外接程序形式实现一个垃圾邮件过滤子系统,在实际应用中能满足垃圾邮件过滤功能。
|
全文目录
摘要 3-4 ABSTRACT 4-8 1 绪论 8-16 1.1 选题背景和研究意义 8-11 1.1.1 选题背景 8-9 1.1.2 垃圾邮件的发展史 9-10 1.1.3 研究意义 10-11 1.2 国内外研究动态 11-14 1.3 论文主要内容和章节安排 14-16 1.3.1 主要内容 14 1.3.2 章节安排 14-16 2 垃圾过滤的基础知识和相关技术 16-22 2.1 垃圾邮件过滤基础知识 16-18 2.1.1 电子邮件工作原理 16-17 2.1.2 邮件协议 17-18 2.2 垃圾邮件过滤手段 18-20 2.2.1 基于 IP 层的垃圾邮件过滤 18-19 2.2.2 基于 SMTP 协议的垃圾邮件过滤 19 2.2.3 基于内容的垃圾邮件过滤 19-20 2.3 语料库 20-21 2.3.1 Spam Assassin 语料 20 2.3.2 PU 语料 20 2.3.3 Ling-Spam 语料 20-21 2.3.4 Spambase 语料 21 2.4 本章小结 21-22 3 特征选择和分类算法 22-38 3.1 邮件过滤模型 22-24 3.2 特征选择 24-28 3.2.1 传统的特征选择算法 24-25 3.2.2 互信息算法的研究 25-27 3.2.3 改进的互信息法 27-28 3.3 分类算法 28-36 3.3.1 常用分类算法 28-30 3.3.2 贝叶斯算法 30-32 3.3.3 支持向量机 32-36 3.4 评价标准 36-37 3.5 本章小结 37-38 4 客户端垃圾邮件过滤系统的设计与实现 38-50 4.1 垃圾邮件过滤系统的设计 38-39 4.2 手动过滤子系统的实现 39-48 4.2.1 邮件预处理模块 39-42 4.2.2 特征选择模块 42-44 4.2.3 分类预测模块 44-48 4.2.4 用户反馈模块 48 4.2.5 数据库模块 48 4.3 自动过滤子系统的实现 48-49 4.4 本章小结 49-50 5 实验研究和分析 50-61 5.1 实验目的 50 5.2 实验平台和语料 50 5.3 贝叶斯分类 50-54 5.3.1 实验一:训练集为400 封邮件 50-52 5.3.2 实验二:训练集为600 封邮件 52-53 5.3.3 实验结果分析 53-54 5.4 支持向量机分类 54-59 5.4.1 实验三:训练集为400 封邮件 54-56 5.4.2 实验四:训练集为600 封邮件 56-57 5.4.3 实验结果分析 57-59 5.5 自动过滤子系统默认参数 59-60 5.6 本章小结 60-61 6 结论 61-63 6.1 总结 61-62 6.2 展望 62-63 致谢 63-64 参考文献 64-67 附录 67
|
相似论文
- K公司计划及预测改进对于合理库存配置的研究,F224
- 空间目标ISAR成像仿真及基于ISAR像的目标识别,TN957.52
- 基于词义及语义分析的问答技术研究,TP391.1
- 基于三维重建的焊点质量分类方法研究,TP391.41
- 基于串核的蛋白质分类算法的研究与实现,TP301.6
- 统计与语言学相结合的词对齐及相关融合策略研究,TP391.2
- 词义消歧语料库自动获取方法研究,TP391.1
- 基于仿生模式识别的文本分类技术研究,TP391.1
- 互联网上旅游评论的情感分析及其有用性研究,TP391.1
- 唇读中的特征提取、选择与融合,TP391.41
- 基于图像的路面破损识别,TP391.41
- 多传感器信息融合及其在可穿戴计算机上的应用,TP202
- 黄磷储罐区安全评价方法研究,TQ126.317
- 计算智能在数字化卷烟叶组配方中的应用研究,TS44
- 基于中国土壤系统分类的土壤类型和界线确定研究,S155
- 基于聚类分析的P2P流量识别算法的研究,TP393.02
- 弯孢属种分子鉴定体系的建立及其在疑难种上的应用,Q949.32
- 基于视觉的番木瓜外观品质检测技术研究,S667.9
- 面向公众的教育视频共建共享平台的设计与实践研究,G434
- 基于土壤系统分类的土壤调查方法研究,S155
- 基因表达谱数据聚类分析方法比较与大豆疫霉基因的网络构建,S435.651
中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 计算机网络 > 一般性问题 > 计算机网络应用程序 > 电子邮件(E-mail)
© 2012 www.xueweilunwen.com
|