学位论文 > 优秀研究生学位论文题录展示

基于决策树的搜索引擎恶意网页检测研究与实现

作 者: 周浩
导 师: 孙建华
学 校: 湖南大学
专 业: 信息与通信工程
关键词: 搜索引擎 恶意网页 机器学习 分类模型 决策树 浏览器扩展
分类号: TP393.08
类 型: 硕士论文
年 份: 2013年
下 载: 9次
引 用: 0次
阅 读: 论文下载
 

内容摘要


随着互联网的快速发展,网络信息呈爆炸式的增长,具有资源整合功能的搜索引擎已经成为人们获取信息的首要途径。然而大量钓鱼网页、恶意代码链接充斥其中,给用户带来极大的安全隐患,避免用户访问恶意的搜索链接具有深远而现实的意义。然而,现有的搜索引擎安全防御工具检测范围有限。本文力图改善搜索引擎网页检测的覆盖面,利用机器学习具有处理同类事物的泛化能力,让检测系统更加智能化。为了正确而迅速地判定搜索引擎网页的安全性,将网页分为正常网页和恶意网页,判定规则通过机器学习中的分类模型来获得。首先,对大量的恶意网页与正常网页进行深入分析,除了考虑网页自身特征之外,选取了多种新的特征来检测恶意网页,包括Google PageRank值及搜索结果数、Alexa流量信息、域名信息、WOT声誉值等。相对于以往检测网页所选择的特征而言,本文得到的网页特征更具有健壮性、权威性,能够更好的区分恶意网页与正常网页,使得网页检测更具真实性、可靠性。其次,采用多种提取技术获得所选的网页特征,利用机器学习中的分类算法,如朴素贝叶斯、支持向量机、K最近邻、决策树算法等从网页特征集中生成分类模型。对分类性能优越且判决复杂度低的J48决策树模型加权叠加后,分类精度达到95.19%,能有效的评估网页的安全性,适合用来对搜索引擎网页进行快速分类。最后,扩展了Chrome浏览器的功能,将机器学习生成的决策树模型应用到搜索引擎网页检测中。当浏览器扩展探测到用户通过搜索引擎进行查询后,对于每个搜索引擎网页,利用异步的XMLHttpRequest从网络中提取分类模型中的特征,将检测的结果通过图标的形式及时反馈到搜索引擎网页旁边。通过在多款主流搜索引擎的大量搜索测试表明,所开发的扩展能够非常准确且有效的对任意搜索引擎网页进行检测。

全文目录


摘要  5-6
Abstract  6-8
目录  8-10
插图索引  10-11
附表索引  11-12
第1章 绪论  12-19
  1.1 研究意义及背景  12-13
  1.2 恶意网页检测技术及国内外研究现状  13-16
  1.3 现有的搜索引擎检测工具  16-17
    1.3.1 SiteAdvisor  17
    1.3.2 WOT(Web of trust)  17
    1.3.3 猎豹浏览器安全铠甲  17
  1.4 本文的工作  17-18
  1.5 本文的结构安排  18-19
第2章 搜索引擎恶意网页检测相关知识介绍  19-29
  2.1 恶意网页及其逃避技术  19-20
    2.1.1 网址重定向技术  19-20
    2.1.2 代码混淆技术  20
  2.2 搜索引擎作弊  20-21
  2.3 机器学习的概念  21
  2.4 分类算法分析  21-28
    2.4.1 朴素贝叶斯算法  22
    2.4.2 支持向量机算法  22-24
    2.4.3 K 最近邻(KNN)算法  24-25
    2.4.4 决策树算法  25-27
    2.4.5 AdaBoost 算法  27-28
  2.5 小结  28-29
第3章 基于决策树的搜索引擎恶意网页检测模型  29-44
  3.1 引言  29
  3.2 搜索引擎恶意网页研究  29-31
  3.3 搜索引擎恶意网页检测框架  31-32
  3.4 恶意网页特征选择  32-41
    3.4.1 URL 特征  32-33
    3.4.2 HTTP 响应头和 HTML 特征  33-35
    3.4.3 JavaScript 脚本特征  35-38
    3.4.4 Google 的 PageRank 值及搜索结果特征  38
    3.4.5 Alexa 特征  38-39
    3.4.6 域名特征  39-40
    3.4.7 WOT 网站声誉特征  40-41
  3.5 网页特征提取技术  41-43
    3.5.1 HTML 及 XML 网页解析  41-42
    3.5.2 字符串匹配  42-43
  3.6 小结  43-44
第4章 搜索引擎恶意网页检测模型生成与实现  44-56
  4.1 数据收集  44-45
  4.2 实验环境及分类平台 Weka  45-46
    4.2.1 实验环境  45
    4.2.2 分类平台 Weka  45-46
  4.3 恶意网页检测模型生成  46-49
    4.3.1 分类器性能指标  46
    4.3.2 分类结果及分析  46-49
  4.4 检测模型在 Chrome 的实现  49-55
    4.4.1 Chrome 扩展开发思路  50-52
    4.4.2 搜索引擎网页检测流程  52-54
    4.4.3 搜索引擎网页检测效率  54-55
  4.5 小结  55-56
结论  56-59
参考文献  59-63
致谢  63-64
附录A 攻读学位期间所发表的学术论文  64-65
附录B 攻读硕士期间参加的科研项目  65

相似论文

  1. 基于支持向量机的故障诊断方法研究,TP18
  2. 网络搜索引擎的相关技术研究,G354
  3. 英汉命名实体翻译方法研究,TP391.2
  4. 基于Lucene的网络文学垂直搜索引擎的研究与实现,TP391.3
  5. 数据挖掘在高职院校学生成绩分析中的应用,TP311.13
  6. 基于数据流挖掘技术的流量识别,TP393.06
  7. 基于Web的未登录词翻译技术研究,TP391.2
  8. 基于数据挖掘的个性化在线教学辅助系统的研究与设计,TP311.13
  9. 基于数据挖掘的课程考核与分析决策系统的设计和实现,TP311.13
  10. 基于社会网络分析的藏文web链接结构研究,TP393.09
  11. 生物医学缩略语消歧,R-5
  12. 基于BP网络的元搜索引擎研究,TP391.3
  13. 基于SOA构架的社区医疗管理系统研究与实现,TP311.52
  14. 李群深层结构学习算法研究,TP181
  15. 基于数据挖掘技术的高校毕业生就业管理信息系统的设计与实现,TP311.52
  16. 机器学习算法在视频指纹识别中的应用研究,TP391.41
  17. 基于最小二乘支持向量机的球团矿质量分类建模,TF046.6
  18. 基于因特网的动态规范词表的系统构建研究,G354
  19. 数据挖掘技术在高职教师绩效考核中的应用研究,TP311.13
  20. 基于Struts2框架的安全教育管理信息系统研究,TP311.52
  21. 基于知识整合的数据流分类算法研究,TP311.13

中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 计算机网络 > 一般性问题 > 计算机网络安全
© 2012 www.xueweilunwen.com