学位论文 > 优秀研究生学位论文题录展示
基于决策树的搜索引擎恶意网页检测研究与实现
作 者: 周浩
导 师: 孙建华
学 校: 湖南大学
专 业: 信息与通信工程
关键词: 搜索引擎 恶意网页 机器学习 分类模型 决策树 浏览器扩展
分类号: TP393.08
类 型: 硕士论文
年 份: 2013年
下 载: 9次
引 用: 0次
阅 读: 论文下载
内容摘要
|
随着互联网的快速发展,网络信息呈爆炸式的增长,具有资源整合功能的搜索引擎已经成为人们获取信息的首要途径。然而大量钓鱼网页、恶意代码链接充斥其中,给用户带来极大的安全隐患,避免用户访问恶意的搜索链接具有深远而现实的意义。然而,现有的搜索引擎安全防御工具检测范围有限。本文力图改善搜索引擎网页检测的覆盖面,利用机器学习具有处理同类事物的泛化能力,让检测系统更加智能化。为了正确而迅速地判定搜索引擎网页的安全性,将网页分为正常网页和恶意网页,判定规则通过机器学习中的分类模型来获得。首先,对大量的恶意网页与正常网页进行深入分析,除了考虑网页自身特征之外,选取了多种新的特征来检测恶意网页,包括Google PageRank值及搜索结果数、Alexa流量信息、域名信息、WOT声誉值等。相对于以往检测网页所选择的特征而言,本文得到的网页特征更具有健壮性、权威性,能够更好的区分恶意网页与正常网页,使得网页检测更具真实性、可靠性。其次,采用多种提取技术获得所选的网页特征,利用机器学习中的分类算法,如朴素贝叶斯、支持向量机、K最近邻、决策树算法等从网页特征集中生成分类模型。对分类性能优越且判决复杂度低的J48决策树模型加权叠加后,分类精度达到95.19%,能有效的评估网页的安全性,适合用来对搜索引擎网页进行快速分类。最后,扩展了Chrome浏览器的功能,将机器学习生成的决策树模型应用到搜索引擎网页检测中。当浏览器扩展探测到用户通过搜索引擎进行查询后,对于每个搜索引擎网页,利用异步的XMLHttpRequest从网络中提取分类模型中的特征,将检测的结果通过图标的形式及时反馈到搜索引擎网页旁边。通过在多款主流搜索引擎的大量搜索测试表明,所开发的扩展能够非常准确且有效的对任意搜索引擎网页进行检测。
|
全文目录
摘要 5-6 Abstract 6-8 目录 8-10 插图索引 10-11 附表索引 11-12 第1章 绪论 12-19 1.1 研究意义及背景 12-13 1.2 恶意网页检测技术及国内外研究现状 13-16 1.3 现有的搜索引擎检测工具 16-17 1.3.1 SiteAdvisor 17 1.3.2 WOT(Web of trust) 17 1.3.3 猎豹浏览器安全铠甲 17 1.4 本文的工作 17-18 1.5 本文的结构安排 18-19 第2章 搜索引擎恶意网页检测相关知识介绍 19-29 2.1 恶意网页及其逃避技术 19-20 2.1.1 网址重定向技术 19-20 2.1.2 代码混淆技术 20 2.2 搜索引擎作弊 20-21 2.3 机器学习的概念 21 2.4 分类算法分析 21-28 2.4.1 朴素贝叶斯算法 22 2.4.2 支持向量机算法 22-24 2.4.3 K 最近邻(KNN)算法 24-25 2.4.4 决策树算法 25-27 2.4.5 AdaBoost 算法 27-28 2.5 小结 28-29 第3章 基于决策树的搜索引擎恶意网页检测模型 29-44 3.1 引言 29 3.2 搜索引擎恶意网页研究 29-31 3.3 搜索引擎恶意网页检测框架 31-32 3.4 恶意网页特征选择 32-41 3.4.1 URL 特征 32-33 3.4.2 HTTP 响应头和 HTML 特征 33-35 3.4.3 JavaScript 脚本特征 35-38 3.4.4 Google 的 PageRank 值及搜索结果特征 38 3.4.5 Alexa 特征 38-39 3.4.6 域名特征 39-40 3.4.7 WOT 网站声誉特征 40-41 3.5 网页特征提取技术 41-43 3.5.1 HTML 及 XML 网页解析 41-42 3.5.2 字符串匹配 42-43 3.6 小结 43-44 第4章 搜索引擎恶意网页检测模型生成与实现 44-56 4.1 数据收集 44-45 4.2 实验环境及分类平台 Weka 45-46 4.2.1 实验环境 45 4.2.2 分类平台 Weka 45-46 4.3 恶意网页检测模型生成 46-49 4.3.1 分类器性能指标 46 4.3.2 分类结果及分析 46-49 4.4 检测模型在 Chrome 的实现 49-55 4.4.1 Chrome 扩展开发思路 50-52 4.4.2 搜索引擎网页检测流程 52-54 4.4.3 搜索引擎网页检测效率 54-55 4.5 小结 55-56 结论 56-59 参考文献 59-63 致谢 63-64 附录A 攻读学位期间所发表的学术论文 64-65 附录B 攻读硕士期间参加的科研项目 65
|
相似论文
- 基于支持向量机的故障诊断方法研究,TP18
- 网络搜索引擎的相关技术研究,G354
- 英汉命名实体翻译方法研究,TP391.2
- 基于Lucene的网络文学垂直搜索引擎的研究与实现,TP391.3
- 数据挖掘在高职院校学生成绩分析中的应用,TP311.13
- 基于数据流挖掘技术的流量识别,TP393.06
- 基于Web的未登录词翻译技术研究,TP391.2
- 基于数据挖掘的个性化在线教学辅助系统的研究与设计,TP311.13
- 基于数据挖掘的课程考核与分析决策系统的设计和实现,TP311.13
- 基于社会网络分析的藏文web链接结构研究,TP393.09
- 生物医学缩略语消歧,R-5
- 基于BP网络的元搜索引擎研究,TP391.3
- 基于SOA构架的社区医疗管理系统研究与实现,TP311.52
- 李群深层结构学习算法研究,TP181
- 基于数据挖掘技术的高校毕业生就业管理信息系统的设计与实现,TP311.52
- 机器学习算法在视频指纹识别中的应用研究,TP391.41
- 基于最小二乘支持向量机的球团矿质量分类建模,TF046.6
- 基于因特网的动态规范词表的系统构建研究,G354
- 数据挖掘技术在高职教师绩效考核中的应用研究,TP311.13
- 基于Struts2框架的安全教育管理信息系统研究,TP311.52
- 基于知识整合的数据流分类算法研究,TP311.13
中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 计算机网络 > 一般性问题 > 计算机网络安全
© 2012 www.xueweilunwen.com
|