学位论文 > 优秀研究生学位论文题录展示

高校数字化校园Web信息过滤的研究

作 者: 谢林栩
导 师: 苏一丹
学 校: 广西大学
专 业: 计算机技术
关键词: 贝叶斯算法 敏感信息 中文分词 最高安全级别 增量学习
分类号: TP393.09
类 型: 硕士论文
年 份: 2011年
下 载: 37次
引 用: 0次
阅 读: 论文下载
 

内容摘要


最近几年,国内外环境变化日渐复杂,各种敌对势力利用校园网不断进行渗透,使得国家对网络信息的监控更为严格,对敏感信息的响应更为迅速,高校信息安全面临着新的挑战。现在,公安部、网监处、教育部门等已将高校校园网信息安全列为高校校园安全工作的重点之一,要求各级单位高度重视并做好信息安全管理工作,其影响就如高压线一般,无法触碰。因此,研究高校数字化校园Web敏感信息过滤具有重要的现实意义。目前,众多IT技术厂商都开发出了针对互联网的信息安全监控系统,此类系统技术先进,功能多、强大,但针对性不强,部署过程耗时费劲,操作繁琐复杂,往往还需要另行购买指定或附带的价格高昂的硬件设备,他们的做法大多是针对网络层中网络数据包的拦截,截获HTTP的应答数据报,然后对截获的数据报进行解析,经过第一层的IP地址过滤后,再对内容进行过滤。IT厂商在互联网普遍情况的基础上所研发出来的产品多数具有普遍性,即在功能上要多,过滤上要全面等。但实则上,校园网应用服务通常以主动服务居多,数据源相对简单,过多的功能、过滤的全面反而会导致整体的用户体验下降、功能得不到合理利用。同时高校科研经费紧张,建设节约型校园是目前大多数高校提倡的发展思路。在这样的背景下来购买厂商研发的这些监控系统显然不够合理,一是性价比不高,二是这些监控系统的普片性未必一定适合或满足高校信息安全管理的特定需求,这样必然会导致从设备到功能再到金钱上的极大浪费。本文从高校信息安全应由高校自身来主导这一观点出发,针对目前高校数字化校园Web信息过滤的真实现状(过滤涉及到的实则是一堆由Web信息管理系统生成并存放于Web服务器上的静态文本,只需对这些静态文本进行合法和敏感分类即可完成过滤。),在基于概率统计的贝叶斯算法基础上,提出了改进的过滤算法并设计了完整的过滤模型来对Web文本信息进行过滤。该方法完全可以将过滤应用于服务器端或者系统管理端,做成主动过滤,避免了金钱和功能上的极大浪费,希望能以此来为解决目前高校信息安全问题提供一个可供参考的解决方案。本文首先阐述了目前高校数字化校园Web建设的大体情况,目前存在和亟需解决的信息安全问题。在过滤中涉及到的中文分词问题,本文采用了正向最大匹配算法,并根据实际情况进行了改进,得到了设想的分词效果。本文设计过滤算法时,对贝叶斯算法进行了深入的研究和分析,考虑敏感信息拦截发生误判时所带来的风险,引入损失因子和利用管理反馈规则的办法,提出了基于最小风险贝叶斯决策的最高安全级别过滤算法,并基于该算法对数字化校园Web文本信息内容过滤的应用进行了研究。根据实际情况,针对过滤算法存在的缺点,通过引入缓冲集的思想,以此来改进贝叶斯增量学习算法,使得分类器能更好地适应日益增长的海量数据分类任务。另外,为了验证本文所提出的设计思路的正确性,作者在Java环境下,应用数据集进行了实验,实验表明本文设计的过滤模型是可行的,并能在一定程度上改善过滤效果。最后是本文的总结和展望。

全文目录


摘要  4-6
ABSTRACT  6-10
第1章 绪论  10-16
  1.1 课题背景及意义  10-11
  1.2 国内外研究现状  11-14
  1.3 本文研究的内容和主要创新点  14-15
    1.3.1 本文研究的内容  14
    1.3.2 本文的主要创新点  14-15
  1.4 论文的组织结构  15-16
第2章 Web文本预处理  16-26
  2.1 Web文本、HTML及相关知识  16-17
  2.2 去除Web文本HTML标记等冗余信息  17
  2.3 中文分词  17-25
    2.3.1 主要中文分词方法  18-21
    2.3.2 中文分词算法设计  21-23
    2.3.3 中文分词的结果  23-25
  2.4 本章小结  25-26
第3章 基于最小风险贝叶斯决策的最高安全级别过滤算法的研究  26-40
  3.1 贝叶斯算法  26-31
    3.1.1 概率论方面的基础知识  26-27
    3.1.2 贝叶斯统计模型  27-29
    3.1.3 贝叶斯过滤模型的P(d_x|C_j)估计模型  29-31
  3.2 贝叶斯算法在实际过滤中的应用  31-35
    3.2.1 特征项的提取  31-33
    3.2.2 公式依据  33-34
    3.2.3 贝叶斯过滤算法  34-35
  3.3 贝叶斯算法优点和局限性  35-36
  3.4 最高安全级别贝叶斯过滤算法的研究与应用  36-38
    3.4.1 基于最小风险的贝叶斯决策规则  36-37
    3.4.2 基于管理反馈的最高安全级别过滤算法  37-38
  3.5 本章小结  38-40
第4章 改进的贝叶斯增量学习算法的研究  40-44
  4.1 存在问题  40-41
  4.2 算法思想  41-42
  4.3 算法描述  42-43
  4.4 算法评价  43
  4.5 本章小结  43-44
第5章 模型的设计及实验结果分析  44-56
  5.1 过滤模型设计  44-45
  5.2 系统实现  45-50
    5.2.1 Web文本预处理程序  45-47
    5.2.2 贝叶斯过滤算法程序实现  47-50
  5.3 评价标准  50-51
  5.4 实验结果及分析  51-55
    5.4.1 算法实验一  52-54
    5.4.2 算法实验二  54-55
  5.5 本章小结  55-56
第6章 总结与展望  56-57
  6.1 总结  56
  6.2 展望  56-57
参考文献  57-61
致谢  61-62
攻读硕士期间公开发表/录用的学术论文  62

相似论文

  1. ATN中敏感信息保护技术研究,TP309
  2. 软测量技术在氯甲烷回收中的应用研究,TQ222.214
  3. 基于改进的支持向量机的模拟电路故障诊断方法研究,TN710
  4. 全文检索及相关技术研究,TP391.3
  5. LUCENE中文分词在科研文档全文检索系统的应用研究,TP311.52
  6. 基于条件随机场的中文分词技术的研究与实现,TP391.1
  7. 信息流跟踪的研究与实现,TP368.1
  8. 面向三网融合的故障管理系统的研究及实现,TP315
  9. 主观题自动评分技术研究,TP391.1
  10. 重构算法在OFDM信道估计中的应用研究,TN919.3
  11. 基于观点挖掘的产品可用性建模与评价,F274
  12. Web数据挖掘技术在网络教育论坛中的应用研究,G434
  13. 基于WebHarvest的中文财经新闻搜索引擎的设计与实现,TP311.52
  14. 中文XML压缩技术研究,TP311.11
  15. 企业邮件监管系统的设计与实现,TP393.098
  16. 基于语素的汉语词法分析方法研究,TP391.1
  17. 支持向量机增量学习算法研究,TP18
  18. 中文分词算法在GIS中的应用研究,TP391.3
  19. 基于WEB的社区智能医疗服务系统的研究,TP311.52
  20. 基于过滤技术的投诉信息智能分析与实现,TP391.1

中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 计算机网络 > 一般性问题 > 计算机网络应用程序
© 2012 www.xueweilunwen.com