学位论文 > 优秀研究生学位论文题录展示

基于概念集合的网页内容过滤方法的研究

作 者: 王阿婷
导 师: 毕红军
学 校: 北京交通大学
专 业: 信息网络与安全
关键词: 网页过滤 知网(HowNet) 语义相似度 情感倾向性 KNN分类方法 概念集合
分类号: TP393.092
类 型: 硕士论文
年 份: 2010年
下 载: 40次
引 用: 0次
阅 读: 论文下载
 

内容摘要


由于Internet的普及和发展,人类社会进入了信息社会。互联网在人们的日常信息交流中占据着越来越重要的地位。网页的内容逐渐丰富,涉及的领域越来越广泛,同时网页的内容形式也更加多样化,比如文字、图像、视频、音频等。而最为普遍的形式当属文字内容,是网页内容的主要载体,因此随着计算机和互联网的推广和应用,由数据处理、信息处理到知识处理,对语言文字处理要求的深度和广度越来越高。正因为文字信息如此重要,所以网页文字信息中很有可能会加入一些敏感信息,给人们的生活、甚至社会带来危害。本文主要针对网页文字信息中的不良信息进行分析,深入研究过滤方法,达到对网络信息的安全过滤。以往的网页过滤算法大多是以基于统计过滤或关键词过滤,这些过滤算法实现比较简单而且快速,但是也存在着不足,那就是:只是在字面意义上机械的理解网页内容,往往不能深入的了解,忽略了文本中的语义约束,无法有效识别带有语义倾向性的信息,最终导致过滤的效果并不理想。所以结果表明,如果要提高过滤算法的准确度,应该加入语义倾向性的判断,试图真正了解作者要表达的内容。本文利用知网(HowNet)和分类算法提出了一种基于概念集合的网页过滤方法。针对互联网资源的丰富性和开放性的特点,首先对网络中收集的文本进行预处理工作,即分词以及词性的标注,为过滤做准备。然后按照本文提出的概念集合算法的步骤进行各个集合的相似度匹配。由于最能表达作者观点或意图的信息往往来自于动词或者形容词,同时否定词和副词也尤其重要,所以根据本文构造的情感词典对这些词再进行匹配和分类比较,最后判断是否为敏感信息,是否需要过滤。最后对改进后的算法进行了验证,收集到政治、军事、娱乐等三个方面的信息进行计算和模板的匹配,实验的结果验证了改进后算法的可行性,证明了能够有效改善网页过滤的效果,对于敏感信息能起到一定程度上的检测效果,并对检测结果进行了分析。由于信息类别的不同,通常计算结果的查准率和召回率会有所不同。

全文目录


致谢  5-6
中文摘要  6-7
ABSTRACT  7-11
1 引言  11-14
  1.1 研究背景及意义  11
  1.2 相关研究现状  11-12
  1.3 论文的主要工作及组织结构  12-14
2 网页过滤的相关知识  14-33
  2.1 文本分词  14-18
  2.2 语义依存分析  18-20
    2.2.1 句法分析  18-20
    2.2.2 语义模式分析  20
  2.3 文本表示模型  20-22
    2.3.1 布尔模型  20-21
    2.3.2 向量空间模型  21-22
    2.3.3 概率模型  22
  2.4 文本分类方法  22-26
    2.4.1 贝叶斯分类法  23-24
    2.4.2 支持向量机(SVM)  24-26
    2.4.3 KNN分类方法  26
  2.5 权重计算  26-27
  2.6 知网(HowNet)  27-32
    2.6.1 知网的组成  28-30
    2.6.2 知网的知识描述语言  30-32
    2.6.3 知网的情感词汇  32
  2.7 本章小结  32-33
3 网页过滤相关算法及其改进  33-43
  3.1 网页过滤出现的问题  33-34
    3.1.1 传统的过滤技术存在的缺陷  33
    3.1.2 情感倾向性过滤的描述  33-34
  3.2 网页过滤的相关算法  34-37
    3.2.1 格语法  34-35
    3.2.2 基于知网的语义相似度  35-37
  3.3 网页过滤算法的改进  37-42
    3.3.1 情感词典的构造  37-38
    3.3.2 网页过滤算法改进  38-42
  3.4 本章小结  42-43
4 仿真过程及结果分析  43-54
  4.1 仿真过程  43-46
    4.1.1 文本分词  43-44
    4.1.2 句子分析与划分  44-45
    4.1.3 概念集合匹配  45-46
    4.1.4 文本匹配结果  46
  4.2 网页过滤演示  46-51
    4.2.1 词语查询  47-49
    4.2.2 分词结果  49
    4.2.3 倾向性判断  49-50
    4.2.4 判断结果  50-51
  4.3 仿真结果及分析  51-53
    4.3.1 过滤性能评价标准  51
    4.3.2 仿真结果  51-52
    4.3.3 结果分析  52-53
  4.4 本章小结  53-54
5 总结与展望  54-55
参考文献  55-57
作者简历  57-59
学位论文数据集  59

相似论文

  1. 互联网上旅游评论的情感分析及其有用性研究,TP391.1
  2. 一种基于领域本体的语义Web服务匹配和组合方法,TP393.09
  3. Web环境下基于语义模式匹配的实体关系提取方法的研究,TP391.1
  4. 基于链接重要性的动态链接预测算法研究,TP393.03
  5. 基于本体的智能电网知识检索系统,TM76
  6. 基于博客的作者声誉度分析,TP393.092
  7. 基于中文维基百科的语义相关度计算的研究与实现,TP391.1
  8. 蛋白质关系网络复合物发现与可视化研究,TP391.41
  9. 基于本体和SWRL推理的知识检索方法研究,TP391.3
  10. 基于接口匹配的语义Web服务发现方法研究,TP391.1
  11. 网络舆情话题情感倾向性分析技术研究,TP393.09
  12. 软件安全领域垂直搜索引擎的优化设计与实现,TP391.3
  13. 基于语义分析的推荐算法在RSS网络信息服务中的研究,TP393.09
  14. 基于半监督学习的中文问句分类研究,TP391.1
  15. 中文文本聚类算法的研究与实现,TP391.1
  16. 基于BP神经网络的本体映射方法研究,TP311.52
  17. 基于语义的访问控制技术在信息整合中的研究,TP393.08
  18. 基于语义理解的论文相似度研究,TP391.1
  19. 嵌入式网页过滤装置设计,TP393.08
  20. 基于领域本体Web信息采集的研究,TP393.09

中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 计算机网络 > 一般性问题 > 计算机网络应用程序 > 网络浏览器
© 2012 www.xueweilunwen.com