学位论文 > 优秀研究生学位论文题录展示

XML文档语义相似性研究综述

作 者: 王成龙
导 师: 卫金茂
学 校: 东北师范大学
专 业: 电路与系统
关键词: XML文档 语义 语义相似性 编辑距离 边匹配
分类号: TP312.2
类 型: 硕士论文
年 份: 2009年
下 载: 151次
引 用: 5次
阅 读: 论文下载
 

内容摘要


随着信息技术的发展,XML成为一个热门的话题。XML的发展,也为基于Web的信息交换带来了新的希望。但由于XML数据是半结构化的,在搜索处理这些半结构化的数据信息时,尤其是在用户需要查找与某一信息相关(但不完全一致)的数据时会产生很多问题。这就需要研究基于XML文档的近似搜索技术。近似搜索技术的基础是准确地度量所查询的信息与文档、文档与文档间的相关性与相似性,因此XML文档之间的相似性研究问题显得尤为重要。XML文档之间相似度的计算是文档检索、挖掘和文本聚类的基础,是信息检索和数据仓库领域的中心论题。本文介绍了XML文档相似性问题的研究背景,实际意义和该课题的研究现状,分析了XML文档相似性在数据综合、数据仓库和文档聚类中的应用。本文首先对XML的语法结构进行简单概述,XML文档的语法规则是应用和处理XML文档的基础。介绍了语义网和树的概念,然后重点对当前的XML文档相似性计算方法进行了总结。当前的XML文档相似性计算方法主要分为基于编辑距离的、基于信息检索的、边匹配、集合度量、模式匹配和结构信息内容(SIC),文中重点对以上六种方法进行了介绍和总结,说明了它们在不同领域中的应用和方法的不足。最后对XML文档相似性的研究问题进行了展望。

全文目录


摘要  4-5
ABSTRACT  5-7
第一章引言  7-13
  1.1 研究背景和意义  7-10
  1.2 课题研究现状  10-11
  1.3 主要工作及章节安排  11-13
第二章XML 及其语法规则  13-26
  2.1 XML 的产生和发展  13
  2.2 XML 语法论述  13-19
  2.3 DOM 思想简述  19-23
  2.4 XML 文档语义相似性的概念  23-25
  2.5 XML 文档解析后树形图  25
  2.6 小结  25-26
第三章 XML 文档语义相似性计算方法  26-37
  3.1 语义网  27-28
  3.2 树的定义  28-29
  3.3 基于编辑距离(ED-BASED)的方法  29-32
  3.4 基于信息检索(IR-BASED)的方法  32-33
  3.5 其它方法  33-35
  3.6 结构信息内容(SIC)  35-36
  3.7 方法总结  36-37
结语  37-38
参考文献  38-41
后记  41

相似论文

  1. 《左传》名词陈述化研究,H146
  2. 基于多示例学习的用户关注概念区域发现,TP391.41
  3. 面向业务过程的服务动态组合方法研究,TP393.09
  4. 基于本体的语义检索研究,TP391.3
  5. 乔治·米勒的认知意义论,B842.1
  6. 一种基于领域本体的语义Web服务匹配和组合方法,TP393.09
  7. 心智游移频率特征研究:问卷开发,B841
  8. 基于语义网络的智能搜索引擎研究,TP391.3
  9. 汉语框架自动识别中的歧义消解,TP391.1
  10. 《摩诃僧祗律》范围副词研究,H141
  11. “二拍”述补结构研究,H141
  12. 汉语中羡余类形式研究综述,H146
  13. 范畴化理论在大学英语词汇教学中的应用研究,H319
  14. 基于贝叶斯理论的社会化标注主题聚类模型研究,C93
  15. 语用逻辑真值问题研究,H030
  16. 《水浒传》、《西游记》、《金瓶梅》、《红楼梦》语气词比较研究,H146
  17. 《论语》心理形容词研究,H131
  18. 汉语农谚研究,H136
  19. 汉英插入语对比研究,H314
  20. 论普通语义学对其后语义研究的影响,H030
  21. 现代汉语触觉感官词的认知语义研究,H136

中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机软件 > 程序语言、算法语言
© 2012 www.xueweilunwen.com