学位论文 > 优秀研究生学位论文题录展示

中文维基百科的结构化信息抽取及词语相关度计算

作 者: 张红春
导 师: 何婷婷
学 校: 华中师范大学
专 业: 计算机应用技术
关键词: 词语相关度计算 中文维基百科 结构化信息
分类号: TP391.1
类 型: 硕士论文
年 份: 2011年
下 载: 128次
引 用: 0次
阅 读: 论文下载
 

内容摘要


为了提高计算机的智能化程度,在自然语言处理的过程中,加入语义知识的理解是非常必要的。随着日益增长的信息处理需求,如何从海量的语料资源中自动地获取丰富的语义知识,以及如何有效地利用这些语义知识来实现对文本语义的理解,已成为一个重要的研究课题。维基百科作为一个以开放和用户协作编辑为特点的Web 2.0知识系统,具有知识面覆盖度广,结构化程度高,信息更新速度快等优点,其中蕴涵有丰富的语义知识,是目前众多学者进行语义知识抽取所青睐的语料数据资源。然而,维基百科的官方仅提供一些半结构化的基本数据文件的备份,很多有用的结构化信息和数据,并不能直接地获取和使用。为此,本文首先从这些半结构化的基本数据中抽取整理出多种结构化信息;接着,对维基百科的知识组织形式进行了抽象架构,实现了一套开放的API接口,减轻了用户从中获取结构化信息的难度;最后,利用这些信息数据,本文提出了一种新的计算词语间语义相关度的算法。因此,本文的主要工作包含以下几个方面:第一,结构化信息的抽取。首先从维基百科官方网站下载了所需的备份数据资源;接着,先把备份数据文本中的繁体字全部转换为简体,再从中抽取整理出条目间内链接信息,分类系统,锚文本数据等多种结构化信息;然后,把这些信息全部存储到数据库中,并对重要的字段建立了索引。第二,对维基百科知识组织形式的抽象架构。首先分析了维基百科中条目的不同作用,进而把所有的条目分为六种类型;然后,针对每种类型的条目,总结并实现了获取其相应的结构化信息的方法;最终,实现了一套开放的API接口,方便了用户更直观地了解和使用这些结构化信息。第三,提出了一种新的计算词语间语义相关度的算法。在对比总结人工语义知识库与维基百科异同点的基础上,借鉴传统算法的优点,结合中文维基百科数据的自身特点,提出了一种新的计算词语间语义相关度的算法,该算法综合利用条目间内链接,锚文本和分类系统三种结构化信息,并通过核函数的思想,融合了分类间的语义知识。在实验部分,本文在不同的数据集上对比了本文算法与其他经典算法的计算结果,最终证明了本文算法的有效性。

全文目录


摘要  5-6
Abstract  6-10
第一章 绪论  10-15
  1.1 研究背景与意义  10-11
  1.2 国内外研究概况  11-12
  1.3 本文的主要研究内容  12-14
  1.4 本文的组织结构  14-15
第二章 相关的技术研究  15-23
  2.1 词语间语义相关度及其计算的方法  15-17
    2.1.1 词语间语义相关度的含义  15
    2.1.2 词语间语义相关度的计算方法  15-17
  2 .2语义核函数的介绍  17-20
    2.2.1 核函数方法的介绍  17-19
    2.2.2 核函数方法的语义平滑  19-20
  2.3 语义相关度的评价  20-22
    2.3.1 测试数据集  21
    2.3.2 评价的标准  21-22
  2.4 本章小结  22-23
第三章 中文维基百科数据的整理  23-38
  3.1 维基百科的介绍  23-26
  3.2 中文维基百科数据的下载  26-28
  3.3 中文维基百科数据的结构化信息抽取  28-34
  3.4 中文维基百科的抽象架构  34-37
  3.5 本章小结  37-38
第四章 基于中文维基百科的词语间语义相关度计算  38-46
  4.1 算法的总体思想  38-39
  4.2 词语到维基百科条目的映射  39-42
    4.2.1 词语所有义项条目的查询  40-41
    4.2.2 词语当前含义的确定  41-42
  4.3 条目间语义相关度的计算  42-45
    4.3.1 算法的总体思想  42-43
    4.3.2 算法的具体实现  43-44
    4.3.3 利用分类系统进行语义平滑  44-45
  4.4 本章小结  45-46
第五章 实验和结果分析  46-52
  5.1 实验数据的准备  46-48
  5.2 实验的步骤和结果分析  48-50
    5.2.1 对条目相关度计算的评估  48-50
    5.2.2 对分类语义平滑方法的评估  50
  5.3 实验小结  50-52
第六章 总结和展望  52-54
  6.1 本文工作的总结  52-53
  6.2 进一步的工作  53-54
参考文献  54-57
硕士期间发表的论文和参与的项目  57-58
致谢  58

相似论文

  1. 学术主页信息抽取系统的研究,TP393.092
  2. 基于语义的金融企业非结构化信息检索系统研究,TP391.3
  3. 基于云计算的海量电子病历文本分析系统研究,TP391.1
  4. 基于归纳学习的Web半结构化信息抽取,TP393.09
  5. 基于树核的代词消解研究,TP391.1
  6. 非结构化信息处理平台中的基于角色的访问控制框架设计与实现,TP393.08
  7. 支持协同的分布式本体管理系统的设计和实现,TP311.52
  8. 基于UIMA的企业知识管理系统研究,TP311.52
  9. 面向领域的垂直搜索系统研究与实现,TP391.3
  10. 网络资源搜集系统的设计与实现,TP393.09
  11. 非结构化信息的Native XML文档存储机制研究,TP312.2
  12. Internet智能比较购物的研究与实现,TP311.52
  13. 基于Ontology和XML的非结构化信息语义表示机制研究,TP393
  14. 基于Ontology的非结构化信息访问机制研究,TP393
  15. 基于XML的非结构化信息存储系统事务处理模型研究,TP393
  16. 基于工程项目文档的文本挖掘系统的研究与实现,TP391.1
  17. 非结构化网络空间信息智能搜索与服务研究,P208
  18. 基于FPGA的数字图像处理基本算法研究与实现,TP391.41
  19. 用于检索的人脸特征提取与匹配算法研究,TP391.41
  20. 基于FPGA的高速图像预处理技术的研究,TP391.41
  21. 2D人脸模板保护算法研究,TP391.41

中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 文字信息处理
© 2012 www.xueweilunwen.com