学位论文 > 优秀研究生学位论文题录展示
中文维基百科的结构化信息抽取及词语相关度计算
作 者: 张红春
导 师: 何婷婷
学 校: 华中师范大学
专 业: 计算机应用技术
关键词: 词语相关度计算 中文维基百科 结构化信息
分类号: TP391.1
类 型: 硕士论文
年 份: 2011年
下 载: 128次
引 用: 0次
阅 读: 论文下载
内容摘要
|
为了提高计算机的智能化程度,在自然语言处理的过程中,加入语义知识的理解是非常必要的。随着日益增长的信息处理需求,如何从海量的语料资源中自动地获取丰富的语义知识,以及如何有效地利用这些语义知识来实现对文本语义的理解,已成为一个重要的研究课题。维基百科作为一个以开放和用户协作编辑为特点的Web 2.0知识系统,具有知识面覆盖度广,结构化程度高,信息更新速度快等优点,其中蕴涵有丰富的语义知识,是目前众多学者进行语义知识抽取所青睐的语料数据资源。然而,维基百科的官方仅提供一些半结构化的基本数据文件的备份,很多有用的结构化信息和数据,并不能直接地获取和使用。为此,本文首先从这些半结构化的基本数据中抽取整理出多种结构化信息;接着,对维基百科的知识组织形式进行了抽象架构,实现了一套开放的API接口,减轻了用户从中获取结构化信息的难度;最后,利用这些信息数据,本文提出了一种新的计算词语间语义相关度的算法。因此,本文的主要工作包含以下几个方面:第一,结构化信息的抽取。首先从维基百科官方网站下载了所需的备份数据资源;接着,先把备份数据文本中的繁体字全部转换为简体,再从中抽取整理出条目间内链接信息,分类系统,锚文本数据等多种结构化信息;然后,把这些信息全部存储到数据库中,并对重要的字段建立了索引。第二,对维基百科知识组织形式的抽象架构。首先分析了维基百科中条目的不同作用,进而把所有的条目分为六种类型;然后,针对每种类型的条目,总结并实现了获取其相应的结构化信息的方法;最终,实现了一套开放的API接口,方便了用户更直观地了解和使用这些结构化信息。第三,提出了一种新的计算词语间语义相关度的算法。在对比总结人工语义知识库与维基百科异同点的基础上,借鉴传统算法的优点,结合中文维基百科数据的自身特点,提出了一种新的计算词语间语义相关度的算法,该算法综合利用条目间内链接,锚文本和分类系统三种结构化信息,并通过核函数的思想,融合了分类间的语义知识。在实验部分,本文在不同的数据集上对比了本文算法与其他经典算法的计算结果,最终证明了本文算法的有效性。
|
全文目录
摘要 5-6 Abstract 6-10 第一章 绪论 10-15 1.1 研究背景与意义 10-11 1.2 国内外研究概况 11-12 1.3 本文的主要研究内容 12-14 1.4 本文的组织结构 14-15 第二章 相关的技术研究 15-23 2.1 词语间语义相关度及其计算的方法 15-17 2.1.1 词语间语义相关度的含义 15 2.1.2 词语间语义相关度的计算方法 15-17 2 .2语义核函数的介绍 17-20 2.2.1 核函数方法的介绍 17-19 2.2.2 核函数方法的语义平滑 19-20 2.3 语义相关度的评价 20-22 2.3.1 测试数据集 21 2.3.2 评价的标准 21-22 2.4 本章小结 22-23 第三章 中文维基百科数据的整理 23-38 3.1 维基百科的介绍 23-26 3.2 中文维基百科数据的下载 26-28 3.3 中文维基百科数据的结构化信息抽取 28-34 3.4 中文维基百科的抽象架构 34-37 3.5 本章小结 37-38 第四章 基于中文维基百科的词语间语义相关度计算 38-46 4.1 算法的总体思想 38-39 4.2 词语到维基百科条目的映射 39-42 4.2.1 词语所有义项条目的查询 40-41 4.2.2 词语当前含义的确定 41-42 4.3 条目间语义相关度的计算 42-45 4.3.1 算法的总体思想 42-43 4.3.2 算法的具体实现 43-44 4.3.3 利用分类系统进行语义平滑 44-45 4.4 本章小结 45-46 第五章 实验和结果分析 46-52 5.1 实验数据的准备 46-48 5.2 实验的步骤和结果分析 48-50 5.2.1 对条目相关度计算的评估 48-50 5.2.2 对分类语义平滑方法的评估 50 5.3 实验小结 50-52 第六章 总结和展望 52-54 6.1 本文工作的总结 52-53 6.2 进一步的工作 53-54 参考文献 54-57 硕士期间发表的论文和参与的项目 57-58 致谢 58
|
相似论文
- 学术主页信息抽取系统的研究,TP393.092
- 基于语义的金融企业非结构化信息检索系统研究,TP391.3
- 基于云计算的海量电子病历文本分析系统研究,TP391.1
- 基于归纳学习的Web半结构化信息抽取,TP393.09
- 基于树核的代词消解研究,TP391.1
- 非结构化信息处理平台中的基于角色的访问控制框架设计与实现,TP393.08
- 支持协同的分布式本体管理系统的设计和实现,TP311.52
- 基于UIMA的企业知识管理系统研究,TP311.52
- 面向领域的垂直搜索系统研究与实现,TP391.3
- 网络资源搜集系统的设计与实现,TP393.09
- 非结构化信息的Native XML文档存储机制研究,TP312.2
- Internet智能比较购物的研究与实现,TP311.52
- 基于Ontology和XML的非结构化信息语义表示机制研究,TP393
- 基于Ontology的非结构化信息访问机制研究,TP393
- 基于XML的非结构化信息存储系统事务处理模型研究,TP393
- 基于工程项目文档的文本挖掘系统的研究与实现,TP391.1
- 非结构化网络空间信息智能搜索与服务研究,P208
- 基于FPGA的数字图像处理基本算法研究与实现,TP391.41
- 用于检索的人脸特征提取与匹配算法研究,TP391.41
- 基于FPGA的高速图像预处理技术的研究,TP391.41
- 2D人脸模板保护算法研究,TP391.41
中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 文字信息处理
© 2012 www.xueweilunwen.com
|