学位论文 > 优秀研究生学位论文题录展示
汉语框架自动识别中的歧义消解
作 者: 高亚慧
导 师: 李济洪
学 校: 山西大学
专 业: 概率论与数理统计
关键词: 汉语框架语义知识库 框架消歧 最大熵模型 汉语基本块
分类号: TP391.1
类 型: 硕士论文
年 份: 2011年
下 载: 15次
引 用: 0次
阅 读: 论文下载
内容摘要
|
自然语言理解是实现人与计算机之间有效的通信的一种技术。在自然语言中,一词多义的现象普遍存在,因此,词义的歧义消解是自然语言理解中重要的环节之一。词汇的框架义是词汇的一种意义表示。汉语框架的自动识别就是对句子中给定的词语,根据其上下文环境自动识别出其激起的框架。框架自动识别技术是大规模自动构建语义语料库的有效途径,同时也为框架语义的自动分析提供分析工具,其深入研究将有效地推动中文信息检索、问答系统、机器翻译和文本分类等技术的向前发展。考虑到目前汉语框架网络知识库仍在完善中,词元列表、框架列表还有待扩充,本文根据框架语义中自然语言自动语义分析的要求,将汉语框架自动识别任务分解为词元识别、未知框架检测和框架消歧义三个子任务,本论文主要关注汉语框架自动识别中的歧义消解任务。该任务主要基于上下文环境,对给定句子中的目标词从现有的框架库中为该目标词自动标注一个合适的框架。本文将该任务看作多类分类问题,使用最大熵对其进行建模本文从当前的汉语框架语义知识库的1960个词元中选取了同时能够激起两个以上框架且例句数相对较多的88个词元的2077条例句,按3-fold交叉验证切分为训练集和测试集。本文基于词的框架消歧模型,构造了词层面、基本块层面,以及依存句法层面的若干特征,并使用了开窗口技术和BOW策略。在测试集上,基于词的汉语框架自动消歧baseline模型的精确率(Accuracy)达到了64.42%。本文在Baseline基础上加入BOW特征,测试集上的精确率达到了68.37%,比原有方法提高了3.95%。这表明:BOW特征,即目标词与其它词的搭配信息在框架消歧任务中起重要作用,这基本符合语言学的规律。进一步,基于清华大学的基本块分析器,本文对语料中的所有例句进行自动分析,并抽取基本块层面的特征加入到baseline模型中,测试集上精确率没有提高,仍然是64.42%。这表明BC特征对框架消歧任务基本不起作用。通过对结果的分析可知,自动基本块分析器的性能在开放语料环境下并不理想是导致性能没有提高的主要原因。此外,基于Stanford、HIT和Mate三个依存句法分析器对全部语料自动分析得到的依存句法树,分别抽取依存句法层面的特征分别加入到baseline模型中。测试集上最好的结果是基于Mate分析器的,比Stanford和HIT的结果高近2个百分点。实验结果中,三组实验较Baseline模型都有不同程度的提高,表明依存句法层面的特征对框架消歧任务有一定的作用。然而,测试结果提高的幅度不大,主要原因是自动分析器在开放语料测试环境下的性能不理想。最后,本文进行融合基于词层面特征、BOW策略和Mate依存句法层面特征进行实验,选取最优模型,实验的最好结果精确率达到69.28%。这是目前最好的框架消歧结果。
|
全文目录
中文摘要 8-10 ABSTRACT 10-12 第一章 引言 12-28 1.1 研究背景及意义 12-13 1.2 框架以及汉语框架语义知识库 13-22 1.2.1 FrameNet工程简介 13-15 1.2.2 汉语框架语义知识库简介 15-18 1.2.3 汉语框架语义知识库语义分析流程 18-22 1.3 国内外研究现状 22-25 1.3.1 FrameNet相关语义角色评测任务介绍 22-24 1.3.2 文献综述 24-25 1.4 研究内容与组织结构 25-28 第二章 汉语框架自动识别中的歧义消解模型 28-38 2.1 汉语框架自动识别任务分解 28-29 2.2 汉语框架消歧模型的形式化描述 29 2.3 算法选择 29-36 2.3.1 最大熵模型 30-31 2.3.2 最大熵原理的推理机制及特征选择 31-35 2.3.3 最大熵模型的参数估计 35-36 2.3.4 最大熵工具包 36 2.4 小结 36-38 第三章 汉语框架消歧模型的实验准备 38-42 3.1 特征选择 38-40 3.2 语料选择及切分 40 3.3 评价指标 40 3.4 小结 40-42 第四章 汉语框架消歧模型的实验结果及错误分析 42-52 4.1 基于词层面的汉语框架消歧模型 42-44 4.1.1 汉语框架消歧Baseline模型 42-44 4.1.2 基于BOW策略的汉语框架消歧模型 44 4.2 基于基本块层面的汉语框架消歧模型 44-47 4.2.1 汉语基本块描述体系及基本块自动标注器的性能 44-45 4.2.2 模型的特征描述及选取 45-46 4.2.3 模型的实验结果 46-47 4.2.4 实验结果分析 47 4.3 基于依存句法分析层面的模型 47-49 4.3.1 依存句法分析器的选取 47-48 4.3.2 模型的特征描述及选取 48 4.3.3 模型的实验结果 48 4.3.4 实验结果分析 48-49 4.4 模型的比较与融合 49-50 4.5 小结 50-52 第五章 总结与展望 52-54 5.1 总结 52 5.2 展望 52-54 参考文献 54-58 攻读硕士学位期间取得的研究成果 58-59 致谢 59-60 个人简况及联系方式 60-62
|
相似论文
- 领域实体属性及事件抽取技术研究,TP391.1
- 基于语义分析的汉语短语识别方法研究,TP391.43
- 基于拼音标注的中文分词算法研究,TP391.1
- 基于最大熵模型的汉语框架语义角色自动标注,TP391.1
- 基于规则抽取的汉语语块识别,TP391.1
- 汉语并列结构的自动识别,TP391.43
- 线性链条件随机场训练算法优化的研究,TP181
- 音乐领域中文实体关系抽取研究,TP391.1
- 蛋白质二级结构特征分析与相互作用预测,Q51
- 统计机器翻译中层次短语翻译模型的研究与实现,TP391.2
- 基于最大熵模型的中文网页分类器设计和实现,TP393.092
- 人物言论抽取与跟踪技术研究,TP391.1
- 基于内容的自动视频监控研究,TP277
- 基于激光热凝固效应的眼角膜屈光矫正原理及预测技术研究,R779.63
- 中文信息抽取中的若干问题研究,TP391.1
- CRFs模型下的中文自动分词研究,TP391.1
- 汉语最长名词短语的自动识别与分析,TP391.43
- 基于条件随机场的中文分词研究与应用,TP391.1
- 基于序列标注的中文依存句法分析研究,TP391.1
- 基于最大熵模型的智能提问系统研究,TP391.6
中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 文字信息处理
© 2012 www.xueweilunwen.com
|