学位论文 > 优秀研究生学位论文题录展示
基于LPCFG的中文句法分析
作 者: 徐文智
导 师: 王小捷
学 校: 北京邮电大学
专 业: 模式识别与智能系统
关键词: 句法分析 概率上下文无关文法 中心驱动 字信息 上下文特征
分类号: TP391.1
类 型: 硕士论文
年 份: 2010年
下 载: 60次
引 用: 0次
阅 读: 论文下载
内容摘要
|
句法分析是自然语言处理的一个重要的基础任务。许多面向应用的自然语言处理相关任务,如信息抽取、机器翻译和语义检索都对句法分析提出了迫切的需求。另一方面,句法分析是对自然语言结构性的一个很好的探索,可以揭示人类语言的部分秘密,对人工智能的探索也很有启示意义。因此,本文对中文的句法分析进行了深入的研究,主要内容分为三个部分:1.对统计句法分析的PCFG模型进行介绍,分析其原始的数学模型并对其问题进行分析。发现其问题在于对句法分析结构和输入的词汇不敏感。2.实现中心驱动模型,并在CTB和TCT语料上进行实验。该论文对其概率模型和概率参数估计方法进行介绍。另外发现中心驱动模型没有充分利用到中文中的字特征以及上下文特征。3.提出了一种新的句法分析模型。该模型能灵活利用字特征和上下文特征。另外还在对机器学习的思想理解的基础上,对语料进行标记上的修改以能区别句法分析中不同的情况。最后的实验结果表明这些特征和修改带来的句法分析性能明显地提升,并且在与其他模型的评测对比中取得良好的成绩。
|
全文目录
摘要 4-5 Abstract 5-8 第一章 绪论 8-14 1.1 句法分析介绍及其意义 8-9 1.2 句法分析研究现状 9-12 1.2.1 英文句法分析现状 10-11 1.2.2 中文句法分析现状 11-12 1.3 论文的主要内容 12-14 第二章 基于中心驱动的汉语句法分析模型 14-26 2.1 引言 14 2.2 概率上下文无关文法 14-18 2.2.1 概率上下文无关文法介绍 14-16 2.2.2 概率上下文无关文法问题 16-18 2.3 中心驱动句法分析模型 18-26 2.3.1 概率生成模型 18-21 2.3.2 概率参数估计 21-22 2.3.3 语料介绍 22 2.3.4 实验结果及错误分析 22-26 第三章 结合字信息LPCFG的汉语句法分析器 26-42 3.1 引言 26 3.2 字信息LPCFG模型介绍 26-32 3.2.1 概率模型 26-27 3.2.2 参数估计和特征集合 27-29 3.2.3 标注系统的修改以及并列成分处理 29-31 3.2.4 二叉树的转换 31-32 3.3 算法介绍与实现 32-37 3.3.1 最大熵算法介绍 32-34 3.3.2 训练特征提取 34-35 3.3.3 解码算法 35-37 3.4 实验结果及讨论 37-42 3.4.1 不同特征对比 37-40 3.4.2 与相关工作对比 40-42 第四章 总结与展望 42-43 参考文献 43-47 附录 47-51 致谢 51-52 作者攻读硕士学位期间发表论文 52
|
相似论文
- 基于句法特征的代词消解方法研究,TP391.1
- 面向统计机器翻译的解码算法的研究,TP391.2
- 基于博客搜索的博文情感倾向性分析技术的研究,TP391.1
- 语义网自动构建中句法分析的研究,TP391.1
- 基于空间句法分析的城市地价与合理用地结构关系研究,F224;TU984.113
- 统计机器翻译中层次短语翻译模型的研究与实现,TP391.2
- 基于贝叶斯分类方法的中文问句分类研究,TP391.1
- 基于数据库的自然语言查询技术研究与实现,TP391.1
- 基于知网和贝叶斯模型的词义消岐技术的研究,TP391.1
- 基于韦伯局部特征和形状上下文的图像识别与匹配算法,TP391.41
- 中文问答系统中问题分析关键技术的研究,TP391.1
- 基于条件随机场的汉语短语识别研究,TP391.1
- “二程语录”被动式研究,H146
- 汉语联合短语结构分析与识别,H146
- 基于领域词典的汉语语块分析的研究,TP391.1
- 否定标记“没有”的句法语义分析,H146
- “没A没B”格式分析,H146
- 结构化支持向量机学习方法及应用研究,TP18
- 新闻语料中名词短语识别的研究,TP391.43
- 基于情感分析的新闻浏览平台关键技术研究,TP391.1
- 基于主动学习的汉语依存树库构建,TP391.1
中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 文字信息处理
© 2012 www.xueweilunwen.com
|