学位论文 > 优秀研究生学位论文题录展示
基于NP树的英文专利文献术语自动翻译技术研究
作 者: 林晓庆
导 师: 张桂平;蔡东风
学 校: 沈阳航空工业学院
专 业: 计算机应用技术
关键词: 机器翻译 NP树 译文选择模型 HowNet NP翻译模式
分类号: TP391.2
类 型: 硕士论文
年 份: 2009年
下 载: 66次
引 用: 0次
阅 读: 论文下载
内容摘要
|
随着对外交流,引进先进技术的增加,人们接触专利文献的机会越来越多。从事科技翻译的人员经常要遇到专利文献的翻译问题。而术语翻译尤其是专利文献翻译的一个重要部分。近年来机器翻译技术取得了很大的突破,使得翻译质量有了很大的提高,为专利文献翻译提供了有力的手段。本文针对专利文献中的术语NP(noun phrase)的特点,使用统计和规则相结合的方法实现了术语NP的自动翻译。从建立NP树库,译文选择模型的建立,NP翻译模式的归纳,到基于知网的最相似NP树的查找以及翻译结果的自动评测,实现了一个完整的术语翻译流程。主要工作包括以下几个方面:第一,提出了一种改进互信息的译文选择方法。本文认为词语的译文的选择不是孤立进行的,上下文对译文的选择有着重要的意义,通过对已有的互信息公式加入翻译模型特征进行改进,结合翻译模型与互信息来选择最佳译文。第二,采用了NP翻译模式进行译文的调序处理。根据术语NP的特点,对句法分析后的NP进行翻译模式的总结,概括出比较常用的NP翻译模式,作为复杂NP进行译文调序的依据。第三,提出了一种基于HowNet的最相似NP树的查找方法。本文将已有的基于HowNet的词语相似度公式进行扩展,提出基于HowNet的NP语义相似度计算方法来进行最相似NP树的查找。第四,建立一个完整的术语翻译系统。使用机器翻译自动评测技术进行翻译结果的自动评测,与基于短语的统计机器翻译系统(Pharaoh)进行对比实验。实验结果表明本文基于NP树的术语翻译方法优于基于统计的机器翻译方法(Pharaoh)。对于下一步的工作,尝试加入更多NP翻译模式和语言学知识来改善翻译效果。
|
全文目录
摘要 6-7 Abstract 7-11 第1章 引言 11-17 1.1 选题的背景和意义 11 1.2 句法结构 11-12 1.3 名词短语定义 12-13 1.4 专利相关概念 13-15 1.4.1 专利文献适合于机器翻译的特点 14 1.4.2 专利文献组成 14-15 1.4.3 专利说明书构成 15 1.4.4 术语定义 15 1.5 本文的组织结构 15-17 第2章 相关研究 17-27 2.1 机器翻译方法 17-19 2.1.1 基于理性主义的方法 17-18 2.1.2 基于经验主义的方法 18-19 2.2 统计机器翻译模型 19-23 2.2.1 基于词的模型 20-21 2.2.2 基于短语的模型 21 2.2.3 基于句法的模型 21-23 2.3 机器翻译子任务 23-25 2.3.1 词汇翻译 24 2.3.2 命名实体翻译 24 2.3.3 基本名词短语翻译 24-25 2.3.4 查询翻译 25 2.4 本章小结 25-27 第3章 基于NP 树的术语自动翻译技术 27-41 3.1 建立NP 树库 28-30 3.1.1 NP 树定义 28-29 3.1.2 NP 树匹配 29-30 3.2 基于知网的NP 语义相似度 30-36 3.2.1 知网(HowNet)介绍 31-32 3.2.2 概念相似度计算 32-33 3.2.3 基于知网的语义相似度计算方法 33 3.2.4 基于知网的NP 语义相似度计算 33-36 3.3 NP 翻译模式 36-40 3.3.1 NP+介词+NP 的翻译模式 36-37 3.3.2 NP+done+介词+NP 的翻译模式 37-39 3.3.3 NP+介词+doing+NP 的翻译模式 39-40 3.4 本章小结 40-41 第4章 基于改进互信息的译文选择方法 41-48 4.1 译文选择 41-42 4.2 互信息 42 4.3 译文选择的相关研究 42-43 4.4 译文选择模型 43-47 4.5 本章小结 47-48 第5章 实验结果评价与分析 48-60 5.1 BLEU 评测方法 48-49 5.2 NIST 评测方法 49-52 5.3 实验条件 52-55 5.3.1 训练数据 52 5.3.2 语料预处理 52-54 5.3.3 对比测试系统 54 5.3.4 系统运行环境 54-55 5.4 翻译结果的自动评测 55-58 5.5 结果译文分析 58-59 5.6 本章小结 59-60 结论 60-62 附录Ⅰ PENN TREEBANK 英文词类标记(包括标点符号) 62-63 附录II 系统界面 63-64 参考文献 64-68 致谢 68-70 攻读硕士期间发表(含录用)的学术论文 70
|
相似论文
- 统计机器翻译中结构转换技术的研究,TP391.2
- 面向统计机器翻译的解码算法的研究,TP391.2
- 基于本体的食品投诉文档文本聚类研究,TP391.1
- 结合本体HowNet的中文文本分类研究,TP391.1
- 基于概念集合的网页内容过滤方法的研究,TP393.092
- 统计机器翻译中命名实体处理研究,TP391.2
- 汉英机器翻译系统中的一种语义排岐模型研究,TP391.2
- 汉英机器翻译系统英文生成中的一种选词模型研究,TP391.2
- 基于模板的英蒙机器翻译系统的研究,TP391.2
- 交互式多策略机器翻译系统(IHSMTS)面向对象分类模式库的研究,TP391.2
- 基于标志词的汉英机器翻译的研究,TP391.2
- 特定场合下的英汉机译系统研究,TP391.2
- EBMT系统中翻译模板的抽取与匹配,TP391.2
- 机器翻译与人类介入,H085
- 基于语义关系的摘要提取,TP391.1
- Corpus-Based Machine Translation of WebPages--A Suggestion on MT Model and Strategy to Disambiguation,H085.5
- IHSMTS中汉英双语句子对齐机制的设计与实现,TP391.2
- 基于Web的计算机辅助图样转换系统的开发,TP391.72
- 对我国几种机器翻译软件译文质量的测评,H085
- 机器翻译中语义因素的理论分析,H085
中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 翻译机
© 2012 www.xueweilunwen.com
|