学位论文 > 优秀研究生学位论文题录展示

基于NP树的英文专利文献术语自动翻译技术研究

作 者: 林晓庆
导 师: 张桂平;蔡东风
学 校: 沈阳航空工业学院
专 业: 计算机应用技术
关键词: 机器翻译 NP树 译文选择模型 HowNet NP翻译模式
分类号: TP391.2
类 型: 硕士论文
年 份: 2009年
下 载: 66次
引 用: 0次
阅 读: 论文下载
 

内容摘要


随着对外交流,引进先进技术的增加,人们接触专利文献的机会越来越多。从事科技翻译的人员经常要遇到专利文献的翻译问题。而术语翻译尤其是专利文献翻译的一个重要部分。近年来机器翻译技术取得了很大的突破,使得翻译质量有了很大的提高,为专利文献翻译提供了有力的手段。本文针对专利文献中的术语NP(noun phrase)的特点,使用统计和规则相结合的方法实现了术语NP的自动翻译。从建立NP树库,译文选择模型的建立,NP翻译模式的归纳,到基于知网的最相似NP树的查找以及翻译结果的自动评测,实现了一个完整的术语翻译流程。主要工作包括以下几个方面:第一,提出了一种改进互信息的译文选择方法。本文认为词语的译文的选择不是孤立进行的,上下文对译文的选择有着重要的意义,通过对已有的互信息公式加入翻译模型特征进行改进,结合翻译模型与互信息来选择最佳译文。第二,采用了NP翻译模式进行译文的调序处理。根据术语NP的特点,对句法分析后的NP进行翻译模式的总结,概括出比较常用的NP翻译模式,作为复杂NP进行译文调序的依据。第三,提出了一种基于HowNet的最相似NP树的查找方法。本文将已有的基于HowNet的词语相似度公式进行扩展,提出基于HowNet的NP语义相似度计算方法来进行最相似NP树的查找。第四,建立一个完整的术语翻译系统。使用机器翻译自动评测技术进行翻译结果的自动评测,与基于短语的统计机器翻译系统(Pharaoh)进行对比实验。实验结果表明本文基于NP树的术语翻译方法优于基于统计的机器翻译方法(Pharaoh)。对于下一步的工作,尝试加入更多NP翻译模式和语言学知识来改善翻译效果。

全文目录


摘要  6-7
Abstract  7-11
第1章 引言  11-17
  1.1 选题的背景和意义  11
  1.2 句法结构  11-12
  1.3 名词短语定义  12-13
  1.4 专利相关概念  13-15
    1.4.1 专利文献适合于机器翻译的特点  14
    1.4.2 专利文献组成  14-15
    1.4.3 专利说明书构成  15
    1.4.4 术语定义  15
  1.5 本文的组织结构  15-17
第2章 相关研究  17-27
  2.1 机器翻译方法  17-19
    2.1.1 基于理性主义的方法  17-18
    2.1.2 基于经验主义的方法  18-19
  2.2 统计机器翻译模型  19-23
    2.2.1 基于词的模型  20-21
    2.2.2 基于短语的模型  21
    2.2.3 基于句法的模型  21-23
  2.3 机器翻译子任务  23-25
    2.3.1 词汇翻译  24
    2.3.2 命名实体翻译  24
    2.3.3 基本名词短语翻译  24-25
    2.3.4 查询翻译  25
  2.4 本章小结  25-27
第3章 基于NP 树的术语自动翻译技术  27-41
  3.1 建立NP 树库  28-30
    3.1.1 NP 树定义  28-29
    3.1.2 NP 树匹配  29-30
  3.2 基于知网的NP 语义相似度  30-36
    3.2.1 知网(HowNet)介绍  31-32
    3.2.2 概念相似度计算  32-33
    3.2.3 基于知网的语义相似度计算方法  33
    3.2.4 基于知网的NP 语义相似度计算  33-36
  3.3 NP 翻译模式  36-40
    3.3.1 NP+介词+NP 的翻译模式  36-37
    3.3.2 NP+done+介词+NP 的翻译模式  37-39
    3.3.3 NP+介词+doing+NP 的翻译模式  39-40
  3.4 本章小结  40-41
第4章 基于改进互信息的译文选择方法  41-48
  4.1 译文选择  41-42
  4.2 互信息  42
  4.3 译文选择的相关研究  42-43
  4.4 译文选择模型  43-47
  4.5 本章小结  47-48
第5章 实验结果评价与分析  48-60
  5.1 BLEU 评测方法  48-49
  5.2 NIST 评测方法  49-52
  5.3 实验条件  52-55
    5.3.1 训练数据  52
    5.3.2 语料预处理  52-54
    5.3.3 对比测试系统  54
    5.3.4 系统运行环境  54-55
  5.4 翻译结果的自动评测  55-58
  5.5 结果译文分析  58-59
  5.6 本章小结  59-60
结论  60-62
附录Ⅰ PENN TREEBANK 英文词类标记(包括标点符号)  62-63
附录II 系统界面  63-64
参考文献  64-68
致谢  68-70
攻读硕士期间发表(含录用)的学术论文  70

相似论文

  1. 统计机器翻译中结构转换技术的研究,TP391.2
  2. 面向统计机器翻译的解码算法的研究,TP391.2
  3. 基于本体的食品投诉文档文本聚类研究,TP391.1
  4. 结合本体HowNet的中文文本分类研究,TP391.1
  5. 基于概念集合的网页内容过滤方法的研究,TP393.092
  6. 统计机器翻译中命名实体处理研究,TP391.2
  7. 汉英机器翻译系统中的一种语义排岐模型研究,TP391.2
  8. 汉英机器翻译系统英文生成中的一种选词模型研究,TP391.2
  9. 基于模板的英蒙机器翻译系统的研究,TP391.2
  10. 交互式多策略机器翻译系统(IHSMTS)面向对象分类模式库的研究,TP391.2
  11. 基于标志词的汉英机器翻译的研究,TP391.2
  12. 特定场合下的英汉机译系统研究,TP391.2
  13. EBMT系统中翻译模板的抽取与匹配,TP391.2
  14. 机器翻译与人类介入,H085
  15. 基于语义关系的摘要提取,TP391.1
  16. Corpus-Based Machine Translation of WebPages--A Suggestion on MT Model and Strategy to Disambiguation,H085.5
  17. IHSMTS中汉英双语句子对齐机制的设计与实现,TP391.2
  18. 基于Web的计算机辅助图样转换系统的开发,TP391.72
  19. 对我国几种机器翻译软件译文质量的测评,H085
  20. 机器翻译中语义因素的理论分析,H085

中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 翻译机
© 2012 www.xueweilunwen.com