学位论文 > 优秀研究生学位论文题录展示

基于双语命名实体识别的词汇对齐和机器翻译研究

作 者: 赵欣
导 师: 史晓东
学 校: 厦门大学
专 业: 计算机应用
关键词: 双语命名实体识别 词汇对齐 机器翻译
分类号: TP391.2
类 型: 硕士论文
年 份: 2009年
下 载: 159次
引 用: 0次
阅 读: 论文下载
 

内容摘要


命名实体是标识某一特定实体的词或词组,通常包括专有名词(如人名、地名、组织机构名及其他专有名词)、日期时间及货币等。双语命名实体是指来自两种不同语言的互译命名实体,双语命名实体识别对于跨语言信息检索和机器翻译等自然语言处理领域都是非常有用的。本文主要研究基于双语命名实体识别的词汇对齐和机器翻译。具体来说,本文的主要工作及创新点如下:双语命名实体识别方面,研究从双语语料库中抽取出双语命名实体的方法。和一般的识别方法不同,我们提出一种迭代算法,将其与双向词汇对齐过程相结合,依据对齐信息抽取可靠双语命名实体对,然后将双语命名实体这一可靠的对齐信息反向加入到词汇对齐过程,改善词汇对齐质量,再将改善后的双向词汇对齐结果再次用于抽取双语命名实体。多次重复进行这一过程,直至双语命名实体对的数量不再增加为止。结果显示,识别出来的双语命名实体的数目在迭代过程中不断增加。词汇对齐方面,提出了命名实体类型替换的观点,双语命名实体替换成它的类型,然后将类型加入到对齐词典,同时将原文中的命名实体也替换为类型。实验结果显示,类型替换的方法与双语命名实体本身加入词典的方法都能改善词汇对齐效果,而命名实体类型替换的方法改善效果更好。机器翻译方面,研究了两种和双语命名实体识别相结合的翻译方法。一种是只将双语命名实体识别加入到翻译模型的训练过程中,另一种是在第一种方法基础上,将双语命名实体识别嵌入到整个机器翻译过程中,实现了一种新的基于命名实体类型的翻译方法。在厦门大学开发的基于短语的机器翻译系统CARAVAN上进行实验,引入双语命名实体识别后,两种方法的BLEU得分和未加入命名实体识别的翻译结果相比,分别相对提高了5.05%和17.27%。

全文目录


摘要  4-5
Abstract  5-13
第一章 绪论  13-22
  1.1 研究背景和意义  13-15
  1.2 命名实体识别研究现状  15-18
    1.2.1 单语命名实体识别  15-17
    1.2.2 双语命名实体识别  17-18
  1.3 词汇对齐和统计机器翻译研究现状  18-19
  1.4 论文的主要工作  19-21
  1.5 论文结构安排  21-22
第二章 命名实体识别相关知识  22-36
  2.1 命名实体识别的基本概念及翻译特点  22-26
    2.1.1 人名  23-24
    2.1.2 地名  24-25
    2.1.3 组织机构名  25-26
    2.1.4 组织机构名和人名地名之间的关系  26
  2.2 现有的双语命名实体识别方法  26-35
    2.2.1 单语命名实体识别方法  27-32
    2.2.2 统计机器音译模型  32-33
    2.2.3 双语命名实体对齐方法  33-35
  2.3 本章小结  35-36
第三章 词汇对齐基本知识  36-44
  3.1 词汇对齐的形式化定义  36-37
  3.2 词汇对齐的难点  37
  3.3 词汇对齐的方法  37-40
    3.3.1 启发式对齐模型  38
    3.3.2 统计翻译对齐模型  38-40
  3.4 词汇对齐工具GIZA  40-42
  3.5 本章小结  42-44
第四章 基于词汇对齐的双语命名实体识别  44-62
  4.1 系统结构  44-45
  4.2 命名实体识别系统介绍  45-48
    4.2.1 中文命名实体识别系统  45-47
    4.2.2 英文命名实体识别系统  47-48
  4.3 双语命名实体识别  48-52
    4.3.1 中文命名实体识别  49-50
    4.3.2 英文命名实体识别  50-52
  4.4 双语命名实体的对齐  52-61
    4.4.1 对齐概率的计算  52-54
    4.4.2 可靠的命名实体对  54-57
    4.4.3 特殊的处理  57-58
    4.4.4 实验设计  58-60
    4.4.5 实验结果及分析  60-61
  4.5 本章小结  61-62
第五章 双语命名实体在词汇对齐和机器翻译中的应用  62-76
  5.1 双语命名实体识别对词汇对齐的作用  62-68
    5.1.1 GIZA对齐的不足  62-63
    5.1.2 改善GIZA对齐效果的途径  63-64
    5.1.3 词汇对齐评测指标  64
    5.1.4 实验设计  64-66
    5.1.5 实验结果及分析  66-68
  5.2 基于双语命名实体识别的统计机器翻译  68-75
    5.2.1 基于短语的统计机器翻译  68-69
    5.2.2 机器翻译评测指标  69-70
    5.2.3 系统结构  70-71
    5.2.4 实验设计  71-73
    5.2.5 实验结果及分析  73-75
  5.3 本章小结  75-76
第六章 总结与展望  76-80
  6.1 总结  76-77
  6.2 展望  77-80
参考文献  80-84
发表论文  84-86
致谢  86

相似论文

  1. 统计机器翻译中结构转换技术的研究,TP391.2
  2. 英汉平行语料库句子级对齐研究及其在机器翻译中的应用,H315.9
  3. 汉英机器翻译中趋向动词的处理,H315.9
  4. 基于英汉树库的机器翻译研究,H315.9
  5. 《飘》的人机翻译对比分析,H315.9
  6. 基于词汇对齐的未登录词Web挖掘译文候选的重排序,TP391.1
  7. 基于Web的计算机辅助图样转换系统的开发,TP391.72
  8. 对我国几种机器翻译软件译文质量的测评,H085
  9. 工艺语句汉英计算机辅助翻译系统关键技术研究,TP391.2
  10. 基于NP树的英文专利文献术语自动翻译技术研究,TP391.2
  11. 基于短语的对数线性模型的统计机器翻译方法与系统实现,TP391.2
  12. 统计机器翻译语料预处理中的问题研究,H085
  13. 面向统计机器翻译的解码算法的研究,TP391.2
  14. 机器翻译,H085
  15. 基于标志词的汉英机器翻译的研究,TP391.2
  16. 特定场合下的英汉机译系统研究,TP391.2
  17. 机器翻译与人类介入,H085
  18. Corpus-Based Machine Translation of WebPages--A Suggestion on MT Model and Strategy to Disambiguation,H085.5
  19. 现代汉语双宾动词研究,H146.2
  20. 基于实例英汉翻译系统研究与实现,TP391.2

中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 翻译机
© 2012 www.xueweilunwen.com