学位论文 > 优秀研究生学位论文题录展示
基于文本挖掘的翻译知识自动获取研究
作 者: 梁铭
导 师: 姚建民
学 校: 苏州大学
专 业: 软件工程
关键词: 双语平行语料库 网页挖掘 查询翻译 翻译等价对 译文挖掘
分类号: TP391.1
类 型: 硕士论文
年 份: 2009年
下 载: 57次
引 用: 0次
阅 读: 论文下载
内容摘要
|
近年来,互联网的普及与迅猛发展,提供了大量而丰富的电子信息。由于国际化的需要,越来越多的网站成为双语网站,越来越多的网上信息以多语言的形式发布,这就为双语提供了很大的来源。互联网是一个取之不尽,日益增长的信息源,因此是一个潜在的巨大的多语种语料库。研究有效的方法从互联网上自动挖掘这些海量的、真实的双语文本(即基于Web的双语语料库挖掘)、利用已挖掘的汉英平行语料库进行汉英翻译等价对的抽取、利用搜索引擎进行译文的挖掘,无疑是解决双语语料库建设和翻译知识获取难题的有效途径。本文主要取得主要成果有以下几方面:基于WEB的双语平行语料库获取研究中探索了双语平行资源在互联网上的存在形式及相应的获取方法,即定义一种启发式信息来概括这类多语种平行文本存在的共同特征,以此作为一个有效的入口,来获取我们关心的Web资源;实现了基于URL命名相似性的双语候选网页获取算法,预先定义在URL命名中常见的与特定语种相关的前后缀表,来发现一个具有命名规律性的双语网站中的双语平行网页,利用该方法可以充分挖掘出具有命名相似性的双语网站中存在的双语平行网页;改进了双语平行句对抽取技术,通过利用双语平行网页HTML结构相似性这一优点,而且牢牢把握住双语平行句对互为翻译这一本质特征,取得到了很好的效果。从双语语料库中获取翻译对的研究中探讨了如何利用汉英平行语料库进行汉英翻译等价对的抽取。首先对英文语料和中文语料分别进行词性标注和切分与词性标注,然后利用N-gram模型获得候选翻译单元,再根据统计同现函数计算候选翻译单元的翻译概率,采用迭代策略实现翻译等价对的抽取。基于搜索引擎的翻译获取的研究中首先利用主题词译文查询扩展方法从搜索引擎获取有效双语摘要资源;其次利用频度变化信息和邻接信息,从含有噪声、规模相对较小的摘要资源中抽取复合词、短语等多词候选翻译单元;最后综合音译特征、统计特征和模板特征进行专有名词译文选择。文章的最后进行了基于WEB和语料库翻译获取的性能比对,分析出各自的优缺点。
|
全文目录
摘要 3-4 Abstract 4-8 第一章 引言 8-14 1.1 研究背景 8 1.2 研究现状分析 8-12 1.3 主要研究内容 12-13 1.4 论文组织结构 13-14 第二章 基于 Web 的双语平行语料库获取 14-23 2.1 现有系统介绍与比较分析 14-15 2.2 基本流程 15-16 2.3 任务分析与界定 16-22 2.3.1 候选双语网站的获取及途径 16-17 2.3.2 双语平行网页的获取及途径 17-18 2.3.3 双语平行网页的验证 18 2.3.4 双语平行文本的获取及途径 18-20 2.3.5 双语平行句对的获取途径 20-22 2.4 小结 22-23 第三章 从双语语料库中获取翻译对 23-42 3.1 相关知识介绍 23-32 3.1.1 基于平行语料的双语词典抽取方法 23-26 3.1.2 句子对齐 26-28 3.1.3 中文分词 28-29 3.1.4 最大匹配法 29-30 3.1.5 切分歧义与逆向扫描 30-31 3.1.6 词性标注 31-32 3.2 翻译等价对获取 32-33 3.3 基于统计的翻译等价对抽取 33-34 3.4 平行语料预处理 34 3.5 候选翻译单元抽取 34-36 3.6 翻译概率计算 36-38 3.6.1 事件关联度度量 36-37 3.6.2 统计同现函数 37-38 3.7 基于贪心策略的翻译等价对抽取 38-39 3.8 实验及结果分析 39-41 3.8.1 统计公式评价指标 39-40 3.8.2 统计同现函数实验结果分析 40-41 3.9 小结 41-42 第四章 基于搜索引擎的翻译获取技术 42-50 4.1 基本思想方法 42 4.2 译文挖掘具体步骤 42-44 4.2.1 双语摘要资源自动获取 42-43 4.2.2 候选翻译单元抽取 43-44 4.3 译文选择 44-47 4.3.1 音译模型 44-45 4.3.2 统计模型 45-46 4.3.3 模板匹配模型 46-47 4.4 实验结果及分析 47-49 4.5 小结 49-50 第五章 基于WEB 和基于语料库翻译获取的性能对 50-54 5.1 实验结果及分析 50-51 5.2 基于WEB 的和基于语料库的翻译获取方法性能比对 51-53 5.2.1 基于语料库的翻译获取方法 51-53 5.2.2 基于WEB 的翻译获取方法 53 5.3 小结 53-54 第六章 总结 54-56 6.1 论文工作总结 54 6.2 未来工作展望 54-56 参考文献 56-58 附录A 可处理的网页文件类型 58-59 附录B 网页间平行资源-锚文本列表 59-60 附录C 部分抽取的译文 60-61 攻读学位期间发表的论文 61-62 致谢 62
|
相似论文
- 跨语言信息检索查询翻译技术研究,TP391.3
- 基于Web的双语词汇构建关键技术研究,TP391.1
- 互联网双语资源挖掘关键技术研究,TP393.02
- 词搭配抽取及在信息检索中的应用研究,TP391.3
- P2P系统一致性及查询问题研究,TP393.02
- 基于本体的XML数据流查询系统,TP319
- 基于维基百科的双语语料挖掘技术研究,TP311.13
- 日语词法分析及在跨语言信息检索中的应用研究,TP391.1
- 基于FPGA的数字图像处理基本算法研究与实现,TP391.41
- 用于检索的人脸特征提取与匹配算法研究,TP391.41
- 基于FPGA的高速图像预处理技术的研究,TP391.41
- 2D人脸模板保护算法研究,TP391.41
- 导弹虚拟试验可视化技术研究,TP391.9
- 基于用户兴趣特征的图像检索研究与实现,TP391.41
- 图像拼接技术研究,TP391.41
- 高效精确字符串匹配算法的研究与实现,TP391.41
- 基于词义及语义分析的问答技术研究,TP391.1
- 基于三维重建的焊点质量分类方法研究,TP391.41
- 舌体特征的提取及融合分类方法研究,TP391.41
- 统计机器翻译中结构转换技术的研究,TP391.2
- 基于人眼检测的驾驶员疲劳状态识别技术,TP391.41
中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 文字信息处理
© 2012 www.xueweilunwen.com
|