学位论文 > 优秀研究生学位论文题录展示

基于自适应的LVCSR系统半监督学习方法的研究

作 者: 邱荣发
导 师: 李海峰
学 校: 哈尔滨工业大学
专 业: 计算机科学与技术
关键词: 大词表连续语音识别 自动标注系统 半监督学习 隐马尔科夫模型 声学模型 数据筛选策略
分类号: TN912.34
类 型: 硕士论文
年 份: 2010年
下 载: 27次
引 用: 0次
阅 读: 论文下载
 

内容摘要


语音识别技术日趋成熟,但仍然存在一系列难题有待解决,尤其是大词表连续语音识别(LVCSR)技术,在识别速度、识别正确率、系统顽健性等能力上还远远没有达到尽善尽美。特别是在声学模型的训练方面,最常用的手段就是使用人工标注的数据来训练声学模型,这样的方法需要大量的标注数据,而人工标注这些数据需要耗费大量的金钱和时间;因此提出了一个新的半监督学习方法—分阶段半监督学习,来训练声学模型。分阶段半监督学习仅需要小部分的人工标注数据来初始化声学模型参数,然后加载模型去识别大量的未标注数据;数据筛选策略对识别结果进行分析,然后合成最优的结果作为标注数据,重复进行训练。依据这种新的半监督学习方法建立了自动标注语料系统(ALCS)。和一般的获取标注数据来训练声学模型的方法相比,分阶段半监督学习有以下几个优势:它仅仅选取一部分词频分布均匀和具有代表性的人工标注数据来初始化模型参数,避免了繁重、枯燥的语料标注工作;它构建了一个自适应的识别单元,能根据工作环境和待识别的数据自发的调整模型的参数,所以系统有好的识别性能和适应性;人工标注数据一般仅能达到有调音节的层次,系统能够自动标注到音素级别,能够满足更高标注精度的需求,实现了精细标注;持续学习能力对于半监督学习是至关重要的,只要系统能不断地得到未标注的数据,就能持续不断地学习、标注和训练模型,从而不断地提升系统性能。实验结果证明,这种新的半监督学习方法在自动标注语料、训练模型方面有良好的表现,用这种半监督学习方法训练出来的声学模型来对测试集进行识别,识别率大约有4.5%的提升。

全文目录


摘要  4-5
Abstract  5-8
第1章 绪论  8-14
  1.1 研究背景及意义  8
  1.2 国内外研究现状及分析  8-12
    1.2.1 连续语音识别  8-10
    1.2.2 连续语音识别主要存在的问题  10-11
    1.2.3 半监督学习  11-12
  1.3 当前研究的热点  12
  1.4 课题来源  12-13
  1.5 主要研究内容  13-14
第2章 分阶段半监督学习  14-24
  2.1 半监督学习  14-15
  2.2 半监督学习方法原理  15-16
  2.3 半监督学习方法  16-21
    2.3.1 置信度  16
    2.3.2 结合置信度进行半监督学习  16-17
    2.3.3 双层置信度半监督学习  17-19
    2.3.4 自学习与确认相结合半监督学习  19-20
    2.3.5 三种半监督学习方法的性能比较  20-21
  2.4 分阶段半监督学习方法  21-23
  2.5 本章小结  23-24
第3章 基于分阶段半监督学习的连续语音识别  24-43
  3.1 概述  24
  3.2 前端处理及特征分析  24-25
  3.3 HMM 模型  25-31
    3.3.1 HMM 定义  25-27
    3.3.2 HMM 模型关键算法  27-31
  3.4 声学建模  31-34
    3.4.1 HMM 单元的选取  31-32
    3.4.2 HMM 建模  32-33
    3.4.3 模型基元  33
    3.4.4 模型训练  33-34
  3.5 语言模型  34-35
  3.6 声学解码  35-42
    3.6.1 令牌  37-38
    3.6.2 解码结构  38-40
    3.6.3 令牌的复制与传递  40-41
    3.6.4 令牌的生命周期和垃圾收集  41
    3.6.5 时间同步搜索策略的令牌实现  41-42
  3.7 本章小结  42-43
第4章 数据筛选策略  43-49
  4.1 N-best 结果及其标注  43-44
  4.2 数据筛选规则  44-46
  4.3 数据筛选算法  46-48
  4.4 本章小结  48-49
第5章 实验分析  49-55
  5.1 实验数据  49-51
  5.2 实验分析  51-54
    5.2.1 测试语料的音素分布及分析  51-52
    5.2.2 语料的有调音节分布以及系统识别率分析  52-53
    5.2.3 改进后的系统的识别率  53-54
  5.3 本章小结  54-55
结论  55-56
参考文献  56-60
攻读学位期间发表的学术论文  60-62
致谢  62

相似论文

  1. 领域知识指导的半监督学习和主动学习倾向性分类研究,TP181
  2. 基于半监督哈希算法的图像检索方法研究,TP391.41
  3. 基于半监督学习的时间序列分类研究与实现,TP181
  4. 数据挖掘在研究生调剂中的应用研究,TP311.13
  5. 半监督学习中协同训练与多视图方法的比较及改进,TP18
  6. 基于半监督SVM的入侵检测研究,TP393.08
  7. 面向金融问答的论坛观点挖掘,TP391.3
  8. 泡沫铝复合结构声学性能分析与实验研究,TB383.4
  9. 基于支持向量机的水电故障分类器的设计与实现,TV738
  10. 半监督学习若干问题的研究,TP181
  11. 基于少量标记数据约束聚类算法的入侵检测技术研究,TP393.08
  12. 基于半监督学习的中文问句分类研究,TP391.1
  13. 基于半监督学习的图像分割系统的设计与实现,TP391.41
  14. 基于嵌入空间的降维算法建模研究及应用,TP311.13
  15. 音频分类技术研究,TN912.3
  16. 半监督学习方法及应用研究,TP181
  17. 基于半监督学习的音频实时检测方法的研究,TN912.3
  18. 半监督分类技术及其算法研究,TP18
  19. 基于机器学习算法的隐喻识别研究,TP181
  20. 搜索引擎作弊检测方法研究,TP391.3

中图分类: > 工业技术 > 无线电电子学、电信技术 > 通信 > 电声技术和语音信号处理 > 语音信号处理 > 语音识别与设备
© 2012 www.xueweilunwen.com