学位论文 > 优秀研究生学位论文题录展示

基于统计模型的语音增强算法研究

作 者: 王海艳
导 师: 赵晓晖
学 校: 吉林大学
专 业: 通信与信息系统
关键词: 语音增强 最小均方误差估计 最大后验概率估计 隐马尔科夫模型 超高斯混合分布
分类号: TN912.35
类 型: 博士论文
年 份: 2011年
下 载: 163次
引 用: 0次
阅 读: 论文下载
 

内容摘要


环境噪声是语音处理设备如语音识别系统、说话者辨识系统中广泛存在的一个负面因素。这些系统在没有噪声的环境中具有非常好的语音处理效果,但在实际的噪声环境中,语音处理性能会明显下降很多。剔除语音中的背景噪声是语音信号处理中具有挑战性的问题。由于自然环境中,噪声具有多样性以及语音信号本身的复杂性,语音增强算法也因环境的不同而不同。语音增强算法的分类方法有很多,依输入信道数量分类,可有单通道语音增强算法、双通道语音增强算法和多通道语音增强算法;依信号处理的域分类,有时域语音增强算法和频域语音增强算法;根据算法的类型又可分为非自适应语音增强算法和自适应语音增强算法。单通道语音增强算法主要应用在如移动通信、助听器等场合。通常,单通道系统利用了语音信号和噪声信号的不同统计特性,在噪声为非平稳时性能不好,同多输入系统相比,它占用资源较少。但是,如何得到性能良好的单通道语音增强算法是这一领域所研究的最困难的问题之一。目前,出现了许多针对不同问题的单通道语音增强算法。针对语音增强算法由固定长度分帧所导致的语音过渡阶段和清音部分增强效果差的问题,本论文提出了基于清浊音分割算法的语音增强算法。该算法首先利用清浊音分割算法将语音信号中的清浊音分离出来,然后对分离后的清浊音谱幅度分布进行估计,找到更接近于清浊音谱幅度的分布函数,根据清浊音的不同使用不同的谱分布函数进行语音增强。计算机仿真实验验证了这种基于清浊音分离处理算法可有效地提高信噪比,改善语音过渡阶段的增强效果以及清音部分的增强效果。基于统计模型的语音增强算法是从带噪语音信号中估计出纯净语音信号。这类算法通常要求准确知道纯净语音信号和噪声信号的联合统计量,而且要求具有易理解的失真度量方法。若语音信号和噪声信号是统计独立的,则需要准确的知道纯净语音信号和噪声信号的概率分布。但实际情况是我们既不知道语音信号和噪声信号的统计量也没有最好意义上的失真度量方法。所以,从理论上讲应首先分别训练得出语音信号和噪声信号的统计量,也就是需要一种最优化算法来获得信号的统计模型,然后将该统计模型结合目前能使用的失真度量以得到语音增强算法。语音增强算法中通常假设语音信号统计独立,短时谱幅度服从瑞利分布。许多语音增强算法致力于找到更为准确的语音信号统计模型来改善语音增强算法。一些统计模型,如超高斯模型如伽玛分布、拉普拉斯分布以及广义超高斯分布已被证明要优于高斯模型。尽管对基于这些模型的语音增强算法研究取得了一些进展,但单一的分布函数并不能够很好模拟语音信号真实的分布柱状图。针对这一问题,本文使用了一种超高斯混合模型为语音信号谱幅度建立模型,采用EM算法对超高斯混合模型中的参数进行估计。这种混合模型能够很好逼近语音信号短时谱幅度柱状图。将该混合模型用于语音增强算法中,得出语音信号短时谱幅度的最小均方误差估计,通过分析该语音增强算法的增益曲线可知超高斯混合模型能够改善语音信号能量较小处的语音增强性能。很显然,根据语音信号自身的产生原理以及非平稳特性,单一的某一分布并不适用于所有的语音信号。因此改善语音增强算法远非用一种模型来代替另一种模型这样简单,需要更为灵活的模型或模型估计算法以适应语音信号自身的特点。隐马尔科夫模型是一种很好的模型估计算法,目前广泛用于语音识别问题中。尽管偶而会应用于语音增强问题中,但到目前为止,它并没有得到很好的发展,或者只用于噪声信号的模型估计时,这里假设不同性质的语音信号处于隐马尔科夫模型的不同状态,训练纯净语音信号得到的参数模型应能适应语音信号的特点。本文在参数估计过程中对语音每一帧的联合概率做了一定程度的约束处理,避免在训练语音谱幅度的过程中出现无穷大或零值,从而得到了相对合理的语音谱幅度分布估计。论文提出了建立在该模型基础上的语音增强算法。由于用基于信号统计模型的语音增强算法处理语音信号无法判断每一帧带有噪声的信号确切属于隐马尔科夫模型的哪一种状态,在论文中引入自适应方法来选择一种最适合该帧带噪语音信号的谱幅度分布模型。该算法提高了语音信号的信噪比,在一定程度上克服了只使用单一语音谱幅度分布函数带来的问题。

全文目录


摘要  4-6
Abstract  6-11
第1章 绪论  11-17
  1.1 语音增强技术的应用背景  11
  1.2 语音增强算法的研究现状  11-13
  1.3 现有语音增强算法的主要问题及其解决办法  13-15
  1.4章节安排  15-17
第2章 语音增强算法概述  17-29
  2.1 引言  17
  2.2 语音增强算法的分类  17-18
  2.3 目前常见的语音增强算法  18-22
  2.4 基于统计模型的语音增强算法  22-25
  2.5 基于训练统计模型的语音增强算法  25-27
  2.6 小结  27-29
第3章 语音增强算法的相关问题  29-43
  3.1 引言  29
  3.2 噪声性质  29-30
  3.3 语音信号活动性检测  30-32
  3.4 信噪比估计  32-34
  3.5 估计理论  34-39
  3.6 性能评价标准  39-41
  3.7 小结  41-43
第4章 清浊音分离语音增强算法的研究  43-69
  4.1 引言  43
  4.2 短时傅里叶分析  43-47
  4.3 清浊音分离技术  47-51
  4.4 语音信号模型  51-58
  4.5 语音增强算法  58-64
  4.6 算法仿真分析  64-67
  4.7 小结  67-69
第5章 基于超高斯混合模型的语音增强算法  69-81
  5.1 引言  69
  5.2 瑞利混合模型  69-72
  5.3 超高斯混合模型  72-73
  5.4 EM 参数估计算法  73-75
  5.5 语音增强算法  75-78
  5.6 算法的仿真与分析  78-79
  5.7 小结  79-81
第6章 基于隐马尔科夫模型的语音增强算法  81-99
  6.1 引言  81-82
  6.2 语音信号模型  82-84
  6.3 EM 算法参数估计  84-86
  6.4 EM 算法的实现  86-93
  6.5 语音增强算法  93-95
  6.6 算法仿真与分析  95-98
  6.7 小结  98-99
第7章 总结与展望  99-101
  7.1 论文总结  99-100
  7.2 展望  100-101
参考文献  101-108
作者简介及在学期间所取得的科研成果  108-109
致谢  109

相似论文

  1. 基于听觉掩蔽效应的数字助听器关键技术的研究,TN912.3
  2. 数字助听器中语音增强技术的研究,TN912.35
  3. 基于听觉侧抑制的滤波算法研究,TN911.72
  4. 复杂环境下语音增强方法研究,TN912.35
  5. MELPe语音编码关键技术研究,TN912.3
  6. 基于ARM的嵌入式语音识别的研究,TN912.34
  7. 基于TVAR和粒子滤波的语音增强方法研究,TN912.35
  8. 语音增强算法性能的评价研究,TN912.35
  9. 基于巴克域语音增强算法的研究与实现,TN912.35
  10. OFDM系统信道估计技术研究,TN919.3
  11. 网络业务流的特性分析及预测技术研究,TP393.07
  12. 说话人识别相关技术的研究,TN912.3
  13. 基于耳蜗滤波及谐波特性的语音增强方法研究,TN912.35
  14. 基于噪声估计和先验信噪比估计的语音增强算法研究,TN912.35
  15. 基于听觉掩蔽的语音增强算法及DSP实现,TN912.35
  16. 基于短时谱估计的语音增强研究,TN912.35
  17. 基于滤波器组GSC麦克风阵语音增强方法研究,TN641
  18. 基于小波变换的语音增强及DSP实现,TN912.35
  19. 多管阵列定向语音增强系统的研制,TN912.35
  20. 说话人识别中不同语音编码影响的补偿方法,TN912.34
  21. 基于自适应滤波器的语音增强算法研究及DSP实现,TN912.3

中图分类: > 工业技术 > 无线电电子学、电信技术 > 通信 > 电声技术和语音信号处理 > 语音信号处理 > 语音增强
© 2012 www.xueweilunwen.com