学位论文 > 优秀研究生学位论文题录展示
高质量语音转换系统中关键技术的研究
作 者: 周莹
导 师: 张玲华
学 校: 南京邮电大学
专 业: 信号与信息处理
关键词: 语音转换 音长 高斯混合模型 美尔倒谱参数
分类号: TN912.3
类 型: 硕士论文
年 份: 2012年
下 载: 47次
引 用: 0次
阅 读: 论文下载
内容摘要
|
语声转换是指对一个说话人(源说话人)的语声信号进行变换,使其话音中含有另外一个说话人(目标说话人)的语声个性特征。人通过语音信号主要来传达其中的语义信息,除此之外语声中还包含说话者的个性化信息。VC系统设计的宗旨就是要改变语声的个性化信息但要保证原有语义信息不变,使一个人的语音经系统变换后如同另一个人发出的语音。论文主要研究高质量语音转换系统中的关键技术,主要工作包括:1、高质量的语音转换系统在达到基本的语音转换要求外,还要解决系统合成语音的机械不自然等问题;从语音的发声机理出发研究适合VC系统的语音分析模型,对应的语声参数以及用于VC系统中的转换算法。着重研究基于高斯混合模型GMM的语音转换系统的主要算法,并对其进行了仿真实现,给出了主客观测试结果。2、针对传统VC系统普遍存在的语音自然度低的问题,提出并实现了一种基于音长变化的语音转换系统的改进算法,通过对转换后的参数插值变换来改变语音的音长。听音测评结果表明经过改进后的转换语音自然度和可懂度都有相应的提高。3、在采取上述改进算法的GMM语音转换系统中,选取更利于人耳声音感知的美尔倒谱参数MFCC进行变换操作;给出了转换前后语音的MFCC三维图以及语音波形图,实验结果表明采用改进算法后的转换语音和目标语音较为接近,VC系统的质量得到了提高。
|
全文目录
摘要 4-5 ABSTRACT 5-6 缩略语注释表 6-8 目录 8-11 第一章 综述 11-17 1.1 课题背景 11-12 1.2 课题研究的主要工作及实际意义 12-14 1.2.1 语音转换描述 12 1.2.2 语音转换技术在实际中的应用 12-14 1.3 论文的研究目标 14-15 1.4 本文的结构及具体内容安排 15-17 第二章 语音信号基本理论 17-28 2.1 引言 17 2.2 语音产生机理 17-20 2.2.1 语音产生过程 17-18 2.2.2 语音的声学特性 18-19 2.2.3 语声信号产生的数学模型 19-20 2.3 听觉感官以及语音感知 20-21 2.3.1 听觉器官 20 2.3.2 语音感知 20-21 2.4 说话人特征描述 21-22 2.4.1 语音个性特征参数的区别及分类 21-22 2.4.2 声学参数对说话人个性的贡献大小 22 2.5 特征参数及提取方法 22-27 2.5.1 LPC 参数及其谱包络 23-25 2.5.2 LSF 参数与谱包络 25-27 2.6 本章小结 27-28 第三章 语音转换系统 28-45 3.1 语音转换技术研究的历史和现况 28-29 3.2 语音转换系统概述 29-34 3.2.1 语音库设计 30-31 3.2.2 语音分析模型及参数表示 31-32 3.2.3 语音转换系统中的转换函数 32-33 3.2.4 语音转换系统性能评测方法 33-34 3.3 韵律的转换 34-37 3.3.1 基音周期的转换 35-36 3.3.2 时长的转换 36-37 3.3.3 能量的转换 37 3.4 语音频谱变换 37-43 3.4.1 码本映射 37-40 3.4.2 多变量线性回归法和动态频率规整 40-41 3.4.3 人工神经网络 ANN 模型 41-42 3.4.4 隐马尔科夫模型 42 3.4.5 高斯混合模型 42-43 3.5 本章小结 43-45 第四章 基于音长变化的 GMM 语音转换系统 45-63 4.1 GMM 中模型参数估计 45-47 4.1.1 期望最大化 EM 算法 46 4.1.2 k 均值算法 46-47 4.2 高斯混合模型用于语音频谱包络的转换 47-49 4.3 基本 GMM 语音转换系统的仿真结果与分析 49-52 4.3.1 实验平台 49 4.3.2 系统实现结果的评价 49-52 4.4 基于音长变化的 GMM 语音转换系统 52-61 4.4.1 提出转换系统的框架结构 53-54 4.4.2 系统语音分析合成采用的模型 54-55 4.4.3 系统中用于转换的语音特征参数 MFCC 求取 55-56 4.4.4 音长的改变 56-57 4.4.5 实验仿真 57-61 4.5 本章小结 61-63 第五章 结论 63-65 5.1 总结 63-64 5.2 语音转换系统后继的主要研究方向 64-65 致谢 65-66 攻读硕士学位期间发表的论文 66-67 参考文献 67-70
|
相似论文
- 基于组合及统计的图像型垃圾邮件检测研究,TP391.41
- 多特征融合的视觉跟踪算法研究,TP391.41
- 无线传感器网络中的追击者—逃跑者跟踪问题研究,TP212.9
- 高斯混合模型及在探测网络社区结构中的应用,TP393.094
- 运动人体检测与异常行为识别技术研究与实现,TP391.41
- 面向智能视频监控的事件检测建模及优化,TP391.41
- 层析芯片阳性信号的信息提取和定量分析研究,TP391.41
- 虚拟人运动合成技术及其工程应用研究,TP391.41
- 基于因子分析的说话人确认,TN912.34
- 关于若干回归模型的研究,O212.1
- 基于隐马尔科夫模型的股价走势预测,F830.91
- 基于分类及相似性的图像型垃圾邮件检测技术研究,TP393.098
- 语音转换中音段特征的建模与转换的研究,TN912.3
- 基于高斯混合模型的语音转换技术研究,TN912.3
- 基于场景语义图像标注关键技术的研究,TP391.41
- 基于分类映射的非并行语料语音转换,TN912.3
- 普通话双音节轻声儿化词的韵律特征,H116
- 山东费县方言声调实验研究,H17
- 基于LPAC-PSOLA合成算法语音转换系统,TN912.3
- 一种智能变换语音技术的研究,TN912.3
中图分类: > 工业技术 > 无线电电子学、电信技术 > 通信 > 电声技术和语音信号处理 > 语音信号处理
© 2012 www.xueweilunwen.com
|