学位论文 > 优秀研究生学位论文题录展示

多路并行实时说话人识别算法研究与实现

作 者: 罗晓亭
导 师: 吉立新
学 校: 解放军信息工程大学
专 业: 军事通信学
关键词: 说话人识别 DSP FPGA 矢量量化 美尔频标倒谱系数
分类号: TN912.34
类 型: 硕士论文
年 份: 2010年
下 载: 64次
引 用: 0次
阅 读: 论文下载
 

内容摘要


随着通信技术的飞速发展,电话通信日益成为人们联系和信息交流的平台,基于电话语音的多路并行说话人识别也成为人们广泛研究的课题。当前许多的语音识别系统是基于计算机软件或者基于DSP平台,系统实现灵活,但相对于电话语音的多路并行应用来说实时性较差。FPGA(Field-Programmable Gate Array,现场可编程门阵列)芯片具有时钟频率高,内部时延小,全部控制逻辑由硬件完成的优点,其速度快、效率高,适于大数据量的高速传输控制。采用DSP+FPGA的说话人识别系统,可以充分利用两种芯片的各自特点,预处理和特征参数算法处理的数据量大,对处理速度要求高,但运算结构相对比较简单,适合于用FPGA进行硬件实现,模板匹配算法的特点是处理的数据量相对较少,但算法的结构复杂,适于用运算速度高、寻址方式灵活、通信机制强的DSP芯片来实现。DSP+FPGA结构可以兼顾速度及灵活性。本文的主要工作包括:(1)针对多路并行实时说话人识别系统对数据吞吐量、计算速度和资源占用有较高的要求,提出了基于FPGA+DSP平台的系统实现方案;(2)研究了当前说话人识别中常用的特征参数和识别方法,并根据并行说话人识别系统的特点,在占用资源和计算复杂度上做权衡,设计了基于MFCC+VQ的多路并行说话人识别系统;(3)研究说话人识别模板匹配经典VQ算法,针对多路并行识别系统在识别精度和处理速度的要求,对VQ算法做两方面的改进,在识别精度上提出了码字可分性加权VQ算法,在模板匹配速度上提出了码字可分性加权VQ算法的均值不等式快速搜索算法(ENNS),经仿真测试,识别精度和模板匹配速度性能均得到了一定的提高;(4)完成DSP平台的相关设计,包括数据接口的设计与测试(DSP与主机通信HPI接口,DSP与FPGA通信EMIFA接口)、DSP系统寄存器配置;设计多路并行事实说话人识别的流程,基于TI DSP6455平台设计并实现了改进VQ算法,并进行了优化,实验测试基于平台的定点结果和VC浮点结果之间相对误差,并对模板匹配时间做测试;(5)对说话人识别系统进行联调及性能测试。测试结果表明,系统能够实时处理32路并行电话语音并且识别精度比较高,达到了设计的要求。

全文目录


图目录  6-7
表目录  7-8
摘要  8-9
ABSTRACT  9-11
第一章 绪论  11-15
  1.1 说话人识别概述  11-12
    1.1.1 说话人识别的分类  11
    1.1.2 国内外研究现状和存在的问题  11-12
  1.2 本文应用背景和主要工作  12-13
  1.3 论文组织结构  13-15
第二章 说话人识别系统概述  15-24
  2.1 说话人识别的基本原理  15-16
  2.2 语音特征参数的选择  16-18
  2.3 说话人识别模型及选择  18-19
    2.3.1 说话人识别模型简介  18
    2.3.2 说话人识别模型选择  18-19
  2.4 多路并行说话人识别系统总体架构  19-23
    2.4.1 系统单元设计  20-22
    2.4.2 核心器件  22-23
  2.5 本章小结  23-24
第三章 基于码字可分性加权VQ 的说话人识别模型  24-39
  3.1 基本VQ 算法  24-28
    3.1.1 VQ 算法简介  24-25
    3.1.2 码本设计  25-27
    3.1.3 码字搜索  27-28
  3.2 码字可分性加权VQ 算法  28-35
    3.2.1 类内码字可分性加权VQ 算法  28-30
    3.2.2 类间码字可分性加权VQ 算法  30-31
    3.2.3 类内类间码字可分性加权VQ 算法  31-32
    3.2.4 码字可分性加权VQ 的ENNS 搜索算法  32-35
  3.3 试验结果与分析  35-37
    3.3.1 识别精度仿真与分析  36-37
    3.3.2 抗噪声性仿真与分析  37
    3.3.3 识别时间分析  37
  3.4 本章小结  37-39
第四章 说话人识别系统设计  39-61
  4.1 数据接口设计  39-45
    4.1.1 DSP 与主机通信  39-40
    4.1.2 DSP 与FPGA 接口  40-43
    4.1.3 DSP 寄存器配置  43-45
  4.2 多路说话人识别系统流程设计  45-47
  4.3 定点DSP 实现的考虑因素  47-50
    4.3.1 溢出处理方法  47-48
    4.3.2 非线性运算定点实现方法  48-50
  4.4 说话人识别模型的DSP 定点实现与代码优化  50-56
    4.4.1 编写C 代码  52-53
    4.4.2 优化C 语言程序  53-55
    4.4.3 使用TI 的库函数  55-56
  4.5 说话人识别模型测试及性能分析  56-57
    4.5.1 定点误差分析  56-57
    4.5.2 识别时间分析  57
  4.6 系统性能测试  57-60
    4.6.1 测试环境及处理流程  57-59
    4.6.2 系统性能分析  59-60
  4.7 本章小结  60-61
结束语  61-63
参考文献  63-66
攻读硕士学位期间完成的主要工作个人简历  66-67
致谢  67

相似论文

  1. 电子提花编织机电控系统设计,TS183
  2. 基于DSP的集成光栅细分数显装置的研制,TH822
  3. 基于DSP的二维准直系统的研究,TH741.14
  4. 基于FPGA的电磁超声检测系统的研究,TH878.2
  5. 半实物火炮自动操瞄俯仰角度控制系统的研究,TJ303
  6. 基于FPGA的五相PMSM驱动控制系统的研究,TM341
  7. LXI任意波形发生器研制,TM935
  8. 同步电动机励磁控制系统研究,TM341
  9. 基于DSP的任意次谐波发生器的设计,TM935
  10. 基于FPGA的射频功放数字预失真器设计,TN722.75
  11. 基于重叠变换与矢量量化的图像压缩算法及应用研究,TN919.81
  12. 突发OFDM系统同步与信道估计算法及FPGA实现,TN919.3
  13. AES算法及其DSP实现,TN918.1
  14. 基于DSP的机器人语音命令识别系统研制,TN912.34
  15. 直扩系统抗多径性能分析及补偿方法研究,TN914.42
  16. 相位法激光测距仪信号接收系统研究,TN249
  17. 基于DSP的OFDM系统中的信道估计技术实现研究,TN919.3
  18. 电视制导系统中视频图像压缩优化设计及实现研究,TN919.81
  19. 基于小波变换的语音信号去噪及其DSP算法实现,TN912.3
  20. 基于FPGA的多用户扩频码捕获研究及硬件仿真,TN914.42
  21. 基于FPGA的数字图像处理基本算法研究与实现,TP391.41

中图分类: > 工业技术 > 无线电电子学、电信技术 > 通信 > 电声技术和语音信号处理 > 语音信号处理 > 语音识别与设备
© 2012 www.xueweilunwen.com