学位论文 > 优秀研究生学位论文题录展示
音频样例检索技术研究
作 者: 张磊
导 师: 张丽珂
学 校: 哈尔滨工程大学
专 业: 模式识别与智能系统
关键词: 音频检索 矢量量化 直方图模型 特征匹配
分类号: TP391.3
类 型: 硕士论文
年 份: 2010年
下 载: 54次
引 用: 0次
阅 读: 论文下载
内容摘要
|
步入21世纪以来,通信技术、互联网技术和多媒体技术得到了迅猛的发展,信息数据中的多媒体数据量已经大大超过了文本数据量,并且仍然保持着高速增长。音频、视频和图像是多媒体信息的主要部分,为了使音频信息得到充分的利用,人们开始关注音频信息检索技术。相对于图像和视频,音频数据具有非结构化的特点,这一特点使得音频信息检索比图像和视频信息检索更加困难。音频信息从存在形式上来讲有两种,一种是存储在某种介质之中的,比如光盘或者磁带,另一种是实时播放的,比如广播。这造成了音频检索的离线和在线之分。另外音频检索还可以分为表示级和语义级。因此检索不同的音频形态需要不同的检索方法。音频信息检索技术发展的时间并不是很长,目前还存在许多问题需要解决。从整体上来说,实用的检索系统还非常的少,音频检索技术研究还是处于刚刚起步阶段。本文主要研究表示级音频检索,针对音频样例检索方面,开展了以下研究工作:1、对于音频样例检索的噪声敏感问题,提出了基于阈值自适应的直方图音频检索方法。在音频特征矢量量化中,根据音频特征的特性优化了矢量量化码书产生方法。分析了动态直方图在噪声情况下的缺陷,结合特征编码匹配进行检索阈值的自适应控制。实验结果表明,该方法具有较好的噪声鲁棒性。2、对于音频检索的残缺鲁棒性问题,提出了划分子模板的检索方法。该方法将参考音频分为若干子模板,并使用子模板登记到滑动窗内来控制其是否进行检索。结合实验分析了目标音频各部位发生残缺对算法的影响,最后对比整体检索方法证明了该方法的残缺鲁棒性。
|
全文目录
摘要 5-6 ABSTRACT 6-10 第1章 绪论 10-19 1.1 课题的研究背景及意义 10-12 1.2 音频信息检索研究的发展现状 12-16 1.2.1 表示级检索 12-16 1.2.2 语义级检索 16 1.3 音频检索存在的问题 16-18 1.4 课题的主要内容和结构安排 18-19 第2章 音频基本理论 19-32 2.1 声音的基本理论 19-27 2.1.1 声音的物理特性 19-22 2.1.2 声音的感知特性 22 2.1.3 人耳对声音的感知 22-26 2.1.4 掩蔽效应 26-27 2.2 音频信号的数字化 27-30 2.2.1 采样和量化 27 2.2.2 采样频率 27-28 2.2.3 量化精度 28 2.2.4 数字音频文件格式 28-30 2.3 MFCC 系数提取 30-31 2.5 本章小结 31-32 第3章 矢量量化 32-43 3.1 矢量量化的基本概念 32-36 3.1.1 矢量量化的理论基础 32-33 3.1.2 矢量量化的定义 33-34 3.1.3 矢量量化器分析 34-35 3.1.4 失真测度 35-36 3.2 矢量量化码书设计算法 36-41 3.2.1 矢量量化器的最优条件 36-38 3.2.2 经典算法——LBG 算法 38-39 3.2.3 LBG 算法的关键问题 39-41 3.3 应用于音频检索的矢量量化 41-42 3.4 本章小结 42-43 第4章 音频样例检索算法 43-57 4.1 直方图搜索算法 43-47 4.1.1 基于MFCC 系数的直方图 44 4.1.2 动态搜索方法 44-47 4.2 阈值自适应直方图检索算法 47-51 4.3 分段式检索策略 51-56 4.3.1 子模板划分 52-53 4.3.2 检索控制 53-54 4.3.3 参考模板的判别检出 54 4.3.4 算法流程 54-56 4.4 本章小结 56-57 第5章 音频检索实验 57-68 5.1 系统结构 57-60 5.1.1 特征提取子系统 57-59 5.1.2 检索测试子系统 59-60 5.2 实验音频库 60-61 5.3 检索系统评价指标 61-62 5.4 实验分析 62-67 5.4.1 阈值自适应直方图检索性能分析 62-63 5.4.2 分段检索性能分析 63-67 5.5 本章小结 67-68 结论 68-69 参考文献 69-73 攻读硕士学位期间发表的论文和取得的科研成果 73-74 致谢 74
|
相似论文
- 基于重叠变换与矢量量化的图像压缩算法及应用研究,TN919.81
- 量子粒子群算法研究及其在图像矢量量化码书设计中的应用,TP301.6
- 压缩感知算法及其在矢量量化中的应用,TN911.7
- Pre~2VOD:一种VCR操作支持的VOD/P2P系统,TN948.64
- 立体视觉三维重建相关技术研究与实现,TP391.41
- 语音人工带宽扩展算法研究,TN912.3
- 基于DSP的单目视觉定位方法关键技术研究,TP391.41
- 非重叠监控摄像机中行人关联技术研究,TP391.41
- 音频检索技术在数字语音教学系统中的应用与研究,TP391.6
- 光笔测量三维建模技术研究,TP391.41
- 基于矢量量化的高光谱图像无损压缩算法研究,TP751.1
- 基于DSM的遥感影像拼接关键技术研究,TP751
- 基于单摄像头的360度旋转跟踪系统,TP391.41
- 甚低速率语音编码器算法研究,TN912.3
- 端到端保密通信中的类语音调制解调研究,TN918
- AMR-WB+编码算法关键技术及码流识别研究,TN912.3
- 基于Windows CE的说话人识别系统的设计与实现,TN912.34
- 基于MELP的低速率语音编码算法研究,TN912.3
- 基于文本无关的说话人识别研究,TN912.34
- 高速公路交通事件检测建模及应用研究,U491.116
- 基于局域网的计算机蠕虫检测技术研究与实现,TP393.08
中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 检索机
© 2012 www.xueweilunwen.com
|