学位论文 > 优秀研究生学位论文题录展示

基于自适应字典稀疏表示超分辨率重建的视频编码技术

作 者: 潘智铭
导 师: 熊红凯
学 校: 上海交通大学
专 业: 电子与通信工程
关键词: 超分辨率 自适应字典 基元块 稀疏表示 时-空一致性
分类号: TN919.81
类 型: 硕士论文
年 份: 2012年
下 载: 223次
引 用: 0次
阅 读: 论文下载
 

内容摘要


近年来,面对移动终端、数码相机和移动电视中增强低质量视觉数据的需求,需要视频分析和计算机视觉领域技术的大量运用,这些方法可以作为可伸缩部分用在任何主流的视频编码系统中,对于获得额外的编码增益具有良好的发展前景。在视频编码中一个值得关注的方向是在一个采样的低分辨率数据与原始高分辨率数据之间建立一个特定的关系。例如,可伸缩视频编码通过下采样和上采样帧间预测来保持空间分辨率。然而这种情形下,编码负载是由编码端和解码端严格的计算复杂度比值控制的(编码端复杂度高,解码端复杂度低),这将限制日益增长的移动通信领域无处不在的多媒体信息获取能力。此后,分布式视频编码通过考虑将高复杂性的预测部分从编码端转移到解码端,被认为是一个具有良好发展潜力的能够满足移动摄像终端和无线传感器网络需求的视频编码方案。由于受到相关边信息估计的限制,实际的DVC编码方案与传统的基于预测的编码器,比如H.264相比,性能上会有明显的下降。从这一思路出发,促使我们进一步研究类似DVC编码方式的具有更强约束性的自适应逆向稀疏重建方法。回顾传统的视频编码系统,比如H.264/AVC和目前正在研究的高性能视频编码系统HEVC,它们都专注于通过帧内和帧间预测来开发像素间的冗余性。众所周知,人眼视觉系统对于特定目标的某些细节部分具有非常有限的识别能力,比如重复的视觉类型和图像中的高频信息。这将为我们在这些区域精简数据提供充足的可能,并且像素精度上的不确定性可以通过最大限度的保留视觉质量加以淡化。事实上,更多的预测方式,比如基于图像修复和基于纹理合成的预测方式,已经取得了更好的压缩效果,它能够将丢失的纹理信息在视觉上足够有效地恢复出来。如今,人们已经开始考虑利用多种辅助边信息,比如边、辅助参数等方式恢复丢失的信息。为了保持视频序列的时间连续性,一个时空补偿技术已经被考虑引入到一个全局最优化问题中。自然地,人们更多的注意到通过目前最新的超分辨率技术进行视频重建的可能性,在这种思想下,稀疏采样的低分辨率与原始高分辨率数据之间的相关性通过非参数的方式进行估计。在视频编码中,图像质量与码率之间的关系可以通过在编码端下采样视频序列中的某些帧,以获得更高的压缩率得到进一步的控制。这种多分辨率的方式能够通过控制下采样或者量化过程提高压缩率,在很多的SVC编码方案中已经得到了应用。在解码端,下采样后的帧需要通过上采样过程以恢复原始的分辨率。然而在编码端,由于一些帧信息在下采样的过程中已经被丢失,内插以后会存在信号的失真问题,因此,超分辨率重建的方法被用来增强重建图像的质量。本文提出了一种新的基于学习超分辨率算法的低码率视频编码系统,其中,基于字典的超分辨率稀疏重建技术为该问题提供了一个非参数化的解决方法。视频序列中的一部分关键帧在编码端以高分辨率被直接编码,并在解码端被用来当做训练集,而剩下的帧被下采样成非关键帧并以低分辨率被编码。图像中的基元块具有更低的维数并能更好地从其他图像的基元块中学习得到。基于此,一个视频序列帧被分为三层:一个基元层、一个非基元粗糙层和一个非基元平滑层。考虑到不同帧之间以及同一帧中不同区域的图像基元块的内容往往差别很大,我们提出根据关键帧的结构特征,从训练集中学习一系列低分辨率和高分辨率子字典对。对于非关键帧中的一个待处理基元图像块,我们自适应地选择与该块结构特征一致的子字典作为最佳稀疏表示字典。值得注意的是,非基元三维视频块在沿着运动轨迹的方向上具有一致连续性、少量的结构信息,并在预先学习的三维时空字典中具有更稀疏的表示结构。我们通过分层双向运动估计和自适应块重叠运动补偿技术来得到该运动轨迹的方向。对应的,该视频超分辨率重建过程可以被概括为一个从自适应规则字典中构建低分辨率帧块的稀疏表示的最优化问题。其中,该自适应字典包括两部分:从二维基元块中学习的一系列二维基元子字典对和一个从非基元视频块中学习的三维字典。在重建端,解码后的低分辨帧中的相应高频信息将从以上两类字典中得到补偿。相关论文"Sparse spatio-temporal representation with adaptive regularized dictionaries for super-resolution based video coding"已经被IEEE国际会议DCC2012 (Data Compression Conference,2012)录用,并即将发表。

全文目录


摘要  5-7
ABSTRACT  7-10
目录  10-13
插图索引  13-15
表格索引  15-16
第一章 绪论  16-23
  1.1 引言  16-17
  1.2 视频编码标准  17-21
  1.3 本文主要内容与贡献  21-23
第二章 基于视觉冗余的视频编码方法介绍  23-36
  2.1 背景介绍  23-24
  2.2 纹理合成技术  24-29
    2.2.1 纹理合成的基本原理  24-25
    2.2.2 纹理合成算法  25-29
  2.3 图像修复技术  29-31
  2.4 基于计算机视觉技术的视频编码方法  31-34
  2.5 本章小结  34-36
第三章 基于基元块自适应稀疏表示超分辨率算法  36-53
  3.1 序言  36-37
  3.2 基于学习的超分辨率研究方法  37-38
  3.3 基于稀疏表示的图像超分辨率算法  38-41
    3.3.1 建立稀疏表示模型  39-41
    3.3.2 本文工作  41
  3.4 基于基元块自适应稀疏表示的超分辨率算法  41-49
    3.4.1 基元图像块的提取  42-44
    3.4.2 学习过程  44-47
    3.4.3 合成过程  47-49
  3.5 实验结果与分析  49
  3.6 本章小结  49-53
第四章 基于自适应字典稀疏表示超分辨率重建的视频编码系统  53-77
  4.1 序言  53-55
  4.2 基于超分辨重建的视频编码框架介绍  55-58
    4.2.1 学习过程  56-57
    4.2.2 合成过程  57-58
  4.3 基于自适应稀疏表示的超分辨率算法  58-69
    4.3.1 基于基元块的图像分割方法  58-59
    4.3.2 自适应字典学习  59-63
    4.3.3 动补偿帧内插方法MCFI  63-67
    4.3.4 合成过程  67
    4.3.5 为何使用不同的稀疏表示模型?  67-69
  4.4 实验结果与分析  69-75
    4.4.1 实验设置  69-70
    4.4.2 结果分析  70-75
  4.5 本章小结  75-77
第五章 总结与展望  77-79
  5.1 全文总结与结论  77-78
  5.2 未来工作展望  78-79
参考文献  79-87
致谢  87-88
攻读学位论文期间发表的学术论文和科研成果目录  88

相似论文

  1. 基于学习的低阶视觉问题研究,TP391.41
  2. 语音信号的压缩感知研究及其在语音编码中的应用,TN912.3
  3. 基于稀疏表示残差融合的人脸表情识别,TP391.41
  4. 基于小波变换的信号稀疏表示及其在图像去噪中的应用,TP391.41
  5. 基于回归的图像超分辨率重建技术研究,TP391.41
  6. 利用非局部相似性的图像超分辨率重建研究,TP391.41
  7. 基于压缩感知的语音稀疏基和投影矩阵构造技术的研究,TN919.8
  8. 基于压缩感知的信号恢复算法研究,TN911.7
  9. 基于学习的视频超分辨率重建算法研究及实现,TP391.41
  10. 基于稀疏表示的高空间分辨率遥感影像纹理描述方法的研究,TP751
  11. POCS图像超分辨率重建技术研究,TP391.41
  12. 基于学习的图像超分辨率技术及其应用研究,TP391.41
  13. 弱稀疏信号欠定盲分离技术的研究,TN911.7
  14. Tetrolet稀疏正则化与样本学习的图像超分辨率算法研究,TP391.41
  15. 基于样例的图像画质增强,TP391.41
  16. 可变光照和遮挡条件下的人脸识别技术研究及其应用,TP391.41
  17. 基于稀疏表示的人体运动捕获数据分析方法研究,TP391.41
  18. 基于内容的商品图像分类技术研究,TP391.41
  19. 基于稀疏表示的人脸图像识别方法研究,TP391.41
  20. 在线字典训练及加权差异性稀疏表示的研究,TP391.41

中图分类: > 工业技术 > 无线电电子学、电信技术 > 通信 > 图像通信、多媒体通信 > 图像编码
© 2012 www.xueweilunwen.com