学位论文 > 优秀研究生学位论文题录展示
视频内容结构化分析的研究和应用
作 者: 张振原
导 师: 薛向阳
学 校: 复旦大学
专 业: 计算机应用技术
关键词: 视频内容结构化分析 场景分割 流形学习 MCMC JSEG 谱聚类 流媒体分发 VCR操作
分类号: TP391.41
类 型: 硕士论文
年 份: 2008年
下 载: 206次
引 用: 1次
阅 读: 论文下载
内容摘要
|
近些年来,随着网络和数字化技术的迅猛发展,信息化程度的不断提高,网上多媒体数据量越来越多,包括文本、图像、视频以及音频等多种形式。传统的信息检索系统已经无法处理这些数量巨大且迅速增长的媒体数据,人们迫切需要一种新的自动化的方法来处理、分析和检索网上海量的多媒体数据,尤其是视频数据,这是因为视频数据融合了图像、文字、声音等多种媒体,具有最强的表现力且被广泛使用。在这一背景下,国内外众多研究人员展开了基于内容的视频检索研究,即通过使用颜色、纹理、形状、运动以及音频等视频本身所具有的特征描述视频,从视频序列中抽取这些特征并对它们进行自动匹配,从而实现对视频内容的快速检索。目前,基于视频内容检索的研究已经取得了长足的进步,涉及到特征提取、视频结构化分析、视频摘要、关键帧选取、数据库设计和索引以及用户界面的研究和设计等多个领域。但由于受制于视频数据的复杂性以及语义鸿沟等问题的制约,目前的研究成果还不能很好的满足用户的需求,这一领域仍然存在很多挑战。本文的研究方向是视频内容的结构化分析,它是针对视频的无结构特性提出的,旨在提供对视频内容层次化的理解。一般来说,视频的结构模型从底层到高层,依次为帧、镜头、场景和视频。帧,是视频的基本组成单位。镜头,是由一个相机动作(如开/关)中的连续帧组成,它包含了一致的背景或者物体特定的活动。对视频进行镜头分割,是视频结构化分析的基础。但由于镜头本身并不包含语义信息,而且一个小时的视频可能包含很多镜头,因此很难直接基于镜头分割的结果进行视频分析。场景,是由一组语义相关的镜头组成,表达一个特定的主题,它是视频结构中的语义单元。因此,对视频进行场景分割,将为我们提供视频语义的理解,这将对实现电影摘要、电视节目分割等应用提供有力的支持。本文的研究重点是假定已经得到准确的镜头边界的基础上,研究视频的场景分割。我们在总结前人工作的基础上,对场景分割中两方面的问题,聚类个数难以确定以及过分依赖视频类型,进行了研究并提出了两种场景分割的方法。具体来讲,第一种方法利用流形学习理论获得视频的结构特征,然后用马尔科夫链蒙特卡罗方法(Markov chain Monte Carlo,MCMC)动态地进行模拟采样,通过寻找场景边界的最大后验概率分布,完成场景的分割。第二种方法,在考虑颜色特征相似度以及镜头时序关系的基础上,利用JSEG的思想挖掘视频的结构特征,计算视频的局部均一性。在此基础上,利用谱聚类的算法完成场景分割。由于两种方法本身可以自适应地反应出场景的结构特征,因此可以满足对不同视频类型的应用。另外,通过使用马尔科夫链蒙特卡罗方法和谱聚类的算法处理得到的结构特征,我们就可以自动地完成场景分割。针对提出的两种场景分割方法,分别在电影、运动、卡通等多种类型的视频数据上进行了实验。实验结果也验证了方法的有效性。我们还将视频结构化分析的思想引入到流媒体分发和用户VCR操作的研究领域。通过使用镜头分割和场景分割算法处理视频数据,我们不仅改变了流媒体分发的内容,更提供给用户层次化的理解方式,帮助他们更快地定位感兴趣的内容,在提高用户体验度的同时,大大降低了系统的负担。
|
全文目录
摘要 5-7 ABSTRACT 7-9 第一章 绪论 9-14 1.1 研究的背景和意义 9-12 1.2 论文的研究目标与贡献 12-13 1.3 论文的组织结构 13-14 第二章 视频的结构化组织和底层特征描述 14-28 2.1 视频的结构模型 14-22 2.1.1 基于帧的分析 15 2.1.2 基于镜头的分析 15-21 2.1.3 基于场景的分析 21 2.1.4 基于关键帧的分析 21-22 2.2 视频的底层特征描述 22-27 2.2.1 颜色 22-24 2.2.2 纹理 24 2.2.3 形状 24-25 2.2.4 音频 25-26 2.2.5 MPEG-7标准 26-27 2.3 本章小结 27-28 第三章 视频的场景分割 28-45 3.1 场景分割综述 28-30 3.1.1 场景分割的定义 28-29 3.1.2 场景分割研究综述 29-30 3.2 场景结构分析 30-32 3.3 场景分割算法研究 32-42 3.3.1 融合流形学习与MCMC的场景分割方法 32-37 3.3.2 基于JSEG思想的谱聚类方法 37-42 3.4 实验结果与分析 42-44 3.5 本章小结 44-45 第四章 视频内容结构化分析在流媒体环境下的应用 45-53 4.1 研究问题的背景 45-47 4.2 基于视频结构分析技术的解决方案 47-50 4.2.1 视频数据预处理 48-49 4.2.2 用户界面设计 49-50 4.3 实验结果 50-52 4.4 本章小结 52-53 第五章 总结与展望 53-54 参考文献 54-61 附录一 硕士期间发表的论文 61-62 附录二 硕士期间参加的研究与项目 62-63 附录三 硕士期间申请的专利 63-64 致谢 64-65
|
相似论文
- 基于流形学习的高维流场数据分类研究,V231.3
- 唇读中的特征提取、选择与融合,TP391.41
- 基于图分割的文本提取方法研究,TP391.41
- 基于流形学习的数据降维技术研究,TP311.13
- 有序Probit模型的非参贝叶斯统计,O212.8
- 基于状态空间模型的赔款准备金的研究,F842.3
- 基于学习的视频超分辨率重建算法研究及实现,TP391.41
- 基于脑电的情感识别,TP391.4
- Pre~2VOD:一种VCR操作支持的VOD/P2P系统,TN948.64
- 基于谱聚类的无监督图像分割,TP391.41
- 人体运动时间序列可视化及多索引方法研究,TP391.41
- 人机交互环境下学术搜索功能学习的心智模型动态改变研究,G350
- 基于多基点定位的ISOMAP算法改进研究,TP181
- 暴雨中冰雹的识别,P429
- 核磁共振谱信号参数的RJMCMC估计,O482.532
- 基于SV模型的我国股市波动性实证分析,F832.51
- ASV模型的扩展及其在中国金融市场的应用,F832.51
- 金融随机波动扩展模型分析及应用研究,F830
- 烟草样品中微量金属元素含量测定及模式识别研究,TS47
- 流形学习中的增量谱嵌入方法,TP181
- 长期演进系统下入侵检测关键技术的研究,TP393.08
中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 模式识别与装置 > 图像识别及其装置
© 2012 www.xueweilunwen.com
|