学位论文 > 优秀研究生学位论文题录展示

互联网图像高效标注和解译的关键技术研究

作 者: 夏丁胤
导 师: 庄越挺
学 校: 浙江大学
专 业: 计算机科学与技术
关键词: 图像标注 图像解译 单词可见度 近邻传播聚类 深度学习 数据驱动
分类号: TP391.41
类 型: 博士论文
年 份: 2010年
下 载: 223次
引 用: 0次
阅 读: 论文下载
 

内容摘要


作为支持互联网大规模图像检索的一种有效和实用方法,互联网图像自动标注和理解已成为学术界和产业界的热点问题而被深入研究。本文研究了图像视觉内容与伴随文本语义之间的潜在关联关系挖掘、图像解译、大规模数据聚类以及图像视觉特征深度学习等关键性问题。论文的主要工作有:一、提出了一种基于数据驱动的互联网图像自动标注和理解框架(Automatic Web Image Annotation and Interpretation, AWIAI)。在图像自动标注过程中,AWIAI框架先计算图像伴随文本中单词可见度属性来构建“图像-单词”关系矩阵,然后对该关系矩阵进行隐性文法分析以扩展备选标注单词,最后通过图像视觉内容的无监督学习和对单词两两共生关系进行分析和排序,得到图像标注最终结果。二、在图像自动标注结果的基础上,提出了图像解译的概念和具体实现方法。现有图像自动标注方法未能对标注单词之间存在的语法关系进行分析,因此得到的图像标注结果是若干离散单词,难以对图像所蕴含丰富语义进行自然语言的深层次描绘(如对图像产生“熊猫吃竹子”的分析结果)。该方法在AWIAI框架下得到图像标注单词后,分析标注单词之间的语句关系,产生句法群组,以自然语言方式对目标图像内容进行解译。三、对存在致密相似度关系的大规模数据,本文针对性提出了两种改进的近邻传播聚类的方法,即在聚类过程中通过局部信息传递来加快整体信息传递速度的方法,以及通过对局部采样数据进行信息传递,再将其它数据内嵌进去从而得到快速全局近似结果的方法。AWIAI框架以数据驱动为核心进行图像智能处理,因此需要解决大规模数据高效聚类这一难点问题。四、在AWIAI的图像理解过程中,本文提出了一种结合模型和数据驱动的深度学习方法(Deep Model-based and Data-driven, DMD)来提取图像理解中最具区别性的视觉特征。近来神经科学理论研究成果认为大脑对外界视觉信息感知是一个逐层学习过程。DMD方法通过一个从简单到复杂的深度学习流程来提取图像视觉特征,先以无监督学习方法获得特征并将其稀疏化,然后通过有监督学习方法实现图像语义理解和标注。

全文目录


摘要  3-5
Abstract  5-12
第1章 绪论  12-19
  1.1 课题研究背景  12-13
  1.2 研究问题  13-15
  1.3 本文内容与贡献  15-17
  1.4 本文组织结构  17-19
第2章 互联网图像标注和检索的相关研究和综述  19-38
  2.1 互联网图像的视觉和文本特征  19-26
    2.1.1 图像的视觉理论  20
    2.1.2 图像的视觉单词  20-23
    2.1.3 图像伴随文本  23-25
    2.1.4 基于内容的图像检索  25-26
  2.2 图像的自动标注  26-32
    2.2.1 基于视觉内容的方法  27-28
    2.2.2 基于伴随文本的方法  28-29
    2.2.3 结合文本和视觉内容的标注模型  29-31
    2.2.4 图像的解译  31-32
  2.3 图像标注相关智能技术研究  32-38
    2.3.1 图像聚类  32-34
    2.3.2 图像排序  34
    2.3.3 机器学习  34-36
    2.3.4 图像的深度学习  36-38
第3章 互联网图像的自动标注和解译  38-64
  3.1 引言  38-40
  3.2 互联网图像的自动标注  40-47
    3.2.1 图像初始标注  41-43
    3.2.2 图像标注单词扩展  43-44
    3.2.3 图像最终标注单词  44-47
  3.3 互联网图像的解译  47-55
    3.3.1 图像解译流程  47-49
    3.3.2 图像的单语句解译  49-50
    3.3.3 图像的句群解译  50-55
  3.4 实验和讨论  55-63
    3.4.1 实验数据集  55-56
    3.4.2 评价标准  56-57
    3.4.3 图像自动标注的实验结果  57-60
    3.4.4 图像解译的实验结果  60-63
  3.5 本章小结  63-64
第4章 大规模互联网图像的近邻传播聚类  64-82
  4.1 引言  64-67
    4.1.1 背景介绍  64-65
    4.1.2 近邻传播聚类  65-67
  4.2 分割式近邻传播聚类算法  67-69
    4.2.1 基本思想  67-68
    4.2.2 算法流程  68-69
    4.2.3 算法分析  69
  4.3 采样式近邻传播聚类算法  69-72
    4.3.1 基本思想  69-71
    4.3.2 算法流程  71-72
    4.3.3 算法分析  72
  4.4 实验和讨论  72-80
    4.4.1 二维数据集  73-75
    4.4.2 流形学习典型例子数据集  75-77
    4.4.3 人脸表情数据集  77-78
    4.4.4 中国书法字数据集  78-80
  4.5 本章小结  80-82
第5章 图像的深度学习  82-108
  5.1 引言  82-85
  5.2 基于视觉皮层模型感知的特征提取方法  85-93
    5.2.1 视觉皮层感知理论  85-86
    5.2.2 视觉皮层感知的算法模拟  86-93
  5.3 基于数据驱动的特征提取方法  93-96
    5.3.1 颜色特征  94
    5.3.2 纹理特征  94
    5.3.3 视觉词袋  94-96
  5.4 实验和讨论  96-106
    5.4.1 实验数据集和设置  96-97
    5.4.2 基于模型的方法与数据驱动方法的比较  97-103
    5.4.3 混合模型与单一模型的比较  103-105
    5.4.4 参数调节  105-106
    5.4.5 难点问题  106
  5.5 本章小结  106-108
第6章 系统整体设计和具体实现  108-114
  6.1 引言  108
  6.2 面向互联网图像标注和解译的整体设计  108-109
  6.3 系统具体设计和实现  109-113
    6.3.1 互联网网页抓取  109-110
    6.3.2 图像和文本处理  110-111
    6.3.3 图像自动标注结果展示系统  111-112
    6.3.4 基于MapReduce的大规模数据处理  112-113
  6.4 本章小结  113-114
第7章 总结和展望  114-117
  7.1 总结  114-115
  7.2 展望  115-117
参考文献  117-130
攻读博士学位期间主要的研究成果  130-132
致谢  132-133

相似论文

  1. 网络环境下开展学习叙事促进学生深度学习研究,G434
  2. 基于QTP的SAFFRON自动化测试框架的研究,TP311.52
  3. 废杂铜冶炼过程控制系统的设计与实现,TP273
  4. 新闻视频故事单元分割,TP391.41
  5. 自动化测试框架系统ATestPPMC研究与实现,TP311.53
  6. 优化算法在调度与控制问题中的应用研究,TP273
  7. 基于组件的数字电路虚拟实验室的设计与实现,TP311.52
  8. 面向DAG数据依赖型应用系统研究与实现,TP311.1
  9. 数据驱动模式视角下的英语专业学生搭配习得研究,H319
  10. 基于稀疏回归模型的图像标注研究,TP391.41
  11. 基于近邻传播聚类的点云简化研究,TP391.41
  12. 视觉注意机制建模中的特征调制和选择策略研究,TP391.41
  13. 基于关键字驱动的网管自动化配置方法的设计与实现,TP311.52
  14. 高分辨率SAR图像目标三维特征提取与建模,TN957.52
  15. 滇东北铅锌成矿区遥感影像环线特征及成矿预测,P618.4
  16. 数据驱动声简正波信息提取方法的研究,P733.2
  17. CTCS-2列控中心自动化测试平台的研究与实现,TP274
  18. 数据驱动控制算法软件仿真平台的设计与实现,TP273.2
  19. 基于数据驱动方法的金线焊线机控制器参数自整定方法,TP273
  20. 教育软件自动测试系统设计,TP311.52
  21. 基于RCP的自动化测试平台的研究与实现,TP311.52

中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 模式识别与装置 > 图像识别及其装置
© 2012 www.xueweilunwen.com