学位论文 > 优秀研究生学位论文题录展示
英文科技文档中数学公式的定位、识别与重建
作 者: 李峰
导 师: 吴微
学 校: 大连理工大学
专 业: 计算数学
关键词: 光学字符识别 局部极大成分标记 数学公式提取 粘连字符分割 公式重组
分类号: TP391.43
类 型: 博士论文
年 份: 2007年
下 载: 250次
引 用: 6次
阅 读: 论文下载
内容摘要
|
随着计算机存储能力的不断提高,越来越多的文档以图像格式被输入到计算机中保存.如何将这些文档图像转换为可检索、可重新编辑的格式已经引起了广泛的关注.文档图像分析技术正是为了满足这些要求产生的.光学字符识别是文档图像分析的核心技术,可以分为印刷体文本识别和手写体文本识别两大类.目前,印刷体文本识别技术较为成熟,广泛应用在办公自动化,数字图书馆建设等领域.但是,科技文档中存在大量的数学公式,这些数学公式往往包含希腊字母等特殊符号,而且其中的符号之间常存在二维的位置关系.而目前的OCR产品无法处理含有二维结构的公式子图像.因此,目前科技文档中的数学公式只能通过人工输入的方法达到重新检索和利用的目的.为此,本文提出了一种用于识别印刷体文档图像中包含的数学公式的识别系统.本文主要包含以下内容:本文第一章回顾了文档图像分析和数学公式定位的历史,概述了相关的技术,并讨论了现有算法的优点和缺点.对于新系统结构的描述也在第一章进行.新系统能够实现自动提取文档图像中包含的数学公式,识别其中的符号.利用LL(1)文法对公式结构进行分析后,系统将识别结果最终存储成可编辑的L~AT_EX格式数学公式.在第二章,定义了适用于文档图像分析的局部极大成分(简称成分),并给出了相应的标记算法.新算法采用轮廓追踪技术检测和标记源图像中每个成分的外部轮廓,继而将成分的内部区域从源图像的副本中移除,标记和移除操作都在对源图像的一次扫描中完成.新算法与传统算法间的效率对比同时在第二章给出.利用新的成分标记算法,本文第三章提出了一种从英文科技文档图像中提取数学公式的新方法.首先利用整幅文档图像的统计数据计算出用于分类的基准参数,然后利用局部极大成分的水平投影数据进行初步的行分割,再利用每行的竖直投影数据将每行的符号分成数个子区域.对每一个子区域依据其性质利用基准参数进行分类,通过对特定类别子区域的适当合并,最终得到文档图像中公式的位置.新方法可以用于处理图文混排的文档图像,能够降低文档中的图片和表格等元素对于公式定位结果的影响.第四章介绍了新系统中采用的数学公式识别及重组算法.新系统利用Zernike距提取字符的特征,由自组织特征映射(SOFM)神经网络和BP神经网络组成多分类器进行符号识别.为了分割图像中存在的粘连字符,系统引入了一种基于改进后的SOFM神经网络的粘连字符分割算法.第四章还介绍了一种基于LL(1)文法的数学公式重构算法.通过应用LL(1)文法,系统最终能够将识别结果保存为L~AT_EX格式字符串.在本文的最后部分,分析了系统中仍然存在的问题,并讨论了新系统未来的扩展方向.
|
全文目录
摘要 4-6 Abstract 6-11 1 绪论 11-29 1.1 文档图像分析概述 11-13 1.2 文档图像分析的相关技术 13-19 1.2.1 图像预处理 13-14 1.2.1.1 去除噪声 13 1.2.1.2 二值化 13-14 1.2.1.3 倾斜矫正 14 1.2.2 粘连字符分割 14-15 1.2.3 连通成分标记 15-16 1.2.4 版面分析和逻辑结构分析 16-17 1.2.5 特征提取 17 1.2.6 光学字符识别 17-18 1.2.7 文档重建 18-19 1.3 数学公式识别 19-26 1.3.1 概述 19 1.3.2 文档图像中数学公式的定位 19-25 1.3.3 数学公式的识别与重建 25-26 1.4 本文的主要工作 26-29 2 局部极大成分和标记算法 29-45 2.1 灰度图像二值化 29 2.2 连通和轮廓的定义 29-30 2.3 轮廓追踪 30-31 2.4 连通成分标记 31-34 2.4.1 经典连通成分标记算法 31-32 2.4.2 利用轮廓追踪技术的连通成分标记算法 32-34 2.4.3 并行连通成分标记算法 34 2.5 连通成分所在矩形标记 34-35 2.6 局部极大成分标记 35-41 2.6.1 局部极大成分的定义 35-37 2.6.2 局部极大成分标记算法 37-38 2.6.3 判断像素是否位于某个局部极大成分 38-40 2.6.4 成分标记算法的部分并行化 40-41 2.7 对比实验 41-43 2.7.1 模拟算法在多CPU环境中的运行情况 41-42 2.7.2 实验结果 42-43 2.8 小结 43-45 3 文档图像中数学公式子图像的定位 45-65 3.1 概述 45-47 3.2 公式字图像定位算法详细流程 47-53 3.2.1 分栏图像分割 47 3.2.2 提取基准行 47-48 3.2.3 文档图像的行分割与行合并 48-50 3.2.4 图片(封闭边界表格)标记 50-51 3.2.5 文本行处理 51-53 3.2.5.1 成分排序及行内分割 51 3.2.5.2 子区域分类 51-52 3.2.5.3 生成最终公式标记结果 52-53 3.3 公式定位实验结果 53-57 3.4 与InftyReader的对比实验 57-63 3.4.1 对比实验环境以及样本的准备 57-59 3.4.2 对比实验结果分析 59-63 3.5 小结 63-65 4 基于人工神经网络的数学公式识别、分析和重建 65-91 4.1 人工神经网络概述 65-67 4.2 数学公式识别中涉及的人工神经网络 67-80 4.2.1 自组织特征映射神经网络 67-69 4.2.1.1 网络拓扑结构及输入、输出 68-69 4.2.1.2 学习过程及权值更新规则 69 4.2.2 BP神经网络 69-78 4.2.2.1 网络拓扑结构及输入、输出 69-71 4.2.2.2 学习过程及权值更新规则 71-72 4.2.2.3 关于梯度法收敛性的讨论 72-78 4.2.3 主成分分析神经网络 78-80 4.2.3.1 网络拓扑结构及输入、输出 78 4.2.3.2 学习过程及权值更新规则 78-80 4.3 数学公式中符号的识别 80-87 4.3.1 符号的分离 80-83 4.3.2 符号特征的提取 83-85 4.3.2.1 字符图象归一化 83 4.3.2.2 应用Zernike矩进行特征提取 83-85 4.3.3 符号识别 85-87 4.4 利用上下文无关文法实现数学公式的重建 87-89 4.5 小结 89-91 结论 91-93 系统总结 91-92 未来应用 92-93 参考文献 93-99 附录A: 数学符号集 99-101 附录B: 描述数学公式的文法规则 101-103 附录C: 预测分析表 103-105 附录D: 预测分析程序的流程图 105-107 攻读博士学位期间发表学术论文情况 107-109 论文创新点摘要 109-111 致谢 111-113
|
相似论文
- 印刷体数学公式识别的研究与实现,TP391.41
- 基于支撑笔画的视觉文档图像透视失真校正,TP391.41
- 数学表达式结构分析的后处理研究,TP391.4
- OCR图像采集参数自动选择的研究,TP391.41
- 复杂的中文文档图像版面分析研究,TP391.41
- 印刷体数学表达式定位技术研究,TP391.41
- 基于Gabor理论的脱机手写汉字识别,TP391.43
- 汽车轮毂型号自动识别系统,TP391.41
- 基于虚拟仪器的芯片识别系统研究,TP391.41
- 基于半阈值的字符分割与识别研究,TP391.41
- Web验证码的生成与识别,TP393.092
- 基于非OCR的车牌识别系统,TP391.41
- 印刷体数学表达式识别系统的设计与实现,TP391.4
- 印刷体数学公式识别的研究,TP391.1
- 基于机器视觉的字符识别技术研究,TP391.41
- 基于人工神经网络的光学字符识别系统及硬件实现,TP391.4
- 脱机手写阿拉伯文切分算法及多队列基元合并模型,TP391.1
- 汽车牌照识别系统的研究与初步实现,TP391.41
- 基于视频和DSP的车辆识别测速系统,TP29
- 印刷体数学公式识别系统的设计与实现,TP391.4
- 基于OCR的支票影像票面要素合法性校验方法研究,TP391.41
中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 模式识别与装置 > 文字识别及其装置
© 2012 www.xueweilunwen.com
|