学位论文 > 优秀研究生学位论文题录展示
多源数据清洗策略研究及在财政部门预算中的应用
作 者: 高旻
导 师: 郭玉东
学 校: 解放军信息工程大学
专 业: 计算机应用技术
关键词: 数据质量问题 数据清洗 财政部门预算
分类号: TP311.13
类 型: 硕士论文
年 份: 2009年
下 载: 38次
引 用: 0次
阅 读: 论文下载
内容摘要
|
目前,各地财政部门都在进行金财工程大系统建设的探索工作,把分散在各个信息孤岛上的财政数据转换成集成统一的数据,最大限度的实现对财政资源的整合,而在这个过程中需要运用适宜的数据清洗策略,为财政预算编制与决策提供准确、一致、完整的信息。本文首先概述了金财工程和数据仓库技术,而后从分析数据质量问题开始,引出数据清洗的相关原理,并着重讨论了对不同数据质量问题采取的不同数据清洗策略。随后,本文描述了多源数据清洗在构建财政部门预算数据平台中的应用,并详细阐述了引入了数据清洗模块的数据抽取、转化和装载应用模型,通过对数据平台应用的整体架构的探讨,为财政预算数据仓库提供一个高效的数据平台。重点研究了数据抽取、转化和装载工具数据清洗策略的实现,并针对财政部门预算数据的特点,改进了相似重复记录清洗的算法。一是改进了记录匹配的计算方法,运用了与阀值相结合的相对文本编辑距离素计算文本相似度,解决了一部分拼写错误和大部分新老身份证号码的识别;二是运用不同关键字执行两趟基本近邻排序,提高了重复记录的检出;三是采用可变窗口,提高了清洗效率。并且还描述了空缺值、单一状态列、非标准字段、不可信极端数据处理的在数据抽取、转化和装载工具数据清洗模块中的实现算法。同时,总结了数据抽取、转化和装载实施数据清洗的工作流程。本文最后运用人员管理信息库和财政统发工资数据库的部分数据对数据抽取、转化和装载工具数据清洗模快进行了测试,并通过相似重复记录清洗不同算法的比较,测试了本文改进基本近邻排序算法的性能。综合测试实验结果,数据抽取、转化和装载工具的数据清洗模快能够针对财政部门预算数据平台中不同的数据质量问题采用不同的数据清洗策略实施数据清洗,为财政部门预算解决了财政供给政策分析和支出预算政策调整的基础数据来源问题。
|
全文目录
表目录 6-7 图目录 7-8 摘要 8-9 ABSTRACT 9-10 第一章 引言 10-19 1.1 金财工程与财政部门预算 10-12 1.1.1 金财工程的主要框架 10-11 1.1.2 财政部门预算概述 11-12 1.2 数据仓库与数据清洗 12-16 1.2.1 数据仓库概述 13-14 1.2.2 数据仓库的架构 14 1.2.3 数据清洗的概念 14-15 1.2.4 数据清洗研究的现状 15-16 1.3 本文的主要工作 16-19 第二章 数据清洗相关理论 19-27 2.1 研究背景 19 2.2 数据质量 19-21 2.2.1 数据质量的定义 19 2.2.2 数据质量的衡量指标 19-20 2.2.3 数据质量问题 20-21 2.3 数据清洗的基本原理 21-27 2.3.1 数据清洗的要求及实现方式 21-23 2.3.2 数据清洗的一般步骤 23-24 2.3.3 数据清洗的质量评估 24-25 2.3.4 数据清洗框架模型概述 25-27 第三章 数据清洗的策略分析 27-34 3.1 属性清洗策略 27-29 3.1.1 自动检测属性错误 27-29 3.1.2 空缺值的清洗方法 29 3.1.3 错误值的清洗方法 29 3.1.4 不一致数据的清洗方法 29 3.2 相似重复记录清洗策略 29-34 3.2.1 属性选择与初步聚类 29-30 3.2.2 相似重复记录检测 30-31 3.2.3 数据库级的相似重复记录聚类 31-33 3.2.4 衡量相似重复记录清洗方法效率的度量标准 33-34 第四章 多源数据清洗在财政部门预算中的应用 34-47 4.1 财政部门预算数据平台应用分析 34-35 4.1.1 财政部门预算数据平台概述 34 4.1.2 财政部门预算业务需求分析 34-35 4.2 财政部门预算数据平台方案 35-37 4.2.1 总体结构概述 35-36 4.2.2 财政部门预算ETL 数据集成过程 36-37 4.3 ETL 工具的数据清洗功能 37-47 4.3.1 ETL 架构 37-38 4.3.2 多源数据的访问 38-39 4.3.3 数据访问端的主要功能 39-42 4.3.4 元数据管理与数据分发中心 42-44 4.3.5 ETL 的清洗转换组件 44-47 第五章 ETL 工具中数据清洗策略的实现 47-59 5.1 财政部门预算数据质量问题分析 47-48 5.2 数据清洗策略的实现 48-53 5.2.1 消除相似重复记录策略的改进 48-51 5.2.2 包含大量空缺值列的处理 51-52 5.2.3 单一状态列的处理 52 5.2.4 非标准字段的处理 52-53 5.2.5 不可信极端数据的处理 53 5.3 ETL 实施数据清洗的流程 53-59 第六章 测试及结果分析 59-62 6.1 测试实验环境 59 6.2 相似重复记录清洗测试与比较 59-60 6.3 ETL 工具数据清洗模块的测试 60-61 6.4 测试结果分析 61-62 结束语 62-63 参考文献 63-66 作者简历 攻读硕士学位期间完成的主要工作 66-67 致谢 67
|
相似论文
- RFID数据清洗处理策略与算法,TP391.44
- Deep Web数据清洗方法研究及应用,TP393.09
- Deep Web数据源下重复记录识别模型的研究,TP311.13
- 构件化数据清洗框架的研究与实现,TP311.13
- 基于多Agent的数据清洗系统的研究与实现,TP311.52
- 序列模式挖掘在医疗保险上的应用,TP311.13
- 无线电监测数据的采集及分析系统的设计与实现,TN98
- 基于特征优选的数据清洗方法研究,TP311.13
- 数据清洗方法研究及工具设计,TP311.13
- RFID数据清洗算法研究及中间件平台实现,TP391.44
- 基于软件总线模型的数据清洗系统的研究与实现,TP311.52
- 采油厂数据中心ETL系统研究与实现,TP311.52
- 民用航空维修工程能力评估及辅助决策支持系统开发研究,F426.5
- 基于神经网络的电力负荷数据清洗模型研究,TP311.13
- 基于蚁群优化的模糊文本聚类算法研究,TP391.1
- 基于聚类树的相似重复记录检测算法改进研究,TP311.13
- 学科团队竞争力分析与评价实证研究,F224
- 基于柔性统计系统的港口企业多维度统计模式构建,F552.3
- 基于知识建模的数据共享研究,TP311.13
- 数据挖掘技术在医院医保费用分析中的研究与应用,TP311.13
中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机软件 > 程序设计、软件工程 > 程序设计 > 数据库理论与系统
© 2012 www.xueweilunwen.com
|