学位论文 > 优秀研究生学位论文题录展示
基于DOM的Web信息抽取系统设计与实现
作 者: 连小刚
导 师: 刘小峰
学 校: 华中科技大学
专 业: 软件工程
关键词: Web 信息抽取 可扩展标记语言 扩展样式表语言 文档对象模型
分类号: TP393.09
类 型: 硕士论文
年 份: 2009年
下 载: 122次
引 用: 0次
阅 读: 论文下载
内容摘要
|
Internet的快速发展使Web已经成为人们获取信息的主要途径,但是随着网页数量的激增和无关信息的充斥,使得人们想快速准确地获取自己需要的信息变得十分困难。同时随着“模板+数据库”型网页的大量出现,Internet上出现了被称为“暗藏网”(the hidden web)的巨大信息资源库,据估计因特网上80%的内容存在于这种看不见的因特网中,这些网页是搜索引擎的“网络爬虫”抓不到的。加之,Internet上的各个网站的信息相互独立,收集起来十分困难,在这种情况下,通常的搜索引擎发挥的作用微乎其微,而Web信息抽取技术显得十分必要。通过对现有信息抽取技术的总结和分析,结合“模板+数据库”型网页的特点,提出了基于DOM结构,利用XPath表述网页待抽取信息点的位置,用XSLT描述抽取规则的半自动化的抽取方案。并在此基础上,实现了一个抽取规则适用性较强,自动化程度较高的Web信息抽取系统。系统的实现分为样本学习、信息抽取和数据库存储三个阶段来完成。其中学习阶段是系统实现的关键点和难点,在该阶段,通过叶子节点路径获取算法、数据区域获取算法、语义获取算法和路径优化算法的设计与实现,同时利用强大而灵活的XSLT,生成健壮、适应性强的抽取规则文件。在信息抽取阶段,系统利用URL模式匹配和DOM相似性算法,实现待抽取网页和抽取规则文件的自动匹配。同时为了解决自动化和准确度的平衡问题,系统提供操作简单的GUI界面,支持人工的指导训练,经过测试,系统对于“模板+数据库”型网页有较好的抽取效果。
|
全文目录
摘要 3-4 Abstract 4-7 1 绪论 7-13 1.1 研究背景 7-8 1.2 国内外概况 8-11 1.3 论文的主要工作 11-12 1.4 论文的组织结构 12-13 2 相关技术概述 13-23 2.1 Web 抽取技术 13-19 2.2 系统涉及的技术标准 19-22 2.3 本章小结 22-23 3 系统设计 23-32 3.1 系统设计目标 23-24 3.2 系统整体设计 24-30 3.3 本章小结 30-32 4 系统实现 32-54 4.1 网页预处理 32-36 4.2 样本学习 36-48 4.3 信息抽取 48-51 4.4 数据库存储 51 4.5 交互界面 51-53 4.6 本章小结 53-54 5 系统测试 54-58 5.1 测试指标介绍 54-55 5.2 测试结果与分析 55-57 5.3 本章小结 57-58 6 总结与展望 58-60 6.1 全文总结 58 6.2 展望 58-60 致谢 60-61 参考文献 61-64
|
相似论文
- 基于用户兴趣特征的图像检索研究与实现,TP391.41
- 领域实体属性及事件抽取技术研究,TP391.1
- 隐式用户兴趣挖掘的研究与实现,TP311.13
- 时间表达式识别与归一化研究,TP391.1
- 基于WEB的仿真互操作性测试工具研究,TP391.9
- LXI仪器Web接口开发,TP274
- LXI计数器研制,TP274
- 面向服务的多主体协作机制的研究与实现,TP393.09
- 基于模型的Web测试技术研究与应用,TP311.53
- 面向RIA开发模型的研究,TP311.5
- 面向业务过程的服务动态组合方法研究,TP393.09
- 基于本体的语义检索研究,TP391.3
- 面向服务的Web报表的研究与设计,TP393.09
- 基于面向服务架构的公众信息系统在新农村信息化建设中的应用研究,TP393.09
- 基于嵌入式Web服务器的监控系统研究,TP393.05
- 一种基于领域本体的语义Web服务匹配和组合方法,TP393.09
- 面向主题的Web文档自动文摘生成方法研究,TP391.1
- 基于BMC的Web服务失配检测方法研究,TP311.52
- Web使用挖掘与网页个性化服务推荐研究,TP311.13
- 基于兴趣度的Web日志用户访问序列模式挖掘,TP311.13
- 基于嵌入式Web技术的动态应变仪研究与实现,TP368.1
中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 计算机网络 > 一般性问题 > 计算机网络应用程序
© 2012 www.xueweilunwen.com
|