学位论文 > 优秀研究生学位论文题录展示
基于Web的竞争信息抽取研究
作 者: 王奔
导 师: 王大震
学 校: 湖北工业大学
专 业: 计算机应用技术
关键词: Web 信息抽取 实体信息 抽取规则 竞争信息
分类号: TP391.1
类 型: 硕士论文
年 份: 2010年
下 载: 24次
引 用: 0次
阅 读: 论文下载
内容摘要
|
21世纪的社会正随着互联网和个人计算机迅速发展,得益于此,互联网上流通的信息也在不断地增长,并已经成为当今人类工作和生活中紧密联系的一部分。与此同时,由于万维网是一个虚拟的“自由平台”,所以舆论自由使得互联网上的信息迅猛增长。基于Web的开发和应用也越来越频繁。这与不断发展的网络相得益彰。然而随着网络信息的不断丰富,如何从浩瀚如海的网络信息中获取我们需要的信息成为一个大家都很关心的课题。随后,各式各样的搜索引擎浮出了市面。它们向用户提供了简易方便的检索服务。人们可以从中检索中查询到自己需要的信息。然后随着用户对信息准确度需求的不断提高。如何能够保证查准率的前提下,又能够提高查询的效率和查全率成了现有检索系统的一个难题。这种高效的检索对于用户来说具有重大的意义。基于Web的关于实体信息抽取研究正是解决如何在海量Web信息中找到用户需要的实体信息的一项技术。本文着重研究了实体关系的抽取。鉴于现代社会的迅速发展带来了无处不在的竞争。作者将重点更加细致的定位于同类型实体信息的抽取(即竞争信息的抽取)。丰富网络资源使竞争信息挖掘成了可能。目前看来,无论是对商家制定策略或是研究学者钻研某一课题,同类实体信息的挖掘都显的十分重要。然后现有的搜索引擎并没有这样的功能,用户需要对查询出的每个结果页面进行理解和阅读。消耗了大量的时间,而且达到效果不能令人满意。作者在这样的背景下,提出了一种以输入实体信息为前提的查询其竞争详细信息的算法CoSorter.它可以运用一些特定的语法结构,抽取到不同实体信息之间的关系。本文的任务是从网页中自动抽取给定实体的竞争者名字,经验证分析正确可行,并具有一定应用价值。使得之前的抽取工作变得非常有意义。
|
全文目录
摘要 4-5 Abstract 5-6 目录 6-8 第1章 引言 8-15 1.1 信息抽取研究背景 8-10 1.1.1 Web1.0的发展 10 1.2 国内外研究现状及分析 10-13 1.2.1 Web信息抽取的历史 10-11 1.2.2 Web信息抽取的相关技术 11-13 1.3 主要研究内容 13-14 1.4 本章小结 14-15 第2章 Web信息抽取及相关技术 15-27 2.1 HTML的介绍 15 2.2 XML的介绍 15-18 2.3 XHTML的介绍 18-19 2.4 XPATH的介绍 19-22 2.5 XSLT介绍 22-24 2.6 XML访问以及DOM树形结构 24-27 第3章 Web网页自动批量获取方法 27-35 3.1 GOOGLE WEB API(GWA) 27-28 3.2 网络中页面内容抽取具体过程 28-29 3.3 正则表达式(REGULAR EXPRESSION) 29-31 3.4 WEB信息自动抽取算法 31-32 3.5 WEB页面信息抽取成果 32-35 3.5.1 建立小型搜索引擎 32 3.5.2 获取URL 32-33 3.5.3 抽取相应Web页面 33 3.5.4 正则表达式校对URL 33-35 第4章 基于Web的竞争对手挖掘 35-47 4.1 简介 35-36 4.2 实现策略 36-37 4.2.1 实体信息检索与收集 36 4.2.2 专业术语提取 36 4.2.3 差异性检索及信息提取 36-37 4.3 利用网络渠道检索竞争对手资源 37 4.4 算法的设计 37-40 4.4.1 竞争者载体信息收集 38 4.4.2 竞争对手排序及筛选 38-39 4.4.3 竞争实体名过滤 39-40 4.5 利用网络渠道检索竞争领域 40-42 4.5.1 收集竞争领域信息 40 4.5.2 竞争领域特征参数 40-41 4.5.3 竞争领域筛选 41-42 4.6 基于网络的竞争依据查找 42-44 4.6.1 竞争依据的全面性分析 42-43 4.6.2 CoSorter算法优化模型 43-44 4.6.3 CoSorter算法的实验验证 44 4.7 模拟实验 44-46 4.7.1 竞争对手抽取结果评估 45 4.7.2 竞争领域挖掘结果评估 45 4.7.3 竞争依据抽取结果评估 45-46 4.7.4 领域约束下的竞争对手挖掘 46 4.8 总结 46-47 第五章 总结与展望 47-48 5.1 本文总结 47 5.2 未来工作的展望 47-48 参考文献 48-52 致谢 52-53 附录 攻读学位期间发表的主要科研成果 53
|
相似论文
- 基于用户兴趣特征的图像检索研究与实现,TP391.41
- 领域实体属性及事件抽取技术研究,TP391.1
- 隐式用户兴趣挖掘的研究与实现,TP311.13
- 时间表达式识别与归一化研究,TP391.1
- 基于WEB的仿真互操作性测试工具研究,TP391.9
- LXI仪器Web接口开发,TP274
- LXI计数器研制,TP274
- 面向服务的多主体协作机制的研究与实现,TP393.09
- 基于模型的Web测试技术研究与应用,TP311.53
- 面向RIA开发模型的研究,TP311.5
- 面向业务过程的服务动态组合方法研究,TP393.09
- 基于本体的语义检索研究,TP391.3
- 面向服务的Web报表的研究与设计,TP393.09
- 基于面向服务架构的公众信息系统在新农村信息化建设中的应用研究,TP393.09
- 基于嵌入式Web服务器的监控系统研究,TP393.05
- 一种基于领域本体的语义Web服务匹配和组合方法,TP393.09
- 面向主题的Web文档自动文摘生成方法研究,TP391.1
- 基于BMC的Web服务失配检测方法研究,TP311.52
- Web使用挖掘与网页个性化服务推荐研究,TP311.13
- 基于兴趣度的Web日志用户访问序列模式挖掘,TP311.13
- 基于嵌入式Web技术的动态应变仪研究与实现,TP368.1
中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 文字信息处理
© 2012 www.xueweilunwen.com
|