学位论文 > 优秀研究生学位论文题录展示
企业关系挖掘技术研究
作 者: 郭凯
导 师: 刘远超
学 校: 哈尔滨工业大学
专 业: 计算机科学与技术
关键词: 信息抽取 Ontology 企业关系 本体构建 语义推理
分类号: TP391.1
类 型: 硕士论文
年 份: 2010年
下 载: 17次
引 用: 0次
阅 读: 论文下载
内容摘要
|
随着互联网电子商务的兴起,越来越多的企业将企业信息发布在网络上。这种渠道使企业的经营市场不再受时间和空间的限制,各企业无论大小拥有一样的信息资源。但是对于企业而言,如何从浩瀚的Internet上获取感兴趣的企业信息,如何寻找企业的潜在竞争对手及潜在合作企业,对企业的经营决策和生存发展都有着极其重要的意义,企业关系挖掘技术研究就是在这一环境下产生的。本文的研究工作包含两方面内容:企业信息抽取和关系挖掘。本文利用了基于DOM的抽取方法抽取企业信息。首先利用网络爬虫从企业门户网站爬取企业网页,由于来自同一个网站的网页在结构上具有很大的相似性。本文利用DOM Tree对企业网页进行解析,首先借用HTML Tidy将HTML格式网页转化为XML格式,然后根据规则进行信息节点定位,抽取需要的企业数据信息。在关系挖掘上尝试了两种方法:基于文本相似度的方法和基于领域Ontology的方法。基于文本相似度的方法利用抽取的部分企业信息作为代表企业的文本,将企业间的文本相似度值作为判定企业竞争关系的依据。本文中以向量空间模型表示企业文本并进行文本相似度计算,并基于此方法进行了实验验证。基于领域Ontology的企业关系挖掘首先对所分析的产品领域构建领域本体,本文详细分析了领域本体的构建过程并借助斯坦福大学开发的Protégé本体构建工具针对计算机领域构建了一个Ontology,并利用Jena解析Ontology文件。通过设定规则对产品的关系产品进行推理查询,针对企业产品查询其相关联产品。因为企业关系通常体现在企业经营产品的关系上,本文中借助Ontology推理出的产品关系判定企业关系。实验证明,这种方法相比基于文本的方法在准确率和召回率上都有显著提高。
|
全文目录
摘要 4-5 Abstract 5-9 第1章 绪论 9-18 1.1 课题背景和意义 9-10 1.2 国内外相关技术研究现状 10-15 1.2.1 关于Web信息抽取 10-11 1.2.2 关于领域Ontology的构建 11-13 1.2.3 关于Ontology的应用 13-15 1.3 本课题的主要研究内容 15-18 第2章 企业元信息抽取 18-26 2.1 企业元信息和抽取思想 18-20 2.2 基于DOM的企业Web信息抽取 20-25 2.2.1 基于XML的信息表示 20-22 2.2.2 HTML Tidy网页规范化 22 2.2.3 企业Web信息解析 22-24 2.2.4 企业类型分类 24-25 2.3 本章小结 25-26 第3章 基于文本的企业关系挖掘 26-30 3.1 企业信息文本化 26 3.2 企业文本相似度计算 26-28 3.2.1 文本的向量空间表示 26-28 3.2.2 文本特征词选取 28 3.3 实验及结果分析 28-29 3.4 本章小结 29-30 第4章 计算机领域本体构建 30-44 4.1 资源描述框架 30-34 4.1.1 Ontology关系描述 30-31 4.1.2 资源描述语言 31-33 4.1.3 Ontology描述语言 33-34 4.2 计算机领域本体构建 34-40 4.2.1 确定本体的领域与范围 34-35 4.2.2 列举重要术语和概念 35-36 4.2.3 建立本体框架 36-37 4.2.4 定义概念间关系 37-38 4.2.5 对领域本体编码形式化 38-40 4.2.6 本体的检验和评价 40 4.3 使用Protege构建领域本体 40-42 4.3.1 本体构建过程 40-42 4.4 本章小结 42-44 第5章 基于Ontology的企业关系挖掘 44-51 5.1 系统框架设计 44-45 5.2 Ontology文件解析 45-47 5.2.1 Ontology概念间关系解析 45-47 5.3 产品关系推理 47-49 5.4 基于产品关系判定企业关系实验 49-50 5.5 本章小结 50-51 结论 51-52 参考文献 52-57 致谢 57
|
相似论文
- 领域实体属性及事件抽取技术研究,TP391.1
- 时间表达式识别与归一化研究,TP391.1
- 猪链球菌2型感染小鼠腹腔巨噬细胞基因表达谱差异分析,S858.91
- 网页属性抽取的方法研究,TP391.1
- 英文文本中命名实体识别及关系抽取技术研究,TP391.1
- 构件垂直搜索引擎的关键技术研究,TP391.3
- 面向教育新闻的主题爬虫设计与实现,TP391.3
- 基于GPU图像搜索中文本检索的关键技术研究,TP391.1
- 学术主页信息抽取系统的研究,TP393.092
- 主题搜索引擎关键技术研究,TP391.3
- 一种基于动态学习框架的全自动网页结构化数据抽取方法,TP393.092
- 基于自然语言打印机人机交互方法研究与实现,TP11
- 基于关系数据库的本体半自动构建方法,TP311.13
- 模板独立的网页信息抽取研究,TP393.092
- 面向互联网的多元信息获取技术研究,TP393.09
- 本体构建中概念和关系获取方法研究,TP391.1
- “Being”、“Ontology”、“Metaphysics”的内涵及关系,B5
- 基于模糊神经网络构建英语情态动词can的语义推理模型,H313
- 网络舆情数据获取与话题分析技术研究,TP393.09
- 基于DOM的Web信息抽取系统设计与实现,TP393.09
- 一种基于前缀表达式的Web信息抽取方法的关键问题的实现,TP391.1
中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 文字信息处理
© 2012 www.xueweilunwen.com
|