学位论文 > 优秀研究生学位论文题录展示

一种基于语义标注的个性化搜索技术的研究与实现

作 者: 李兴钦
导 师: 王大玲
学 校: 东北大学
专 业: 计算机系统结构
关键词: 搜索引擎 语义网 语义标注 倒排索引 分词
分类号: TP391.3
类 型: 硕士论文
年 份: 2009年
下 载: 79次
引 用: 0次
阅 读: 论文下载
 

内容摘要


万维网改变了人们彼此交流的方式,然而绝大部分现有的网络内容只适合于人工处理,虽然一些软件工具在一定程度上改善了人类的交流方式,但是在某些方面还有些欠缺,例如:搜索结果主要是基于关键字的频度而非语义,高匹配低精度,低匹配或无匹配,检索结果对词汇高度敏感,基于关键字搜索却不能得到想要的结果,检索结果是单一的网页等等。即使搜索结果是成功的,用户必须自己浏览搜索得到的文档,从中提取所需的信息。其原因是,缺少计算机能够理解的语义信息。语义网(Semantic Web)被称作是下一代Web的存在形式,是万维网的延伸,不仅可用自然语言表现网络内容,而且这些内容还可以被软件代理人所阅读和使用,因此,语义网被认为是一种数据、信息和知识交换的万有媒介,可以用来解决网络中计算机语义的问题。语义网作为一种数据表示和共享的形式,为搜索引擎提供了含有语义的数据,可以利用语义网的技术实现语义搜索,搜索的结果是对用户查询请求在语义分析后做出的反应,而不仅仅是关键字的匹配。本文应用语义网技术,建立了一种基于语义标注的搜索模型,该模型构建了一个领域本体,将抓取的相关网页进行语义标注产生元数据,对元数据建立索引,能有效地改善搜索结果,使搜索精确度提高,更加满足用户的语义需求。论文以语义搜索引擎的分析、设计、研究与实现为主体,利用网页预处理技术抓取网页的文本信息并分词。然后讨论领域本体构建的可行性与有效性,并在此基础上实现语义分析与标注,产生语义元数据,对其工作机制、使用技术、实现方法等方面进行了详尽而全面的分析与研究,对产生的元数据基于现有的倒排索引技术建立语义索引,对输入关键字进行预处理,形成形式化的查询语句后进行检索。实验测试证明了这种方法在搜索精度上较传统方法具有一定的改进和提高,搜索结果更加接近用户要求。

全文目录


摘要  5-6
Abstract  6-10
第1章 绪论  10-16
  1.1 问题提出  10
  1.2 国内外研究现状  10-15
    1.2.1 信息提取技术简介  10-11
    1.2.2 语义Web  11-13
    1.2.3 Web语义搜索研究现状  13-14
    1.2.4 语义标注的意义  14-15
  1.3 本文的研究目标和研究内容  15
  1.4 本文的组织结构  15-16
第2章 面向搜索的语义标注模型设计  16-28
  2.1 系统工作流程设计  16-18
  2.2 本体概念检索语言  18-20
  2.3 问句成分与查询结构的映射关系  20-22
  2.4 语义检索策略  22-26
    2.4.1 查询关键词扩展  22
    2.4.2 本体概念词汇的扩展方式  22-23
    2.4.3 概念的匹配过程  23-26
  2.5 本章小结  26-28
第3章 支持语义标注的网页预处理  28-34
  3.1 相关理论与技术  28-30
    3.1.1 网页去噪技术  28
    3.1.2 分词技术  28-30
  3.2 网页预处理  30-31
    3.2.1 内容提取  30-31
    3.2.2 语义信息提取  31
  3.3 文本分词  31-32
  3.4 本章小结  32-34
第4章 本体构建及语义标注  34-48
  4.1 相关理论与技术  34-38
    4.1.1 本体及其功能  34-37
    4.1.2 语义标注概述  37
    4.1.3 现有的标注方法  37-38
  4.2 本体构建  38-41
    4.2.1 Movie本体的结构设计  39-41
    4.2.2 Movie本体的形式化  41
  4.3 语义标注  41-46
    4.3.1 语义标注元数据存在形式  41-43
    4.3.2 语义标注策略  43-46
  4.4 本章小结  46-48
第5章 语义索引及检索  48-56
  5.1 相关理论与技术  48-50
    5.1.1 网络信息检索  48-49
    5.1.2 倒排索引  49-50
  5.2 建立语义索引  50-52
    5.2.1 查询预处理  50-51
    5.2.2 建立索引  51-52
  5.3 语义检索  52-54
  5.4 本章小结  54-56
第6章 实验及结论  56-62
  6.1 实验数据  56-59
    6.1.1 语义标注产生元数据  56-58
    6.1.2 建立索引  58-59
  6.2 实验结果及分析  59-61
    6.2.1 全文搜索与语义搜索的查询实例比较  59-60
    6.2.2 全文搜索与语义搜索的查询结果比较  60-61
  6.3 本章小结  61-62
第7章 结束语  62-64
  7.1 本文的主要工作  62
  7.2 进一步的研究工作  62-64
参考文献  64-66
致谢  66-68
攻硕期间参与项目及发表的论文  68

相似论文

  1. 网络搜索引擎的相关技术研究,G354
  2. 基于语义网络的智能搜索引擎研究,TP391.3
  3. 搜索引擎服务提供商版权侵权责任认定标准探讨,D923.41
  4. 基于Web搜索和网页结构分析的IT相关主题新闻抓取研究,TP393.092
  5. 基于条件随机场的中文分词技术的研究与实现,TP391.1
  6. 基于SNS的教育视频细粒度标注研究与实现,TP391.6
  7. 主观题自动评分技术研究,TP391.1
  8. 情景应对模式下数字化应急预案的语义模型研究,TP391.1
  9. 分布式搜索引擎索引安全及缓存策略研究,TP333
  10. 基于WebHarvest的中文财经新闻搜索引擎的设计与实现,TP311.52
  11. 中文XML压缩技术研究,TP311.11
  12. 基于大规模模糊RDF数据的推理引擎,TP181
  13. 图像语义标注中的块—全局特征提取方法研究,TP391.41
  14. 语义网自动构建中句法分析的研究,TP391.1
  15. 人体运动序列数据的语义化分析方法研究,TP391.1
  16. 基于字词联合解码的中文分词研究,TP391.1
  17. 企业邮件监管系统的设计与实现,TP393.098
  18. 教育培训行业互联网营销问题的研究,F49
  19. 搜索引擎侵权行为研究,D923
  20. 基于Web数据挖掘的个性化搜索引擎研究,TP391.3
  21. 基于Agent元搜索引擎的个性化研究,TP391.3

中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 检索机
© 2012 www.xueweilunwen.com