学位论文 > 优秀研究生学位论文题录展示
农业复杂自适应搜索模型研究及实现
作 者: 黄河
导 师: 王儒敬
学 校: 中国科学技术大学
专 业: 模式识别与智能系统
关键词: 复杂自适应系统 垂直搜索引擎 网络资源发现 深度网页 用户个性化 网页结构化数据抽取 形式化概念分析
分类号: TP391.3
类 型: 博士论文
年 份: 2010年
下 载: 218次
引 用: 2次
阅 读: 论文下载
内容摘要
|
截止2009年底,互联网上的涉农网站已超过30000个,积累了丰富的农业技术、市场信息、政策法规、农业新闻等信息资源。然而由于互联网信息资源缺少统一的形式化表达,信息异质、异构、分散、重复现象严重,形成“信息孤岛”,很难发挥农业信息资源的集成效用。同时,由于农户文化水平、计算机操作能力的限制,“三农”用户很难使用传统的搜索工具去直接交互、捕捉和筛选个性化信息。面对海量的农业信息资源,“三农”用户只能望洋兴叹,“信息淹没”问题严重。因此,建立专业化、个性化、智能化的农业搜索模型及相应的搜索引擎系统意义重大。本文针对互联网的开放性、分散性、层次性、演化性、巨量性等本质特性,提出了一种农业复杂自适应搜索模型。该模型建立农业信息资源发现、信息获取、信息处理与用户服务主体联盟,通过主体与网络资源、主体与网页内容和网页表现形式、主体与用户个性化需求之间的学习与适应机制,实现对复杂、动态的互联网环境的适应,从而提高农业搜索引擎的查全率与查准率,解决新一代搜索引擎面临的核心问题。针对农业互联网资源的动态性和高度分散性特点,本文提出了AADWED(Adaptive Agriculture Deep Web Entry Discovery)算法,一种自适应农业领域Deep Web资源发现算法。该算法通过不断从样本中学习到合适的查询表达式提交给通用搜索引擎来高效获取领域Deep web资源入口页面。实验证明,该算法大幅度提高农业领域Deep Web资源发现的收益率。针对对Web站点页面表现形式具有多样性、动态性等特点,本文提出了一种自适应的Web结构化数据提取算法。该算法在MDR算法的基础上,提出了一种基于相对熵的页面去噪算法,从而提高了Web结构化数据抽取的准确率。针对互联网存在的大量农业领域数据描述不统一、不完整、冗余等问题,本文重点研究了农产品价格、供求等信息的空间属性自动标注和基于语义的数据冗余处理问题,提高了数据的质量和可用性,为进行精确检索和可视化分析服务提供了基础。针对不同Web用户的个性化需求,本文提出了一种基于FCA的自动挖掘用户兴趣主题算法。挖掘出的兴趣主题模式被描述成一组形式化概念,兴趣主题模式之间的联系被显示的在概念格中描述出来,利于用户理解。本文还提出了一种文档和用户感兴趣主题相关度的计算方法。通过对比实验,证明该方法是有效的。最后,本文基于所提出的农业复杂自适应搜索模型,设计并实现了农业垂直搜索引擎系统“中国搜农”,该系统已经开始大规模对外公开服务,并已在多个省市得到推广和应用。
|
全文目录
摘要 5-7 ABSTRACT 7-11 第1章 绪论 11-27 1.1 研究背景与意义 11-21 1.1.1 互联网与搜索引擎 11-15 1.1.2 农业互联网资源现状 15-18 1.1.3 本课题研究意义 18-21 1.2 国内外研究现状 21-23 1.2.1 专业化搜索模型 21 1.2.2 个性化搜索模型 21-22 1.2.3 自适应搜索模型 22-23 1.3 农业复杂自适应搜索模型 23-26 1.3.1 复杂自适应系统 23 1.3.2 农业复杂自适应搜索模型 23-26 1.4 本文主要内容及章节安排 26-27 第2章 自适应农业Deep Web资源发现模型 27-47 2.1 引言 27-30 2.2 AADWED算法框架 30-44 2.2.1 算法思想 30-32 2.2.2 基本定义 32 2.2.3 问题的形式化 32-33 2.2.4 算法描述 33-44 2.3 实验评估 44-46 2.3.1 实验设置 44 2.3.2 实验算法 44-45 2.3.3 实验结果分析 45-46 2.4 小结 46-47 第3章 农业Web结构化数据智能获取与处理 47-71 3.1 自适应农Web结构化数据提取 47-56 3.1.1 Web结构化数据 47-49 3.1.2 相关工作 49-51 3.1.3 自适应Web结构化数据提取 51-56 3.2 农业领域Web智能数据处理 56-70 3.2.1 空间属性标注 57-63 3.2.2 冗余数据处理 63-70 3.3 小结 70-71 第4章 农业Web用户个性化建模 71-88 4.1 引言 71-73 4.2 相关工作 73 4.3 基本知识 73-76 4.3.1 基本定义 74 4.3.2 FCA形式化概念分析 74-76 4.4 利用FCA方法挖掘用户信息 76-81 4.4.1 利用FCA方法挖掘用户兴趣主题模式 76-77 4.4.2. 用户兴趣主题模式 77-79 4.4.3. 挖掘用户的兴趣主题算法 79 4.4.4. 计算模式权重 79-81 4.5 测量文档与用户兴趣主题的相关度 81-84 4.6 实验 84-87 4.7 本章小结 87-88 第5章 农业垂直搜索引擎系统设计与实现 88-103 5.1 农业垂直搜索引擎系统概述 88-91 5.1.1 硬件配置 89 5.1.2 体系结构 89-91 5.2 农业垂直搜索引擎系统设计 91-102 5.2.1 Web采集子系统 91-94 5.2.2 Web数据处理子系统 94-95 5.2.3 可视化分析子系统 95-100 5.2.4 检索子系统 100-102 5.3 总结 102-103 第6章 结论与展望 103-105 参考文献 105-111 致谢 111-112 读博期间获得的学术成果 112
|
相似论文
- 个性化多媒体资源垂直搜索引擎技术研究,TP391.3
- 基于深度网页爬虫搜索引擎原型的研究和实现,TP391.3
- 面向交易信息的垂直搜索引擎搜索机制研究与实现,TP391.3
- 基于粗糙集的数据分析模型及其在垃圾邮件过滤中的应用,TP311.13
- 开放式复杂自适应系统动力学及其在经济学中的应用,F224
- 基于Multi-Agent的供应链不确定性仿真研究,F274
- 基于Nutch的漏洞垂直搜索引擎,TP391.3
- 企业信息搜索引擎的设计与关键技术的研究,TP391.3
- 基于计算实验的供应链不确定性建模及其优化研究,F274
- 基于关联规则的知识点智能导航的研究,TP393.092
- 垂直搜索引擎中的网页对象抽取模型及实现技术研究,TP391.3
- 用户个性化建模的研究及其在游戏式学习系统中的应用,TP391.6
- 基于CAS理论和ASP技术的供应链系统动力学研究,F224
- 基于模糊聚类的个性化搜索引擎的研究,TP391.3
- 基于Web的个性化信息检索研究,TP393.09
- 基于Multi-agent仿真的IPO首日价格走势研究,F224
- Ad Hoc按需加权自适应(AOW)算法的改进研究,TN929.5
- 基于Web的网络搜索技术研究,TP391.3
- 地区电业局大用户配电工程项目个性化管理研究,F407.61
- 企业信息系统软件构架及开发过程研究,TP311.52
- 教学研究起点的反思与重构,G424
中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 检索机
© 2012 www.xueweilunwen.com
|