学位论文 > 优秀研究生学位论文题录展示

基于Web日志挖掘的个性化服务研究与应用

作 者: 刘宇婷
导 师: 陈英
学 校: 北京理工大学
专 业: 计算机科学与技术
关键词: 个性化服务 推荐系统 信息论 聚类 Web日志挖掘 混合推荐
分类号: TP393.09
类 型: 硕士论文
年 份: 2010年
下 载: 140次
引 用: 1次
阅 读: 论文下载
 

内容摘要


随着互联网应用的飞速发展和持续扩张,Web信息的爆炸式增长带来的“信息过载”,已成为限制人们获取有效信息的严重障碍。如何快速、准确地为用户提供个性化服务成为一个具有挑战性的问题。个性化服务提高了Web信息资源的利用率和获取效率,满足了用户的个性化需求,具有重要的理论意义和实用价值。基于Web的个性化服务是当前Web数据挖掘的研究热点,也是实现个性化服务系统的核心内容。针对目前Web挖掘和个性化服务的研究现状和面临的主要挑战,本文重点研究基于Web日志挖掘的个性化服务技术,并对Web日志挖掘中的数据预处理、个性化推荐系统中的用户兴趣模型发现及推荐算法等关键技术进行了深入的研究。本文阐述的主要研究内容及成果如下:1.分析了Web日志挖掘中数据预处理的数据来源构成及数据源格式,详细描述了数据预处理的各个阶段,给出一种基于启发式规则的Web日志数据预处理算法。2.对常用的用户兴趣模型表示方法及发现技术进行探讨,简要介绍其各自工作原理、优缺点以及适用情况。重点研究了聚类技术中的基本K-Means算法,包括算法的流程及局限性。针对该算法的缺点,采用改进的基于密度的自适应K-Means算法,提高了聚类的质量,并通过实验验证了其有效性。3.对个性化推荐技术进行分类,研究和比较了基于规则、基于内容、协同过滤、基于信息论混合推荐方法的特点。重点对几种基于信息论的推荐算法进行剖析,分析传统算法的不足之处。在此基础上,提出基于信息论与用户聚类的推荐算法,在小幅度降低系统时间性能的代价下,显著改进了推荐的有效性和精确度。4.设计并实现基于Web日志挖掘的个性化推荐系统原型。在对数据预处理算法、基本K-Means算法和推荐算法改进的基础上,提出一种混合推荐系统框架,重点用于解决对未注册用户和新用户进行有效推荐的问题,改善了对注册用户推荐的准确性。

全文目录


摘要  2-3
Abstract  3-8
第1章 绪论  8-14
  1.1 课题背景  8-10
  1.2 国内外研究现状  10-12
  1.3 主要研究内容和阶段成果  12-13
  1.4 本文的组织结构  13-14
第2章 关于 Web 日志数据的预处理  14-23
  2.1 Web 日志的数据源  14-17
  2.2 基于启发式规则的预处理算法  17-22
    2.2.1 数据清洗  17-19
    2.2.2 页面访问识别  19-20
    2.2.3 用户识别  20
    2.2.4 会话识别  20-21
    2.2.5 路径补充  21-22
  2.3 本章小结  22-23
第3章 用户兴趣模型的表示与发现  23-34
  3.1 用户兴趣模型的表示  23-25
  3.2 用户兴趣模型的发现  25-33
    3.2.1 用户兴趣模型发现技术概述  25-28
    3.2.2 基本的K-Means 算法  28-30
    3.2.3 基于密度的自适应K-Means 算法  30-33
  3.3 本章小结  33-34
第4章 个性化推荐技术与算法  34-47
  4.1 推荐方法综述  34-38
  4.2 基于信息论的推荐算法  38-43
    4.2.1 基于人气的推荐算法  39
    4.2.2 基于熵的推荐算法  39-40
    4.2.3 基于熵与人气值对数的调和平均数的推荐算法  40-42
    4.2.4 基于加入0 分值评价熵的推荐算法  42-43
  4.3 基于信息论与用户聚类的推荐算法  43-46
    4.3.1 算法原理  43-44
    4.3.2 算法设计  44-45
    4.3.3 算法描述  45-46
  4.4 本章小结  46-47
第5章 个性化推荐原型系统  47-56
  5.1 个性化推荐系统框架  47-48
  5.2 推荐系统的运行  48-49
  5.3 实验数据集  49-50
    5.3.1 Web 服务器日志  49
    5.3.2 MovieLens 数据集  49-50
  5.4 实验结果及分析  50-55
    5.4.1 Web 日志挖掘数据预处理算法  50-51
    5.4.2 基于密度的自适应K-Means 算法  51-53
    5.4.3 基于信息论与用户聚类的推荐算法  53-55
  5.5 本章小结  55-56
结论  56-58
参考文献  58-63
致谢  63

相似论文

  1. 隐式用户兴趣挖掘的研究与实现,TP311.13
  2. 图像分割中阴影去除算法的研究,TP391.41
  3. 基于图分割的文本提取方法研究,TP391.41
  4. 牡丹EST-SSR引物开发及其亲缘关系分析,S685.11
  5. 高血压前期证候特征研究,R259
  6. 高忠英学术思想与经验总结及运用补肺汤加减治疗呼吸系统常见病用药规律研究,R249.2
  7. K-均值聚类算法的研究与改进,TP311.13
  8. 大学生综合素质测评研究,G645.5
  9. 大豆品种对腐竹品质的影响及其品质评价体系的初步构建,TS214.2
  10. 21个荷花品种遗传多样性的ISSR分析,S682.32
  11. 基于聚类分析的P2P流量识别算法的研究,TP393.02
  12. 基于混合自适应遗传算法的动态网格调度问题研究,TP393.09
  13. 桃杂交后代(F1)幼苗光合效能评价,S662.1
  14. 南通市农业面源污染负荷研究与综合评价,X592
  15. 土壤环境功能区划研究,X321
  16. 基因表达谱数据聚类分析方法比较与大豆疫霉基因的网络构建,S435.651
  17. 大豆杂种优势及其遗传基础研究,S565.1
  18. 象草自交后代无性系的饲用价值及生物质能特性初步评价,S543.9
  19. 细菌聚类算法及其在图像分割问题中的研究与应用,TP391.41
  20. 基于变异粒子群的聚类算法研究,TP18
  21. K-means聚类优化算法的研究,TP311.13

中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 计算机网络 > 一般性问题 > 计算机网络应用程序
© 2012 www.xueweilunwen.com