学位论文 > 优秀研究生学位论文题录展示

基于概率的潜在语义分析模型在搜索引擎商业文本分类系统中的应用研究

作 者: 苏麒匀
导 师: 张红延
学 校: 北京交通大学
专 业: 软件工程
关键词: 文本分类 潜在语义模型 空间向量模型 EM迭代计算 信息检索
分类号: TP391.1
类 型: 硕士论文
年 份: 2011年
下 载: 57次
引 用: 0次
阅 读: 论文下载
 

内容摘要


就搜索引擎的盈利性来说,搜索引擎投放的商业广告是否与用户的搜索意图相关十分重要。传统的文本分类方法在搜索引擎的商业文本分类系统中解决了一部分问题,但是,语义的抽象性、多义性、同义性等特征是普遍存在的现象,如何定义和计算语义、怎样与上下文结合分析语义,仍然是搜索引擎目前面临的主要问题。本文针对搜索引擎的商业需求,利用近年来学术界提出的“潜在概率语义分析”(Probability Latent Semantic Analysis, PLSA)技术,以软件工程的思想为指导,设计并实现了搜索引擎商业文本分类系统中的潜在概率语义计算模块。最后,按照商业搜索引擎的业务要求,本文作者采用相关标准对本模块进行了测试,证明了它的有效性和实用性。

全文目录


致谢  5-6
中文摘要  6-7
ABSTRACT  7-8
目录  8-11
1. 引言  11-16
  1.1 研究背景  11-13
  1.2 国内外研究现状  13
  1.3 研究意义  13-14
  1.4 论文的研究方法  14-15
  1.5 论文的组织结构  15-16
2. 业务需求分析  16-22
  2.1 角色行为分析  16-18
    2.1.1 搜索用户行为分析  17
    2.1.2 广告客户行为分析  17-18
    2.1.3 搜索引擎公司行为分析  18
  2.2 业务需求目标定位  18
  2.3 资源结构分析  18-21
    2.3.1 务资源结构  19-20
    2.3.2 系统资源结构  20-21
  2.4 务风险分析及应对策略  21-22
3. 文本分类理论概述  22-32
  3.1 文本分类的基本概念  22-23
  3.2 文本的训练样本集  23
  3.3 文本的表示模型  23-24
  3.4 文本的特征选择  24-27
    3.4.1 信息增益法(Information Gain)  25-26
    3.4.2 信息法(Mutual Information,MI)  26
    3.4.3 χ~2统计量  26-27
  3.5 文本分类器的设计  27-31
    3.5.1 中心向量法  27
    3.5.2 朴素贝叶斯分类法  27-29
    3.5.3 KNN(K最近邻居)算法  29
    3.5.4 基于投票的方法  29-30
    3.5.5 支持向量机(SVM)  30-31
  3.6 文本分类器评估方法  31-32
4. 系统关键技术及解决方案  32-38
  4.1 潜在语义分析模型  32-34
  4.2 潜在概率语义分析模型  34-38
    4.2.1 潜在概率语义模型概述  34-36
    4.2.2 模型主题的设定及其语义表达  36-38
5. 潜在概率语义模型的设计与实现  38-53
  5.1 模型总体设计  38-40
    5.1.1 训练层  38-39
    5.1.2 应用层  39
    5.1.3 输出层  39-40
  5.2 模型功能模块设计  40-47
    5.2.1 文本预处理模块  40-41
    5.2.2 词频统计模块  41-42
    5.2.3 迭代计算模块  42-45
    5.2.4 字典压缩模块  45
    5.2.5 相关度计算模块  45-47
  5.3 数据结构设计  47-48
  5.4 接口设计  48-50
  5.5 异常处理设计  50-53
6. 测试与结果分析  53-59
  6.1 测试标准  53-55
    6.1.1 相关性评分机制  53-54
    6.1.2 人员评分保障机制  54
    6.1.3 评估样本抽样机制及跟踪机制  54-55
    6.1.4 绝对指标衡量机制  55
  6.2 测试平台  55-56
  6.3 测试结果分析  56-59
    6.3.1 相关性评估数据分布对比  56-57
    6.3.2 点击率和展现率数据对比分析  57-59
7. 总结与展望  59-61
  7.1 总结  59
  7.2 展望  59-61
8. 参考文献  61-63
9. 附录  63-65
索引  65-66
作者简历  66-68
学位论文数据集  68

相似论文

  1. 基于仿生模式识别的文本分类技术研究,TP391.1
  2. 互联网上旅游评论的情感分析及其有用性研究,TP391.1
  3. 生物医学领域检索系统查询扩展技术研究,TP391.3
  4. 面向海量邮件的检索系统研究与实现,TP393.098
  5. 基于跨语言信息检索的企业竞争情报收集系统模型研究,TP391.3
  6. 基于数据分布特征的文本分类研究,TP391.1
  7. 面向文本分类的改进K近邻的支持向量机算法研究,TP391.1
  8. 基于树型条件随场的特定域事件提取方法研究,TP391.1
  9. 基于PLSA语义聚类的web服务发现方法,TP393.09
  10. 基于策略Agent的个性化信息检索系统的研究与实现,TP391.3
  11. 网络教育新闻文本分类系统的设计与实现,TP391.1
  12. 一种于经验数据的软件缺陷修复工作量预测模型研究,TP311.53
  13. 基于稀疏非负矩阵分解的图像检索,TP391.41
  14. 跨语言文本分类的研究,TP391.1
  15. 基于分类模型监测电子商务违禁信息的研究与实现,TP393.09
  16. 排序学习损失函数的研究,TP181
  17. 基于语义分析的文本挖掘研究,TP391.1
  18. 基于点击的用户聚类的研究,TP311.13
  19. 英汉跨语言问答系统中的文档语义检索,TP391.1
  20. 网络舆情分析关键技术研究与实现,TP393.09

中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 文字信息处理
© 2012 www.xueweilunwen.com