学位论文 > 优秀研究生学位论文题录展示
基于文档频率的分级主题模型
作 者: 张一凡
导 师: 徐蔚然
学 校: 北京邮电大学
专 业: 信号与信息处理
关键词: 图模型 主题模型 分级 语义
分类号: TP391.1
类 型: 硕士论文
年 份: 2011年
下 载: 65次
引 用: 0次
阅 读: 论文下载
内容摘要
|
为了抽取文档集中的语义结构,研究者提出了一系列的无监督方法,在文本的词袋模型假设下,我们得到了词计数向量来表示文本的信息。而在词袋模型的基础上,可以通过主题模型的方法得到了一个精致的统计框架以描述向量化的数据。在这一思路下,一系列的模型被提出来用以改进模型的表达能力。统计主题模型如此吸引入是因为它允许一个对新文档集的快速分析和理解。然而如果要从数据中得到一个分级的结构,这个框架本身不能提供一个答案。而近期的一些研究表明在单纯数据驱动的方法的基础上,加入背景知识和先验信息是一个值得研究的方向。本文提出了一个扩展的分级主题模型。这个模型将词在文本中的频率作为分级信息加入主题,从而使主题具有更自然的分级语义结构。DF主题模型产生的分级主题拥有一个比树结构更宽泛的主题关系表示。在通用数据集上的生成概率实验表明模型的分级表达具有比LDA和HLDA更好的数据拟合能力。在认知科学领域,背景知识是人类获取分级语义的重要工具。并且大量的先前工作用文本的外部信息来完善已有的模型。本文在这个思路上采用了略有不同的方法。原因是词的文本频率来自原始数据本身。所以本文的工作仍然是无监督的方法。在将词的文本频率信息和统计学习过程融合的基础上,本文希望能得到一个更符合人类认知角度的分级主题表示。
|
全文目录
摘要 4-5 ABSTRACT 5-8 第1章 自然语言处理 8-14 1.1 自然语言处理的发展现状 8-11 1.2 论文的研究背景 11-12 1.3 论文的研究内容 12-13 1.4 论文的结构 13-14 第2章 统计语言模型 14-23 2.1 文本处理 14-21 2.1.1 文本的表示 15-16 2.1.2 特征项的抽取 16-17 2.1.3 训练方法与分类算法 17-20 2.1.4 评估方法 20-21 2.2 贝叶斯方法 21-23 第3章 基于词频的分级统计主题模型DF-LDA 23-31 3.1 图模型 23-27 3.1.1 无向图模型的表示 24-25 3.1.2 有向图模型的表示 25-27 3.2 LDA模型 27-28 3.3 分级主题模型(DF-LDA) 28-29 3.4 DF-LDA模型的生成过程 29-31 第4章 DF-LDA主题模型的求解 31-34 4.1 Gibbs抽样方法 31-32 4.2 DF-LDA模型的求解 32-34 第5章 实验与分析 34-37 5.1 分级主题抽取实验 34 5.2 生成概率比较实验 34-37 第6章 结论 37-38 参考文献 38-42 致谢 42-43 攻读硕士期间发表学术论文 43
|
相似论文
- 670t/h四角切圆锅炉炉内煤粉燃烧过程的数值模拟,TK224.11
- 《左传》名词陈述化研究,H146
- 支持XML数据查询的F&B索引结构的研究,TP311.13
- 基于多示例学习的用户关注概念区域发现,TP391.41
- 低分子量亨氏马尾藻岩藻聚糖硫酸酯的制备及抗肿瘤活性研究,TS254.9
- 大豆品种对北豆腐品质的影响及其品质评价方法的研究,TS214.2
- CSB Image-Meater猪智能化影像分级仪瘦肉率预测及猪胴体等级评定标准的研究,S828
- 面向业务过程的服务动态组合方法研究,TP393.09
- 基于本体的语义检索研究,TP391.3
- 乔治·米勒的认知意义论,B842.1
- 面向自恢复的微重启技术研究,TP306
- 肝性脑病的相关危险因素及预后的分析,R747.9
- 胃肠间质瘤临床病理特征及危险度分级相关性的研究,R735
- 慢性阻塞性肺疾病患者营养状况与病情严重程度的关系,R563.9
- 保德煤矿奥灰富水性及11~#煤底板突水危险性评价,TD745
- 化学工业园区环境风险源管理技术研究,X327
- 一种基于领域本体的语义Web服务匹配和组合方法,TP393.09
- 基于计算机视觉的柑橘品质分级技术研究,TP391.41
- 心智游移频率特征研究:问卷开发,B841
- 基于语义网络的智能搜索引擎研究,TP391.3
- 汉语框架自动识别中的歧义消解,TP391.1
中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 文字信息处理
© 2012 www.xueweilunwen.com
|