话题发现与追踪研究是对大规模的新闻流数据进行分析,以期发现、追踪、组织其中包含的多个话题。话题被定义为“一个具体事件(或活动)以及与之直接相关的事件(或活动)集合”。自1996年确立研究方向以来,一直是自然语言处理领域的热点。到目前为止,话" />
学位论文 > 优秀研究生学位论文题录展示

新闻话题表示模型和关联追踪技术研究

作 者: 张晓艳
导 师: 王挺
学 校: 国防科学技术大学
专 业: 计算机科学与技术
关键词: 话题发现与追踪 话题关联识别 话题追踪 话题
分类号: TP391.1
类 型: 博士论文
年 份: 2010年
下 载: 272次
引 用: 0次
阅 读: 论文下载
 

内容摘要


话题发现与追踪 的学位论文">话题发现与追踪研究是对大规模的新闻流数据进行分析,以期发现、追踪、组织其中包含的多个话题。话题被定义为“一个具体事件(或活动)以及与之直接相关的事件(或活动)集合”。自1996年确立研究方向以来,一直是自然语言处理领域的热点。到目前为止,话题发现与追踪相关技术已经被广泛应用,尤其是舆情监控和新知识发现这两个方面。本文对话题发现与追踪中的话题关联识别和话题追踪问题进行研究,在表示模型和关联追踪方法上提出了以下改进技术:话题关联识别,判断随机两篇报道的话题相关性,即是否描述同一个话题,是话题发现与追踪研究的核心技术。在这方面主要取得了以下研究成果:事件模型:对报道表示模型中的特征选择、相似度计算方法以及多向量表示模型的特征集合划分标准进行分析,提出了一种基于事件框架的多向量事件模型,并在使用过程中结合不均衡支持向量机分类模型解决了训练数据中正负样本比例失调的问题。此外,还对模型间的模糊匹配技术进行了初步研究。实验表明,基于事件模型的话题关联识别系统的性能有较大幅度的改进。动态信息扩充技术:针对单个报道中内容较少以及内含话题可能发生演化漂移的问题,把处理过的报道对充分利用起来,打破报道对之间的独立性,提出了一种动态扩充方法,并对扩充信息进一步分析研究,挑选出核心信息、名实体信息、依存名词三类信息进行精化,在最大程度上确保表示模型的有效性。实验表明,无论是动态扩充方法还是三种特征精化策略都能很好地改进话题关联识别系统的性能,是进一步改进识别效果的两个有效途径。话题追踪,根据一个话题的已知信息在一个报道流中追踪该话题的相关报道,是话题发现与追踪的主要研究内容之一,也是话题发现与追踪中唯一一个有先验知识的研究任务。在这方面主要取得了以下研究成果:动态话题模型:针对待追踪话题存在的话题漂移现象,提出了一种新的动态话题模型,这也是上述信息扩充技术的延续和深入。该模型使用一个基于话题的权重计算方法,把训练数据按话题聚类,从话题的角度度量所有追踪到的相关报道特征,在此基础上从全局的角度选择特征用于扩充,在学习相关信息的同时也尽可能地减小伪相关报道中的噪音影响。另外还用最新的话题无关报道来定位过滤当前话题模型中的动态噪音。实验表明,这种话题模型能够很好地动态调整发生了偏移的话题,不仅能够保证追踪性能不衰退,还能使追踪性能进一步提高。基于话题的权重计算方法也可以用于静态模型中的特征度量,并且是有效的。联合追踪方法:由于话题追踪中已知相关信息较少,致使追踪性能起点低,且无法处理追踪过程中遇到的新知识,同时也为了充分发挥话题关联识别技术在判断话题关联性方面的特点,提出了一种联合追踪方法。该方法首先从可包含任意话题的训练数据中设计一个独立于具体话题的基于关联特征的追踪方法,然后以线性组合的方式使该方法辅助基于已知信息的追踪方法。实验表明,联合追踪方法能够较好地解决上述问题,更重要的是该方法综合了本文提出的大部分改进技术且使性能获得累计改进。

全文目录


中文摘要  10-12
Abstract  12-14
第一章 绪论  14-34
  1.1 背景  14-17
    1.1.1 问题来源  14-15
    1.1.2 发展历史  15-17
  1.2 重要概念  17
  1.3 研究任务  17-20
  1.4 评价方法  20-23
  1.5 研究现状分析  23-29
    1.5.1 表示模型  24-27
    1.5.2 相似度计算  27-28
    1.5.3 相似度整合  28
    1.5.4 关键问题和难点  28-29
  1.6 本文主要工作  29-31
  1.7 本文结构  31-34
第二章 话题关联识别中的表示模型分析  34-54
  2.1 新闻报道分析  34-37
  2.2 多向量表示模型的构建  37-40
    2.2.1 预处理  38
    2.2.2 特征选取  38-40
    2.2.3 特征权重计算  40
  2.3 多向量表示模型的使用  40-45
    2.3.1 相似度计算  40-42
    2.3.2 模糊匹配  42-43
    2.3.3 多个相似度整合  43-45
  2.4 实验及讨论  45-53
    2.4.1 话题关联识别流程  46
    2.4.2 实验数据  46
    2.4.3 实验结果及分析  46-53
  2.5 小结  53-54
第三章 话题关联识别中的信息扩充技术  54-72
  3.1 问题描述  54-55
  3.2 相关工作  55-56
  3.3 动态扩充技术  56-57
  3.4 动态扩充信息  57-60
    3.4.1 摘要信息  58
    3.4.2 名实体  58-59
    3.4.3 依存信息  59
    3.4.4 精化策略  59-60
  3.5 实验及讨论  60-70
    3.5.1 实验数据  60
    3.5.2 实验结果及分析  60-70
  3.6 小结  70-72
第四章 基于动态话题模型的话题追踪  72-94
  4.1 话题漂移实例分析  72-74
  4.2 相关工作  74-77
  4.3 基于话题的权重计算方法  77-78
  4.4 动态话题模型  78-81
    4.4.1 基于相关样本更新  79-80
    4.4.2 基于无关样本更新  80-81
  4.5 实验及讨论  81-93
    4.5.1 话题追踪流程  81-82
    4.5.2 实验数据  82
    4.5.3 实验结果及分析  82-93
  4.6 小结  93-94
第五章 基于联合追踪方法的话题追踪  94-108
  5.1 问题描述  94-95
  5.2 相关工作  95
  5.3 联合追踪  95-99
    5.3.1 基于关联特征的追踪方法  95-97
    5.3.2 基于已知相关信息的追踪方法  97
    5.3.3 联合追踪方法  97-99
  5.4 实验及讨论  99-105
    5.4.1 实验数据  99
    5.4.2 实验结果及分析  99-105
  5.5 小结  105-108
第六章 结论与展望  108-112
  6.1 本文总结  108-109
  6.2 下一步展望  109-112
致谢  112-114
参考文献  114-124
作者在学期间取得的学术成果  124-125
附录A ICTCLAS 词性标注集  125-126
附录B 停用词集  126-129
附录C TDT4 中文语料相关信息  129-131

相似论文

  1. 人物言论抽取与跟踪技术研究,TP391.1
  2. 汉语主语与话题研究综述,H146
  3. 教育新闻热点话题发现系统的设计与实现,TP391.1
  4. 微博客话题追踪及实时检索的相关研究,TP393.092
  5. 英译汉中的主位结构转换,H315.9
  6. 基于话题的多文档文摘技术研究,TP391.1
  7. 从篇章语言学角度分析德国网络上的租房广告,H33
  8. 英汉“话题—说明”结构比较研究,H146
  9. 对外汉语初级口语教材课文话题分析,H195.4
  10. 汉语话题句习得情况考察与分析,H195
  11. 中国社交网站(SNS)话题关注与网络集群行为研究,G206
  12. BBS舆情智能分析系统研究与实现,TP393.094
  13. 高中英语词汇语义网络建构的研究,G633.41
  14. 汉英句子结构对比:“话题说明”与“主谓宾”,H314
  15. 汉语话题突出在中国学生英语中介语中的迁移研究,H319
  16. 网络舆情数据获取与话题分析技术研究,TP393.09
  17. 邮件通联关系网络中重要节点及社团发现技术研究,TP393.098
  18. 互联网新闻热点挖掘系统的研究与实现,TP393.09
  19. 面向网络舆情监控的热点话题发现技术研究,TP393.09
  20. 对话式阅读教学中话题的设置,G633.3
  21. 高校校园网论坛热点话题发现系统的研究与实现,TP393.18

中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 文字信息处理
© 2012 www.xueweilunwen.com