学位论文 > 优秀研究生学位论文题录展示

基于统计与语法分析的关键词提取

作 者: 吴强
导 师: 战学刚
学 校: 辽宁科技大学
专 业: 计算机软件与理论
关键词: 关键词提取 语法分析 分词
分类号: TP391.1
类 型: 硕士论文
年 份: 2012年
下 载: 39次
引 用: 0次
阅 读: 论文下载
 

内容摘要


随着网络的不断发展,每天都会有海量的信息呈现出来。信息爆炸式的增长是当前计算机自然语言处理领域面临的既困难、又重要的问题。如何有效地掌控海量数据,并且准确识别、区分是否是人们所需要的信息,已经成为当今亟待解决的问题。所以提出关键词提取这一课题。文本关键词自动提取的处理技术可以广泛的应用于许多领域,如文本分类,信息反馈系统、网络信息过滤系统、信息检索、数字图书馆,自动文摘。本文采用基于TF统计和语法分析的关键词提取算法。这其中包含了中文分词、语法分析、句法分析、关键词提取等相关技术,主要研究内容如下:一、详细阐述了汉语关键词自动提取的相关理论、解决方案以及实验分析。并且提出在统计的基础上结合语法分析的关键词提取算法。二、详细介绍了中文分词技术,而且对分词歧义进行了总结。然后介绍一些当前比较成熟的分词算法,并且进行对比,通过实验数据选取结果明显优于其它算法的中科院分词系统作为本题目实验前期工作的工具。然后根据实际应用提出一种统计方法,对中科院的初步分词后的结果进一步划分。三、详细描述了目前比较流行的语法分析方法:基于规则和基于统计两种方法。进行规则和统计两种方法的对比,通过其他学者的研究、分析,最后采用两者结合的办法来建立树库。四、在句法分析算法方面,简单介绍了目前比较流行的方法,并且详细的描述当前公认的比较好的Chart算法。五、在语法分析、句法分析是通过宾夕法尼亚大学的Penn语料库,提取句子的组成结构信息。并且根据汉语语法实际应用情况,对句子成分划分等级分别赋予不同级别的值。六、最后是通过统计和语法分析相结合的办法,提出六种特征值作为权重的参数并对六种特征值进行详细讲解、分析。

全文目录


中文摘要  5-6
ABSTRACT  6-10
第一章 绪论  10-13
  1.1 课题的提出  10
  1.2 本文研究意义  10-11
  1.3 本文研究内容  11
  1.4 本文创新之处  11-12
  1.5 章节安排  12-13
第二章 关键词提取的研究综述  13-19
  2.1 关键词提取的重要性  13
  2.2 关键词的定义、识别、提取  13-14
  2.3 中文关键词自动提取技术与其它技术相结合  14-15
    2.3.1 信息检索系统  14
    2.3.2 信息反馈系统  14
    2.3.3 网络信息过滤、提取系统  14-15
    2.3.4 文本库的建立与重建  15
    2.3.5 数字化图书馆管理  15
  2.4 关键词识别提取的算法  15-19
    2.4.1 经典算法  15-18
    2.4.2 本文提出的分词改进算法  18-19
第三章 中文自动分词  19-30
  3.1 中文自动分词技术综述  19-22
    3.1.1 自动分词  19-20
    3.1.2 关于分词歧义  20-21
    3.1.3 中文自动分词经典算法  21-22
  3.2 I CTCLAS 中科院分词算法及提出改进算法  22-30
    3.2.1 ICTCLAS 中科院分词系统  22
    3.2.2 HMM 模型及相关理论  22-23
    3.2.3 基于隐马尔可夫模型提出 HHMM 模型  23-25
    3.2.4 基于 N-最短路径方法的中文词语粗分算法  25-28
    3.2.5 分词算法的改进  28-30
第四章 基于语法功能匹配的汉语句法分析  30-48
  4.1 形式语法描述  30
  4.2 短语结构语法与乔姆斯基层次体系  30-33
    4.2.1 短语结构语法  30-32
    4.2.2 乔姆斯基层次体系  32-33
  4.3 语法分析概要  33-35
    4.3.1 基于规则的方法  33-34
    4.3.2 基于统计的方法  34
    4.3.3 基于统计和规则相结合的方法  34-35
  4.4 句法分析算法  35-38
    4.4.1 句法分析概述  35-36
    4.4.2 Chart 算法  36-38
  4.5 树库  38-41
    4.5.1 树库定义  38-39
    4.5.2 树库的构造  39-41
  4.6 宾夕法尼亚大学的 Penn 树库  41-48
第五章 关键词提取算法  48-55
  5.1 关键词算法  48-51
    5.1.1 词频特征值  48
    5.1.2 位置特征值  48
    5.1.3 词性特征值  48-49
    5.1.4 词跨度特征值  49
    5.1.5 new 短语或者词特征值  49
    5.1.6 Headword 短语或者词特征值  49-51
  5.2 实验测试与分析  51-55
    5.2.1 实验环境、过程与语料  51
    5.2.2 评测标准  51-52
    5.2.3 系数调整  52
    5.2.4 实验结果  52-55
第六章 结束语与展望未来  55-56
  6.1 结束语  55
  6.2 展望未来  55-56
参考文献  56-59
附录 A 树库功能对照表  59-62
攻读硕士学位期间发表学术论文情况  62-63
致谢  63-64
作者简介  64-65

相似论文

  1. 基于规则的中文地址分词与匹配方法,P208
  2. 基于本体的文本信息抽取技术及实现,TP391.1
  3. 基于词跨度的中文文本关键词提取及在文本分类中的应用,TP391.1
  4. 基于校园网的用户行为分析系统的设计与实现,TP393.18
  5. 基于主题分类特征的物业评论情感分析,TP391.1
  6. 基于理解的汉语分词系统的设计与实现,TP391.1
  7. 全文检索及相关技术研究,TP391.3
  8. LUCENE中文分词在科研文档全文检索系统的应用研究,TP311.52
  9. 基于条件随机场的中文分词技术的研究与实现,TP391.1
  10. 短文本指纹的研究,TP391.1
  11. 主观题自动评分技术研究,TP391.1
  12. 情景应对模式下数字化应急预案的语义模型研究,TP391.1
  13. 基于观点挖掘的产品可用性建模与评价,F274
  14. Web数据挖掘技术在网络教育论坛中的应用研究,G434
  15. 新闻网页抽取技术的研究与实现,TP393.092
  16. 高校数字化校园Web信息过滤的研究,TP393.09
  17. 基于WebHarvest的中文财经新闻搜索引擎的设计与实现,TP311.52
  18. 中文XML压缩技术研究,TP311.11
  19. 基于字词联合解码的中文分词研究,TP391.1
  20. 企业邮件监管系统的设计与实现,TP393.098
  21. 基于自适应分词与SVM算法的互联网智能音乐检索技术研究,TP391.3

中图分类: > 工业技术 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机的应用 > 信息处理(信息加工) > 文字信息处理
© 2012 www.xueweilunwen.com