学位论文 > 优秀研究生学位论文题录展示
基于支持向量机和蛋白质全序列的蛋白质—蛋白质相互作用预测
作 者: 张杰
导 师: 刘伟
学 校: 郑州大学
专 业: 生物化学与分子生物学
关键词: 蛋白质组学 蛋白质-蛋白质相互作用预测 生物信息学 支持向量机
分类号: Q51
类 型: 硕士论文
年 份: 2010年
下 载: 99次
引 用: 1次
阅 读: 论文下载
内容摘要
|
随着人类基因组计划的完成,生命科学研究已经进入到后基因组时代,蛋白质组学是后基因组时代的一个重要研究内容。蛋白质是生命活动的主要承担者,蛋白质的在生物体内功能大部分与蛋白质间的相互作用有关联。蛋白质-蛋白质相互作用研究则成为蛋白质组学中的一个研究热点。用传统的实验方法来鉴定蛋白质相互作用不仅费时费力、代价高,而且有很高的假阳性和假阴性,发展先进高效的信息分析技术和数据挖掘手段,从大量蛋白质组数据中发掘蛋白质之间的内在联系,以揭示蛋白质的功能及相互作用关系具有极其重要的意义。因此,很多研究者选择用生物信息学方法去研究蛋白质-蛋白质相互作用。本论文首先从DIP数据集中下载啤酒酵母的蛋白质相互作用数据,然后从中筛选实验所需的原始正数据集,共得到5943对相互作用蛋白。然后在通过多序列比对,去除原始正数据集蛋白质序列中同源性大于40%的蛋白质,得到5594对相互作用蛋白,构建为非冗余的正数据集。由于目前缺乏非相互作用蛋白质对实验数据,通过随机组合正数据集中的蛋白质、组合不同亚定位的蛋白质和Shufflet软件组合正数据集中的相互作用蛋白序列这三种方法来构建原始负数据集,共得到5个负数据集,分别是Prq、Psub、1-let、2-let、3-let负数据集。再去除Psub负数据集中蛋白质序列同源性大于40%的蛋白质,构建非冗余负数据集,也筛选出5594对非相互作用蛋白质。基于蛋白质一级序列信息结合氨基酸五位编码和氨基酸7个理化参数编码两种编码去表达蛋白质序列信息,使用支持向量机算法构建模型和预测。使用氨基酸五位编码方法时预测结果最好,当用1-1et作为负数据集时,预测准确率达到95.50%,其次是Psub作为负数据集时,预测准确率为92.12%,非冗余数据集的预测准确率为90.84%。对1-let数据集和Psub数据集的五倍交叉验证的准确率分别为93.62%,90.31%。上述预测结果高于目前的文献预测值。本文最后,对预测工作进行了总结,工作中的不足之处也进行了探讨,并展望了蛋白质组学未来研究的重点和方向。
|
全文目录
摘要 4-5 ABSTRACT 5-10 第一章 引言 10-20 1.1 生物信息学简介 10-12 1.1.1 生物信息学的定义 10 1.1.2 生物信息学的主要研究内容 10-11 1.1.3 生物信息学的研究意义 11-12 1.2 蛋白质相关知识 12-17 1.2.1 20种氨基酸简介 12-14 1.2.2 蛋白质的结构 14-16 1.2.3 蛋白质的功能 16-17 1.3 蛋白质-蛋白质相互作用研究意义及现状 17-18 1.3.1 蛋白质-蛋白质相互作用研究意义 17 1.3.2 蛋白质-蛋白质相互作用研究现状 17-18 1.4 本论文的主要研究内容与创新点 18-20 1.4.1 论文的主要研究内容 18-19 1.4.2 论文的主要创新点 19-20 第二章 蛋白质间相互作用研究相关方法与数据库介绍 20-27 2.1 蛋白质-蛋白质相互作用的研究方法 20-24 2.1.1 研究蛋白质-蛋白质相互作用的实验方法 20-22 2.1.2 蛋白质-蛋白质相互作用研究的生物信息学计算方法 22-24 2.2 蛋白质相互作用数据库简介 24-27 2.2.1 DIP数据库 25 2.2.2 BIND数据库 25 2.2.3 MIPS数据库 25-27 第三章 支持向量机及相关软件介绍 27-36 3.1 支持向量机简介 27-30 3.1.1 支持向量机产生与发展 27-28 3.1.2 支持向量机原理 28-30 3.2 MATLAB软件介绍 30-32 3.2.1 MATLAB概述 30-31 3.2.2 MATLAB语言的优势及特点 31-32 3.3 LIBSVM软件介绍 32-35 3.4 EmEditor编辑器介绍 35-36 第四章 实验数据来源构建处理及预测结果评价方法 36-39 4.1 数据来源 36-37 4.1.1 正数据集的构建 36 4.1.2 负数据集的构建 36-37 4.1.3 独立预测数据集的构建 37 4.2 训练集和预测集的选取 37-38 4.3 蛋白质序列数据的表达 38 4.4 预测结果的评价方法 38-39 第五章 应用支持向量机方法预测蛋白质-蛋白质相互作用 39-47 5.1 氨基酸五位编码方法预测蛋白质间相互作用 39-43 5.1.1 氨基酸五位编码方式 39 5.1.2 SVM最适参数的选择 39-40 5.1.3 实验方法 40 5.1.4 预测结果和讨论 40-43 5.2 氨基酸7个理化参数编码方法预测蛋白质-蛋白质相互作用 43-46 5.2.1 氨基酸7个理化参数编码方式 43-44 5.2.2 SVM最优参数选择 44 5.2.3 实验方法 44 5.2.4 预测结果和讨论 44-46 5.3 小结 46-47 第六章 结论与展望 47-49 参考文献 49-53 附录 53-54 个人简历 在学期间发表的学术论文与研究成果 54-55 致谢 55
|
相似论文
- 基于SVM的常压塔石脑油干点软测量建模研究,TE622.1
- 基于SVM的高速公路路面浅层病害的自动检测算法研究,U418.6
- 基于PCA-SVM的液体火箭发动机试验台故障诊断算法研究,V433.9
- 空间目标ISAR成像仿真及基于ISAR像的目标识别,TN957.52
- 音乐结构自动分析研究,TN912.3
- 基于三维重建的焊点质量分类方法研究,TP391.41
- 胆囊炎和肾病综合症脉象信号的特征提取与分类研究,TP391.41
- BioLab面向生物计算服务的网格系统,TP399-C8
- 直推式支持向量机研究及其在图像检索中的应用,TP391.41
- 基于SVM的中医舌色苔色分类方法研究,TP391.41
- 基于图像的路面破损识别,TP391.41
- 基于支持向量机的故障诊断方法研究,TP18
- 过程支持向量机及其在卫星热平衡温度预测中的应用研究,TP183
- 南极冰藻GPx、GST和SAHH基因的克隆、定量分析及原核表达载体的构建,Q943.2
- 棉花纤维初始发育的磷酸蛋白质组学研究,S562
- 高温蛋白酶Pgsey及解旋酶Htc16特征的初步研究,Q814
- 溶藻弧菌耐四种抗生素的蛋白质组学研究,S941
- 基于监督流形学习算法的固有不规则蛋白质结构预测研究,Q51
- 红曲霉洛伐他汀生物合成相关基因克隆与分析,TQ927
- 八种昆虫转录组数据中OBP、CSP和RyR基因预测及序列分析,S433
- 甘蓝型油菜种质资源芽期和苗期耐盐性鉴定与双向电泳体系的建立,S565.4
中图分类: > 生物科学 > 生物化学 > 蛋白质
© 2012 www.xueweilunwen.com
|