学位论文 > 优秀研究生学位论文题录展示
多肽结构表征及其在抗菌肽定量序效关系中的应用
作 者: 丰锋
导 师: 袁哲明
学 校: 湖南农业大学
专 业: 植物保护
关键词: 抗菌肽 定量序效关系模型 地统计学 支持向量机 描述子
分类号: Q51
类 型: 硕士论文
年 份: 2011年
下 载: 72次
引 用: 0次
阅 读: 论文下载
内容摘要
|
抗菌肽(antimicrobial peptide, AMP)是由20-50多个氨基酸残基组成的、具抗微生物活性的肽类的总称,现已在细菌、真菌、昆虫等中分离、纯化到上千种抗菌肽。抗菌肽具分子质量小、热稳定性好、抗菌谱广甚至抗病毒及抗肿瘤的特点,作用机理迥异于传统抗生素不易产生耐药性。因其在农业(抗病转基因植物)和药用(克服日益严重的抗生素耐药问题、开发新型抗病毒及抗肿瘤药物)等领域的广泛应用前景,抗菌肽受到国内外的极大关注。但与传统抗生素相比,多数抗菌肽的抗菌活性还不够理想因而用量较大成本较高。多肽和蛋白质的空间结构与功能由其一级结构(氨基酸序列)决定,高级结构甚难测定而一级结构简便易得。因此,用定量序效模型(Quantitative Sequence-Activity Model,QSAM)取代定量构效关系(Quantitative Structure-Activity Relationship,QSAR),有目的地改造已有抗菌肽、设计新抗菌肽分子意义重大。假定欲设计的抗菌肽长为30个氨基酸残基,则理论上共有2030种可能(不含非天然氨基酸),显然不可能全部合成再生物测定验证。抗菌肽QSAM的最终目的就是从已有的少量实验数据出发,建模预测出少量高活性(仅仅是预测)的多肽,合成后生测验证;因此QSAM模型独立预测准确性决定成败。多肽QSAM涉及三个关键环节:描述符的获取,描述符的选择,回归模型的选择。由于描述子与多肽活性间的复杂非线性关系,传统的多元线性回归、偏最小二乘回归等线性模型解析能力有限;基于结构风险最小的支持向量机(Support Vector Machine, SVM)以统计学习理论为基础,较好地解决了局部最小、过学习、非线性等问题,泛化能力优异。因此,本文采用SVM为基本建模工具。无关、冗余描述符会影响模型预测精度,描述符选择与回归模型选择常常藕联,在QSAM中逐步线性回归模型线性筛选描述符效果不佳。本实验室前期基于支持向量回归(Support Vector Regression, SVR)发展了一种非线性变量精细筛选方法-多轮末尾淘汰法,每轮依均方误差(Mean Squared Error, MSE)最小原则非线性地筛去一个最差的描述符。但当描述符个数很大时,多轮末尾淘汰法极为耗时。进一步,本实验室前期基于SVR发展了高维变量快速非线性筛选法,较好地解决了这一问题。因此,本文的重点是描述符的获取,即多肽结构的表征。本文针对传统氨基酸描述子Z-scales、ISA-ECI、MS-WHIM scores等不能表征肽序列的上下文关联(而上下文关联对肽的活性影响很大)、稳定性欠佳等缺陷,将多肽中的各氨基酸残基整体考虑,构建了两种新的多肽结构描述子GS-AA531和GS-AA531-MSCC。氨基酸残基指数数据库中每一残基有531种理化性质值(AA531),对等长(假定为n)的肽体系,每条肽用AA531串联表征可得n×531个描述子。GS-AA531是基于地统计学(Geostatistics, GS)半变异函数得到的反映序列关联特征的描述子,一个长为n的多肽,每种性质可用(n-1)个半方差表征,共有(n-1)×531个描述子。多尺度组分与关联(Multi-scale Component and Correlation, MSCC)反映序列在多个尺度上的残基组成、在多个尺度上的残基关联特征,GS-AA531-MSCC是GS-AA531与MSCC的综合。对肥大细胞脱粒抗菌肽类似物数据集(25条抗菌肽、每肽14个残基),依次采用AA531、GS-AA531和GS-AA531-MSCC表征多肽结构,每条抗菌肽获得7434、6903、7372个描述子,高维特征非线性快速筛选后获得45、15、16个描述子,多轮末尾淘汰精细筛选后最终获得20、12、11个保留描述子用于建模,SVR模型拟合(内部)决定系数R2分别为0.959、0.997、0.995,独立预测(外部)Qext2,分别为0.357、0.693、0.620。GS-AA531和GS-AA531-MSCC表征明显优于AA531表征。对CameL-s抗菌肽数据集(101条抗菌肽、每肽15个残基),依次采用GS-AA531和GS-AA531-MSCC表征多肽结构,每条抗菌肽获得7434、7910个描述子,高维特征非线性快速筛选后获得22、18个描述子,多轮末尾淘汰精细筛选后最终获得17、13个保留描述子用于建模,SVR模型拟合R2分别为0.717、0.726,独立预测Qext2,分别为0.716、0.708。GS-AA531和GS-AA531-MSCC表征的SVR模型明显优于参比文献报道模型。两个抗菌肽数据体系QSAM研究表明,GS-AA531和GS-AA531-MSCC是两种新的有效的多肽结构表征方法,且GS-AA531表征更为稳健。GS-AA531表征结合高维特征非线性快速筛选、多轮末尾淘汰精细筛选在多肽QSAM中有较大应用前景。
|
全文目录
摘要 4-6 Abstract 6-11 第一章 绪论 11-19 1 抗菌肽 11-14 1.1 抗菌肽简介 11-12 1.2 抗菌肽在农作物抗病基因工程中的应用及存在的问题 12-14 2 定量构效关系 14-17 2.1 定量构效关系研究进展 14-15 2.1.1 二维定量构效关系 14 2.1.2 三维定量构效关系 14-15 2.2 肽的定量构效关系 15-17 3 研究内容与创新点 17-19 3.1 主要研究内容 17 3.2 本文的主要创新点 17-19 第二章 统计建模方法与模型评价 19-24 1 统计建模方法 19-21 1.1 偏最小二乘法 19-20 1.2 遗传算法 20 1.3 人工神经网络 20 1.4 支持向量机回归 20-21 2 模型评价 21-24 2.1 模型评价统计量 21-22 2.2 模型的验证 22-24 2.2.1 模型内部验证 22 2.2.2 模型外部验证 22-24 第三章 肽结构的表征 24-27 1 肽结构表征方法 24-25 2 氨基酸理化性质的地统计学关联特征描述子 25 3 联合特征描述子(GS-AA531-MSCC) 25-27 3.1 多尺度组分 26 3.2 多尺度关联 26-27 第四章 肥大细胞脱粒抗菌肽类似物的QSAM研究 27-34 1 原理与方法 27-30 1.1 数据集 27 1.2 抗菌肽的结构表征 27-29 1.2.1 基于氨基酸性质531种的肽结构表征 27 1.2.2 GS-AA531的结构表征描述子 27-28 1.2.3 多特征联合的GS-AA531-MSCC的结构表征描述子 28-29 1.3 特征变量的筛选 29-30 1.3.1 基于SVR的高维特征非线性快速筛选 29 1.3.2 基于SVR的非线性变量精细筛选 29-30 2 研究结果 30-33 2.1 高维特征非线性快速筛选结果 30-31 2.2 多轮末尾淘汰精细筛选后的结果 31-33 3 小结 33-34 第五章 CAMEL-s抗菌肽的QSAM研究 34-38 1 数据集 34 2 基于AA-531与GS-AA531表征的QSAM研究 34-36 3 基于GS-AA531-MSCC表征的QSAM研究 36-37 4 小结 37-38 第六章 总结与展望 38-40 1 研究结论 38 2 前景展望 38-40 参考文献 40-45 致谢 45-46 作者简历 46 发表论文 46
|
相似论文
- 基于SVM的常压塔石脑油干点软测量建模研究,TE622.1
- 基于SVM的高速公路路面浅层病害的自动检测算法研究,U418.6
- 空间目标ISAR成像仿真及基于ISAR像的目标识别,TN957.52
- 胆囊炎和肾病综合症脉象信号的特征提取与分类研究,TP391.41
- 直推式支持向量机研究及其在图像检索中的应用,TP391.41
- 中医舌诊中舌形与齿痕的特征提取及分类研究,TP391.41
- 基于图像的路面破损识别,TP391.41
- 基于支持向量机的故障诊断方法研究,TP18
- 过程支持向量机及其在卫星热平衡温度预测中的应用研究,TP183
- 基于GIS的植烟土壤养分分区及推荐施肥研究,S158
- 基于监督流形学习算法的固有不规则蛋白质结构预测研究,Q51
- 太湖地区水稻土有机碳空间表征尺度效应研究,S158
- 萝卜霜霉病抗性遗传标记与Rs-AFPs基因表达分析,S631.1
- 麦胚抗菌肽富集与分离纯化技术研究,TQ936.16
- 高光谱图像技术诊断黄瓜病害方法的研究,S436.421
- 基于基因打靶的绿色荧光丝转基因家蚕研究,Q78
- 基于特征选择的入侵检测研究,TP393.08
- 基于机器学习的入侵检测系统研究,TP393.08
- 时间序列非线性分析及其应用,S11
- 大样本支持向量机研究,TP18
中图分类: > 生物科学 > 生物化学 > 蛋白质
© 2012 www.xueweilunwen.com
|