学位论文 > 优秀研究生学位论文题录展示
调控性SNP结构特征的生物信息学分析和分子动力学模拟研究
作 者: 张志毅
导 师: 孙建中; 梁龙; 岳俊杰
学 校: 中国人民解放军军事医学科学院
专 业: 军事预防医学
关键词: 调控性SNP 机器学习 位点矩阵 羟基自由基切割 分子动力学模拟
分类号: R318.0
类 型: 博士论文
年 份: 2011年
下 载: 129次
引 用: 0次
阅 读: 论文下载
内容摘要
|
随着现代医学的发展和人民生活水平的提高,过去一些严重威胁人类健康的传染病、营养性疾病得到大幅控制,而遗传病则成为比较突出的问题。当前一些影响人类健康和寿命的主要疾病如高血压、糖尿病、癌症、精神疾病等都发现和遗传因素有不同程度的关联。因此,近年来寻找基因序列差异与常见疾病易患体质之间的相关性成为研究热点。对多种疾病开展的全基因组关联研究已给出很多与疾病相关的单核苷酸多态性(Single Nucleotide Polymorphism,SNP),其中多数位于非编码区。当前非编码区的功能性SNP中受到关注的是调控性SNP(regulatory SNP,rSNP),即位于顺式作用元件(如启动子、增强子、沉默子、绝缘子等)上并能够改变基因表达水平的SNP。验证调控性SNP的实验方法成本高,效率低,因此非常需要理论预测作为补充和指导。但是,目前调控性SNP理论分析和预测中存在的一个重要问题是:很多预测和分析侧重于解决SNP的定位问题,对于同位于顺式作用元件上的SNP,则缺少有效的结构属性来加以识别。这主要是因为对调控性SNP形成的内在机制缺乏本质的理解。本研究致力于在不同层次对调控性SNP的结构特征进行全面分析,以考察调控性SNP预测中结构属性的作用,深化对其机制本质的理解。主要工作如下:首先运用机器学习算法对多个结构属性进行综合分析。通过文献调研和相关数据库,我们重新搜集了一批调控性SNP和对照SNP,又从文献得到与DNA片段结构或能量相关的未曾考察过的结构属性共11个,结合同类文献的数据集和属性集作比较分析。经过属性排序可知,新加入的结构属性中,DNA螺旋参数中的升高(Rise)改变和羟基自由基切割谱改变的重要性较为靠前;训练比较后发现采用朴素贝叶斯分类器性能最佳,比文献所用支持向量机预测性能提高6%,适当选取新加入的结构属性可使预测性能有小幅提高。这部分工作启示我们,调控性SNP的预测是一个较为复杂的问题,合理选用新的结构属性可提高调控性SNP预测性能。而后,我们对位点矩阵法和羟基自由基切割法这两种重要方法分别进行深入分析。位点矩阵法的应用首先需要对多个相关数据库进行交叉筛选以得到所需的可靠数据,这些数据对于以后应用更多方法考察调控性SNP也具有重要意义。于是我们从收录转录因子结合位点最全的数据库TRANSFAC中提取了人属转录因子结合位点(Transcription Factor Binding Site,TFBS),进一步确定其在参考基因组中的准确位置,而后确定其中有183个上有SNP,它们中18个有调控性SNP,去掉重复位点后实际得到12个位点上的13个rSNP。183个位点上的SNP,位于位点矩阵内的只有32个,其中5个是调控性SNP。从数量可知,rSNP研究目前仍处于数据积累阶段,需要积累更多数据才能进行完善的统计学分析。对当前数据的统计表明,不论是SNP还是rSNP,其引起碱基频数百分比的改变从高到低都有分布。因此,认为在位点矩阵中调控性SNP所在位置的碱基保守性高的想法不能成立。据此,我们猜想很可能是因为同一转录因子与DNA结合有不止一种模式,而调控性SNP所在位置的碱基在不同模式中的作用有很大差异。其论证还需要更多细致而深入的调研和分析。之后,我们又充分考察了羟基自由基切割法在识别调控性SNP中的作用。计算表明,当以正链序列为对象时,调控性SNP和对照SNP引起的羟基自由基切割谱变化的差异有统计学意义;而以负链序列为对象时,则无统计学意义。我们认为正负链计算结果不一致是原方法的一处疏漏,与作者沟通后提出了双链算法作为改进,消除了这一矛盾,且阳性数据与对照差异显著性也有所提高。以上从综合及独立的不同角度,对调控性SNP的通用结构属性做了基于概率统计的分析。为了更深一步探究调控性SNP形成的本质,我们又运用分子动力学模拟方法从原子水平通过具体实例来分析调控性SNP的内在机制。首先从前面筛选出的有rSNP的转录因子结合位点中,在PDB数据库搜索转录因子序列,得到了有高同源性复合物结构文件的转录因子结合位点。又经核酸序列比对,进一步筛选出三个转录因子——垂体特异转录因子POU1F1、维他命D受体VDR和雄激素受体AR,以它们的DNA复合物作为模拟对象。由于时间关系,只对AR-DNA复合物的模拟结果作了全面分析。分析表明,结合态SNP的复合物中氢键总数和稳定氢键数量都明显高于非结合态复合物,且分布在整个核酸片段上。疏水作用分析发现结合态SNP中突变碱基T上的甲基导致附近的疏水作用大为增强;对两个识别螺旋相对运动的考察发现结合态复合物中两识别螺旋基本平行,而非结合态中的相对运动趋势与自由蛋白非常相似。故认为疏水作用是使该SNP成为调控性SNP的关键原因。这部分工作说明分子动力学模拟方法在合理应用的前提下,对rSNP的机制分析具有重要的参考价值。最后我们还考察了同源二聚体转录因子的两个识别螺旋的平面内相对运动的现象,对今后分析相似类型的转录因子的构象运动进而理解蛋白质-DNA结合都提供重要启示。本研究的创新点主要包括:重新综合考察了一些未用机器学习考察过的结构类属性对于识别rSNP的作用;较完整地挑选出人属TFBS上所有SNP和rSNP,为全面而深入的分析rSNP的功能机制提供了重要的数据平台;发现了羟基自由基切割法的一处疏漏并进行了改进,分析得出调控性SNP与羟基自由基切割谱改变具有相关性;将蛋白质-DNA特异性识别的研究结果应用到调控性SNP的结构机制分析中,体现了分子动力学模拟方法对rSNP的机制分析的重要参考价值;应用分子动力学模拟发现了同源二聚体转录因子的两个识别螺旋在平面内相对运动的现象,对其理论背景和适用范围作了更深入的分析。目前,与调控性SNP结构特征相关的属性、方法仍在不断涌现和完善,随着新的有效属性的合理加入,识别rSNP的综合理论模型的预测性能一定会不断提高;同时随着结构蛋白质组学受到更为广泛的关注,新测定的蛋白质-DNA结构数量日益增多,可用来分析蛋白质-DNA识别机制及调控性SNP内在原因的实例也必然越来越多。当这些实例研究获得的知识积累到一定数量,通过归纳总结,其背后的规律必然会逐渐明晰。
|
全文目录
英文缩略词表 8-9 摘要 9-12 Abstract 12-16 第一章 绪论 16-28 1 背景 16-17 2 SNP 的概念 17-18 2.1 人类基因组的差异 17 2.2 SNP 概念和分类 17-18 3 调控性SNP 的概念、意义及理论研究的意义 18-20 3.1 调控性SNP 概念、意义 18-19 3.2 调控性SNP 理论研究的意义 19-20 3.2.1 全基因组关联研究得到大量非编码区的表型相关SNP 19 3.2.2 近年来实验方法得到了大量调控元件的大概位置 19-20 3.2.3 检测调控性SNP 的实验方法需要理论指导和补充 20 4 调控性SNP 理论分析和预测研究进展及存在的问题 20-23 4.1 转录因子结合位点(TFBS)的预测 21-22 4.2 转录因子结合位点上SNP 的功能性预测 22-23 4.3 当前调控性SNP 理论分析和预测中存在的问题 23 5 本研究的主要工作和创新点 23-24 参考文献 24-28 第二章 基于机器学习方法的调控性SNP 结构特征分析 28-44 1 引言 28-32 1.1 机器学习方法 28-29 1.2 基于机器学习方法预测调控性SNP 的研究进展 29-31 1.3 本章研究目的与路线 31-32 2 数据与方法 32-38 2.1 数据集构建 32-33 2.2 结构属性的采集 33-37 2.2.1 能量参数 33-34 2.2.2 螺旋结构参数 34-35 2.2.3 弯曲度参数 35 2.2.4 羟基自由基切割法 35-37 2.2.5 颠换(transversion)与转换(transition) 37 2.3 属性排序 37 2.4 选择最优属性集 37 2.5 选用分类器和训练方法 37 2.6 性能评价指标 37-38 3 结果与讨论 38-41 3.1 数据集A&属性集A 作属性排序 38-39 3.2 数据集C&属性集C 作属性排序 39-40 3.3 “数据集B&属性集B”与“数据集C&属性集B”的预测性能比较 40-41 3.4 “数据集C&属性集C”与“数据集C&属性集B”的预测性能比较 41 3.5 讨论 41 4 小结 41-42 参考文献 42-44 第三章 转录因子结合位点上的调控性SNP 提取及分析 44-56 1. 引言 44-46 2. 数据来源与方法 46-48 2.1 TRANSFAC 中人的TFBS 筛选 46 2.2 转录因子结合位点在基因组中精确位置的确定 46-47 2.3 确定有多少TFBS 上有SNP 47 2.4 确定有多少rSNP 位于TFBS 上 47 2.5 手动核对哪些SNP 在位点矩阵中 47 2.6 运用位置频率矩阵及改进方法计算差值 47-48 3 结果和讨论 48-53 3.1 TRANSFAC 中的人类转录因子结合位点 48-49 3.2 转录因子结合位点在基因组中的精确位置 49 3.3 有SNP 的转录因子结合位点 49 3.4 转录因子结合位点上的rSNP 49-52 3.5 位于位点矩阵中的SNP 52 3.6 矩阵中单碱基和两两相关碱基的频率改变的计算 52 3.7 讨论 52-53 4. 小结 53-54 参考文献 54-56 第四章 羟基自由基切割法识别调控性SNP 的应用与改进 56-66 1 引言 56-58 1.1 基于序列的方法——PWM 矩阵算法 56 1.2 基于结构的新方法——羟基自由基切割法 56-58 2 数据与方法 58-60 2.1 数据 58 2.2 方法 58-60 3 结果与讨论 60-64 3.1 羟基自由基切割谱的计算 60-61 3.2 以正链计算SNP 引起切割谱变化差异有统计学意义 61 3.3 以负链计算SNP 引起切割谱变化无统计学差异 61-62 3.4 改进为双链算法的计算结果 62 3.5 讨论 62-64 4 小结 64 参考文献 64-66 第五章 应用分子动力学模拟分析调控性SNP 的分子机制 66-88 1. 引言 66-69 1.1 分子动力学模拟 66-67 1.2 蛋白质-DNA 特异性识别研究进展 67-68 1.3 本章研究策略 68-69 2. 方法与数据 69-73 2.1 筛选具有结构文件并含调控性SNP 的转录因子-DNA 复合物 69-70 2.2 核酸序列的对齐 70 2.3 序列突变及延长得到模拟所用的初始结构 70-71 2.4 分子动力学模拟方法 71 2.5 蛋白质-DNA 直接氢键作用的统计和分析 71 2.6 水介导的氢键作用统计和分析 71-72 2.7 统计分析疏水相互作用 72 2.8 两个识别螺旋所成角的分解、分布与推断 72-73 3. 结果与讨论 73-84 3.1 核酸序列的比对结果 73-74 3.2 相关文献调研 74-75 3.3 分子动力学模拟的RMSD 75 3.4 蛋白质-DNA 直接氢键作用统计结果 75-79 3.5 水介导的氢键作用——水桥 79-82 3.6 疏水相互作用分析 82 3.7 两个识别螺旋相对运动分析 82-83 3.8 结论 83 3.9 讨论 83-84 4. 小结 84-85 参考文献 85-88 第六章 同源二聚体转录因子识别螺旋相对运动的分子动力学模拟研究 88-98 1. 引言 88-89 2. 方法与数据 89-91 2.1 初始结构准备 89-90 2.2 分子动力学模拟 90 2.3 两个识别螺旋角度分解方法 90-91 2.4 向量坐标的提取和角度的计算 91 2.5 两角成正比的数学分析 91 3. 结果与讨论 91-94 3.1 动力学特征 91 3.2 垂直偏移角θ和平面偏移角φ成正比现象 91-92 3.3 θ和φ成正比的几何分析 92-93 3.4 讨论 93-94 4. 小结 94-95 参考文献 95-98 第七章 总结与讨论 98-100 1 全文组织结构 98 2 主要研究成果 98-100 综述 100-106 参考文献 104-106 个人简历 106-107 致谢 107-108
|
相似论文
- 不同类型亲水性结构表面修饰的聚氨酯材料与凝血十二因子九肽片段及纤维蛋白原P1片段相互作用的计算机模拟,O631.3
- 英汉命名实体翻译方法研究,TP391.2
- 生物医学缩略语消歧,R-5
- 基于数据分布特征的文本分类研究,TP391.1
- 温度对Pt/Au异质外延薄膜生长影响的分子动力学模拟,O484.1
- 二维晶格失配外延铝薄膜结构弛豫的分子动力学模拟,O484.1
- 环肽纳米管作为跨膜水通道的分子设计,TB383.1
- 人类抗原肽载体结合力预测,R392.1
- 李群深层结构学习算法研究,TP181
- 机器学习算法在视频指纹识别中的应用研究,TP391.41
- 蛋白质关系抽取中平面特征和结构化信息的研究,TP181
- 基于李群机器学习算法的智能布线,TN710
- 学习表达式的映射机制研究,TP181
- 军事港口目标分类平台的设计与实现,TP751
- 基于糖尿病相关靶标β3-AR和GLP-1R的药物设计研究,R914.2
- 基于多视角的分类器设计与权值优化方法研究,TP18
- 基于条件随机场的中文分词技术的研究与实现,TP391.1
- 基于区域高斯特征的人体检测算法,TP391.41
- 领域知识指导的半监督学习和主动学习倾向性分类研究,TP181
- Android恶意软件静态检测方案的研究,TP309
- 基于马尔可夫链蒙特卡罗方法的RBM学习算法改进,O211.62
中图分类: > 医药、卫生 > 基础医学 > 医用一般科学 > 生物医学工程 > 一般性问题
© 2012 www.xueweilunwen.com
|