文摘
微阵列的发明和新一代测序技术革新了基因组学研究;平台已导致大量的基因表达数据,甲基化,protein-DNA交互。许多生物中的共同主题使用高通量技术是微分分析问题。尽管共同的主题,不同的数据类型都有自己的特色,创造一个“移动的目标”的场景。因此,方法专门为一个数据类型可能不会带来满意的结果应用到另一个数据类型。迎接这一挑战,这样不仅目前现有的数据类型,而且未来的数据问题,平台,或实验可以分析,我们提出一个混合建模框架,足够灵活,能够自动适应任何移动的目标。更具体地说,该方法认为几类混合模型和本质上提供了一个基于模型的自适应过程的模型被分析的特定数据。我们将演示方法的效用将它应用于三种类型的真实数据:基因表达,甲基化,ChIP-seq。我们还进行了模拟测量性能和显示,可以更有效的方法比任何单个模型没有膨胀错误。
1。介绍
人类基因组计划的完成超过十年前,大规模生物研究方法正在迅速推进。特别是,微阵列的发明和新一代测序技术革新了基因组学研究;这样的高通量平台导致了大量的数据。根据这项研究,每种类型的实验产生的数据具有不同的特点。其中有互补脱氧核糖核酸微阵列或RNA-seq同时测量成千上万个基因的表达水平的变化(1,2];ChIP-chip花砖数组或ChIP-seq为研究基因组protein-DNA互动(3,4];亚硫酸氢和微分甲基化芯片杂交或全基因组测序进行全基因组DNA甲基化分析研究[5,6]。一个共同的主题感兴趣的生物学家们当他们使用这些实验是执行差异分析(7- - - - - -12]。例如,在基因表达分析,基于微阵列或测序的,有兴趣寻找差异表达的基因。表观遗传分析癌症的样本,发现感兴趣的CpG岛之间的差异甲基化的癌细胞和正常细胞。另一方面,ChIP-seq数据经常用来审问蛋白结合在两种不同条件下分化。在过去的十年中,提出了方法为每一种类型的数据在新的平台/技术。尽管共同的主题,不同的数据类型都有自己的特色,创造一个“移动的目标”的场景。因此,方法专门为一个数据类型可能不会带来满意的结果应用到另一个数据类型。此外,新数据类型从新的生物实验将继续成为我们正在进入一个新时代的发现(13,14]。因此,它是需要有一个统一的方法,multitype数据提供满意的解决方案,这两个目前和将来会变得可用。迎接这一挑战,这样不仅目前现有的数据类型,而且未来的数据问题,平台,或实验可以分析,我们提出一个混合建模框架,足够灵活,能够自动适应任何移动的目标。也就是说,我们提出的模型是自适应数据被分析而不是固定的。更具体地说,该方法认为几类混合模型和本质上提供了一个基于模型的过程具有以下特点:(1)使用一个多级模型,(2)模型在每个类适应数据被分析,和(3)灵活的组件分类方案。因此,取决于底层分布的数据分析,该模型将相应的适应提供最好的健康,,当我们通过模拟演示,能够提高力量和微分灵敏度没有导致错误识别。为了说明方法的实用程序,我们使用它来分析三种不同类型的高通量数据,导致每个人改善单模分析相比。
2。材料和方法
2.1。整体方法的简介
提出了混合模型方法针对不同的数据类型。在这里,我们提出一个方法,试图合成这些方法的优点到一个包中。根据数据分析,这种整体的方法将选择最适合的模型数据和执行基于模型的分类。第一个混合模型被认为是合奏是gamma-normal-gamma (GNG)模型提出了分析DNA甲基化数据(15]。它使用的一个特例伽马分布(指数)来捕获数据来自微分集团和利用多个正常组件捕获nondifferentiating甲基化组允许小偏见即使正常化。我们这个模型集成uniform-normal混合模型(推动)院长和阿布提出的16),使用一个统一的,一个正常的组件来分析基因表达数据。延长整体方法的适用性与其他数据类型,使我们增加这个整体推动的延伸,我们称之为iNUDGE,改善健康的想法从GNG正常使用多个组件。一个健壮的加权方案GNG也扩展到(我)的推动。此外,我们允许一些正常的组件被归类为捕获分化观察基于其位置和尺度参数,进一步提高整体模型的灵活性。我们注意到这个特性不同于正常的组件的用途(s)在GNG和推动。取决于底层的分布数据,最好的整体模型中选择三个类,用于推断。这个过程的整体性质使其高度适应的数据从不同的平台。我们将演示这个功能通过应用这三种类型的数据:基因表达、DNA甲基化和ChIP-seq。在下面,我们描述我们的整体模型,参数估计、模型选择,最后基于模型的分类。
2.2。有限混合模型的合奏
在拟议的整体方法中,我们通过考虑多个集成来自不同模型的优势基础分布。具体来说,一组三个类的混合模型是利用。每个类的模型是为了适应规范化数据,通常表示为(日志)在两种实验条件下的差异,例如,健康与病禽或之前和之后的治疗。
让是未知的规范化数据点的密度函数,这是建模为 在哪里,,是底层模型参数的混合物和每个两个组件,分别将指定为制定拥抱。在这一级的混合物,指定捕获微分元素(overdispersion)而是为那些更集中。尽管如此,也可以用来确定微分观测,详细的二级混合建模。具体来说,我们的模型和如下: 我们可以看出从上面的建模、数据中的overdispersion被均匀分布或两个指数分布的混合物(γ的特例)。均匀分布的参数,和是模型参数的一部分(例如,),因此规模参数和指数分布的混合比例(即,)。位置参数,和> 0,都假定为已知。在实践中,和可以使用的估计和。更靠近数据由一个正态分布或正态分布的混合物。位置和尺度参数模型参数的一部分,也就是说,,所以是混合比例在混合和组件的数量,;这是。因此,。最后,是通常的指标函数,等于1如果条件是满意的;否则,它是0。因为任何分布可以表示为一个混合正态分布,两者兼而有之和一些组件的正常混合会指定为“微分”组件,如下详细。
2.3。鲁棒参数估计
为了得到模型参数的稳健估计,GNG之后,我们在整体使用加权似然函数模型: 在哪里,因为规范化的观测数据和有一些指定的重量。
因为我们想降级使用加权似然从观察小”强度的贡献。”例如,在建模log-ratio,我们要区分数据点与同一log-ratio但截然不同的大小以个人强度。如果我们让平均对数强度(标准化意味着零和标准偏差1),然后下半身Huber权函数: 在哪里,可用于downweigh那些较小的平均强度。除了Huber的权函数,图基bisquare函数也可以使用(17]。此外,上半部分或小动物——一张长有权函数可以正当使用特定数据类型或学习目标。
EM算法以适应每个类的模型在合奏。EM算法的停止条件时或最大迭代数是达到了。在我们的模拟和数据分析,集和,这也是默认设置在程序中实现整体的方法。
2.4。模型选择和基于模型的分类
GNG和iNUDGE模型,我们首先需要确定,正常的组件的数量模型,也称为模型的顺序。在我们的分析中,我们检验模型并选择贝叶斯信息准则最大化(BIC (18])。我们利用BIC赞成处罚以来吝啬的模型其他参数比Akaike信息准则(AIC (19])。也就是说,当选择的顺序模型,我们要额外小心,不要选择过于复杂的模型。确定每个类中最好的模型后,我们最好使用AIC选择整体模型中三个类。这种平衡的模型选择方法的使用不仅是为了防止选择模型太复杂(因此使用BIC在每个类),但与此同时,也要避免选择一个模型过于简单(因此使用AIC当选择的类)。
使用最好的模型选择,一个两步的方法是采取分类每个观察微分。在第一步,我们正常的组件进行分类差一个如果一个尾巴捕捉观察“局外人”的总体布局: 在哪里是整个数据集的四分位范围。正常的组件不贴上微分被称为“nondifferential。”
每个正常的组件标记后,我们计算出当地的错误发现率(罗斯福)提出的埃夫隆(20.和适应哈利利的et al。15对于每一个观察: 在哪里是由正常的组件指定为nondifferential。然后我们将观察与重量如果是一个微分元素,对于一些阈值。
2.5。软件
本文给出的方法实现在R包DIME(微分识别使用混合物整体)和可用http://www.stat.osu.edu/ statgen /软件/分钱/或http://cran.r-project.org/web/packages/DIME/index.html(凹口)。
3所示。结果与讨论
3.1。模拟研究
我们的模拟是仿照AI人群的基因表达数据(21]。让相对应的表达水平的对数th基因(观察单位)th样本(如果它是一个控制样本如果它是一个治疗样本)。对于nondifferential基因,我们生成的通过随机抽样从APO AI的基因数据集的log-ratio是最多的。差异基因,我们模拟了日志控制样本的表达水平均匀分布(即,;我们设置日志表达水平在治疗样本,在那里,,遵循以下三个发行版之一:
请注意,是这样较小的基因表达将有更大的方差,在吗控制——或者underexpression的基因。此外,代表三个不同的潜在分布微分观测研究整体模型的性能在不同的数据类型。我们生成10000个基因的10%(1000)微分元素。100数据集下的模拟三种仿真设置(这三个分布在(7))。在每一个复制,我们计算假阳性率(玻璃钢)和真阳性率(TPR)每个基因作为微分或nondifferential分类。这里,TPR的正确分类率差异基因和玻璃钢分类的一个基因是微分时,它实际上是一个nondifferential基因。图1显示了合奏的方法拟合的结果这三种类型的模拟数据。在第1列(与指数分布的数据集),我们可以看到,选择最好的模型GNG多数复制,这是明显的事实,大多数的对角线上的点是最好的模型与GNG阴谋(1行1列)。尽管iNUDGE也有类似的TPR(2行1列),它更变量(散射)平均TPR略低。在第2列(有均匀分布的数据集),iNUDGE被选为最好的模型在所有复制,尽管GNG TPR和散射略低(1行2列),第1列。模型与基本正常的真理(第3列),iNUDGE选择是最好的在某些情况下,而在其他情况下GNG被选为最佳的整体模型。总的来说,不管底层分布,最好的模型选择类似或更好的TPR相比个人iNUDGE或GNG模型。另一方面,推动的结果与更低的TPR由于其限制使用只有一个法向分量(第3行),假阳性利率不是显示为零在所有复制。
3.2。实际数据分析
确认后的效用合奏的方法来处理多个数据类型通过仿真研究中,我们分析了真实数据集从ChIP-seq, DNA甲基化和基因表达。ChIP-seq实验已成为最常用的技术来审问近年来基因组protein-DNA交互位置。它使得科学家能够研究转录因子结合位点以更好的精度和更少的成本比老技术如ChIP-chip [4]。这些数据可用于捕获微分转录因子结合位点在正常和肿瘤样本,这可能提供见解癌症相关的基因是如何开启/关闭。关于ChIP-seq数据集的更多信息和方法用于预处理,包括归一化、看到Taslim et al。11]。DNA甲基化是一个重要的因素遗传改变基因表达的表观遗传调控,已被证明没有DNA序列的变化。DNA甲基化与许多重要的有关过程,如基因组印记和致癌作用22,23]。同样,微分分析基因的表达使研究人员能够找到癌症相关的基因和其他疾病(24,25]。有关DNA甲基化和基因表达数据集的更多信息和归一化方法,看到哈利利的et al。15和迪恩和阿布16]。表1总结了三种类型的真实数据在这一节中使用。
3.2.1之上。ChIP-Seq数据
整体模型应用于识别与丰富相关的基因聚合酶II (Pol II)绑定OHT数量(三苯氧胺耐药性乳腺癌细胞系),而正常乳腺癌(MCF7)。我们使用描述的规范化数据Taslim et al。11]。整体建模方法选择iNUDGE作为最好的整体与5正常组件模型。然而,混合比例为统一的组件可以忽略不计。根据分类标准的第一步,三个正常的组件指定为微分组件(参见图2(一个))。图2 (b)显示了QQ-plot,这表明一个合适的模型数据。硬币识别约21%(3909)的基因具有丰富波尔II绑定数量与MCF7 OHT细胞系相比。
(一)
(b)
3.2.2。DNA甲基化
整体模型也适用于识别不同甲基化基因在三个乳腺癌细胞系:MCF7 T47D, mda - mb - 361。这些甲基化数据来自DMH微阵列,采用双色技术比较癌细胞与正常池DNA样本(12]。降低Huber的加权方案用于downweigh log-ratios小强度。整体的最佳模式选择MCF7、T47D和mda - mb - 361细胞系GNG, iNUDGE和iNUDGE分别。数据3(一个)- - - - - -3 (c)表明该模型选择可以捕获所有三个细胞株的分布。原来,每个估计模型有3个正常组件与微不足道的制服或指数。这表明需要正常组件(s)来表示微分探针,事实上两三个正常的组件被称为微分三种细胞系。探测器数量的确定不同的甲基化是2816年,2928年和2799年之间(约44 k探针)MCF7, T47D,分别和mda - mb - 361。三个细胞株,异构和预计许多独特的甲基化位点。然而,由于这三个细胞株受体阳性,一些共享甲基化位点也应该存在。事实上,大多数的调查是独特的甲基化在每个细胞株之间共享的但有一些不同的细胞系(图3 (d))。
(一)MCF7
(b) T47D
(c) nda - mb - 361
(d)十字路口
3.2.3。基因表达
院长和阿布16]分析了几一些已知的数据集和一些已知的类似表达基因的差异表达基因,这使他们有价值的测试数据集可以检查假阳性和假阴性率。
数据集我:Apo AI。在这个实验中,基因表达是来自八个正常小鼠和八个老鼠AI基因人群淘汰(21]。与4毛钱了iNUDGE正常组件作为最好的整体模型,事实上捕获三峰的特征数据(图4(一))。的拟合优度iNUDGE进一步支持的陪同QQ-plot(图4 (b))。在这个模型中,一个正常的密度是贴上一个微分组件。基于这个模型中,31日被确定为差异表达的基因,其中包括8阳性基因中讨论Dudoit et al。21]。
(一)
(b)
(c)
(d)
第三集:艾滋病毒数据。这个数据集比较从CD4的互补+T细胞在感染后1小时HIV-1BRU和未感染同行。有13个已知基因差异表达(hiv - 1基因,它被用作积极控制),还有29负控制基因。iNUDGE再次被选为最佳整体模型解释数据。的密度图5正常组件和QQ-plot(数字4 (c)- - - - - -4 (d))确认所选模型的拟合优度。特别是,它是指出,“飙升”中心的分布是很好了,虽然QQ-plot显示数据和模型之间的分歧在正确的尾巴。有18个归类为差异表达的基因,其中包括13名积极控制。进一步说,没有一个29负控制基因包括在确定集。
4所示。结论
由于快速发展和创新在基因组的研究中,科学家们正在生产大量的不同类型的数据在很短的一段时间。然而这些激动人心的发展进行适当的数据分析带来了巨大的挑战。现有方法专门为某一特定类型可能不会导致令人满意的结果应用到另一个数据类型。在本文中,我们提出一个统一的微分识别方法基于一个整体框架,灵活地处理multitype数据(从老/当前技术以及未来潜在的数据)。我们的方法是基于类的混合模型提出了特定的数据类型。在这里,我们这些方法封装成一个统一的框架合成它们各自的优势。在我们提出的方法,选择最好的整体模型根据数据的基本特征和分类基于该模型将被执行。
我们证明了我们的方法的适用性使用模拟和真实的数据。我们模拟数据在三个不同的潜在分布的多功能性分析方法对不同类型的数据。我们的结果确实表明,最好的模型选择的程序以及执行或,在大多数情况下,比个人GNG结果,推动,或iNUDGE,不管底层数据类型。此外,很明显从仿真研究,推动并不是一个竞争模型。推动的表现不佳的主要原因是由于这样的事实,它不能够适应不同的数据类型没有多个正常组件。在GNG多个正常组件和iNUDGE显示捕获nondifferential至关重要的元素是不对称的,有时甚至可能是多通道。在我们的方法中,标记一些正常的组件作为微分证明是有益的,因为它允许最好的模型来捕获微分数据来自任何分布,从而提高我们的整体模型的灵活性来捕获不同的数据类型。结果三种真实数据的分析导致合理的拟合优度。此外,取得了较好的分类能力和低错误率应用数据与已知的积极和消极的控制。
我们混合模型使用正常的组件与不平等的方差,从而导致一个奇点问题(无界性可能当一个组件方差为0)在某些情况下。在某种程度上缓解这个问题的一个建议是使用BIC模型选择标准阻止更大的模型(因此,更少的机会与观测一个组件都有相同的值),我们已经实现了在包。还可以使用聚类算法(例如,k - means)来提供合理的初始参数混合模型开始。在我们的实现中,我们显示一个警告,如果检测到潜在的奇点。重新启动模型从不同的初始值和/或随机种子也会推荐。事实上,作为一个良好的实践,我们的模型应该运行在许多迭代开始与不同的参数,避免简单地寻找局部最优。一个惩罚可能性也可以娱乐引导方差估计远离零(26]。在我们的方法中,我们指定正常组件作为捕获基于微分地区通常被视为极端值。因此,分类的结果可能会有所不同,如果这截止值设置不同。
利益冲突
作者宣称没有利益冲突有关的出版。
确认
这项工作是由美国国家癌症研究所支持部分(格兰特U54CA113001)和美国国家科学基金会(格兰特dms - 1042946)。