文摘
癌症亚型的正确分类具有重要意义的癌症发病机制的深入研究,实现准确的治疗癌症患者。近年来,癌症亚型的分类使用深层神经网络和基因表达数据已经成为一个热门话题。然而,大多数分类器可能面临的挑战过度拟合和低分类精度在处理小样本大小和高维生物数据。本文提出了级联灵活的神经森林(CFNForest)模型来完成癌症亚型分类。CFNForest扩展传统的柔性神经树结构FNT集团森林利用装袋整体战略,可以自动生成模型的结构和参数。为了深化FNT集团森林没有引入新的hyperparameters,多层层叠框架利用设计FNT组织森林模型,转换特性之间的水平,改善了模型的性能。拟议中的CFNForest模型还提高了运营效率和模型的鲁棒性,样本选择机制层和设置不同的权重之间每一层的输出。完成癌症亚型分类、FNT集团森林不同特性集被用来丰富模型的结构多样性,使它更适合处理小样本数据集的大小。RNA-seq基因表达的实验数据显示,CFNForest有效改善癌症亚型分类的准确性。分类结果具有良好的鲁棒性。
1。介绍
癌症是一种异构的损失造成的损伤局部组织细胞生长的正常调节基因层面的致癌因素的作用下(1]。如今,癌症已经成为人类死亡的主要原因之一(2]。传统的癌症研究方法大多是基于临床经验。通过分析临床医生做出诊断数据和数量有限的情况下。然而,癌症的分子表达水平高度异构,这意味着有很多分子亚型在癌组织。癌症患者相同的症状可以显示重要的预后差异在同样的治疗方案(3]。异质性是癌症的基本特性之一,也是最大的挑战精密治疗癌症的发展(4]。
的过程中发生、发展和转移的癌症是非常复杂的。研究结果表明,不同的癌症亚型在多个基因表达数据方面有显著的差异(5]。因此,癌症研究在基因水平是非常重要的对于癌症的治疗和诊断。新一代测序的出现导致的基因表达数据量的爆炸性增长。然而,最好的利用这些数据做出准确的预测不同的癌症亚型研究者们是一个严重的挑战6]。
尽管所有组织细胞的基因记录在样品的基因表达谱,只有少数基因与癌症亚型的分类(7]。此外,基因表达的数据结构很复杂,冗余的信息非常高,和基因之间的相关性很强。传统的生物研究方法难以有效处理基因表达数据(8]。因此,研究人员迫切需要新的和有针对性的分析方法。
深入学习人工智能的一个分支,已成为生物数据分析和处理的有力工具通过使用反向传播,分层处理和各种优化算法(5]。基因表达数据的特点是高维度、高冗余,和极端的空间复杂度。处理后的基因表达数据和机器学习方法,它不仅可以有效地识别基因之间的关系,而且还建立更准确的预测模型。这提供了一个重要的技术支持的正确分类癌症亚型,具有十分重要的意义对于理论研究和实际临床应用的癌症(9]。
近年来,许多研究人员已经做了各种尝试使用深度学习方法来研究癌症亚型分类。Fakoor et al。10)无监督特征学习深栈autoencoder用于处理基因表达数据和完成癌症检测和癌症亚型分析使用它。该方法改善癌症亚型分类的准确性。一个可伸缩的方法来处理不同的癌症亚型基因表达数据也提供了。Khademi和Nedialkov11)提出了一个概率图形模型(PGM)预测和诊断乳腺癌。模型解决贫穷问题的学习问题,如高和体积小的基因组数据集通过多样化的学习和深刻的信念网络。在这篇文章中,作者使用SoftMax节点将铂族金属和DBNs由临床和微阵列数据,和方法显示,癌症亚型分类好的结果,癌症复发和转移预测真实数据集上的任务。郭et al。12)提出了一个名为BCDForest深度学习框架。传统的森林深处模型改进了利用深度学习的优点。实验结果表明,该模型可以表现出各种癌症亚型分类时更好的分类性能。Karabulut和Ibrikci13)提出了一种区别的深层信念网络(DDBN)模型对癌症亚型分类。在本文中,高维度和失衡的问题解决了基因表达数据。实验结果表明,该模型比其他分类器在癌症亚型分类的准确性。肖et al。14)提出了一种基于深度学习的多通道整体癌症使用深度学习方法预测方法融合多个机器学习分类模型。RNA-seq数据集的实验结果肺癌、胃癌、乳腺癌显示,该方法可以有效改善癌症亚型分类的准确性。
在本文中,提出了级联神经森林(CFNForest)灵活癌症亚型分类。这个模型是一个深层神经网络集成的框架基于FNT组森林。与传统的深层神经网络模型相比,CFNForest可以自动优化内部的结构和参数神经网络在训练过程中。与深模型建立在nondifferentiable模型相比,该模型可以分层遗传特性没有离散输入功能。CFNForest集成多个分类器整体策略和改进模型的总体分类精度通过功能转换之间的水平。通过增强的样本和特征优化机制的引入,该模型还显示在小样本数据集良好的分类性能。实验结果表明,CFNForest始终优于最先进的乳腺浸润性癌的分类方法,使用RNA-seq多形性成胶质细胞瘤、肺癌基因表达数据。
2。材料和方法
2.1。数据集
RNA序列基因表达数据使用本文下载的癌症基因组图谱(TCGA) [15]。三种类型的癌症TCGA下载的数据库和排序:乳腺浸润性癌(BRCA)多形性胶质母细胞瘤(GBM),和肺癌(肺)。每个样本的标签是基于真正的TCGA提供的癌症患者临床资料。有四个基本的BRCA亚型:官腔(98 /∼19.06%),HER2-enriched (58 /∼11.28%), a(231 /∼44.94%)和b (127 /∼24.72%)。总共514份有效数据样本。在肺有三个亚型:Bronchioid (104 /∼37.82%), Magnoid(72 /∼26.18%),和鳞状(99 / 36.0∼),275份有效样本。在“绿带运动”有四种基本类型:古典(42 /∼25.62%),间充质(55 /∼33.5%)、神经(28 /∼17.1%)和颈板(39 /∼23.78%),可用有效样本的数量是164。三种癌症类型的细节如表所示1。
预处理步骤是离群值删除,缺失数据归责,和归一化:如果基因表达数据缺失值超过20%的病人,病人数据过滤;缺失的数据,K最近的邻居是用来填写;癌症基因表达数据的标准化处理如下: 在哪里基因表达数据特性和吗是标准化的基因表达特性。和的均值和方差是吗 。
2.2。灵活的神经树模型
深层神经网络的优点,如逐层处理,反向传播,和足够的模型的复杂性,使其显示在几个机器学习领域强大的性能优势。然而,当设置神经网络的结构,几乎都有无数的组合层神经网络,数量的神经元,神经元之间的联系(16]。模型的质量往往取决于研究者的经验。当网络结构过于复杂,模型不仅容易过度拟合的风险,但复杂的训练过程也带来了极高的计算成本(17]。
当网络结构过于简单,分类和预测模型的性能不会很好。在此基础上,陈等人提出了灵活的神经树(FNT)模型(16- - - - - -18]。自动优化的结构和参数的自动优化的过程中最重要的两个部分构建FNT模型。摘要语法指导遗传规划(GGGP)和粒子群优化(PSO)算法被用来优化FNT的结构和参数,分别。
2.2.1。语法制导遗传规划
遗传编程是一种进化计算方法提出Koza [19]。运营商种群进化,遗传编程算法取代了遗传算法的二进制串表示和操作更直观的人口的个人。遗传算法主要利用优势和劣势的概念在生物学。计算一个预先确定的适应度函数使用层次结构和更灵活的表达形式。之后,它模拟了生物遗传进化的过程,寻找最好的一个解决方案空间通过基因操作,如选择、交叉和变异。
GGGP克服缺点的设置功能和相同类型的终端指令必须在标准遗传规划算法和避免产生无效的问题个人交叉或变异的过程中。当使用GGGP产生染色体的个体人口的上下文无关语法G被定义为一个成套的{N,T,PΣ},N是一组非终结符号,T是一组终端符号,P是一组生成规则和Σ开始的象征。如果 和 定义,语法规则来标示 。下面是生成GGGP算法流程:(1)随机生成初始种群个体生成方法根据语法模型(2)计算个体的健康人群中来评估每个目前(3)生成新一代种群遗传操作(包括选择、交叉和变异),根据预定义的标准和评估所有单个树和个人健康(4)如果个体最优解出现或终止条件满足,项目结束;否则转到步骤(2)并继续进化
在人口优化生成的过程中,个人的质量由适应度函数的价值判断 。值越小,误差越小的实际和预期输出算法。在本文中,我们使用标准的方差作为适应度函数: 在哪里N代表个体的总数。和代表的实际价值我th个人和算法的输出值,分别。的值越小 ,个人越好。
2.2.2。粒子群优化
粒子群优化(PSO)算法肯尼迪提出的以人群为基础的启发式搜索算法(20.]。PSO表示问题的解空间的搜索空间粒子和问题的解决方案作为粒子的位置。空间中粒子的速度决定了粒子的运动的速度和方向(21]。每个粒子的健身价值可以通过计算目标函数。通过这种方式,找到问题的最优解的问题转化为寻找最优位置的粒子在搜索空间。
当使用粒子群优化算法,首先随机初始化粒子群在给定的解决方案空间,然后每个粒子的初始位置和初始速度(22]。迭代执行根据一组规则:每个进化粒子更新显示其在解空间的位置和速度p最好的和 ,在哪里p最好的获得的最优解是一个单粒子在进化过程中,是所有粒子在进化过程中获得的最优解。在获得这两个最优解,粒子我可以更新它的速度和位置根据公式(3)和(4): 在哪里粒子的速度吗我,粒子的位置吗我,和正在学习的因素, , 。 是惯性因素。粒子不断调整其位置根据速度但不能超过的最大速度 ,这将限制吗当超过 。图1进一步说明了PSO优化过程。
粒子群优化算法主要包含六个基本步骤:①初始化相关参数;②计算粒子的适应度值;③找出每个粒子的当前最优解为p最好的;④找出当前整个粒子群的最优解和设置它 ;⑤更新粒子的速度和位置根据公式(3)和(4);⑥去步骤②直到满意的结果达到或满足终止条件。
2.2.3。灵活的神经树
与其他形式的深层神经网络相比,FNT模型可以自动优化自身结构培训期间,不需要用户事先设置它。在结构优化过程中,FNT允许跨层输入向量和各个节点之间的联系,从而产生一些稀疏的网络具有良好的性能相对容易。很难实现这一目标,当设置基于人类经验的网络结构。(23]此外,FNT可以自动选择关键特性通过分配不同的权重来输入向量在培训过程中,从而大大提高了模型的分类能力。图2是一个灵活的神经树模型。
构建一个灵活的神经树如图2,我们首先定义了模型 ,在哪里 是nonleaf节点(函数集),FNT可以产生更多样的树形网络结构通过改变函数集(24]。 是叶节点(终端指令集)。FNT如图的算法流程3。
初始化相关数据;随机分配网络参数并生成初始树结构;然后由语法指导遗传规划优化树结构,重复这个步骤,直到找到更好的树结构。使用粒子群优化来优化网络参数的当前最优的树结构和重复这个步骤,直到找到最优参数值或超过设定值的迭代次数。最后生成当前网络结构和参数判断根据终止条件是否能满足要求,如果没有,网络被回到树结构优化再生步骤,直到满足终止条件。在计算FNT的输出,我们使用 随着nonleaf激活函数的节点(25]。FNT模型的算法规则如表所示2。
2.3。整体方法
整体学习结合多个学习者不同的整体策略训练他们来执行相同的任务。整体学习模型通常具有更好的泛化性能比个人学习者(27]。主要有两种方法将学习者:一个是生成基础学习者不依赖彼此平行的装袋合奏策略(28]。代表是随机森林算法(RF) (29日]。装袋的整体战略可以有效地提高算法的准确性;另一种是通过提高整体策略30.),它可以连续生成基础学习者相互之间有很强的依赖性。代表学习演算法和梯度提高决策树(GBDT) [31日]。提高整体策略可以降低模型过度拟合的风险,提高模型的泛化能力。图4给出了框图结合装袋的两种合奏的方法和提高。
(一)
(b)
2.4。级联灵活神经森林模型
癌症亚型基因表达数据是一个连续的数据类型。不同的基因表达信息有很强的相关性,这意味着它是最好不要离散化时分类癌症亚型的基因表达数据。这将导致不同的分类器(如决策树和随机森林)显示癌症亚型的分类(表现不佳32]。FNT是一种新型的神经网络,它有许多优点,传统的深层神经网络模型没有(例如,模型的结构和参数可以自动优化,特征选择可以自动执行,等等)(23,33]。
然而单一的输出特性决定它不能直接用于处理multiclassification。因此,需要进一步优化。其次,基因表达数据是昂贵的获得和可用的样本数量很小。但深层神经网络的良好的性能往往取决于大量的训练样本。样品太少会导致模型遭受表现不佳引起的过度拟合(34]。因此,有必要使用新方法来改善FNT使用样本的能力,使模型适合处理小样本数据集的大小。此外,为了获得更好的分类性能和提高模型的泛化能力,我们需要做FNT的进一步深化。共同深化方法不仅向模型中添加许多hyperparameters,但也带来高计算成本。所以应该使用一个更合适的框架,深化FNT。在此基础上,本文提出了级联神经森林模型灵活(CFNForest)如图5。
FNT模型只有一个根节点的输出,确定它可以只做二元分类问题,而癌症往往有多个亚型。为了使FNT模型适用于癌症亚型分类领域米必要的方法是利用变换multiclassification问题分成几个二进制的问题。然后根据生成的FNT组生成二进制的数量问题,这意味着在一群FNTs (米是参数数量)。我们把FNT集团作为一个整体,装袋合奏森林,把战略形成FNT集团K在每个节点上FNT组。的数量K可以根据需求(增加FNT团体的数量在森林里有利于改善森林的分类性能,但与此同时,将增加整体的计算成本;降低的价值K可以提高操作效率模型的但可能影响森林的总体分类精度)。图6显示森林FNT集团内部的结构和算法。
为了提高深化FNT癌症亚型的分类精度,提高策略采用合奏多个强大的并行FNT组森林。这个框架的优点是,它不能只会让整体学习模型的优势,提高其泛化能力,还没有引入新的hyperparameters深化FNT。建立一个良好的整体框架中,个体学习者应该多样化(35]。因此,我们使用三个不同的函数集FNT集团的森林在我们的模型中。
在得到森林的第一层的输出,我们使用森林的分类结果作为增强样品。我们结合他们与原来的特性和在新输入传递到下一层。通过这个内部功能转换,我们可以有效地提高模型的性能,提高分类精度。通过这种方式,每一层的森林增强样品。随着层数的增加,整个森林可以使用越来越多的增强在训练样本。这将使模型仍有出色表现在处理小样本数据集的大小。随着模型的深度增加,这种优势将会越来越明显。
CFNForest为了提高运营效率和降低模型的计算复杂度,我们引入了一个样本选择机制在森林的每一层:设置一个预测信心将样本划分为两个部分。一个是样品,已经达到了较高的分类精度,叫做样本集Y。另一个是信心不符合要求的样本,被称为样本集X。例如,给出预测置信区间 。第一层,有5个样品处理和分类结果{[0.07,0.03][0.35,0.44][0.52,0.67][0.83,0.12][0.95,0.14]}。我们可以把这个样本集分成两个部分:输出结果的两个样本[0.07,0.03]和[0.95,0.14]是我们设置置信区间内,这两个样本属于样本集Y。其他三个样品不符合要求属于样本集的信心X。
对于每一个样本的Y我们有足够的确定性,他们属于癌症亚型,我们不需要重新分类送他们到下一个水平。至于样本集X,我们认为当前森林结构不能有效分类。因此,有必要继续增加的深度模型和优化整体结构。设置输出优化机制的主要目的是解决过度造成的计算复杂度的问题毫无意义的计算。随着森林层数量的增加,样品的数量满足置信度要求会增加一层一层地。与此同时,越来越少的样品需要发送到下一个层次进行进一步的分类。在这个实验中,训练集划分为两个部分,一个用于培训,另一个用于验证。当添加一个新图层,验证集将验证整个森林。当添加新森林不会增加了准确性或准确性增加并不显著,模型中的层数将停止增加。通过这种方式,该模型可以自动确定其层数。
为了避免分类错误的分类结果之间的差异造成的森林和其他层的一层相同的样本,在计算模型的最终的输出,我们每一层的分类结果参与最终的输出的计算有不同的权重。最终结果计算如下: 在哪里层数,的输出是什么 - - - - - -th层森林和的分类结果的重量吗 - - - - - -层森林,最终的输出。
3所示。结果
3.1。与其他分类器比较CFNForest BRCA数据集
我们测试了模型的分类性能对CFNForest癌症亚型。为了证明CFNForest分类性能的优越性,我们比较它与再(资讯),概率图形模型(PGM) [11),支持向量机(SVM),随机森林(RF),歧视的深层信念网络(DDBN) [13],增加级联森林深处(BCDForest) [12),分别。处理后获得的基因信息功能是用作每个分类器的输入。对于所有的输入样本,我们使用了5倍交叉验证方法对每个分类器的整体性能进行评估。完整的数据集分为5类基数后subdatasets比例;每个5部分被反过来作为测试数据(剩下的训练数据)在每个5分的交叉验证实验。对于每一个分类器,分类结果的平均精度相比,回忆,和f - 1的分数(如图7)。
当分类癌症亚型的BRCA CFNForest的分类精度达到94.4%。优于其他分类器的分类性能。在图7分类精度的偏差值相比,我们在10实验和回忆。实验结果表明,我们建议的CFNForest不仅取得了较高的分类精度,但也有更稳定的分类结果与其他分类器相比,表明该模型具有良好的鲁棒性的分类性能。
3.2。比较与其他分类器在GBM CFNForest数据集
我们继续测试该模型的分类性能的“绿带运动”数据集癌症亚型。相比之下,然而,PGM,支持向量机,射频,DDBN, BCDForest。为了保证实验结果的准确性,采用5倍交叉验证评估每个分类器的整体性能。每个分类器的评估结果的平均精度,召回,f - 1得分图所示8。
如图8CFNForest的分类精度明显优于其他分类模型。与资讯相比,PGM、支持向量机、射频,DDBN, BCDForest, CFNForest仍然显示在GBM数据更好的分类性能。与此同时,我们可以发现所有分类器的分类精度远低于BRCA数据集的结果。我们认为这是由于训练集的样本容量太小了。这种情况的出现也重申我们之前提到过的:可用训练样本的数量有限,如何构建一个更好的模式来实现准确分类为每个样本仍然是一个问题,需要进一步考虑。
3.3。比较CFNForest与其他肺数据集分类器
最后,我们测试的性能提出了这些癌症亚型的分类模型的肺的数据集。我们让它被拿来与资讯的PGM,支持向量机,射频,DDBN, BCDForest。处理后获得的基因信息功能是用作每个分类器的输入。对所有输入特征向量,本文使用了5倍交叉验证方法对每个分类器的整体性能进行评估。每个分类器的分类结果进行比较的平均精度,回忆,和f - 1的分数,结果如图所示9。
CFNForest实现肺数据集上的分类精度为90.9%,优于其他分类模型。与资讯相比,PGM、支持向量机、射频、DDBN, BCDForest,该模型还显示在这个数据集更好的分类性能。实验的标准偏差分类精度表明,获得的实验结果CFNForest比其他分类模型更稳定。
4所示。讨论
基因表达信息之间的相关性很强,而决策树以及随机森林经常丢失信息的过程中离散输入特性,进而破坏基因之间的相关性。因此,这种类型的癌症亚型分类分类器往往表现出糟糕的性能问题。深层神经网络,由反向传播训练多层参数模型,非常适合于处理连续数据如遗传信息由于其非线性和可微的特征。然而,传统的深层神经网络模型结构的设计通常是基于研究者的经验。几乎无限的组合模型结构的方法。因此,有必要使用一个更合适的神经网络模型实现过程的基因表达数据准确分类癌症亚型。
基因表达数据是昂贵的收购和可用样本的数量很小。然而,深层神经网络的训练过程通常需要大量的训练数据。否则,模型性能不仅是穷,但也容易陷入过度拟合的风险。因此,需要提出新的优化策略来提高深层神经网络使用训练样本的方式,让他们适合处理小样本数据集的大小。
在这篇文章中,提出了小说深层神经网络集成模型。基于传统的柔性神经树模型,这是扩展到FNT集团森林使用装袋整体策略,它不仅能产生良好的自适应神经网络的结构和参数,而且还克服了问题FNT不能用于多个分类任务。FNT模型加深了一个级联的框架,和模型性能提高了功能转换的模型。后,算法的鲁棒性是确保通过设置不同的权重为每一层以及引入森林的功能优化机制,使模型运行的效率。最后,FNT集团与不同的功能集引入森林丰富模型结构的多样性,使其更适合处理小样本数据集的大小。
在当前的医疗诊断,大多数癌症患者的诊断是基于医生的医学知识和经验。和癌症有一定的潜伏期,早期病变现象不是很明显,而且一旦医务工作者是出差,病人的病情往往容易错过最佳治疗时期。因此,如何有效地诊断癌症和正确识别其亚型是极其重要的医学领域和维护人的生命。
癌组织细胞的基因表达是不同于正常组织细胞,它提供了一个有效的基础阐明癌症的发病机理和发育特点从基因的角度2]。基因表达数据的分析和决策提供指导癌症早期诊断,具有积极和深远的意义,正确的和及时的诊断癌症。当然,研究癌症基因表达数据仅为临床医生提供了另一种方法,和个性化的治疗癌症的其他分子生物学特性36)也将重点在未来的研究方向。
5。结论
作为人类死亡的主要原因之一,癌症具有多种类型的特点和复杂的发病机理。癌症的病变往往发生在任何时间。客观和准确的分类癌症亚型使医生能够正确认识癌症的发病机理和主要的位置,这是对癌症成因的研究具有重要意义。基因表达数据的全面性和高基因与癌症之间的相关性使它成为一个天然的优势进行癌症亚型的基因表达数据分类研究。基因表达数据本质上是一个高维、小样本大小和高度冗余数据。有很大的困难在功能处理和模型设计这些数据使用传统分类器。在本文中,一个新的癌症亚型分类模型,CFNForest,提出能够分层处理的基因特性没有离散输入特性与深模型建立在nondifferentiable模型。与传统的深层神经网络相比,该模型可以自动优化训练过程中内部结构和参数。CFNForest使用一个框架,集成了多个装袋算法使用一个提升的策略。整体学习的优点的基础上,模型的整体性能是提高功能层之间的转换,从而使它能够获得高分类精度在小样本数据集。 Experimental results show that CFNForest consistently outperforms the state-of-the-art methods in classifying breast invasive carcinoma, glioblastoma multiforme, and lung cancer by using RNA-seq gene expression data.
数据可用性
基因表达数据和microrna的表达数据可以从癌症基因组图谱的网站下载https://www.cancer.gov/about-nci/organization/ccg/research/structural-genomics/tcga/。特定的BRCA,“绿带运动”,肺在我们的手稿可以通过数据集https://github.com/VeblenChung/Cancer-Subtype-Classification-Data-Set。
的利益冲突
作者宣称没有利益冲突有关这项研究的出版物。
确认
这项研究是由中国国家自然科学基金(批准号61671220),大学创新团队项目的济南(2019 gxrc015)和山东省重点科技创新项目(2019 jzzy010324)。