rayapp
PDF
rayapp /2016/文章
特刊

目前用于预测与非编码rna相关的各种相互作用的计算模型

看本期特刊

研究论文|开放存取

2016 |文章编号 4563524 | 8 页面 | https://doi.org/10.1155/2016/4563524

ENS-PPI:一种新型集成分类预测蛋白质从PSSM使用自协方差变换的相互作用

学术编辑器:正音
收到了 2016年4月9日
公认 2016年05月08日
发表 2016年6月29日

抽象

蛋白质 - 蛋白质相互作用(生产者价格指数)在大多数生物活性起到至关重要的作用。虽然高通量生物技术的发展已经产生了各种生物体相当大的PPI数据,许多问题仍远未解决。一些基于机器学习的计算方法已经被开发,以促进新型PPI的鉴定。在这项研究中,一种新颖的预测器是使用旋转森林(RF)算法自协方差(AC)组合的特征从位置特异性得分矩阵(PSSM)萃取设计。更具体地,使用蛋白质的氨基酸序列中的信息产生的PSSM来。然后,有效的基于序列的特征表示,自协方差,被用于提取特征从PSSM来。最后,RF模型被用作分类器的相互作用和非相互作用蛋白对之间进行区分。该方法实现上的生产者价格指数进行时承诺业绩预测酵母H幽门,独立的数据集。好结果表明,该模型适用于生产者价格指数的预测,也可为解决其他生物信息学问题有用的辅助工具。

1.简介

蛋白质是生命中用途最广泛、最重要的大分子。它们对细胞中几乎所有的活动都至关重要,包括信号级联、代谢周期和DNA转录和复制[1]。研究人员发现,蛋白质很少作为分离剂来实现其功能。正如预期的那样,蛋白质之间相互匹配,形成一个巨大而复杂的蛋白-蛋白相互作用网络[2]。因此,对PPIs的研究已成为系统生物学的核心问题[34]。

到目前为止,各种实验技术已经开发和设计用于检测生产者价格指数。高通量技术,包括酵母双杂交(Y2H)屏幕[-7、串联亲和纯化(TAP) [2],和质谱蛋白复合物识别(MS-PCI)[6]花费相当多的时间,金钱和人力用于检测生产者价格指数。另外,目前由生物实验获得的质子泵抑制剂可以仅覆盖整个网络的PPI的一小部分[8]。因此,开发可靠的计算方法,提高识别效率具有重要意义[9-11]。

大量的在网上预测PPI方法已经出现[12-14]。这些方法通常基于基因邻近的信息[15],基因共表达[15],亲缘关系[16,基因融合事件[17],三维结构信息[18],等等[19]。然而,这些方法的应用受到限制[2021],因为他们需要依靠蛋白质的preknowledge。最近,基于对蛋白氨基酸,用于检测PPI的序列信息的方法已经被提出[22-24]。例如,你等。[25]只用蛋白质序列信息来预测PPI,其中一种方法称为PCA-EELM(主成分分析,合奏极限学习机)的设计。当上的质子泵​​抑制剂的数据执行酿酒酵母,该模型的预测精度为87.00%,灵敏度为86.15%,精度为87.59%。Martin等人[26]设计了一个使用扩展的签名描述符检测PPIs的模型,扩展到蛋白质对。为了验证该方法的预测能力,在使用10倍交叉验证时应用于H幽门酵母数据集,该方法的准确度为70%至80%。Shen等。[11[]考虑了残差局部环境,设计了联合三联法。当上执行人类生产者价格指数数据集,这种方法取得了83.9%的准确率。郭等人。[9]组合的支持向量机分类器带有自动协方差特征从蛋白质序列中提取预测的PPI在酿酒酵母。该方法的平均预测精度达到86.55%。

在这项研究中,我们提出了一种基于序列的方法,结合RF分类器和自协方差(AC)算法来预测相互作用的蛋白对[92728]。一种新的蛋白质特征表示方法来自于位置特异性评分矩阵(PSSM) [29],这给对数比值基于进化信息的特定位置得分特定残基置换。然后,有效的基于序列的蛋白质表示,自协方差,采用从PSSM来提取特征。中的一定数目的氨基酸序列的相互作用通过AC算法计算得出。因此,这种模式考虑到了邻近效应,并有可能找到整个序列模式。最后,将合奏RF分类器被建立,它是使用PSSM-导出的特征作为输入。在实验中,所提出的模型进行评价酵母H幽门PPI数据集。实验结果表明,我们的模型达到97.77%和84.84%的预测准确度95.57%,并在这两个数据集82.77%的灵敏性。此外,我们评估的独立数据集所提出的模型C线虫Ë杆菌H智人,中号家鼠质子泵抑制剂和分别达到96.01%,97.73%,98.30%,和96.81%的预测精度。

2.材料与方法

2.1。数据源

在实验中,我们使用了非冗余酵母数据,这是云集酿酒酵母相互作用蛋白(DIP)的数据库的核心子[三十],和版本是DIP20070219郭等人著[9]。两种方法:对子验证法(PVM)和表达式配置文件可靠性(EPR) [31],已经证明核心子集的可靠性。有包含在核心子5966相互作用对。具有少于50个氨基酸残基序列进行删除,因为它们可能只是片段。最后积极数据集由剩余的5943蛋白质对。该CD-HIT [3233算法进一步使用少于40%的身份来减少成对序列冗余。通过这样做,余下的5594对蛋白质构建了正数据集。我们选择了5594个额外的亚细胞定位蛋白对来构建负数据集。最后,构建完整的数据集;它由11188对蛋白组成,一半为阳性,另一半为阴性。

我们还使用的双混合测量方法测试了我们的方法H幽门通过雨等人提出。[34]。该H幽门数据集(可以在http://www.cs.sandia.gov/~smartin/software.html)包含2916蛋白对。有相互作用对和互不影响的对,各占50%。此数据集提供了比较我们的方法和其他方法[平台252635-38]。

2.2。位置特异性得分矩阵(PSSM)

位置特异性评分矩阵首次用于检测远相关蛋白,这是由Gribskov等人提出的[29]。其可行性已在蛋白质二级结构预测中得到验证[39],无序区域的预测[40],与蛋白质结合位点的预测[41]。一个PSSM的结构 行和20列。假设 。矩阵的行表示蛋白质残基,列表示原始氨基酸。各矩阵可表示为: 哪里 是相应的蛋白质序列的长度和 在里面 PSSM的排意味的概率 th残基突变成类型 的的进化信息中的蛋白质从多重序列比对游行期间20个天然氨基酸。

在本实验中,我们引入了位置特异性迭代BLAST (pci -BLAST)程序[42),SwissProt数据集在本地机器上,产生PSSM来。相比BLAST PSI-BLAST更为敏感,特别是在蛋白质家族新成员的发现。为了产生PSSM,PSI-BLAST需要序列的对比与在所述输入的蛋白质和在数据库中的蛋白质,且所有序列条目之间非常高的灵敏度SwissProt数据库经过计算机工具的仔细验证,并通过分子生物学家和蛋白质化学家的经验查阅相关文献,所以我们把SwissProt数据库作为实验中最优的比较数据库。为了得到广泛的高同源序列,我们保持其他参数不变 -value设置为0.001,迭代次数设置为3。应用PSI-BLAST和SwissProt数据库可以从以下网址下载http://blast.ncbi.nlm.nih.gov/Blast.cgi

2.3。自协方差(AC)

作为载体的统计工具最有效的分析序列中的一个,交流中得到了广泛的研究人员[应用于蛋白质家族分类4344],二级结构内容预测[4546,蛋白质相互作用预测[9]。AC是给定蛋白序列中两个残基平均相关性的表达变量,可以计算 哪里 是残基之间的距离, 代表了 氨基酸, 表示蛋白序列的长度, 表示氨基酸的矩阵分数 在位置

使用上述表达式中,AC变量的值 可以计算出: ,在那里 是描述符的数量。当在数据库中的所有数据完成该操作,每一个蛋白质序列表示为AC变量的向量;蛋白质对的特点是连接两个蛋白的载体中这种蛋白对。

2.4。旋转森林分类

旋转森林(RF)是一种流行的集成分类器,其思想起源于随机森林分类器。旋转森林中的每棵决策树都在旋转特征空间中的数据集上进行训练。决策树学习算法利用平行于特征轴的超平面来建立分类区域,轴的微小旋转就可以建立完全不同的树,通过变换可以保证RF的多样性。因此,射频模型可以提高分类器的分类精度,同时提高集成的多样性。与之前提出的集成系统(如随机森林)相比,它具有更强的鲁棒性[3247],套袋[3348],促进[49]。RF算法描述如下。

假设 包含 训练样本, 是一个 维特征向量。假设 为训练样本集( 矩阵),由 观测特征向量组成; 表示的功能集,和 表示相应的标签,然后 。假设特征集与适当的因子随机分成 相同大小的子集;在本例中,是决策树 在森林中可以表示为 ,分别。单个分类器的训练集的执行步骤 如下所示:(1)选择合适的参数 哪一个是因子 ;让 被随机分成 不相交的子集的部件;每个子集包含了许多特征, (2)从训练数据集中 ,选择特征子集中对应的列 并形成一个新的矩阵 ,然后是对象的自举子集,提取75%的 组成一个新的训练集 (3)矩阵 作为特征变换来产生矩阵中的系数 , 第列系数为特征 组件。(4)在基体中获得的系数 构造成一个稀疏旋转矩阵 ,表示为:

在预测期间,测试样品 ,由分类器生成 确定 属于阶级 。然后通过平均组合计算置信度的类别,公式如下:

然后,分配最大的类别 价值

3.结果和讨论

3.1。评价办法

在本节中,5倍交叉验证来评估所提出的方法,其中所有的样品都分裂成五个子集的性能。因此,一个子集是测试集,其余四子集的训练集。在我们的研究中所使用的评估标准包括总体预测准确度(的Accu。),灵敏度(森),精密(PREC),和马修斯相关系数(MCC)。计算公式如下所列: 真阳性(TP)代表样本的数量正确检测为阳性,真阴性(TN)代表样本的数量,正确检测到负数,假阳性(FP)代表样本的数量错误检测为阳性,和假阴性(FN)代表样本的数量错误检测为阴性。我们还生成接收者操作特性(ROC) [50]的曲线,以评估分类器的性能。典型地,分类器的阈值是0.5默认。当一组新的预测结果被接受,阈值会随着真阳性率与假阳性率的改变;这种变化可以用图形绘制出来。此外,下面积的曲线(AUC),其具有得分范围为0至1,也可以通过ROC曲线表示。当AUC值的预测比另一个预测时,该预测被认为是一个更好的。我们的方法的工作流程示于图1

3.2。预测能力评估

为了在实验中取得更好的效果,我们使用网格搜索方法对模型的参数进行了探索;具体的参数了 交流和参数值 射频价值。首先,我们讨论交流的参数;最大可能 最短的序列长度(50个氨基酸)在哪里酵母数据集。在这个实验中,几个 )进行评估,以获得最佳的蛋白序列性能。预测结果如图所示2。如从图中的曲线看出,预测精度逐渐参数时增加 的AC算法从5变化到40,当 值从40变化到45。有一个峰值点,其平均精度为95.86% 为40.我们可以得出一个结论;当参数 AC算法中的氨基酸数量小于40或小于40,蛋白质序列会丢失一些有用的信息,但会较大 可能会引入噪声而不是提高模型的性能。所以我们设置的值 40。

其次,我们讨论了RF的参数。根据以往的研究,我们选择PCA作为旋转森林转换方法。此外,J48决策树被选定为从WEKA数据库基础分类。在该实验中,两个参数(该特征子集的数目 以及决策树的数量 )通过网格搜索方法在取值范围内进行了测试,取得了较好的性能。数字3给出了不同参数的预测结果。我们可以看到,精度在开始时是波动的,然后随着的增加逐渐增强 ,但似乎与…的增长没有密切关系 。考虑到算法的准确率和时间代价,得到的最优参数 。为幽门螺旋杆菌数据集,我们使用AC提取特征和RF验证用的相同的参数酵母数据集。

引入5倍交叉验证方法,减少数据对预测模型的依赖[51-55]。表格1列出所有预测结果;预测准确率大于97.54%,准确度大于99.82%,灵敏度大于95.01%。该方法的平均预测精度为 %。ROC曲线在酵母数据集如图所示4。在这个图中, 射线显示假阳性率(FPR) 射线描绘真阳性率(TPR)。


测试组 所以他们的。(%) PREC。(%) 参议员(%) MCC (%)

1 97.59 100.00 95.14 95.28
2 97.54 100.00 95.03 95.19
3 98.17 100.00 96.40 96.40
4 97.59 100.00 95.01 95.27
97.99 99.82 96.27 96.06

平均 97.77±0.29 99.96±0.08 95.57±0.70 95.64±0.55

3.3。与所提方法进行了比较H幽门数据集

为了分析该方法在不同数据集上的预测能力,我们测试了该方法的预测能力。我们用所提出的方法来预测系统上的交互作用H幽门数据集。共有2916个蛋白质被纳入这个数据库,其中一半是相互作用的对,另一半是非相互作用的对。我们的预测结果见表2。我们可以看到一个准确度,精度,灵敏度,和MCC的84.84%,86.36%,82.77%,74.30和%分别。ROC曲线在H幽门数据集如图所示


测试组 所以他们的。(%) PREC。(%) 参议员(%) MCC (%)

1 85.76 87.45 82.87 75.52
2 83.53 82.65 84.38 72.49
3 86.11 87.55 83.57 76.02
4 81.99 83.27 79.51 70.42
86.82 90.88 83.55 77.06

平均 84.84±2.01 86.36±3.40 82.77±1.90 74.30±2.76

3.4。与以前方法的比较

为了更清晰地评价所提方法,我们将其结果与先前的模型进行了比较酵母数据集。作为一种经典的分类算法,支持向量机在识别相互作用和非相互作用的蛋白质对方面具有非常优越的性能。如Guo等人[9]提出了支持向量机的新方法与计算相关相结合,预测蛋白 - 蛋白相互作用中酵母数据集,结果证明了它的能力。具体来说,我们使用相同的特征提取方法(AC)结合PSSMs来比较旋转森林和SVM在同一数据集中的分类性能。采用网格搜索的方法对支持向量机的参数进行优化 ,分别。我们采用的LIBSVM工具可以从https://www.csie.ntu.edu.tw/~cjlin/libsvm/。如从表中可以看出3,利用SVM预测的PPIs酵母数据集,我们得到优异的结果与准确度,精度,灵敏度和分别95.86%,96.46%,95.21%,92.06和%MCC。大多数基于SVM方法产生了比我们的方法更低的平均标准值酵母数据集。


模型 测试集 所以他们的。(%) PREC。(%) 参议员(%) MCC (%)

郭等人的工作[9] ACC 89.33±2.67 88.87±6.16 89.93±3.68 N/A
AC 87.36±1.38 87.82±4.33 87.30±4.68 N/A

你等人的工作[25] PCA-EELM 87.00±0.29 87.59±0.32 86.15±0.43 77.36±0.44

杨等人的工作[56] COD1 75.08±1.13 74.75±1.23 75.81±1.20 N/A
COD2 80.04±1.06 82.17±1.35 76.77±0.69 N/A
COD3 80.41±0.47 81.86±0.99 78.14±0.90 N/A
COD4 86.15±1.17 90.24±0.45 81.03±1.74 N/A

周等人的工作[57] 支持向量机+ LD 88.56±0.33 89.50±0.60 87.37±0.22 77.15±0.68

我们的方法 支持向量机+ PSSM 95.86±0.34 96.46±0.50 95.21±0.70 92.06±0.62
RF + PSSM 97.77±0.29 99.96±0.08 95.57±0.70 95.64±0.55

此外,我们还比较了在现有的其他方法酵母H幽门数据集。表格3显示在其他六种方法的平均结果酵母数据集;可以看出,这些方法的精度结果在75.08% ~ 89.33%之间。这些方法的平均准确度、精密度、灵敏度和MCC值均低于本方法的97.77%、99.96%、95.57%和95.64%。表格4显示6种对方法的平均预测值H幽门数据集。我们可以看到,这些方法得到的精度值在75.80% ~ 87.50%之间,而我们提出的方法的精度值为84.84%,在该方法中也表现得很好。


模型 所以他们的。(%) PREC。(%) 参议员(%) MCC (%)

系统引导程序(35] 75.80 80.20 69.80 N/A
HKNN [36] 84.00 84.00 86.00 N/A
HKNN的合奏[37] 86.60 85.00 86.70 N/A
签名产品[26] 83.40 85.70 79.90 N/A
推进[38] 79.52 81.69 80.37 70.64
合奏榆树(25] 87.50 86.15 88.95 78.13
我们的方法 84.84 86.36 82.77 74.30

3.5。独立数据集的性能

已经取得的相当不错的结果酵母数据集和幽门螺旋杆菌数据集,我们决定测试该方法的性能独立的数据集。我们建立了我们的最终预测模型中使用的所有11188双酵母数据集作为训练集,使用网格搜索方法获得的参数;的价值 是40 AC,的值 是20, 在RF 3。特征向量使用基于从四个数据集作为RF测试输入的PSSM来以提取特征提取方法(AC)。独立测试数据集是由四个数据库(C线虫Ë杆菌H智人,中号家鼠)收集在数据库DIP。我们的模型的结果列于表;预测精度最高的C线虫Ë杆菌H智人,中号家鼠分别为96.01%、97.73%、98.30%、96.81%。这些结果显示了我们的方法在预测其他物种相互作用的准确性方面的出色表现。


物种 测试对 所以他们的。(%)

线虫 4013 96.01
大肠杆菌 6954 97.73
智人 1412 98.30
m .骶 313 96.81

4。结论

本研究提出一种基于PSSM特征提取的稳定、鲁棒的计算方法来预测PPIs。众所周知,预测PPIs的基于序列的方法的主要计算挑战是找到一个合适的特征表示,以充分描述蛋白质相互作用的重要信息。为了解决这一问题,我们首先使用自协方差(AC)方法从位置特定评分矩阵(PSSMs)中提取特征。然后,采用轮作森林(RF)模型作为一种新颖而准确的分类器进行PPIs预测,其性能优于现有的SVM分类器。为了评价所提方法的性能,五个PPIs数据集,即C线虫Ë杆菌H幽门H智人,中号家鼠,用于进行比较。实验结果表明,该方法的性能优于其他方法。因此,该方法可以作为预测PPI的有力工具。

利益争夺

作者宣称,有这方面的论文发表没有竞争的利益。

作者的贡献

高振国和王磊对这项工作同样做出了贡献。

致谢

本课题由国家科学基金61373086、61572506、61401385、广东省自然科学基金2014A030313555、深圳市科研开发基金JCYJ20140418095735569资助。

参考

  1. 尹中,邓,L. E. Peterson等,“人类脂肪细胞的转录组分析表明肥胖诱导的脂肪炎症中的节点样受体通路,”分子与细胞内分泌,第394卷,第2期。1-2, 80-87页,2014。视图:出版商网站|谷歌学术搜索
  2. A.-C.加文,M.Bösche,R. Krause等人,“通过蛋白质复合物的系统的分析的酵母蛋白质的功能性组织”性质,第415卷,no。6868, 141-147页,2002。视图:出版商网站|谷歌学术搜索
  3. K. A. Theofilatos,C. M. Dimitrakopoulos,A. K. Tsakalidis,S. D. Likothanassis,S. T. PAPADIMITRIOU和S. P. Mavroudi,“计算方法用于蛋白质 - 蛋白质相互作用的预测:一项调查,”当前生物信息学第6卷,no。4,第398-414页,2011。视图:出版商网站|谷歌学术搜索
  4. N. Tuncbag,G嘉,澳Keskin的,A Gursoy和R. Nussinov,“对蛋白质 - 蛋白质相互作用和界面的分析可用的工具和Web服务器的一项调查显示,”简报的生物信息学,第10卷,第2期。3,第217-232,2009。视图:出版商网站|谷歌学术搜索
  5. T. Ito, T. Chiba, R. Ozawa, M. Yoshida, M. Hattori,和Y. Sakaki,“探索酵母蛋白相互作用体的综合双杂交分析,”美国国家科学院院刊,第98卷,no。2001年,第4569-4574页。视图:出版商网站|谷歌学术搜索
  6. 何耀华,A. Gruhler, A. Heilbut等,"蛋白质复合物的系统鉴定。酿酒酵母通过质谱法”性质,第415卷,no。6868,第180-183页,2002。视图:出版商网站|谷歌学术搜索
  7. N. J. Krogan, G. Cagney, H. Yu等人,“酵母中蛋白质复合物的全球概况。酿酒酵母”,性质卷。440,没有。7084,第637-643,2006年。视图:出版商网站|谷歌学术搜索
  8. J.-D.J.汉,D.杜佩,N.贝尔坦,M. E.库斯科,和兰,“对蛋白 - 蛋白相互作用网络的拓扑结构预测采样的影响,”自然生物技术卷。23,没有。7,第839-844,2005。视图:出版商网站|谷歌学术搜索
  9. 利用支持向量机结合自协方差从蛋白质序列中预测蛋白质-蛋白质相互作用。核酸研究第36卷,no。9, 3025-3030页,2008。视图:出版商网站|谷歌学术搜索
  10. Z.-H。你,殷中,韩,杜斯。“一种半监督学习方法,通过结合功能基因网络的功能和拓扑特性来预测合成遗传相互作用。”BMC生物信息学卷。11,第343条,2010。视图:出版商网站|谷歌学术搜索
  11. J.沉,J.章,X. Luo等人,“预测仅基于序列信息蛋白质 - 蛋白质相互作用,”美国国家科学院院刊第104卷,no。11,第4337-4341页,2007。视图:出版商网站|谷歌学术搜索
  12. 纪,王b,邓s.p.,汝中,“基于lssr的时间序列方法预测围护结构动态变形”,神经计算《中国日报》,2014年第137卷,第165-172页。视图:出版商网站|谷歌学术搜索
  13. l .朱Z.-H。你,D.-S。“t-LSE:蛋白质-蛋白质相互作用网络建模的一种新的鲁棒几何方法”,公共科学图书馆·ONE卷。8,没有。4,文章ID e58368,2013。视图:出版商网站|谷歌学术搜索
  14. l .朱Z.-H。你和D.-S.黄,“通过非凸语义嵌入增加蛋白质 - 蛋白质相互作用的网络的可靠性,”神经计算,第121卷,第99-107页,2013。视图:出版商网站|谷歌学术搜索
  15. T. Ideker, O. Ozier, B. Schwikowski, A. F. Siegel,《发现分子相互作用网络中的调节和信号电路》,生物信息学第18卷,no。1,第S233-S240页,2002。视图:出版商网站|谷歌学术搜索
  16. R. Jothi, M. G. Kann,和T. M. Przytycka,“通过搜索进化树自同构空间预测蛋白质-蛋白质相互作用”,生物信息学第21卷,no。1,第I241-I250页,2005。视图:出版商网站|谷歌学术搜索
  17. “基于基因融合事件的全基因组蛋白质相互作用图”,国立台湾科技大学学报,2002。性质第402卷第2期6757,第86-90页,1999年。视图:出版商网站|谷歌学术搜索
  18. Q. C.章,D.皮特瑞,L. Deng等人,“在基因组范围内蛋白质 - 蛋白质相互作用的基于结构的预测,”性质,第490卷,no。7421,第556-560页,2012。视图:出版商网站|谷歌学术搜索
  19. Z. Yin, A. Sadok, H. Sailem等人,“一个形态学复杂性的筛选,识别离散细胞形状之间的开关样过渡的调节器,”Nature Cell Biology上第15卷第2期7,第860-871页,2013。视图:出版商网站|谷歌学术搜索
  20. Yin Z., Zhou X., C. Bakal等,“在高通量RNAi筛选的背景下,使用迭代聚类合并改进的间隙统计来执行在线表型发现,”BMC生物信息学,第9卷,no。1, 2008年第264条。视图:出版商网站|谷歌学术搜索
  21. 毛元华,夏振华,尹振华,孙元华,“基于模糊支持向量机的参数调整和特征选择的故障诊断”,硕士论文。中国化学工程杂志第15卷第2期2,第233-239页,2007年。视图:出版商网站|谷歌学术搜索
  22. Z.-H。你,Y.-K.雷,J.桂,D.-S.黄和X周“利用从评估和预测蛋白质相互作用歧管嵌入高通量实验数据,”生物信息学第26卷,no。21, 2744-2751页,2010。视图:出版商网站|谷歌学术搜索
  23. Y.-K。Lei, Z.-H。你,Z.吉,朱L.和D.-S.黄,“评估和通过结合多种信息集成歧管嵌入预测蛋白质相互作用,”BMC生物信息学,第13卷,补充7,第3篇,2012年。视图:出版商网站|谷歌学术搜索
  24. Y.-K。Lei, Z.-H。你,T. Dong, Y.-X。江工业大学。杨,“通过快速多方面嵌入提高蛋白质相互作用体的可靠性,”模式识别的字母卷。34,没有。4,第372-379,2013。视图:出版商网站|谷歌学术搜索
  25. Z.-H。你,Y.-K.雷,L.诸,J.夏,和B.王“从与合奏极端学习机和主成分分析的氨基酸序列的蛋白质 - 蛋白质相互作用的预测,”BMC生物信息学,第14卷第18号补充,第S10条,2013年。视图:出版商网站|谷歌学术搜索
  26. S.马丁,罗伊D.和J.-L。Faulon,“使用签名产品预测蛋白质 - 蛋白质相互作用,”生物信息学第21卷,no。2005年,第218-226页。视图:出版商网站|谷歌学术搜索
  27. J. J.罗德里格斯,L. I. Kuncheva,和C. J.阿隆索,“旋转森林:一种新的分类器群的方法,”IEEE模式分析与机器智能汇刊第28卷第2期2006年,第1619-1630页。视图:出版商网站|谷歌学术搜索
  28. L.南尼和A.光皮,“集生成和识别学生有学习障碍的特征选择,”与应用专家系统第36卷,no。2期,第3896-3900,2009。视图:出版商网站|谷歌学术搜索
  29. M. Gribskov,A. D.穆尔和D.艾森伯格,“资料分析:检测远亲蛋白质,”美国国家科学院院刊第84卷,no。13,第4355-4358页,1987年。视图:出版商网站|谷歌学术搜索
  30. I. Xenarios,L。Salwínski,X. J.段,P. Higney,S.-M.金,和D.艾森伯格,“DIP,相互作用的蛋白质数据库:用于研究蛋白质相互作用的蜂窝网络的研究工具,”核酸研究卷。30,没有。1,第303-305,2002。视图:出版商网站|谷歌学术搜索
  31. c·m·迪恩Ł。Salwiński、i Xenarios和d·艾森伯格”蛋白质相互作用:两种方法评估高通量观测的可靠性,”分子与细胞蛋白质组学卷。1,没有。5,第349-356,2002。视图:出版商网站|谷歌学术搜索
  32. D. R. Cutler, T. C. Edwards Jr., K. H. Beard等人,“生态分类中的随机森林”,生态第88卷,no。11,第2783-2792页,2007。视图:出版商网站|谷歌学术搜索
  33. P. L. Braga, A. L. I. Oliveira, G. H. T. Ribeiro,和S. R. L. Meira,“评估软件项目工作的Bagging预测器”,in神经网络国际联席会议会议录(IJCNN '07),第1595-1600页,奥兰多,佛罗里达州,美国,2007年8月。视图:出版商网站|谷歌学术搜索
  34. J. C.雨,L.塞利格,H.德重用等人,“蛋白质 - 蛋白质相互作用的地图幽门螺杆菌”,性质卷。409,没有。6817,第211-215,2001年,勘误表性质卷。409,没有。6821,743条,2001年。视图:出版商网站|谷歌学术搜索
  35. 博克和高夫,“全蛋白质组相互作用的挖掘”,生物信息学第19卷,no。1,第125-135页,2003。视图:出版商网站|谷歌学术搜索
  36. L.南尼,“超平面预测蛋白质 - 蛋白质相互作用,”神经计算第69卷,no。1-3,第257-263页,2005。视图:出版商网站|谷歌学术搜索
  37. L.南尼和A.光皮,“K-局部超平面预测蛋白质 - 蛋白质相互作用的整体,”生物信息学卷。22,没有。10,第一二零七年至1210年,2006年。视图:出版商网站|谷歌学术搜索
  38. B. Liu, J. Yi, a . Sv等," QChIPat:在不同实验条件下识别两种生物ChIP-seq样品不同结合模式的定量方法"BMC基因组学,第14卷,no。8,第3条,2013年。视图:出版商网站|谷歌学术搜索
  39. 基于位置特异性评分矩阵的蛋白质二级结构预测,分子生物学杂志,第292卷,第2号。第195-202页,1999年。视图:出版商网站|谷歌学术搜索
  40. D. T. Jones和J. J. Ward,“从位置特异性评分矩阵预测蛋白质无序区域”,蛋白质:结构、功能和遗传学第53卷,no。2003年,第573-578页。视图:出版商网站|谷歌学术搜索
  41. X.-W。Chen和J. C. Jeong,“基于序列的蛋白质相互作用位点预测的综合方法,”生物信息学卷。25,没有。5,第585-591,2009。视图:出版商网站|谷歌学术搜索
  42. S. F. Altschul,T. L.劲爆,A. A. Schaffer等人的“缺口BLAST和PSI-BLAST:新一代的蛋白质数据库搜索程序”核酸研究卷。25,没有。17,页3389-3402,1997。视图:出版商网站|谷歌学术搜索
  43. Y.过,M.李,M.路,Z.闻和Z.黄,“预测的G蛋白偶联受体,G蛋白偶联特异性基于越野 - 协方差变换,”蛋白质:结构、功能和生物信息学卷。65,没有。1,第55-60,2006年。视图:出版商网站|谷歌学术搜索
  44. 《利用初级氨基酸序列的主要化学性质的非比对提取方法对g蛋白偶联受体的分类》。蛋白质科学第11卷,no。4, 2002年第795-805页。视图:出版商网站|谷歌学术搜索
  45. Z.林和X.-M.锅“的蛋白质二级结构含量准确的预测,”杂志蛋白质化学第20卷,no。第217-220页,2001年。视图:出版商网站|谷歌学术搜索
  46. C.-T.张,Z.-S.林,Z.章,和M.严,“基于其一级序列的球状蛋白的螺旋/根含量的预测,”蛋白质工程第11卷,no。11, 971-979页,1998年。视图:出版商网站|谷歌学术搜索
  47. L. Breiman,“随机森林”机器学习卷。45,没有。1,第5-32,2001。视图:出版商网站|谷歌学术搜索|Zentralblatt数学
  48. 郭宏源。Lee和Y. Yang,“时间序列的二进制和分位数预测器”,杂志的经济学卷。135,没有。1-2,第465-497,2006年。视图:出版商网站|谷歌学术搜索|MathSciNet
  49. G. Ratsch, S. Mika, B. Scholkopf, k - r。《从支持向量机构建增强算法:对单类分类的应用》,IEEE模式分析与机器智能汇刊第24卷第2期2002年,第1184-1199页。视图:出版商网站|谷歌学术搜索
  50. m.h. Zweig和G. Campbell,“受试者工作特性(ROC)图:临床医学中的基本评估工具”,临床化学第39卷,no。4, 1993年561-577页。视图:谷歌学术搜索
  51. Z.-H。你,J.李X. Gao等,“用一种新的基于矩阵的蛋白质序列的代表性和支持向量机检测蛋白质 - 蛋白质相互作用,”生物医学研究的国际,第15卷,文章编号867516,9页,2015年。视图:出版商网站|谷歌学术搜索
  52. Z.-H。You, k.c.c. Chan和P. Hu,“使用一种新的多尺度局部特征表示方案和随机森林从初级蛋白质序列预测蛋白质-蛋白质相互作用,”公共科学图书馆·ONE,第10卷,第2期。5,第e0125811条,2015。视图:出版商网站|谷歌学术搜索
  53. Y.黄,Z.你,X.高,L.王和L.王,“使用加权稀疏表示模型离散余弦变换来预测来自蛋白质序列的蛋白质 - 蛋白质相互作用结合,”生物医学研究的国际卷。2015年,文章编号902198,10页,2015年。视图:出版商网站|谷歌学术搜索
  54. Z.-H。你,J.-Z。Yu, L. Zhu, S. Li和Z.-K。基于MapReduce的大规模预测蛋白质-蛋白质相互作用的并行支持向量机。神经计算《中国日报》,2014年第145卷第37-43页。视图:出版商网站|谷歌学术搜索
  55. Z.-H。你,S.李X.高,X.罗和Z基“大型蛋白质 - 蛋白质相互作用检测通过整合与计算模型大生物传感数据,”生物医学研究的国际, 2014年第3卷,文章编号598129,9页。视图:出版商网站|谷歌学术搜索
  56. L.杨,J.-F.夏,和J.桂,“使用局部描述符从蛋白质序列的蛋白质 - 蛋白质相互作用的预测,”蛋白质和肽字母第17卷,no。9,第1085-1090页,2010年。视图:出版商网站|谷歌学术搜索
  57. Y. Z.周,Y.高,和Y Y.郑,“蛋白质 - 蛋白质相互作用预测利用氨基酸序列的本地描述,”在在计算机科学与教育应用,第II部分进展,第02卷,第254-262页,施普林格,德国,柏林,2011。视图:出版商网站|谷歌学术搜索

版权所有这是一篇开放获取下发布的文章知识共享署名许可,允许在任何媒体中不受限制地使用、发布和复制原创作品,只要原稿被正确引用。


更多相关文章

1008 的观点 | 401 下载 | 13 引文
PDF 下载文献 引用
下载其他格式更多
为了打印副本订购

相关文章

我们致力于快速,安全地与COVID-19尽可能共享成果。任何作者提交COVID-19纸应该通知我们的help@hindawi.com以确保他们的研究被快速跟踪,并尽快在预印本服务器上可用。我们将为已接受的COVID-19相关文章提供不受限制的出版费用减免。注册在这里作为审稿人,帮助快速跟踪新提交的内容。