) and gene frequency of individual term (Pearson correlation = 0.1298, ) in GeneRIFs and GOA shows our annotation resource is very reliable."> 用基因本体论和疾病本体论诠释人类基因组的功能 - raybet雷竞app,雷竞技官网下载,雷电竞下载苹果
rayapp
PDF
rayapp /2016/文章
特刊

针对多样化的交互相关的非编码RNA的预测目前的计算模型

看本期特刊

研究文章|开放获取

体积 2016 |文章的ID 4130861 | 8 页面 | https://doi.org/10.1155/2016/4130861

用基因本体论和疾病本体论诠释人类基因组的功能

学术编辑器:陈星
收到了 02年6月2016年
修订 2016年7月24日
接受 2016年7月27日
发表 2016年8月22日

抽象

越来越多的证据表明人类基因组中的该功能标注在分子水平和表型水平对基因的系统的分析非常重要。在这项研究中,我们提出了一个名为Gene2Function注释基因参考到功能(GeneRIFs)框架,其中GeneRIFs的各功能说明可以通过文本挖掘工具打开生物医学注释器(OBA)进行注释,并且每个Entrez基因可以映射到人类基因组组织基因命名委员会(HGNC)基因符号。注释所有关于GeneRIFs的人类基因的记录,13148倍的mRNA和7182项,948个microRNA和533个条款和139个长非编码RNA(lncRNAs)和297项之间901个协会之间的9496个协会之间288869家协会后,得到了一个全面的注释资源的人类基因组。个体基因(Pearson相关= 0.6401的术语频率的高稠度, )和个体项基因频率(Pearson相关性= 0.1298, )在GeneRIFs和GOA显示了我们的注释资源是非常可靠的。

1.简介

人类基因组是一套完整的人类[核酸序列的1]。人类基因组序列研究的目的是探讨基因的功能[2- - - - - -5]。由序列的人类基因可以在平衡体内发挥基于其在分子水平上功能不同的角色。一旦平衡被缺乏或增强的基因的功能丧失,疾病可以被诱导[6- - - - - -9]。

以往的研究主要是根据编码蛋白在分子水平上识别编码蛋白基因的功能。例如,通过研究p53蛋白、Brain和Jenkins [10]暴露了TP53基因是潜在地能够通过阻断复制起点招募期间DNA链分离步骤抑制哺乳动物复制的DNA合成。基于病例对照研究,BENZON Larsen等人。[11]确定ADH多态性,其修改乙醇氧化速率为乙醛,分别与乳腺癌的风险关联。

随着越来越多的蛋白质编码基因被发现,大量的功能术语出现了。为了便于比较基因的功能,需要对这些术语进行规范化。为此,引入本体来规范基因的功能术语。在现有本体中,基因本体(GO) [12]是最早和最频繁使用的词汇表,其重点是描述生物过程(BP),分子功能(MF),和基因的细胞组分(CC)中的一个。由于出现在2000年,大量的数据库记录的基因的功能进行了注释的GO。人类蛋白质编码基因的功能注释在GO注解(GOA)数据库[​​提供13,其中包括一组对人类蛋白质组的非冗余注释。与围棋相比,疾病本体论(DO) [14侧重于在表型水平上标准化基因的功能术语。和功能基因参考中的疾病术语(GeneRIF) [15]被注释到DO上[16- - - - - -18]。

最近,在基因组学和转录组学水平大规模序列分析表明基因组序列的98%以上的不能编码蛋白[19,20.,其中microRNA基因和长链非编码RNA (long noncoding RNA, lncRNA)基因占很大一部分[21]。与蛋白质编码基因的比较,微小RNA基因和lncRNA基因的功能难以被识别[22]。然而,这些非编码基因发挥在分子水平和表型水平[中起重要作用23- - - - - -27]。例如,在分子水平上,qPCR和硅杂交显示,miR-124和miR-155可直接参与runt相关转录因子2 (RUNX2)和核因子kpa - b配体(RANKL)基因受体激活因子的转录调控[28]。在表型水平上,Huang等发现miR-345低表达与前列腺癌相关[29]。目前,HMDD中microRNA和lncrna相关疾病[30.]和LncRNADisease [31]具有由医学主题词(目)被手动注释[32]。而最近的几项研究表明,miRNA与疾病的关系还有待进一步研究[33- - - - - -35]。

基因功能词汇注释数据库虽然已经有了一些,但尚未出现完整的记录人类基因功能的注释资源。例如,据我们所知,没有在分子水平上将非编码基因的数据库注释到功能词汇表中。这可能是由于缺乏同时记录蛋白质编码基因和非编码基因功能的资源。幸运的是,GeneRIFs [15]提供NCBI数据库中每个基因的简短功能描述(最多255个字符),这些功能描述可以注释到词汇表中,例如DO和GO。

在本文中,我们提出了一个框架,Gene2Function,标注有去做人类基因组的功能。注释GeneRIF后,也能够获得包括蛋白质编码基因,微RNA基因和lncRNA基因的综合资源。资源可以从访问http://www.bio-annotation.cn/gene2function/

2.结果

2.1。基因定位到基因本体论和疾病本体论

在通过GO和DO对GeneRIFs进行注释之后(参见部分)3.),获得13148倍的mRNA和7182点而言,948个微RNA和533项和139个lncRNAs和297项之间的关联901之间9496个协会之间288869名关联。统计信息显示在表1


基因的数量 项数 基因和术语之间关联的数量

信使核糖核酸
13148年 7182年 288869年
 948 533 9496年
lncRNA
139年 297 901

数字1(一)演示与注释结果去做的方面相关的基因数量的直方图。1657个功能性术语(23.0%)与仅一个基因相关联,而3924个功能性术语(54.5%)与多于三个基因相关联。与个别基因相关术语的数目的直方图示于图1 (b)。1375个基因(9.9%)只与一个功能词相关,10273个基因(74.3%)与三个以上的基因相关。

按基因注释数量排序的前10个词和按词注释数量排序的前10个基因见表23., 分别。不足为奇的是,在DAG的顶层几个常用术语具有与它们相关的基因,如细胞,绑定和发育过程的更大数量(表2)。出现在注解结果的最普遍的疾病方面是癌症,这与3139个基因(所有条款的22.7%)有关。当我们看很多方面相关的基因,TP53是出现在注解结果,这与828项(全部基因的11.5%)相关的最普遍的基因。


长期ID 项名称 数量的基因

去:0005623 细胞 7524年
去:0005488 捆绑 5011
去:0065007 生物调节 4846年
去:0023052 发信号 4466
去:0032502 发展的过程 3521
去:0009058 生物合成的过程 3346年
DOID:162 癌症 3139年
去:0006351 转录,dna模板 3121年
DOID: 305 3,069
去:0040007 增长 3011年


HGNC基因身份证 基因符号 泛函项数

HGNC:11998 TP53 828
HGNC:11892 肿瘤坏死因子 792
HGNC: 6018 IL6 683
HGNC:12680 VEGFA 669
HGNC:11766 TGFB1 664
HGNC: 3236 表皮生长因子受体 560
HGNC: 7176 MMP9 521
HGNC: 391 AKT1 517
HGNC: 7794 NFKB1 494
HGNC: 6025 CXCL8 473

2.2。与现有本体注释资源进行比较

为了验证我们的注释结果的性能,我们将其与以前流行的注释资源GOA [13],其中将人基因被手动注释去。为了确保准确的评估,GeneRIFs的DO注释被丢弃,并从GOA电子注释(IEA)推断注释被拆除。

总体上,我们获得了4,613 GO术语和13,107基因GeneRIFs和13920个GO术语和16724个基因在果阿之间168246个协会之间的关联196423。只有10658协会和3,375 GO术语出现在两个注释资源。相比较而言,两者有更多的共同基因(11816)。

数据2(一个)2 (b)表明每GO术语基因的数目的直方图,并且每个基因的GO术语的数目的在分别GeneRIFs和GOA,注释的直方图。显然,更多的GO术语(4,545)可以注释在GOA在GeneRIFs只有一个基因比(1114)。相比之下,更多的基因(1671)可以添加注释,只有一个GeneRIFs(1499)长期高于GOA。

为了评价其一致性,我们比较了各属和果阿族中个体基因的词频和个体基因的词频。因此,术语GeneRIF个体基因的频率显著正相关在果阿(皮尔森相关 , ;数字2 (c)),和基因频率的个人任期GeneRIF也显著正相关在果阿(皮尔森相关 , ;数字2 (d))。考虑到GOA是最常用的注释资源,GeneRIFs的注释也应该是可靠的。

2.3。基于人类基因组功能注释的网络可视化

注释结果中的信息可以用来描述多个基因或多个术语之间的关系。为此,我们创建了一个二部分图,描述了三个基因(RNF2、RNF8和RPS6)和79个术语之间的关系(图)3.)。在这个网络中,33个术语注释以RNF2,37个术语注释以RNF8和37点而言被注释到RPS6。在图的中心,6项涉及翻译,凋亡的执行阶段,乳腺癌,生物调节,绑定和凋亡过程涉及到所有这三个基因的。使用我们的注解结果,需要一个能够创建这种类型的二分网络。

3.材料和方法

3.1。数据收集
3.1.1。GeneRIF

GeneRIF是在2016年6月下载的4)。包括税务标识符、NCBI基因ID、PubMed唯一标识符(PMID)、更新日期、功能描述五个栏目。提取人类基因的功能描述后,剩下650,079个描述。


数据源 网站(下载日期)

GeneRIF http://www.ncbi.nlm.nih.gov/gene/about-generif(2016年6月)
HGNC http://www.genenames.org/(2016年6月)
GO&GOA http://geneontology.org/(2016年6月)
http://disease-ontology.org/(2016年6月)

3.1.2。标准化基因符号词汇

人类基因组组织基因命名委员会(HGNC)36负责批准人类基因座的独特符号和名称,包括编码蛋白质的基因和非编码基因,以便进行明确的科学交流。本文将属中的基因归一化为HGNC基因符号。

3.1.3。本体和注释

如图所示4,GO通过“IS_A”关系组织在向无环图(DAG)BP条款。目前,GO包含55565“IS_A” 28654个BP方面之间10159个MF术语之间12,375“IS_A”关系3,907 CC术语之间5618“IS_A”关系的关系,和。GOA与我们的标注结果进行比较。除IEA和摆脱的GOA的重复记录后,13920个GO术语和16724个基因之间的关联168246保持。

DO是第一个组织有关人类疾病的术语的本体论,它通过唯一的标识符、疾病名称及其同义词来描述每种疾病。在当前版本中,涉及6,920个疾病术语之间的7,124个“IS_A”关系。

3.2。用于注释人类基因组方法

如图所示5(一个)为了解释人类基因组的功能,我们提出了一个名为Gene2Function的框架。首先,使用Open Biomedical Annotator (OBA)文本挖掘工具对具有函数描述的泛型原始文本进行注释[37],它提供了一个基于本体的web服务,该服务根据公共数据集的文本元数据,用生物医学本体概念注释公共数据集。因此,功能描述将被映射到相应的本体,比如GO和DO。然后,将Entrez基因标识符转换为规范化的基因符号。本研究利用HGNC对蛋白编码基因、microRNA基因、lncRNA基因等基因的位点类型进行归一化和标记。最后,每一种类型可以被注释为包含基因符号、基因座类型和功能描述的三元组。

所有GeneRIFs可以基于注释框架进行注释。数字5 (b)给出一个用GO注释泛型的示例。“酶活性”是“催化活性(GO:0003824)”的同义词,由OBA鉴定。并基于HGNC将Entrez基因标识符“9”转换为“NAT1 (HGNC:7645)”。通过注释框架,可以得到注释三联“mRNA, NAT1, catalytic activity”。

4.讨论

基因功能注释的重要性已经在以前的注释资源中得到了体现,如GOA。遗憾的是,非编码RNA的功能注释资源非常少,导致蛋白质编码基因、microRNA基因、lncRNA基因等缺乏完整的注释资源。非编码基因是人类基因组中数量最多的基因,急需对这些基因进行功能注释。在这项研究中,我们提出了一个框架,Gene2Function,用于注释GeneRIFs。从而获得了基于该框架的完整的人类基因组功能注释资源,可访问http://www.bio-annotation.cn/gene2function/。为了评估其可靠性,将我们的注释结果与常用的GOA资源进行了比较。随后,通过功能词对基因连通性进行网络可视化,显示了注释结果的可用性。

注释框架基于文本挖掘工具OBA [37]。在该框架下,GeneRIFs的描述的功能条款注释以GO和DO术语。和基因符号被映射到人类基因HGNC [归一化的词汇36],这使得它易于区分基因的基因座类型,如蛋白质编码RNA,微小RNA,和lncRNA。

的GeneRIFs和GOA(图的一致性测试2 (c)2 (d))显示了我们的注解结果的可靠性。因为在这两种注释资源基因和GO术语之间共同关联的少量的,它们可以是在蛋白质编码RNA注解的使用互补。更多的GO术语在GOA进行注释(见2)表明它比我们的注释结果更加深刻和严肃。相比之下,GeneRIFs的优势在于不仅蛋白编码基因,而且microRNA基因和lncRNA基因都可以用GO等功能术语进行注释(Table)1)。

相互竞争的利益

作者宣称,他们没有竞争的利益。

参考文献

  1. 《人类基因组序列》,文特尔、亚当斯、迈尔斯等人著,《人类基因组序列》。科学卷。291,没有。5507,第1304-1351,2001年。视图:出版商的网站|谷歌学术
  2. 《动物microRNAs的功能》,自然第431卷,no。2004,7006, 350-355页。视图:出版商的网站|谷歌学术
  3. S. M. Hollenberg, C. Weinberger, E. S. Ong等,“功能性人类糖皮质激素受体cDNA的初级结构和表达,”自然第318卷,no。1985年,第635-641页。视图:出版商的网站|谷歌学术
  4. 霍姆斯,李,w - j。“人类白细胞介素-8受体的结构与功能表达”,王建民,“人类白细胞介素-8受体的结构与功能表达”,科学第253卷,no。5025,第1278-1280页,1991。视图:出版商的网站|谷歌学术
  5. 梁振英,“脂多糖结合蛋白的结构与功能”,国立中山大学医学与科学研究所硕士论文。科学卷。249,没有。4975,第1429至1431年,1990。视图:出版商的网站|谷歌学术
  6. 石宏华,张国强,周明等,“整合多基因组和表型数据以推断新的mirna -疾病关联,”《公共科学图书馆•综合》第11卷,no。2、文章编号e0148521, 2016。视图:出版商的网站|谷歌学术
  7. 周m, Sun Y., Sun Y.等,“lncRNA表达谱的综合分析揭示了一种新的lncRNA签名来区分卵巢癌患者的非等效结果,”Oncotarget第7卷,no。22,第32433-32448页,2016。视图:出版商的网站|谷歌学术
  8. 周m, Xu W., Yue X.等,“复发相关长链非编码RNA信号改善肺腺癌预后预测”,Oncotarget第7卷,no。20, 29720-29738页,2016。视图:出版商的网站|谷歌学术
  9. Shi H., J. Xu, G. Zhang等人,“通过miRNA靶点和疾病基因之间的功能联系,行走相互作用体识别人类miRNA-疾病关联,”BMC系统生物学, 2013年第7卷第101条。视图:出版商的网站|谷歌学术
  10. R. Brain和J. R. Jenkins,“人类p53引导DNA链再结合,并被8-叠氮ATP光催化。”致癌基因,第9卷,no。1994年,1775-1780页。视图:谷歌学术
  11. S. Benzon Larsen, U. Vogel, J. Christensen等,“相互作用ADH1C参数272关于乳腺癌的风险谷氨酰胺和酒精的摄入量表明,乙醇是酒精相关的乳腺癌的致病因素,”癌症的信卷。295,没有。2,第191-197,2010。视图:出版商的网站|谷歌学术
  12. M. Ashburner, C. A. Ball, J. A. Blake等,“基因本体论:生物学统一的工具”,自然遗传学卷。25,没有。1,第25-29,2000。视图:出版商的网站|谷歌学术
  13. E. Camon, M. Magrane, D. Barrell等,“基因本体注释(GOA)数据库:与基因本体共享Uniprot中的知识”,核酸的研究刘志军,第32卷,第D262-D266页,2004。视图:出版商的网站|谷歌学术
  14. W. A. Kibbe, C. Arze, V. Felix等人,“疾病本体2015年更新:一个通过疾病数据连接生物医学知识的扩展和更新的人类疾病数据库,”核酸的研究第43卷,no。1, D1071-D1078页,2015。视图:出版商的网站|谷歌学术
  15. 刘振华,“一般质量保证作为摘要修订”,载于《质量保证与质量管理》太平洋生物计算研讨会论文集(PSB '07),第269-280页,2007年1月。视图:谷歌学术
  16. J. D. Osborne, J. Flatow, M. Holko等,《用疾病本体论注释人类基因组》,BMC基因组学,第10卷,附录1,第S6条,2009年。视图:出版商的网站|谷歌学术
  17. W.许,王H.,W Cheng等人,“一种用于标注在疾病方面人类基因组的框架,”《公共科学图书馆•综合》第7卷,no。12,文章编号e49686, 2012。视图:出版商的网站|谷歌学术
  18. K.鹏,徐W.,郑洁等人。“该疾病和基因注释(DGA):用于人类疾病的注释资源,”核酸的研究第41卷,no。1,第D553-D560,2013。视图:出版商的网站|谷歌学术
  19. P. Kapranov, A. T. Willingham, T. R. Gingeras,“全基因组转录和对基因组组织的影响,”自然遗传学评论,第8卷,no。2007年,第413-423页。视图:出版商的网站|谷歌学术
  20. 林瑞德、林顿、伯伦等人,“人类基因组的初始测序与分析”,自然,第409卷,第2号6822,第860-921页,2001。视图:谷歌学术
  21. 魏l .,廖M.,高Y., Ji R., He Z., and Q. Zou,“通过纳入高质量的负集改进了人类MicroRNAs的鉴定,并且前景光明。”IEEE/ACM计算生物学和生物信息学汇刊第11卷,no。1, 192-201, 2014。视图:出版商的网站|谷歌学术
  22. Y.黄,刘N.,J. P. Wang等人,“监管长非编码RNA及其功能”生理学杂志和生物化学卷。68,没有。4,第611-618,2012。视图:出版商的网站|谷歌学术
  23. J.太阳,H.石,Z. Wang等人,“推断小说lncRNA-病协会根据lncRNA功能相似网络的随机游走模型,”分子生物系统,第10卷,第2期。8, 2074-2081页,2014。视图:出版商的网站|谷歌学术
  24. 长链非编码rna相关ceRNA网络的表征揭示了lncRNA生物标志物在人类卵巢癌中的潜在预后Oncotarget第7卷,no。11,第12598-12611,2016。视图:谷歌学术
  25. J.孙,周M.,H.杨,邓J.,L. Wang和Q.王,“推断基于蛋白质相互作用网络的情况下瞄准倾向和连接潜在的microRNA微RNA协会”《公共科学图书馆•综合》,第8卷,no。7,文章ID e69719,2013。视图:出版商的网站|谷歌学术
  26. 黄玉甲,陈欣华,尤志华,黄德胜,陈国昌,“ILNCSIM:改进的lncRNA函数相似度计算模型”,Oncotarget第7卷,no。18, 25902-25914, 2016。视图:出版商的网站|谷歌学术
  27. 十,陈,Y. A.黄X. S.王,Z. H.您和C. K.陈,“FMLNCSIM:基于模糊测度,lncRNA功能相似的计算模型,”Oncotarget,2016年。视图:出版商的网站|谷歌学术
  28. 王建民,“非编码rna:氟中毒发生的可能因素”,《非编码rna:氟中毒发生的可能因素》。生物医学研究的国际,第15卷,文章编号274852,10页,2015年。视图:出版商的网站|谷歌学术
  29. Y.-A。黄,Z.-H。“利用加权稀疏表示模型与全局编码结合的基于序列的蛋白质-蛋白质相互作用预测”,You, X. Chen, K. Chan, X. Luo,“基于序列的蛋白质-蛋白质相互作用预测”,BMC生物信息学第17卷,no。1、2016年第148条。视图:出版商的网站|谷歌学术
  30. 李玉英,邱中,屠等,“HMDD v2.0:实验支持的人类微rna与疾病关联的数据库”,核酸的研究第42卷,no。1,第D1070-D1074页,2014。视图:出版商的网站|谷歌学术
  31. 陈国强,王振华,王德华等,“长非编码rna相关疾病的数据库研究”,核酸的研究第41卷,no。1, D983-D986, 2013。视图:出版商的网站|谷歌学术
  32. c.e.p Lipscomb,“医学主题标题(MeSH)”,医学图书馆协会的公告第88卷,no。3,第265-266页,2000。视图:谷歌学术
  33. Zeng, X. Zhang, and Q. Zou,“利用生物交互网络预测microRNA功能和优先排序疾病相关microRNA的综合方法,”简报的生物信息学第17卷,no。2,第193-203,2016。视图:出版商的网站|谷歌学术
  34. Y.刘,X.曾,Z.他,并问邹,“推断的microRNA疾病协会通过与多个数据源的异构网络上的随机漫步”IEEE/ACM计算生物学和生物信息学汇刊,2016年。视图:出版商的网站|谷歌学术
  35. 邹庆,李俊,洪庆等,“基于社会网络分析方法的微rna疾病相关性预测”,生物医学研究的国际,第15卷,文章编号810514,9页,2015年。视图:出版商的网站|谷歌学术
  36. E. a . Bruford, M. J. Lush, M. W. Wright, T. P. Sneddon, S. Povey,和E. Birney,“2008年HGNC数据库:人类基因组资源”,核酸的研究第36卷,no。1, D445-D448页,2008。视图:出版商的网站|谷歌学术
  37. C. Jonquet,N. H. Shah和M. A.木森,“开放的生物医学注释器,”翻译科学会议的AMIA峰会, 2009年,第56-60页。视图:谷歌学术

版权所有:杨虎等这是一篇开放获取下发布的文章知识共享署名许可,允许在任何媒体中不受限制地使用、发布和复制原创作品,只要原稿被正确引用。


更多相关文章

1283 查看 | 452 下载 | 8 引用
PDF 下载引用 引文
下载其他格式更多
订单打印副本订购

相关文章

我们致力于尽快、安全地分享与COVID-19有关的发现。任何提交COVID-19论文的作者,请在以下地址通知我们help@hindawi.com以确保他们的研究被快速跟踪,并尽快在预印本服务器上可用。我们将为已接受的COVID-19相关文章提供不受限制的出版费用减免。在此注册作为审稿人,帮助快速跟踪新提交的内容。