研究文章|开放获取
Balaswamy, R. Vishnu Vardhan, "ROC曲线的置信区间估计:广义半正态分布和威布尔分布的应用",概率与统计杂志, 卷。2015, 文章的ID934362, 8 页面, 2015. https://doi.org/10.1155/2015/934362
ROC曲线的置信区间估计:广义半正态分布和威布尔分布的应用
摘要
最近,ROC分析领域的工作在解释测试的准确性和识别最佳阈值方面获得了关注。这种类型的ROC模型被称为双分布ROC模型,例如双正态、双指数、双逻辑等。然而,在实际情况中,我们遇到的数据在本质上是倾斜的,有延伸的尾巴。为了解决这个问题,测试的准确性是通过涉及尺度和形状参数来解释的。因此,本文着重提出一个考虑两种广义分布的ROC模型,这有助于解释检验的准确性。进一步构造了该曲线的置信区间;即曲线坐标(FPR, TPR)和精确测量,曲线下面积(AUC),这有助于解释曲线的变异性,并提供特定值的敏感性,反之亦然。该方法得到了实际数据集和仿真研究的支持。
1.介绍
在分类分析中,受试者工作特征(ROC)曲线是一种广泛使用的工具来评估测试的性能。此外,敏感性、特异性和准确性等内在指标对于描述诊断测试将个体划分为两组/人群之一的能力至关重要。敏感性提供了对该检测在预测疾病方面的良好程度的估计。特异性估计了没有疾病的患者能够被正确识别的可能性。ROC曲线是1 -特异性和敏感性的图形表示。即通过将分类阈值从最正的分类值移动到最负的分类值来得到曲线上的点。对于随机分类,ROC曲线是一条连接原点的直线到图形的右上角.进一步,精确度测量被定义为ROC曲线下的面积。因此,ROC曲线下面积(AUC)被广泛用于衡量一项测试在ROC背景下的准确性。
在分类中,主要目的是更好地区分正常和异常群体。迄今为止,在文献中存在许多基于双分布假设的ROC模型,如副正态(Egan [1)、bilogistic和bilognormal (Dorfman和Alf Jr. [2,3.)、双β和双指数(Zou等,[4];Tang等人[5];Tang和Balakrishnan [6),重婚等等(侯赛因[7])。如果正常人群和异常人群的测试分数遵循不同的分布,那么这些ROC表格将不会产生可靠的输出。例如,考虑使用APACHE (Acute Physiology and Chronic Health Evaluation) II标记物来预测ICU患者的死亡率状况。活患者和死患者的APACHE评分模式不具有常态,并解释了数据的扭曲性质。在这里,传统的副正态ROC模型在AUC、阈值、敏感性和特异性方面无法产生可靠的输出。然而,分数的分布可能遵循任何偏态分布。因此,本文的主要重点在于处理两个总体分布不同的情况,以及数据的偏倚性质。我们提出了一个ROC模型,该模型考虑了具有形状和尺度参数的广义半正态(正态总体)和威布尔(异常总体)分布。在医学、工程和生命研究中,数据往往有延伸的尾部;在这种情况下,常规的副正态ROC曲线无法解释所考虑的测试的隐藏准确性。 Recently, Balaswamy et al. [8]解决了这个问题,并开发了基于半正态和指数分布的混合ROC (HROC)曲线。然而,该模型仅考虑尺度参数来说明精度,因而受到限制。但也有其他统计方法来描述数据的尾部属性信息。本文提出了广义半正态分布和威布尔分布的广义半正态分布和威布尔分布的扩展版。广义半正态分布和威布尔分布的尺度和形状参数分别对应于正态和异常总体。一个bootstrap研究被用来构建95%置信区间和其他测量建议的ROC曲线。此外,提出的方法是使用仿真研究和真实的数据集证明。
本论文组织如下。ROC曲线是基于广义半正态(GHN)和威布尔分布()和形状()的参数和GHROC曲线的精度测量,曲线下面积,推导。进一步,利用bootstrap方法估计AUC和所提出的ROC曲线的置信区间。最后,在结果与讨论中说明了使用所提出的方法所获得的结果。
2.方法
让为测试分数,在正常情况下()及异常()数量,分别。这里假设和总体服从广义半正态分布(GHN)和威布尔分布,形状和尺度参数为和,分别。GHN的概率密度函数和累积分布函数(Cooray和Ananda [9]), Weibull分布如下: 在哪里为标准正态分布的C.D.F.: 在分类中,ROC曲线是一个图形图,说明了当区分阈值变化时二进制分类器的性能(Green and Swets [10])。通过绘制假阳性率(FPR)与真阳性率(TPR)的关系曲线得到。
利用FPR的概率定义导出了FPR的表达式 进一步简化,表示为可以通过公式得到吗 在哪里为逆累积标准正态分布函数。
同样,利用Weibull分布的概率定义,导出TPR的表达式为 用(4) (6),则TPR的表达式为 在这里,, (7)是基于广义半正态分布和威布尔分布的ROC曲线表达式。这个表达式(7)可以被称为广义杂交ROC (GHROC)曲线,因为ROC曲线是基于两种广义分布而发展的。
在ROC方法学中,有助于解释重叠面积和分类准确率的统计度量是曲线下面积(area Under the Curve, AUC)。它可以被解释为从有条件组中随机选择的受试者将具有比从无条件组中随机选择的受试者具有更大可能性的判别得分的概率(Bamber [11])。AUC可以取0到1之间的值,实际下界值为0.5(机会对角线)。通过积分ROC表达式,可以得到精度测量AUC的表达式(7超出范围假阳性率为 上述表达式没有封闭形式;因此,必须用数值积分来求解。在下一小节中,通过bootstrapping方法估计AUC的方差和置信区间。
2.1.AUC的置信区间
的AUC的置信区间定义为 在哪里是标准正常百分位数的估计方差是,它是通过自举获得的。让“为根据样本大小从数据中获得的自举次数和,分别来自正常和异常人群。则自举AUC估计及其方差为 在哪里是AUC的自举估计。下一小节将处理所建议的ROC曲线的置信区间的构建,以解释在每个阈值处曲线的可变性。
2.2.GHROC曲线的置信区间
的用delta法估计了GHROC曲线的置信区间。ROC曲线的置信区间表示每个点的假阳性率和对应的真阳性率的范围。因此,FPR和TPR的置信区间如下: 在哪里和估算的FPR和TPR分别为,其方差为 FPR和TPR的置信区间可由下式求得: (完整证明见附录)。这些置信区间线显示了拟ROC曲线在ROC曲线上每一点上的可变性。
在下一节中,将使用模拟研究和真实数据集来解释所提出的方法。此外,还对总结测量AUC和内在测量FPR和TPR的置信区间进行了评估。
3.结果与讨论
该方法通过仿真研究和真实数据集(SAPS III)进行了验证。
3.1.模拟研究
模拟研究采用正常和异常总体的不同规模和形状参数组合进行,并在不同的样本量下进行整个模拟与自强。在每个参数组合和样本容量下,得到了AUC及其置信区间。进行模拟的主要目的是为了说明随着正态分布和异常分布的尺度和形状参数的变化,GHROC曲线的AUC具有不同的值。利用两个种群参数值的变化来解释重叠区域的AUC;这意味着下面积越高,重叠区域越小,反之亦然。进一步,为了演示AUC的行为,整个仿真工作通过三个不同的实验进行。在第一个实验中,通过将其他参数固定为常数来改变异常总体的形状参数;在第2个实验中,通过将异常总体的其他参数固定为常数来改变异常总体的尺度参数;在第3个实验中,考虑两个异常总体的形状参数随尺度的变化而相等。从这些实验中得到的结果见表1.
|
||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
在第一个实验中,当与,,, AUC约为0.6791(精度为67.91%)的值越大,如3和5,则观察到AUC的值越好,表明精度水平越高,从而反映了当正常总体和异常总体形状参数的差异增大时,AUC值越大,表明正确分类程度越好,重叠面积百分比越小。假设我们有具有这些参数值的真实数据集,那么特定的测试将提供更好的准确性。除形状外,标度参数也影响测量的AUC。此外,在实验,异常总体的尺度参数()通过保留所有其他参数而变化为常数。形状值和尺度参数的适度差异会影响分类的准确性。作为的值越大,则GHROC曲线的AUC趋向于具有更好的精度值。因此,这表明,除了两种总体形状参数的差异外,规模参数也倾向于解释数据中更好的可变性,从而导致讨论所考虑的测试的确切性能。当不同尺度参数的形状参数存在相等的差异时,需要检验试验的准确性。通过进行另一个实验(第三个)可以解决这个问题。在这里,第一部分的定义是考虑两个种群的规模和形状参数相等,而在本实验的第二部分,规模参数的变化是采用相同的形状参数。第一部分发现,当所有参数趋于等于单位值时,两个种群会重叠,AUC接近0.5。第二部分概述观察的结果,即使形状参数相同的情况下,人口的规模差异参数异常时倾向于解释隐藏的准确性和两个种群的规模价值观之间的差异较大,解释关于测试的准确性可以更好。因此,从三个实验中可以看出,形状参数对解释测试的准确性有很大的影响。然而,尺度参数也有其解释精度的作用,不能忽视。
为了在图形可视化的帮助下演示所提出的方法,绘制了三个实验的ROC曲线(图1).从图1(一),可以看到,随着异常总体形状趋向于有较大的值,曲线向图的左上角移动,准确率也越来越高。此外,图1 (b)解释了尺度在异常群体中的作用,可以看出,随着尺度在异常群体中的取值越高,曲线越远离机会线,精度越高。数字1 (c)说明了等形状参数存在时尺度参数的影响,观察到ROC曲线的形状随尺度的变化而受到影响。从图1,可以合理地说,所提出的ROC曲线完全依赖于正常和异常人群的形状和规模参数。
(a)异常群体中形状参数的影响(实验)
(b)尺度参数在异常群体中的作用(实验)
(c)尺度参数对常形状参数异常种群的影响(实验)
除了解释尺度和形状参数在GHROC背景下的重要性和影响之外,构建GHROC曲线测度的置信区间也是至关重要的。这一尝试是为了说明ROC曲线估计值的变化行为。在统计文献中,区间估计理论比点估计具有更重要的意义,因为它揭示了潜在不确定性下估计的真实信息。因此,在潜在不确定性的范围内,在样本量存在的情况下,解决真实估计的位置是非常重要的。的对定义为三个不同实验的所有组合建立了置信区间。
关于置信区间的方法,关于样本量对置信区间宽度的影响的认识,以及GHROC曲线及其置信区间的真实估计的图形化可视化是更重要和需要解决的问题。由结果可以看出,样本容量效应可以从置信区间的宽度上看到,真实的估计是独立于样本容量的影响,其相应的置信区间具有缩小现象。这些模拟研究指出,无论样本量和置信区间的宽度如何,关于ROC曲线的真实估计的信息都在潜在的不确定性之内。尽管这是一个普遍观察到的现象,但需要注意的事实是,随着样本量的增加,总体的可变性会减小,从而导致置信区间缩短。
数字2清晰地解释了GHROC曲线在ROC曲线上每一点的变异性。这意味着所建议的ROC曲线的控制下限和控制上限是以特定的样本量绘制的(图2),这些曲线解释了每个阈值的假阳性率和真阳性率的范围。此外,图中还描述了最佳阈值2和他们一起在那个最优阈值处得到的。此外,该最优阈值用于对被试进行更准确的分类,可作为未来分类的参考价值。例如,考虑组合,,,在此组合下,最佳阈值为2.0592,真阳性率为0.8096。这解释了异常受试者的识别为异常,80.96%的正确分类在最佳阈值2.0592考虑的组合。在最坏的分类情况下(相同的尺度和形状参数),观察到最优阈值为1.9914,真实阳性率为0.1846(图)2).同样,我们可以用Figure来解释研究中考虑的所有剩余组合2.
3.2.真实数据集
真实的数据集是关于ICU评分系统的;SAPS III是一个用于预测ICU患者死亡率(死亡或存活)的系统。根据需要校准的数学模型,SAPS III通过遵循一个定义良好的程序,为患者提供真实的预测死亡率。该数据包括111名受访者,其中66人(59.45%)活着,45人(40.54%)死亡。
从该数据集可以观察到,死亡患者的SAPS III评分遵循Weibull分布(KS−Statistic = 0.1280;在0.05水平上,值= 0.4165),而存活患者的评分遵循GHN分布(KS−Statistic = 0.0901;在0.05显著性水平下,值= 0.6243)。疾病预后结果见表2.可以观察到,该测试的准确率为62.78%,说明SAPS III评分能够识别死亡率状态约为62.78%。观察到最佳阈值为22.00,即当SAPS III评分超过最佳阈值22.00时,患者的死亡概率为71.35%。此外,AUC的置信区间为(0.5530,0.6917),所提出的SAPS III的ROC曲线均位于机会线之上,以解释死亡率(图3.)描述拟拟ROC曲线的上、下置信区间及其最佳阈值。
|
||||||||||||||||||||||||||||||
4.结论
本文的重点是解决实际问题,在有条件和没有条件的总体下存在两种不同的广义偏态分布,它们具有规模和形状参数,有助于解释和处理数据的偏态性质。在不同的参数组合下进行了仿真研究。整个实验用三个实验完成,并注意到样本量的影响。此外,可以观察到,置信区间的宽度受样本大小的影响,反过来提供缩短的置信区间,因为样本大小被认为是大的。此外,从提出的方法学,它是可行的,以确定敏感性在特定的假阳性率,反之亦然。
此外,该方法被应用于真实数据集,即SAPS III,用于预测ICU患者的死亡状态。SAPS III系统预测死亡事件的准确率为62.78%。最优阈值确定为22.00,可用于识别新个体的状态,计算其SAPS III评分。
附录
对FPR和TPR的参数进行了偏微分 现在,通过将上面的偏导数代入(12),我们有 参数的自举估计及其方差,,,是 在哪里,,,是的bootstrap估计,,,,分别。
现在,通过将所考虑的两个分布的参数的方差代入(a .)和(a .),可以得到FPR和TPR的方差表达式。此外,使用(a .)和(a .),可以估计内在测度的置信区间,从而产生以下所建议的ROC曲线的置信区间:
利益冲突
作者声明本文的发表不存在利益冲突。
承认
作者要感谢和感谢印度金奈SRM医学院医院和研究中心公共卫生和医学部的维马尔·库马尔博士,感谢他分享了数据来完成研究结果。
参考文献
- j·p·伊根信号检测理论与ROC分析,学术出版社,美国纽约,1975年。
- D. D. Dorfman和E. Alf Jr.,“信号检测理论参数的最大似然估计—直接解”,心理测量学第33卷第3期1,页117-124,1968。视图:出版商的网站|谷歌学术搜索
- D. D. Dorfman和E. Alf Jr.,“信号检测理论参数的最大似然估计和置信区间评分方法数据的确定”,数学心理学杂志,第6卷,第2期3,第487-496页,1969。视图:出版商的网站|谷歌学术搜索
- 邹克华,W. J. Hall, D. E. Shapiro,“连续诊断试验的平滑非参数接受者工作特征(ROC)曲线”,医学统计,第16卷,第5期。19,页2143-2156,1997。视图:出版商的网站|谷歌学术搜索
- 唐磊,杜鹏,吴志刚,“使用转换不变平滑ROC曲线比较诊断试验”,统计计划与推理杂志号,第140卷。11, pp. 3540-3551, 2010。视图:出版商的网站|谷歌学术搜索
- “一种随机和的Wilcoxon统计量及其在ROC和LROC数据分析中的应用”,统计计划与推理杂志,第141卷,第141期1, pp. 335-344, 2011。视图:出版商的网站|谷歌学术搜索|Zentralblatt数学
- E. Hussain,“双gamma roc曲线以一种直接的方式,”基础与应用科学学报,第8卷,第2期2, pp. 309 - 314,2012。视图:出版商的网站|谷歌学术搜索
- S. Balaswamy, R. V. Vardhan,和K. V. S. Sarma,“二元分类的混合ROC (HROC)曲线及其散度度量”,国际医学研究统计杂志,第4卷,第4期。1, pp. 94-102, 2015。视图:出版商的网站|谷歌学术搜索
- K. Cooray和M. M. A. Ananda,“应用于寿命数据的半正态分布的推广”,统计通讯-理论与方法,第37卷,第2期9, pp. 1323-1337, 2008。视图:出版商的网站|谷歌学术搜索
- d·m·格林和j·a·斯威特,信号探测理论与心理物理学, John Wiley & Sons,纽约,纽约,美国,1966。
- D. Bamber,“序数优势图之上的区域和接受者工作特征图之下的区域”数学心理学杂志,第12卷,第2期4,第387-415页,1975。视图:出版商的网站|谷歌学术搜索
版权
版权所有©2015 S. Balaswamy和R. Vishnu Vardhan。这是一篇发布在知识共享署名许可协议,允许在任何媒介上不受限制地使用、传播和复制,但必须正确引用原作。