文摘
心脏病是全球死亡率的主要原因之一。预测心血管疾病临床数据分析是一个主要的困难。艾未未被证明是强大的决定和预测一个巨大的信息创建的健康领域。我们提供一个独特的方法寻找基本特征本文采用机器学习的方法,提高识别心脏疾病的有效性。决策树(DT)、支持向量机(SVM),人工神经网络(ANN),再(资讯)分类技术用于创建该系统。合奏叠加整合这四个分类模型来创建一个最佳适合使用逻辑回归预测模型。许多探索针对心脏感染的识别;然而,精确的结果很差。因此,为了进一步提高效率,Moth-Flame优化(MFO)算法。特征选择策略是用于提高分类精度,同时缩短执行时间的分类系统。 Medical data are used to assess the probability of heart disease based on BP, age, gender, chest ache, cholesterol, blood sugar, and other variables. Results revealed that the proposed system excelled other existing models, obtaining 99% accuracy in the Cleveland dataset.
1。介绍
心脏病是指一组疾病,影响人们的心灵和静脉。心脏病的症状因人而异(1]。心脏病暗指一堆问题具有副作用,例如,高血压、中风、呼吸衰竭和心律失常。医疗服务供应商的麻烦给顶级的保健在一个合理的成本。结果不足可能会导致不准确的临床诊断和治疗。检测和诊断心血管疾病是一个永无止境的任务,可以通过一个熟练的医生有重要的经验和理解2]。决策支持系统(DSSs)可能使用医疗组织降低成本(3]。病人记录,各种疾病诊断、资源管理、和其他方面的医疗是很常见的。
有很多的工作投入建立远程监控设备和流程诊断病人。设备疲惫,话又说回来,被视为阻碍依从性(4]。商业访问技术已经被减轻征服这个边界展出人类接触的必要性(5,行动追踪器的精度已被证明是适合卫生工作者(6]。临床记录不断产生、处理和评估的结果信息技术系统的出现。临床报告包含数据,可以用来开发新的世界各地的医疗服务,解决社会和经济状况等问题。临床报道,例如,包含各种各样的数值数据,医学描述,图片,等等。这些都可以用来创建基于内容的服务,帮助病人和医生。
快速心血管疾病高危患者的诊断和更快的检测使用一个预测系统被广泛提出减少死亡率和提高选择未来的诊断和干预措施(7]。决策支持系统(DSS)框架可以用来帮助临床医生在评估心血管疾病的机会和提供合适的药物,进一步防止发生。此外,一些研究表明,采用DSS能够提高预防服务,治疗计划,和更好的决策8]。基于机器学习的一个专家DSS (ML)模型和metaheuristics方法用于有效地识别心脏病。
毫升有先见之明的模型需要合法的信息准备和测试。毫升正在利用在医院援助组织的行政程序,传染病的规划和管理,定制的医学治疗9]。此外,机器目前使用在各种各样的心脏方面的学科,以及新的医疗业务的提高,患者信息的控制和记录,和持久的疾病的治疗10,11]。
监督方法(12)是一个毫升方法预测未来数据通过基于标签的训练数据流映射信息。这种方法的目的是旨在创建一个模型,然后提高机器的性能,因为它暴露在新数据。无监督学习技术是一个毫升方法系统给出一个无标号数据集和需要发现数据中的关系。无监督学习是针对分组数据和检测现有的模式。强化学习算法使用试验和错误来发现数据内的模式或关系。决定代理,代理交互的环境,代理必须完成的行动所涉及的三个关键组件。该算法的目的是发现最优政策根据经验做出可靠的决策。
数据挖掘和机器学习(ML)方法减少计算机成本和时间。毫升使用之一是医疗疾病的检测和治疗以提高病人的生活质量。心脏病通常被认为是一个条件,只有影响老年人;然而,在所有年龄段的人越来越普遍。
预计信息预处理信息标准化进一步发展毫升模型的期望的能力。预处理技术,如噪声数据删除和规范化进行。模型的性能也提高了特征提取和选择策略。特征选择是使用Moth-Flame执行优化技术,并使用主成分分析特征提取。此外,分类是使用四个模型执行的,也就是说,DT,支持向量机,安,和资讯。合奏叠加执行结合使用逻辑回归结果从四个分类模型。提出系统的评估结果使用等几个指标的准确性,精确,回忆, - - - - - -衡量。
本研究的主要贡献包括以下:(我)一个自动化系统设计使用克利夫兰数据集对数据集进行分类(2)特征选择是使用Moth-Flame执行优化算法,有助于消除不必要的功能出现在数据集(3)特征提取是使用主成分分析(PCA),有助于进一步减少数据集的维数(iv)分类是使用四个不同的执行模型,使用合奏叠加方法得到最好的结果(v)系统优于现有技术发展水平系统精度、精度、回忆 - - - - - -测量
以下显示了这种预期工作的分解。部分2进入细节相关的工作计划任务。部分3详细说明拟议的框架。第四部分深入的细节和性能评价实验结果。部分5讨论了结论以及未来努力。
2。文学作品
研究人员已经提出了高清几个ML-based诊断方法。ML算法(13,14)被广泛应用在各种研究疾病的识别和鉴定等15]。Gudadhe et al。16]用多层感知器和SVM为心脏病(HD)创建一个检测方法分类,实现了81%的效率。Detrano et al。17]毫升分类技术来构建使用高清分类系统,77%的准确率。
Al-Makhadmeh和Tolba18)神经网络模型引入了一个很深的信仰IoT-based心脏病识别系统。收集到的数据缺失值的检查。作者观察数据分布。作者还使用studentized方法使用规范化的数据。深度信念网络和高阶玻耳兹曼机被用来从噪声中提取特征数据所使用的模型。研究人员取得了99.03的预测精度,可以帮助减少心脏疾病的死亡率。艾哈迈德(19)提出了一个高清识别算法采用物联网架构与支持向量机。预测心脏病、病人数据使用支持向量机进行了分析。研究人员声称他们的方法预测心脏疾病有97.53%的准确度。使用一个物联网设备,他们收购了心脏数据和识别高清。这种方法在短时间内检测到高清,但是精度时使用大量的数据(20.]。
Guidi et al。21)帮助创建一个DSS心力衰竭(HF)分析。他们研究了神经网络(NN)的有效性,支持向量机,CART-based模糊规则,和随机森林毫升分类器(RF)。购物车模型与随机森林产生最好的结果,87.6%的准确性。Parthiban和Srivatsa22探索一个SVM方法检测高清糖尿病患者95%的效率。
所以et al。23)导致的形成一个自动化分类模型,区分那些在低和高的风险。敏感性和特异性的分类和回归树(CART)计算了93.3%和63.5%,分别。减少的数量特征,Sewak et al。24)采用二元分类器正确识别心脏病精度提高了100%。多种技术可用于特征选择(25,26]。主成分分析(27,28)已被使用为功能分类检索策略在最近的研究的医疗保健服务。
分类是使用克利夫兰执行数据集(29日)确定如果一个病人有心脏病。ML算法结合特征提取有三个主要目标:(i)发现的独特特征,(2)评估PCA的效率,和(3)研究模型能产生更好的结果。
3所示。提出的方法
本节将详细描述该系统及其组件。图1描述了建议的系统的原理图。
3.1。材料
在这个研究中,克利夫兰数据集。有303事件和75年当这个数据集设计特性。我们在这项研究预处理数据集,和六个样本排除由于缺失的值在这个数据集。
3.2。数据预处理
数据准备是毫升的关键阶段,提高数据的质量,使其更容易从大数据中提取有用的知识。数据预处理是一种组织和管理方法未加工的数据准备毫升模型的发展和培训。数据清洗的过程,消除错误,丢失,和不一致的数据从数据库以及恢复丢失的数据。6样品用缺失值被丢弃后,剩余的样品处理。没有和高清的存在是由一个单独的结果描述标有两类。缺失值消除后,数据应该规范化从0到1的简化评估心脏病的趋势。studentized残留方法是一个标准偏差计算的规范方法(30.]。标准化高清的数据预测,几个数据分布和回归分析。
3.3。降维
降低变量分析的过程被称为降维(31日]。它被用来检索未加工特征在不牺牲的完整性。这项工作包含两个方法:Moth-Flame优化(MFO) [32)对特征选择和特征提取的主成分分析(PCA) (33]。
3.3.1。特征选择的Moth-Flame优化(MFO)算法
MFO是一种优化的方法集中于飞蛾的横向方向使用夜间旅行。飞蛾飞可能更大范围以线性方式通过保持一个常数朝向月球。当飞蛾进入接触环境光,他们努力维持相同的角向光源,但紧密亲密使他们成为卷入了螺旋路线。
MFO方法分配飞蛾对各种备选方案优化问题的解空间,在每一个适应度函数。每一个蛾子携带包含最优解斜纹夜蛾发现了火焰。飞蛾飞在一个圆形的绕过他们的火焰,改变他们的位置在每个迭代中探索解空间。在MFO蛾在解空间位置是随机设定。飞蛾的健身价值计算。每个蛾最好的个人的位置是确定的火焰。对于每一个蛾火焰识别的理想位置。飞蛾的位置是改进使用螺旋运动算法接近最好的个人立场凸显了火焰在接下来的迭代中,火焰的位置替换为新的最佳和最一致的位置。直到终止要求,MFO算法不断更新和产生新的职位飞蛾和火焰。
以下是MFO的计算过程:
步骤1(创建初步的人口)。每个蛾被认为是占据 - - - - - -维空间的解决方案。飞蛾的集合可能写成 在哪里表示蛾和表示维度。适应度函数是由 MFO的两个组件包括火焰和各自的健身功能如下所示: 在MFO,飞蛾在每个迭代中寻求最优解,与火焰描绘发现最优解。火焰的位置然后重组。
步骤2(飞蛾被更新的位置)。MFO雇佣了三个函数设置飞蛾的随机位置( ),最优解( ),和停止过程( ): 设置飞蛾的位置在最优位置,可以利用随机分布。的可以写成函数的实现 和罗是数组,函数的确定上限和下限,分别。飞蛾在最优位置的方向是容易使用对数函数描述的条件列出如下:(我)螺旋的初始点应该斜纹夜蛾(2)火焰的位置应该是螺旋的终极点(3)螺旋的范围不应变化超过空间的问题结果,代表了运动如图所示如下: 在哪里是一个常数用于建立对数的形状,1和1之间是一个随机值,是长度。 斜纹夜蛾的螺旋路径环绕火焰确保最优的解决方案是探索和利用。每个周期类型理想溶液(火焰)保持飞蛾被困在当地的最适条件,和它徘徊在周围火焰的使用和OM相关矩阵。
第三步(火焰更新)。方程(8)将用于减少MFO火焰的算法,导致只蛾子绕着最优解的方法的最后阶段。 坏蛋代表时代的现有数量,马克斯代表最多的火焰,Iter代表迭代的数量。解决方案空间发展是通过减少火焰的数量平衡。
步骤4(终止条件)。算法终止准则决定时,应该停止。一个好的的选择终止算法的正确的收敛标准是至关重要的。MFO经常终止基于重复的次数,提高性能,并已经运行的时间长度。
3.3.2。特征提取的主成分分析(PCA)
我们使用eigenvalue-one准则来识别有意义的组件的数量分析。我们能够把所有组件与一个特征值大于1的结果。作为一个独立变量,每个元素占了一个单位的变化。因此,组件有一个特征值大于高方差占比个人的贡献。组件特征值小于1,另一方面,小比个人和被淘汰。
3.4。分类
该研究的后续阶段分类。类标签预测特定输入数据分类的例子,这是一个预测模型(PM)工作在下午毫升。设计的方法从离散输入参数估计特征表示离散的独立变量。主要目的是确定对应于哪一组额外的知识。有四种分类算法纳入拟议的研究,包括决策树、支持向量机,安,和资讯。
3.4.1。决策树(DT)
DT是决定将使用一个算法的可视化表示。创建一个DT问是的/没有问题,然后将答案分为两部分导致另一个决定。问题是在节点,在树叶和接下来的决定。它可以用来解决分类和回归问题。
3.4.2。支持向量机(SVM)
支持向量机是一种监管毫升的方法论,可以解决分类和回归问题。它也可以用来解决分类问题。每一块数据表示为几何轨迹,没有每个属性的值表示的算法的价值一个轨迹。然后通过确定超平面分类,明确区分两组。一个支持向量机模型在高维空间只是一个表示不同的团体在一个超平面。减少错误,SVM逐步将创建超平面。支持向量机的目标是将数据集划分为组,这样最大边际超平面可以识别(嗯)。使用这些支持向量,我们优化分类器的边缘。如果删除的支持向量,超平面的位置会改变。
3.4.3。人工神经网络(ANN)
人工神经网络是一个人类的大脑如何学习的粗糙模型。负责层的神经元,这是一代,构成一个安。这些神经元也被称为调整因素。每一层的结果转发给随后的层。每一层都有自己的非线性激活函数,这有助于学习的过程和生产结果。终端输出层的神经元是另一个名称。每个时代,负责整体的重量与神经元和预测被修改。各种优化合并来增加学习过程。每一个安目标函数,会随着学习的进展。最好的成本函数的权重给最好的结果是使用。
3.4.4。再(资讯)
资讯是一个简单,方便的解决方案处理分类和回归的任务。资讯技术确保最新的场景和现有的场景是一样的和地方的新病例组最接近于原始组。然而,下面的讨论。
|
||||||||||||
3.5。合奏叠加
3.5.1。叠加
集成学习是机器学习术语中有几个模型训练来处理相同的问题,然后综合改善的结果。主要的思想是,通过正确结合弱模型,我们可以得到更准确的和/或有弹性的结果。一个方法可能无法提供最好的估计对于一个给定的数据集。ML算法的局限性,很难创建一个高精度模型。总精度可能被开发和增强结合许多模型。每个系统整合的结果达到减少误差,同时保持通用性。这种聚合可能以多种方式实现。Meta-algorithms一些教科书使用的术语来描述这种设计。
叠加是一种毫升方法用于集合体。使用metalearning策略,它学会了如何合并两个或两个以上的ML算法的预测。堆积的利益整合的特点,许多高性能系统提供预测,超越任何一个模型组成一个分类或回归任务。
3.5.2。逻辑回归
有限的概率评估方法结果给出独立变量被称为逻辑回归。一个二进制的结果是包含在大多数常见的逻辑回归方法。模型场景有超过2截然不同的结果,可以使用多项逻辑回归。逻辑回归是一种强大的统计方法确定新的一组内数据匹配。因为网络安全组件,比如威胁检测、分类问题,逻辑回归是一个有用的分析技术。
4所示。结果与讨论
克利夫兰数据集用于运行该建议的体系结构。它执行分类使用以下步骤,即预处理、特征选择使用MFO,使用PCA特征提取,使用决策树和分类,支持向量机,安,和资讯,其次是合奏铆合使用逻辑回归。该系统达到更高的精度,减少了计算。
表1显示了克利夫兰的描述数据集。一个热图有助于可视化数据集的数据。图2代表克利夫兰的热图数据集。表2代表了预处理后的数据集实例。
提出研究的数据集分为两部分:(1)以70%的信息和培训部分(2)以30%的测试部分的信息。四个性能指标,即准确性、精密,回忆, - - - - - -措施,被认为是在拟议的研究。准确率是通过准确分类的数量除以数据集类的总数。它表示在
精度、召回和 - - - - - -测量估计使用以下方程:
准确度、精密度、召回和 - - - - - -测量应该改进周期。表3显示了研究成果没有预处理,去除噪声等预处理技术通过消除失踪值,使用min-max规范化,标准化 - - - - - -分数,和组合的结果。各种metaheuristic算法适用于各种应用程序(34- - - - - -39]。表4显示实验结果使用等特征选择策略的遗传算法,粒子群优化和Moth-Flame优化。该方法使用MFO达到最好的结果与其他技术相比。表5实验的结果显示的几个特征提取策略,与PCA用于该方法产生最好的结果与其他方法相比。图3描绘了一个预处理方法的比较。
表6显示了实验分类方法像DT,支持向量机,安,和资讯。使用逻辑回归结果应用合奏叠加后产生最好的结果比采用单个模型。相比之前的策略,目前的技术采用MFO提供卓越的结果。
表7显示了该方法的比较的结果与现有各种技术。图4显示了与各种特征选择和特征提取技术。图5显示与几个技术发展水平的比较方法。推荐的策略产生方面性能优越的精度,精度,回忆,和 - - - - - -衡量。
(一)
(b)
5。结论和未来的工作
许多生命保存医疗监测和预测技术,特别是当病人放置遥远。分类器的目的是确定病人是否有心血管疾病或不是。必须考虑系统资源时,使用所有的功能是不可能的。在这项工作中,我们利用降维方法提高收集的原始数据。使用决策树进行分类,支持向量机,安,和资讯,合奏叠加称为逻辑回归帮助实现最好的结果从各个分类模型。我们的技术可以用来评估大量数据和发现与多种疾病相关的风险变量在各种现实世界的应用程序或其他医疗诊断。我们打算测试我们的战略在更大的数据集和分析不同疾病使用替代特征选择策略。我们的主要限制是有限的样本容量很难概括这些发现心脏疾病。在进一步的工作中,我们想扩大我们的方法将使用的数据集和分析更多疾病使用各种特征选择方法。
数据可用性
作者确认数据支持拟议的工作从公开可用的数据集。
的利益冲突
作者确保在这个提议没有利益冲突的工作。