文摘
最近的进步发展的传感器设备提高了信息收集和允许复杂但智能应用程序基于学习隐藏收集传感器数据和目标之间的关系。在这个场景中,multilabel特征选择可以扮演重要的角色在实现更好的学习精度和有限的资源限制。然而,现有multilabel特征选择方法是search-ineffective因为经常包括重要特征子集生成的功能。此外,只有少数特征子集的搜索空间被认为是相比,收益率较低的特征子集multilabel学习精度。在这项研究中,我们提出一个有效multilabel特征选择方法基于一种新的特征子集生成过程。实验结果表明,该方法可以识别比传统方法更好的特征子集。
1。介绍
最新进展在传感器网络的发展提高了精度连续数据传感(1],增加环境应用的报道活动监视等日常工作,包括活动的并发预测水平和热量支出(2,3]。由于计算和存储能力的限制(4,5为去噪[]和冗余数据传感6,7),组合策略,会产生最好的准确性考虑到数据收集的条件下被认为是最重要的一个问题在这个领域8]。因此,multilabel学习被认为是一种很有前途的方法,因为它允许改善准确性利用标签之间的依赖关系(9,10]。
让 表示组模式所描述的一组功能 。然后,每个模式 ,在那里 是分配给一个特定的标签子集 在这 和代表一个有限集的标签。获得额外的提高精度,算法利用有用的标签基于输入特征值之间的依赖关系(11]。为此,multilabel特性选择标识的一个子集 以最大的 特性,提供最大的依赖可以作为一个有前途的预处理步骤,因为它救济功能之间的复杂关系和标签通过选择重要特性,抛弃不必要的(12,13]。
基本上,multilabel特征选择是一个搜索问题(14];它可以通过识别出最好的预测精度的最优特征子集 候选特征子集(15]。因为考试的所有特征子集是不切实际的,传统方法采用启发式搜索的方法,确定了通过牺牲最优可行解在有限计算成本(16]。许多搜索方法的进化搜索方法被认为是一种很有前途的方法,因为它有效地缩小了搜索空间通过检查邻居解决方案或特征子集的最佳解决方案创建从过去几代17,18]。
在进化的搜索方法,最好的解决方案是更换如果一个新创建的邻居解决方案能够更好的健身价值。因此,生成有前途的解决方案确定搜索的有效性。由于广泛搜索空间和有限的计算成本,传统的策略解决这个困难的方法是使用一种廉价的措施的潜在可能的解决方案的评价方法,过滤掉没有希望的解决方案,然后验证的健身价值剩余的解决方案(19]。然而,我们所知,没有认真调查这个方向的相关文献智能传感器应用和multilabel特征选择。
在这项研究中,我们提出一个新的有效的进化搜索multilabel数据集的方法。先前的研究考虑到智能传感器应用程序导致multilabel特征选择没有解决问题的生成相关承诺特征子集,导致变性的搜索效率。我们的贡献可以概括如下:(我)该方法提高了搜索效率生产大量的功能和重要的特征子集,然后过滤掉不使用廉价的评价方法特征子集。(2)一个廉价的特征子集评价方法是用来过滤无前途的功能子集没有检查健身价值要求昂贵的计算成本。(3)我们比较传统的性能multilabel功能包装方法和该方法14日multilabel数据集,进行了53个标准统计测试来验证该方法的优越性
2。相关工作
因为multilabel特征选择可以提高学习精度以及后面的算法的效率通过强调重要的并发特性,比如multilabel分类器预测,它得到了显著的注意力从不同的领域(20.,21]。
特征选择方法有两类:过滤器和包装器。过滤器等级特性根据自己的标准的方法评估每个特性的重要性。对于multilabel multilabel数据集特征选择,一个简单的策略,改变标签集,通常被认为是一个标签组,如标签powerset [22]。这种方法是有利的,因为它使传统的单标牌数据集特征选择方法。几种传统过滤方法已报告(23];然而,过滤方法通常遭受multilabel分类精度低,由于noninteraction multilabel分类器或后续转换单标牌数据不平衡等问题。相比之下,包装方法评估创造特征子集和完善它们。在细节,他们使用一个搜索方法找到有前途的特征子集采用然后评估他们使用后学习算法(17]。虽然学习算法可以根据应用不同,最近的评论表明,最常见的搜索方法的选择是进化搜索(24),因为它是有效的在全球视角寻找可行的解决方案。Zhang et al。14)提出了一个multilabel基于遗传算法的特征选择方法。然而,遗传算法的主要缺点是他们过早收敛未经提炼的解决方案(17]。另一方面,遗传算法遗传algorithm-II nondominated排序(25和多目标粒子群优化26)已被用于multilabel特征选择。
尽管大多数研究认为单标牌感官数据集,有几项研究特征选择方法,因为有前途的潜力。应用自动生成视图,semisupervised特征选择方法从高分辨率遥感图像中提取特征提出了(27]。具体来说,功能分为一系列的分离群体,然后每组重要特征选择的解决-norm-based最小化问题。同样,一个精炼功能子集从离散小波变换系数的特性,从人工提取舌传感器信号,选择使用离散率计算(12]。活动识别使用加速度计也被证明是提高了特征选择(28]。有几个研究识别相关的一组重要特性基于健身或分类精度来自学习算法。例如,特征子集可以得到每一步迭代包括最好的特性,这称为顺序向前选择算法(29日]。该技术应用于机组故障检测中的应用(30.),这是一个实例化的自动故障检测问题在智能工厂(31日]。最著名的的遗传算法进化搜索方法在机器学习社区还考虑选择区别的特性在线轴承故障诊断(32]。此外,粒子群优化技术,这是另一个流行的进化搜索方法,也找到最优特征子集用于入侵检测(13]。支持向量机的递归特性消除气体传感器已被用于分析相关数据7]。能量消耗最小化,提高了分类精度,从传感器数据特征选择5]。
3所示。该方法
3.1。初步
的各种进化搜索方法、分布估计算法(EDA)已被证明有效的解决各种各样的问题(24,33]。与典型的进化搜索方法不同,产生新的特征子集,eda不使用遗传算子(19]。相反,传统的eda产生新的解决方案或候选人使用概率模型和更新基于统计分布估计的概率模型表示的解决方案。因此,它提供了一个机会来生成有前途的特征子集通过操纵的概率模型。概率模型可以实现如下(33,34]: 在哪里选择的概率th的特性th一代,相关的概率是多少th特性特征子集在前50%th代排名的健身价值,和是学习速率,它是一个用户定义的参数控制的影响下一代的概率模型。通过(2),选择的概率特性( )th一代, ,计算,( )th,特征子集。重复这个过程,直到最大允许计算成本是筋疲力尽了。尽管有许多停止标准,我们设置了适应度函数调用的数量(ffc)作为终止条件所有进化搜索方法用于本研究对多样化的设置和实现一个公平的比较35]。
在特征选择问题,算法应该能够搜索一个巨大的参数空间;因此,重要的计算成本与找到一个有前途的解决方案。虽然简单的概率模型是容易实现的,它可以解决复杂问题的不足,如确定有前途的特征子集在大型搜索空间(36]。例如,在传统EDA-based特征选择方法,所有功能最初分配的选择概率0.5。这意味着nonpromising特性也可以出现在特征子集。为了克服这个缺点,我们设计一个过程生成一个有前途的特征子集。具体地说,在创建一个特征子集时,该算法将考虑重要特性更频繁地通过设置优先级过滤这些特性由个体特性。
创建特征子集后,下一步选择有前途的特征子集。尽管良好的特征子集可以创建使用过滤方法,可以有nonpromising特征子集,因为创建过程概率和可能有有效的交互功能。Nonpromising特征子集消耗ffc和搜索效率产生负面影响。为了克服这个问题,我们提出一个特征子集评价方法使用廉价的计算成本。使用的信息理论方法,该方法计算,对于每一个子集,子集的相关性和冗余功能。然后,该方法选择特征子集最大相关性和最小冗余。因为有可能建议的解决方案只会在本地有前途,该方法使用轮盘赌选择作为选择算法(37]。因此,nonpromising特征子集从邻居集,过滤掉没有确切的评估。
在该方法中,有两个关键特征子集生成的功能。创建函数使候选特征子集,由相关的特性。选择函数选择有前途的特征子集之间创建的采用轮盘赌选择基于他们的潜力评价方法给出的一个功能子集。图1示意图显示了该方法。在第一阶段,初始化概率模型,表明特征子集包含随机选择功能将频繁地创建。概率模型表示为向量,每个元素编码每个特性的存在。在下一步中,特征子集是使用创建的创建函数。所有特征子集分配随机整数,从一个 。如果决心一个特征子集选择两个特性,该方法排名的功能的重要性,使用一个过滤器的方法。在第一次迭代中,最重要的特性 。然后,该方法选择一个随机数字在0和1之间和比较选择的概率在概率模型中, 。自大于在这个例子中,选择并添加到特征子集。排名在第二个迭代,特点是再次使用过滤方法。在这种情况下,功能的重要性再次测量的相关性和冗余性的选择 。因此,特征的排名可以改变。在这个例子中,是最重要的特性。然后,另一个随机数画和比较选择的概率 , 。然而,低于 ;因此,不是选择。然后,可以选择第二个最重要的特性。在这个例子中,添加到功能的子集,迭代终止。通过这个过程,该方法创建一系列的新功能包括重要的特征子集。下一步,选择有前途的特征子集之间创建特征子集选择函数。该方法选择有前途的特征子集通过轮盘赌选择偏见所列出的特征子集评价。最后,更新使用的概率模型有前途的特征子集和(2),以反映的存在特性最好的新功能子集在健身价值的一半。
3.2。提出了搜索过程
该算法创建功能子集大搜索空间和过滤器nonpromising子集评价方法不使用该子集产生精确的评估。算法1显示了该方法。的人口规模和最大数量的ffc ,该方法初始化功能子集和概率模型(第3行)。该方法生成的一组特征子集通过一个随机分配的最大值二进制位。的概率模型是一个长度向量,向量中的每个条目的概率是指选择协调功能。初始化每个条目的分布特性 。然后,创建集评估(第4行)。该方法设置ffc消费吗0(第5行)和商店全球最佳特征子集(第6行)。更新(2)(第8行)。该方法创建一组邻居特征子集 ,基于过滤器的方法创建函数(第9行),然后特征子集选择通过轮盘赌选择加权选择功能设置和产生新一代 (第6行)的特征子集 评估(第11行),并设置消费ffc吗(12行)。特征子集 ,提供全局最优性能、存储和取代的过程(13号线)。毕竟允许ffc消耗,算法返回的特征子集 。
|
||||||||||||||||||||||||||||
算法2是一个创建函数显示创建特征子集的过程。每一个特征子集选择随机大小特性(第5行)。介绍重要的功能更加频繁,应该按其重要性排名第一,每个特性值。为了达到这个目标,我们评估每个特性的重要性使用相关性准则(20.]: 在哪里和表示的相关性和冗余th特性和表示的重要性th特性。虽然两个函数可以实现不同根据每项研究的主题,我们使用最近的过滤方法测量特性的重要性。在的工作15),我们提出了一个过滤器multilabel数据集的方法,并证明优于传统过滤方法。因为这个原因,我们使用这种方法测量特性的重要性。因此,可以实现为 在哪里 表示变量之间的互信息和和 联合熵的概率是 , ,和 。接下来,可以实现为
|
||||||||||||||||||||||||||||||||||
因此,功能的重要性是衡量
然后每个特性的秩可以由使用(6后),记得(第8行)。然后,功能决定是否从最重要的子集的选择功能(9 - 13行)。如果选择一个特性,它被添加到子集(11行)。此外,创建一个子集后,它被添加到组的邻居特征子集(16行)。
众所周知的事实特征选择社区,一组单独的好特征并不一定是好由于特征子集之间的交互功能。这意味着可以无前途的特征子集创建即使(6)只包含重要的功能。为了达到这个目标,选择函数描述的算法3显示选择有前途的特征子集的过程在一个邻居是必要的。在选择函数,一个新特性子集筛选方法(38]。具体地说,它对健康的特征子集
|
||||||||||
通过使用(7),选择居的邻居集特征子集的函数(3)行。接下来,算法选择特征子集使用轮盘赌选择[37),这是一个有偏见的选择重量(7)(4号线)。
总之,一代的特征子集,该算法排名功能使用过滤方法的重要性,选择最重要的特征基于概率考虑子集在这一点上。如果th特性是没有选择,下一个最重要的特性可以选择的概率 ,并重复这个过程,直到一个特性被选中。然后,对于每个邻居特征子集,(7)排名功能子集的重要性,并与最高的特征子集值可能会选择。
4所示。实验结果
我们在14个不同领域的数据集进行实验。鸟类数据集是音频数据包含多个鸟调用的样本。安然和语言日志(Llog)数据集生成的文本挖掘应用程序,其中每个功能对应一个词的存在,每个标签代表每个文本模式的关联到一个特定的主题。Mediamill数据集包含了视频数据的自动检测系统。大型语料库的医疗数据集采样自杀信件从自然语言处理的临床获得免费的文本。TMC2007数据集包含一个复杂空间系统的安全报告。剩下的八个数据集来自雅虎数据集收集。我们对数据集进行无监督降维,包括TMC2007和雅虎集合,组成的10000多个特性。因为我们的算法使用信息理论,数值特性,我们使用监督离散化方法进行离散化39]。表1显示的标准特征multilabel数据集用于我们的实验,包括模式的数据集的数量 ,数的功能 ,类型的特性和数量的标签 。标签基数测量代表的平均数量为每个实例标签。标签密度测量是标签的基数超过总数的标签。不同的标签集的数量表示独特的标签子集的数量 。域代表与提取的数据集相关联的应用程序。
我们提出的方法与传统方法相比,包括遗传算法(GA) [14),nondominated排序遗传algorithm-II (NSGA-II) [25),多目标粒子群优化特征选择(MPSOFS) [26]。我们认为传统multilabel分类器,即multilabel朴素贝叶斯分类器(MLNB) (14]。我们使用传统的合作为每个数据集交叉验证。的模式,80%是随机选择作为训练集,剩下的20%被选为测试集,我们人口的大小设置为20,和最大数量的ffc仅限于100年。在我们的方法中,我们创造了500个特征子集使用概率模型和设置学习速率(0.4)。GA和NSGA-II创建了两个后代特征子集和变异操作的每一代一个特征子集。MPSOFS保存全球最佳粒子的解决方案和每个粒子的最佳解决方案。此后,MPSOFS更新速度值。所有的实验都重复10次,平均测量值被用来比较的表现方法。
测量方法的性能,我们采用以下四个评价指标:multilabel准确性、汉明损失,损失,排名和规范化的报道。Multilabel精度定义为 在哪里是一个给定的测试集,汉明损失被定义为 在哪里表示正确的标签和子集表示对称的两组之间的差异。排名被定义为损失 在哪里是一套互补的 。的平均分数排名损失措施 对与 在对所有可能的相关和不相关的标签。最后,标准化覆盖率的定义是: 在哪里返回相应的等级相关的标签 根据nonincreasing秩序。因此,规范化覆盖措施多少标签必须对所有相关标签标记为积极正面的。multilabel的值更高的精度和更低的汉明损失值,排名下降,和标准化的报道表明良好的分类性能。
表2,3,4,5列出实验结果不同的性能措施的采用数据集上实验的平均值。每个数据集的最佳性能是由一个大胆的字体表示。每个表的最后一列显示的平均等级(平均排名)每个比较法multilabel数据集。排名的multilabel准确性和损失的措施,该方法优于GA, NSGA-II MPSOFS,在所有的数据集。汉明损失而言,该方法优于传统的方法在所有数据集TMC2007除外。规范化的报道,该方法优于传统的方法在所有数据集Llog除外。
测量方法的性能在所有的数据集后,我们分析使用统计工具的性能。我们雇用了弗里德曼测试,一种广泛使用的统计检验,比较多种方法的数据集(40]。假设有方法和数据集,让表示的平均排名在虚假设条件下(即th方法。,when all of the methods perform equally well). Then, the following Friedman statistic分布式根据吗分布与分子的自由度和()()分母自由度参数: 在哪里被定义为
如果在显著性水平大于临界值 ,零假设被拒绝,暗示的方法相比有不同的表现。零假设被拒绝后,我们执行事后测试分析方法是否执行明显好于其他方法。Bonferroni-Dunn测试采用(41]。关键的区别()用于比较该方法和比较法。CD被定义为 关键值是恒定的,是由水平的方法和意义。如果两者的区别比较方法的平均排名大于 ,better-ranking方法得出的表现明显优于其他方法。因为我们的实验中使用的四种方法,包括方法、14个数据集,我们集 和 。我们采用弗里德曼测试当显著性水平是0.05。表6显示了采用弗里德曼测试的总结。3岁至39岁自由度的关键值是2.845。弗里德曼的统计所有性能措施高于临界值。因此,零假设,相比方法执行同样被拒绝了。
雇佣Bonferroni-Dunn测试、计算与 1.168自 在显著性水平0.05。图2显示了图的所有评价措施,每个方法的平均排名在每个图的顶端。我们提出的方法明显优于其他传统方法在所有评价措施。
(一)Multilabel准确性
(b)汉明的损失
(c)排名的损失
(d)的报道
5。结论
处理multilabel传感器数据集,我们提出了一个有效的基于一个有前途的特征子集生成方法寻找multilabel特征选择问题。这项工作的主要贡献是提出和验证新功能子集生成方法。具体来说,该方法生成使用重要的特点和特征子集选择有前途的候选人没有消耗大量计算成本的特征子集。实验结果表明,我们的方法收敛速度比其他传统的方法。在未来,我们想调查一个新特性子集生成更有效,因为该功能子集生成强烈依赖于采用过滤的方法,而且可能造成搜索过程中冗余的特征子集。此外,我们希望将该方法应用于各种传感器数据和比较性能与传统特征选择方法从感官数据分析。
数据可用性
所有使用的数据用于支持这项研究的结果已经存入木兰库(http://mulan.sourceforge.net/datasets-mlc.html)。
的利益冲突
作者宣称没有利益冲突。
确认
这项研究受到了基础科学研究项目通过韩国国家研究基金会(NRF)由科技部,ICT和未来规划(NRF - 2016 r1c1b1014774)。