文摘

一个二进制的效率支持向量机(SVM)分类器为基础的数量取决于组合和从原始信号中提取输入特征。有时,结合个人良好的特性不执行在歧视类由于高水平的相关性,第二个类也。此外,增加一个输入向量的维度也在大多数情况下会降低分类器的性能。要获得有效的结果,是需要输入的最低数量的组合分类器识别特性。在本文中,我们提出一个框架来提高传感器的基于svm分类器的性能故障分类在两个方面:首先,通过选择最佳组合的特性从功能池和目标类,其次,通过最小化输入向量的维数。获得最佳组合的特性,提出一种新的特征选择算法选择 特性的最大互信息与目标类(或关联)和最小互信息不属预定目标的类。这种技术可以确保目标类选择敏感的特性。此外,我们提出一个diversified-input SVM多类分类问题(DI-SVM)模型来实现我们的第二个目标是减少输入向量的维度。在这个模型中,基于svm的数量是一样的数据集的类的数量。然而,每个分类器是用一个独特的组合特征选择的目标类的特征选择方案。的效率提出了特征选择算法通过比较从实验中获得的结果进行显示和特征选择。此外,实验结果的准确性,接收机工作特性(ROC)和ROC曲线下的面积(AUC-ROC)表明,该DI-SVM模型优于传统的支持向量机模型,神经网络, 最近的邻居传感器故障检测和分类算法。

1。介绍

列出了传感器在工业系统作为第二错误后滚动元素的主要来源(如轴承)上(1- - - - - -3]。这些错误导致无法忍受的后果包括维护成本的增加,影响产品的可靠性,更加重要,安全3,4]。这些问题可以避免明显通过检测故障立即出现。因此,传感器的输出监控及时识别异常。检测后,必须找出故障发生的主要原因是为了实现安全措施。为此,断层分为预定义的类从历史数据中获得,这一过程称为分类。

最近,机器学习(ML)技术,如神经网络(NN)、支持向量机(SVM)和 最近的邻居(资讯),支持分类问题是由于一个高效的性能(5- - - - - -12]。然而,他们需要一种特征提取方法克服高维度的输入信号的诅咒。该方法特征几百,甚至thousand-dimensional输入信号通过提取几个特性。然后,这些特征作为分类器的输入,而不是原始的信号。尽管这种技术可能会增加效率在某些情况下,大多是没有或很少的改善分类器的性能。主要原因是使用功能不同样本之间的辨别能力较低的类。好的特性是描述信号的所有类的一个类的数据集,这样信号很容易别人的歧视。选择从池特性好等特点,一个特征选择算法(FS)。因此,特征选择的步骤有一个主导作用在模式识别和分类性能可靠的分类器应用程序。然而,单独的结合良好的特性并不一定导致分类性能好(13]。因此,一个好的FS算法试图找到最佳组合的特性,而不是单独的组合好的特性。此外,如前所述,系统的复杂性取决于输入向量的维度的直接关系。因此,选择尽可能少的特性,选择良好的特性会导致分类器性能的提高。

FS算法分为wrapper-based,藉由和基于过滤器(14- - - - - -16]。wrapper-based方法选择特性,通过分析每次选择后分类器的性能。的特征优化选择分类器的性能。这些技术要求高的计算资源和很长时间才能得到最好的功能;即便如此,不保证最优。藉由特征选择同时优化分类器和特征选择。这些方法的问题是,考虑分类器的特征选择和可能无法与其他分类器合并。相比之下,基于过滤器的特征选择方法不考虑分类器优化选择特性。在这种方法中,互信息(MI)是一种广泛使用的度量来选择最相关的目标类的特性。

当前工作的目标是开发一种有效的检测和分类算法使用监督ML-based传感器故障分类器。为了这个目的,我们首先提出一个小说MI-based FS方案选择独家相关特性与高鉴别力的特征池。然后,我们提出一个diversified-input SVM (DI-SVM)模型来降低分类器的输入向量的维度最终改善性能。

1.1。贡献

这项工作的主要贡献是总结如下。(我)基于过滤器FS算法选择一个组合的特性专门歧视别人的一个类。目标类,测量心肌梗死的任命不属预定目标的类特性是衡量MI的减去相同的功能在目标类。这种技术选择的特性有较高能力识别目标类,同时,减少灵敏度不属预定目标的类。结果显示提出的FS的效率比其他计划,计划利用特征之间的冗余除了相关性测量特性的美好。(2)此外,我们提出一个DI-SVM模型来降低分类器的输入向量的维度。该模型输入功能的多样化组合不同的支持向量机用于多级分类。这些功能的组合输入任何选择分类器的特征选择算法。例如, 分类器是美联储的选择组合 类。另一方面,在传统的方式使用svm多类分类,分类器都是训练有素的确切同样数量和设置功能选择所有类。实验分析表明,该DI-SVM模型进一步改进传统的支持向量机的分类性能。(3)提出方法的性能进行了分析使用两个数据集。在第一集,错误的信号是通过保持指数故障插入点固定在500年模拟,而第二个数据集是获得使用错误的信号和故障插入点在每个样本从0到1000不等。后一种情况是用来复制一个实际的场景在工业系统。结果表明,它是更具挑战性的检测和分类错误在第二种情况下。然而,拟议的FS的框架方案和DI-SVM也达到令人满意的结果,在这种情况下。(iv)一系列的五个实验进行比较的性能提出DI-SVM模型与传统的支持向量机,神经网络,然而,分类器。前两个实验执行使用传统的支持向量机,神经网络,然而,没有应用特征选择的分类器。在接下来的实验中,我们证明了FS算法的效率使用精度的措施,接收机工作特性(ROC),面积中华民国(AUC-ROC)和散点图里,在选定的功能空间。在过去的两个实验,我们部署提出FS和DI-SVM模型以及上述分类器和性能进行比较。结果表明,DI-SVM优于所有柜台三个分类器。

本文组织如下。审查相关的工作和提出的特征选择算法提出了部分2。分类的理论模型和提出DI-SVM模型提出了部分3。实验结果说明在部分4。部分5介绍了讨论实验结果,最后,研究得出在部分6

2。互信息特征选择

2.1。预赛

回顾之前的相关工作,我们现在基本背景知识MI-based特征选择方案。两个随机变量, ,的MI定义如下17]: 在哪里 连续随机变量的概率密度函数吗 ,分别为, 是他们的联合概率密度函数。离散随机变量的集成被替换为总结如下: 在哪里 离散随机变量概率质量函数 ,分别为, 是他们的联合概率质量函数。小姐可以用熵来表示如下:

代表了熵和条件熵,定义如下:

2.2。相关的工作

在本文中,我们关注的选择标准基于MI的测量特性。提出了不同的FS算法使用不同的标准来衡量过去的美好特性使用MI。Battiti [18通过计算MI)选择特性 个人的特性 与类 为了避免冗余特征的选择,MI的措施 两个功能 计算。MI-based功能选择(mif)作为(18] 在哪里 正则化参数的重量是冗余吗 候选人之间的特性 和已经选择功能 。夸克和崔19证明的一个较大的值 会导致次优的选择功能。他们改善了mif方案提出MIFS-U通过修改如下

在这两种算法,选择特性是依赖于用户定义的参数 权重的重要性之间的冗余功能。如果 选择太大,冗余的特征选择算法将主要因素。的作者(13]提出parameter-free特征选择的标准,称为minimal-redundancy-maximal-relevance (mRMR),给出的 在哪里 特征选择的数量。

这几年会等。20.)指出,右手边的mif MIFS-U, (6)和(7),将增加与基数的增加所选的特征子集。这将导致控制右边,从而迫使FS选择nonredundant特性。这可能会导致的选择无关的特性在相关特性。另一个问题是,没有技术优化 和它的价值高度取决于正在考虑的问题。虽然mRMR部分解决了第一个问题在mif和MIFS-U,性能仍然是比得上mif和MIFS-U [21]。

规范化的mif (NMIFS)提出了解决上述问题和给药20.]

一个改进版的NMIFS (I-NMIFS)中给出了21)如下:

NMIFS和I-NMIFS问题在于它们都依赖于选定的熵的测量和观察特性。的熵特性完全依赖于样本的数量数据集的每个类。如果一个类有一个比另一个大量的样本,这种情况会影响价值的熵的特性导致分类器的性能退化。

此外,所有这些算法依赖于互信息的选择特性的测量与目标类(相关性)和一个选定的特性(冗余)。在本文中,我们只关注一个特性的相关性与目标类和不属预定目标的类来评估候选人的美好特性。事实上,高MI(即一个特征。,relevance) with a target class might not be a good choice due to a high relevance to at least one nontarget class as well. This may lead to degrading rather than improving the performance of the classifier. Therefore, we propose a feature selection scheme that relies only on the measures of relative relevance of a feature with different classes in the dataset. The measure of redundancy is eliminated making the scheme simplified yet achieving satisfactory performance compared to that of the FS schemes utilizing the redundancy factor also in the selection criteria.

2.3。提出的特征选择方案

给定一个训练数据集组成的 样品和 特性,目的是选择 功能,为每个类 ,单独的, 总类的数目。拥有最大关联类的特性 和最小剩余的相关性 类是最适合不同的类 相关性通常是被错过或相关性,MI是一种广泛采用的测量表明两个随机变量之间的依赖。一般来说,它们之间的相互独立的变量为零MI。两个变量的依赖性越高,越高MI。

提出的特征选择算法选择特性,考虑他们的MI类与目标类和不属预定目标的措施。的 特征与目标类最大相关性适合目标类,但它不属预定目标的类也可以有很高的相关性,使这个功能更少的歧视。因此,功能与目标类和最小最大相关性相关性不属预定目标的类型选择。这种方法中选择最微妙特性目标类的特性集。特性的相关性独家获得的目标类的计算差异的MI选择特征向量 ,在哪里 在目标类 心肌梗死的 不属预定目标的类 数学上, 在哪里 不属预定目标的类的集合。的 特性的最大值 选择目标类 心肌梗死的 在类 熵的计算如下: 在哪里 类熵 条件熵 鉴于 假设 从连续性, 被定义为 在哪里 目标类的概率和不属预定目标的类,分别和可以计算吗 分别在哪里 是样品的数量对应于类 在训练数据集。的条件概率 给药 在哪里 对应的集合 类。

概率质量函数 可以使用Parzen窗口估计方法如下(13]: 在哪里 代表一组训练样本对应类的指标 是窗口函数。常用的高斯窗函数表示为 在哪里 的协方差矩阵是吗 维向量的随机变量, ,和宽度参数 是由 对于积极的常数 适当的选择 和一个大 可以收敛(16),一个真正的密度(13]。使用(5),(6)和(7),估计条件概率质量函数可以获得

伪代码步骤提出了FS算法的算法1。训练数据集 样品和 的特性, 元素的 特征向量,给出了选择方案的输入。一个矩阵 的大小 算法的输出,其中每个吗 行包含 特征选择的目标类 第一步,目标类 选择集的所有类 。然后,各自的组不属预定目标的类。在下一步中,每个特征向量同时被选中。为每一个 特征向量,从类的元素 和类 存储在 ,分别。这些向量存储在的平均值 经过一系列的计算条件概率的估计,熵和条件熵, 计算给定类 使用(2)。然后, 特性的最大值 在最后的向量选择和存储 矩阵的行 同样的, 为每个类和特性选择存储在最后的矩阵

输入: ,训练数据集; ,数量的功能; ,数量的类; ,数量的特征选择算法。
输出: ,矩阵的 向量的 为每个类特征选择
1:
2:
3:
4: 的值 从类的特性
5: 的值 从类的特性
6: 的意思是 从类
7: 的意思是 从类
8:获得 使用Eq (8)
9:获得 , 使用Eq (4)
10:获得 使用Eq (4)
11:获得 使用Eq (3)
12:获得 使用Eq (2)
13:结束了
14:指数 最大的值
15:结束了

3所示。分类模型

一个通用的框架使用基于监督机器学习分类器的分类方法是在图1。这种方法是在两个阶段:训练阶段和测试阶段。在训练阶段,训练一个分类器使用一组历史数据(或培训)。包括从原始信号特征提取的步骤获得功能池。然后,FS算法选择最佳特性的数据从不同的类之间的辨别能力。最后,所选特征的集用于训练分类器,如图1(一)。训练分类器的性能评估使用一组未被注意的测试阶段的测试信号。的分类器加载特定的特性,选择在训练阶段和从测试中提取信号如图1 (b)

通常采用基于监督机器学习分类器包括神经网络,然而,基于svm分类器。一个简短的介绍每一个分类器的完整性。然后,提出DI-SVM-based分类器模型。

3.1。神经网络

神经网络(NN),也称为前馈神经网络或多层感知器(MLP),是一个机器学习的工具,用于分类和回归问题。神经网络的结构设计灵感来自生物神经系统。它由一个输入层、输出层和至少一个隐藏层。输入信号从输入层到输出层向前传播获得每一层的权重向量。在这个阶段,隐层和输出层的神经元学习输入模式从不同的类。神经元与可微非线性激活函数触发。常用的乙状结肠激活函数给出 在哪里 是所有突触输入的加权和的偏见 神经元和 神经元的输出是相同的。

使用反向传播算法来估计网络的预测输出和真实的结果。梯度向量的估计包含错误的梯度表面对隐层和输出层神经元的输入权值计算。然后通过逆向梯度向量从输出层的输入层更新每一层的权重向量。摘要Levenberg-Marquardt (LM)算法用于更新权重的神经元在反向传播(22]。

3.2。 最近的邻居

一个 最近的邻居(资讯)是一个简单的分类器,以决定测试输入,只需看 在训练集(最近的点23]。的分类器的数量从这组的每个类成员 最近的邻居测试输入和分类测试信号的类拥有最多的成员。欧几里得距离是常用的距离度量获取最近的邻居。

3.3。支持向量机

支持向量机是一个著名的分类器主要解决两级分类问题。画一个线性超平面作为决策边界数据点之间的两个类。最优决策边界是最大化权重向量 (3,24]。

对于一个给定的训练样本集, ,和离散类标签, ,支持向量机试图获得最优权向量, ,使用如下的优化问题: 在哪里 参数和成本 代表了松弛变量。一个测试观察, ,分类决策函数,给出如下: 在哪里 代表支持向量的集合在训练阶段和获得 是内核函数在下一节中解释。

多级(两类)多分类问题,同等数量的二进制SVM在利用数据集类的数量,每个支持向量机用于one-versus-rest方法(10,25- - - - - -27]。的 分类器训练样本 类作为正类和其余的类作为一个负类样本。

3.3.1。内核函数

减少机器的复杂性在线性不可分的模式,数据点被映射在高维特征空间中线性决定表面可以对不同类型的数据集进行分类。内积内核用于执行这项工作。这是支持向量机的关键技术解决优化问题的输入特征空间的高维特征空间。在这样一种方式,支持向量机处理线性不可分的问题。映射函数 ,两个向量的核函数 给药 。径向基函数是一种常用的核函数,定义为

3.4。提出Diversified-Input SVM模型

提出diversified-input SVM的训练和测试阶段(DI-SVM)模型对传感器故障检测和分类数据中所示2(一个)2 (b),分别。给定一个训练数据集组成的 标签原始信号从传感器,是提取的第一步 功能获取功能池的大小 。原始信号是指信号从传感器获得,这不是预处理(即。,任何预处理技术,如特征提取和标准化,不是应用)。换句话说,从最早形式的传感器信号的原始信号,而 维行向量特征池中,这是由 特性和提取原始信号,互换被称为样本或观察。特征提取后获得一个功能池,FS算法选择 特征为每个类,分别。执行此,FS算法首先选择一个目标类, ,从给定的一组类 ,在那里 是类的总数。然后,每个特性评估使用的美好选择标准来决定选择的特性 类。随后,下节课目标类,选择和特征选择的步骤是重复的。通过这种方式, 数据集特征选择的每个类。最后,训练数据的列向量特征池中对应每一个类的功能选择输入 不同的支持向量机,另外,进行训练。例如,如果两个特性 选择目标类 ,那么向量 包含的值 从功能池输入到支持向量机专门识别类 此外, 分类器的训练与观测 类贴上一个积极类和剩下的 类贴上消极类。在这样一个方式, 不同的支持向量机训练了 海尔集团分类问题,观察每个支持向量机的输入由diversified-feature组合选择FS算法。

分类测试原始信号,首先,在训练阶段中选择的特性从原始信号中提取获得功能池。经过训练的 使用支持向量机进行分类测试观察。支持向量机的输入给出相同的特性组合在训练阶段。输出所有支持向量机的类标签和各自的分数都存储在输出向量。检查任何观察分为多级,也就是说,如果任何观察都是分类正由多个SVM分类器。在这种情况下,决策支持向量机的最大输出分数是考虑,如图2 (b)

3.5。分类器参数
3.5.1。交叉验证

交叉验证(CV)技术评估泛化和克服过度拟合问题的分类器训练阶段。的 倍的简历技术分区训练数据 互补的SVM训练和验证子集 次了。在每一轮中,一个新的子集用于训练,剩下的样品用于验证。这个循环重复,直到每个样本用于培训至少一次。因此,每个子集都是使用一次培训时使用 次验证分类器。

3.5.2。标准化

标准化之前的训练数据训练支持向量机可以提高分类的性能(28]。这种预处理技术应用于防止大的价值特性控制小数据集的价值特性。标准化的数据集的两种常用方法包括min-max(也称为归一化)和 分数的公式。min-max数据标准化、数据向量的值从0到1。相比之下, 得分公式尺度数据向量标准化向量具有零均值和单位方差。其他标准化技术源于这两种基本方法提出了在文献[28,29日]。

事实上,没有明显的技术是最好的回答。然而,一个基本的区别这两种方法是min-max方法标准化的数据在0和1之间的界线。在这种方法中,一个离群值的数据可能对零压缩其余的特征值。另一方面,没有限制的范围使用标准化的数据 分数的公式。这使得 分数标准化更健壮的异常值的数据相比min-max标准化方法。

分数标准化,输入特征向量扩展的零均值减去每个元素的统计均值向量和规范化的标准差除以标准差1的输入向量。给定一个向量, ,的公式 给出分数标准化 在哪里 是标准化的价值观和向量 特征向量的均值吗 与标准偏差

3.6。功能池

池的一个特征是通过提取4 14时域和频域特性。各自的名字和数学定义这些功能表中所示12

4所示。实验分析

4.1。数据采集

传感器故障的类型考虑这项工作包括漂移,飘忽不定,hardover,飙升,缺点3]。一块原始信号从这些类和普通类图3。故障被认为是漂移故障传感器的输出线性增加。hardover故障发生时传感器的输出从正常价值增加,由一个红线图表示3。如果不稳定故障发生时,传感器的输出信号的方差从常规增加价值。在高峰故障发生的情况下,峰值观察输出信号的传感器。当一个传感器的输出坚持一个固定的值,那么这个故障类型命名为卡的错。这些故障类型的划分是基于数据测量,可以被认为是不同类型的通用传感器压力传感器等。这些错误被许多研究人员称,使用不同的术语。例如,Yu et al。4]和Kullaa [30.)被称为不稳定,卡和hardover缺点是精度退化失败,彻底失败,失败和偏见。

训练和测试数据集用于这项工作得到了使用健康temperature-to-voltage转换器TC1047 / TC1047A如下。一组100年的原始时间信号从传感器获得的使用一个Arduino Uno单片机板和Arduino和个人电脑之间的串行通信。每个原始信号由1000从传感器原始数据元素。每种故障类型,也就是说,漂移,hardover,飘忽不定,尖峰,并把缺点,模拟在每个存储信号获得健康的传感器。以这样一种方式,一套100信号从每个类,包括正常和故障类,。故障模拟的细节在一个正常的数据信号如下:漂移故障信号 通过添加一个线性增加的偏差在正常信号 ,偏差添加到哪里 元素是 乘以常数初始偏差 一个hardover故障信号 通过添加一个大的恒定偏差值吗 所有元素的正常信号。获得一个不稳定的故障信号 ,一个信号 意思是0和高方差, ,在那里 正常信号的方差,添加到原始信号正常。获得峰值故障信号 ,一个常数偏差是定期添加到 正常信号的元素, 是元素的索引信号 作为一组自然数 作为一个正整数。最后,卡故障信号 获得通过保持一个固定值指数正常的信号。这些故障的统计表示在表3,在那里 原始信号对应于正常类的元素。总之,100年最后一个数据集是由原始信号的六类。这意味着100原始时间信号的每个类都包含导致的 生的时间信号在最终的数据集。如前所述,原始信号是由1000年的数据元素。因此,原始信号的最终数据集的大小 数据点。

在数据集1中,故障插入点保持固定在每个故障样本指数= 500,见图3。故障插入点元素的索引的信号发生错误的位置开始。采用类似的方式的故障模拟,得出数据集2与同样大小的第一个数据集;然而,故障插入点一个变量指标,随机选择,信号的。这种情况被认为是复制一个更实际的场景在传感器故障发生时间。的时域图1日,25日,五十,75,100样品从每个类的第二个数据集随机故障插入点在图4

4.2。绩效评价指标

分类模型的性能进行了分析和比较使用以下指标。

4.2.1。准备精度

分类器的精度是真正的预测数量比观测的总数在测试集。数学, 在哪里 表示真阳性的数量和真正的负面预测和 测试下观测的总数。

4.2.2。接受者操作特征

接受者操作特征(ROC)图用于可视化分析,并选择基于性能的分类器。一个二维图代表一个真正的积极策划速度之间的权衡 设在和假阳性率 设在。

4.2.3。面积中华民国

比较二维ROC曲线的两个分类器会变得困难,如果差异表现太小了。它可能需要代表性能与标量值。计算ROC曲线下的面积(AUC-ROC)是一种常见的技术用于此目的(31日]。

4.3。分类器的实现

提出的基于svm的传统和模型训练和测试使用MATLAB one-versus-rest的方式。成本和箱约束错误分类的支持向量机设置为1。优化问题的解得到使用序列最小优化算法(SMO)。

神经网络是由一个输入层,三个隐藏层和输出层。不幸的是,没有办法计算出优化的层数和每层的神经元数神经网络。然而,在输入层节点的数目等于输入变量的数量。我们用12、6和2的隐藏层和隐层节点12节点最近的输入层。输出层由一个节点,输出一个整数的形式从1到6的数字对应正常,飘忽不定,漂移,hardover,尖峰,分别和困的缺点。Levenberg-Marquardt (LM)算法在训练阶段优化神经元的权重。均方误差(MSE)利用更新在反向传播网络的权重。乙状结肠函数是用来激活隐藏层中的节点。

资讯分类器,最近的三个邻居使用欧氏距离加权参数分类测试观察。错误的成本确定一个类的观察在任何其他类设置为1。

10倍的简历的所有实验中,技术是应用在培训阶段提高每个分类器的泛化。此外, 分数标准化预处理的应用测试数据集规范化输入向量。

4.4。实验结果

分析各自的效率提出了特征选择方案和提出DI-SVM模型中,一系列的五个实验正在进行。第一次和第二次实验是没有应用特征选择执行计划的故障检测和诊断程序,使用数据集1和2,分别。在这些实验中,传统的SVM的性能比较,神经网络,然而,分类器。在实验3中,提出了特征选择方案的性能进行了分析和比较现有的方案。最后,前两个实验是重复添加系统提出的特征选择算法之后观察影响分类器的性能。提出DI-SVM模型的性能还与传统支持向量机相比,神经网络,然而,在最后的两个实验。

4.1.1。实验1:故障诊断特征选择使用数据集1

第一个实验是没有应用故障检测的特征选择和分类方法。1000 -维正常和故障样本数据集包含有一个常数故障插入点索引,享年500岁。表中给出的所有特性23提取和分类器的输入。

从这个实验结果准确性使用传统的支持向量机,神经网络,然而,分类器在表4。个体的准确性每个类是通过假设给定的类作为正类,剩下的类组负类。总精度的比率百分比的总和个人精度尽可能高的总和所有类的精度。

作为支持向量机达到给定的表中,精度高于神经网络和资讯分类所有类除了正常和困的缺点。原因是小区别功能在正常的范围和卡故障类。然而,支持向量机优于神经网络和资讯分类器实现总准确率为81%。此外,神经网络执行中最差的三个分类器实现总准确率为78%,从1%的差异几乎79%由资讯分类器实现。然而,神经网络,支持向量机相比,然而,明显优于常规的课堂进行分类。此外,资讯分类器实现分类卡故障类时精度略高于神经网络和支持向量机。

10/24/11。实验2:故障诊断特征选择使用数据集2

在这个实验中,故障检测和分类方法是类似于实验1;然而,与变量故障样本数据集包含插入0到1000之间的指数,如图4

结果在表5表明样品被认为在这种情况下,把一个更高的挑战比考虑分类器在前面的情况。所有分类器的总精度退化与实验1。然而,支持向量机仍然优于神经网络和资讯分类器。然而,总精度从81%下降到80%左右。同样,神经网络,然而,分类器的总精度也从78%和79%减少到76%和74%,分别。神经网络成功实现同等精度对正常和故障类,尽管减少观测精度的其他类。资讯分类器的分类性能的大部分课程是减少相当大的差异。另一方面,增加准确性的不稳定故障类支持向量机和资讯的分类器。

4.4.3。实验3:特征选择

4 14时域和频域特性的平均值从训练样本中提取表6。拟议的FS方案应该选择独家最相关的特征对于每个类中给定的一组特征。

获得一个最优值 FS方案,民国连同各自AUC-ROC值给出了数据5,6,7,8。传统的支持向量机分类器被用来获取识别分类器的效率在这些数据为正常类。的结果图5使用数据集1。正常类训练样本作为正类而其余类训练样本作为一个负类。图6显示了类似的结果使用数据集2积极类,也就是说,正常类,和消极的类。在数据78数据集1和2,分别利用;然而,错误的类的集合训练作为正类和普通类作为负类。

如下数据,使用分类器性能更好当数据集1比柜台使用数据集2。这些结果表明,是更具挑战性的分类器进行分类数据集时使用一个变量故障插入点。此外,它可以观察到 特征选择为正常类给出了优化结果相比,在所有情况下 , , ,

各自AUC-ROCs为每一个类图9使用数据集1和图10使用数据集2。这些数据也说明AUC-ROC措施 是所有类的最优值与给定组特性和故障类型。hardover故障类型有一个几乎类似的AUC-ROC值 。原因是只有一个信号函数是一个足够好的特性来区分hardover断层类。特征选择的数量进一步增加 从2显示了这个类的降解AUC-ROC测量。

的效率提出了FS方案如图1112。mif的性能相比,MIFS-U, mRMR, NMIFS I-NMIFS,详尽的搜索算法。穷举搜索算法功能池中使用所有的组合特性来评估分类器的性能,然后选择之间的最佳组合。从传统的SVM分类器是获得总精度作为评估标准。数据集1和2中利用数据1112,分别。

在选择第一个功能,所有上述的方案也有类似的标准选择一个特性,即衡量候选人的互信息的特征与目标类。这导致所有FS方案选择相同的特性,因此给类似的性能,如两个数字所示。选择下一个特性,所有FS的标准方案几乎是相同的,除了提出FS方案。这些特性依赖于互信息和冗余措施,也就是说,评估候选人的互信息特征与目标类以及冗余已经选择特性。这种技术可能有时导致失去一个好的识别功能由于高冗余已经选择特性。因此,这些计划遵循类似的趋势,提高分类的准确性与数量的增加所选择的功能。此外,选择下一个功能高度取决于当前选中的本质特性。可能已经选择的特性之一是目标类不是一个好的选择,它可能会导致失去一个好功能的手由于high-redundancy因素。然而,这些数字表明,该FS方案能够实现良好的性能通过选择只有2最歧视功能池中的每个类的特性。此外,包括所有18个特征在分类器的输入结果无论FS方案相似的性能。

此外,表7显示了最优分类器获得的准确性与给定的特性选择不同的FS方案总数。结果表明,该方案可以实现结果几乎与穷举搜索算法需要的最低数量的特性与其他技术相比。数据集1,该方案可以实现最优结果通过选择只有9功能从给定的功能池。同样,10个特性选择提出了FS方案获得最优结果的数据集2。

每个类的两个特点选择提出FS方案给出了表8。展示的效率提出了特征选择算法,所有样品的散点图如图所示13在选定的功能空间。红色方块表示数据元素的类选择各自的特性。黑色圆圈说明剩余类的数据点在同一个特征空间。例如,两个特点选择常规的课堂是波峰因素(CF)和中心频率(FC)。因此,红色方块代表正常的数据样本类图(13日)CF-versus-FC的特征空间,而黑色圆圈表示的数据元素subfigure剩下的所有类。一个类似的趋势是在所有subfigures之后。

观察功能空间CF-versus-FC FC-versus-mean,重绘的散点图数据1415与正常的数据元素、卡和峰值故障类。CF和FC特性选择针对常规的课堂。因此,大多数的数据元素的正常类可以从最近的杰出的类,也就是说,和卡故障类,如图14。同样,FC-versus-mean特征空间目标卡故障类,因此卡故障类的数据很容易识别正常和故障类而CF-versus-FC空间,如图15。这个图显示的效率提出了特征空间图形。

的值 用于获取实验4和5的结果。

4.4.4。实验4:故障诊断特征选择使用数据集1

执行这个实验应用提出了FS方案的分类方法和使用数据集1。的性能提出diversified-input (DI) SVM模型比传统的支持向量机,神经网络,然而,分类器。

这个实验的精度结果给出了所有四个分类表9。拟议的古怪,DI-SVM达到100%的精度漂移,hardover故障类。分类的准确性正常、峰值和卡类略低,为98.33%,98.88%,和99.44%,导致DI-SVM的总准确率为99.44%。传统的支持向量机模型是名单上的下一个执行有效地实现总准确率为97.87%。NN和资讯分类器执行相对更糟糕的总准确率为94%和85%,分别。

10显示了AUC-ROC措施的四个分类器相同的数据集。每个类的个体AUC-ROC从ROC曲线达到获得各自的类被训练成一个积极类和其余类培训为一组负类。这些结果也表明,该DI-SVM模型优于传统的支持向量机,神经网络,然而,分类器。

分析的影响提出了FS方案和提出DI-SVM模型,传统的支持向量机的准确性没有应用FS方案,传统SVM与应用FS方案,提出用FS DI-SVM模型应用使用 如图16。图显示,FS方案成功地提高了传统SVM分类器分类性能的所有类。此外,利用支持向量机的提出DI-SVM模型能够进一步提高分类器的性能。

4.4.5。实验五:故障诊断特征选择使用数据集2

实验5是一个重复实验4不同数据集。在这个实验中,数据集2是用来评估提出了FS方案和分类器的性能。如表所示11柜台,DI-SVM成功超越三个分类器在分类数据集2中的类。然而,总精度从99%减少到93%,在这种情况下在前面的实验。类似的趋势减少精度观测到的分类器。直观的原因是与一个变量数据集2故障插入点放在一个更高的挑战的分类样本与样本数据集的分类1固定故障插入点。

这个实验的AUC-ROCs表12。再次DI-SVM成功实现最优AUC-ROC措施对所有类。

实验5,准确性比较传统的SVM应用FS计划,没有传统SVM与FS方案,提出用FS DI-SVM模型应用使用 如图17。图中还加强了我们的宣称该DI-SVM模型优于传统的SVM模型。

5。讨论

MI-based FS方案选择特性对于一个给定的目标类基于候选人的MI特性的测量与目标类和相互冗余已经选择功能,无论不属预定目标的类。提出了FS算法考虑了MI的功能目标和不属预定目标的类选择最佳组合不属预定目标的特征识别目标类的类。这个特性选择方案被认为是一个基于过滤器的功能选择,分类器的特征选择独立性能和原始信号的本质。因此,声称是安全提出了FS算法可以有效地选择独家最相关的特征对目标类池特性在任何应用程序。然而,应该注意的是,分类器的效率高度依赖的本质特性功能池中用来描述信号。使用最特征的特性将会增加系统的效率,反之亦然。从我们的工作的结果,可以得出结论:考虑候选人的相关特性的测量与目标类以及一个不属预定目标的类可以帮助选择独家识别特性。

此外,在传统的模型,应用支持向量机的多类分类,每个类的特性选择连接训练支持向量机。直觉上,减少输入的维度观察导致改进支持向量机的性能考虑到选择适当的特性。记住这一点,我们减少了支持向量机的输入向量的维度通过输入不同的特性选择不同的类组合。这意味着功能组合为目标选择 类是输入 支持向量机,特别是,训练数据的观测 类标记为积极类,反之亦然。通过这种方式,输入向量的维数降低到简化分类器的优化。此外,类似的功能组合可能会选择不止一个类如果这种组合是最不同的功能组合为每个类。

我们的以前的工作3)从实验结果证明增加原始信号的大小,也就是说,增加数据元素的数量每一个传感器输出的原始信号,并增加训练数据集的大小(增加训练样本的数量)提高分类的准确性。因此,选择一个小尺寸的目的是观察训练集和测试集的下界性能提出的故障诊断方法。

6。结论

选择不同的功能组合针对每个类,我们提出一个特征选择方案,考虑相关性的特性的测量与目标和不属预定目标的类。两个变量的相关性的特点是它们之间的互信息的测量。的集合 特征在目标类和最大互信息最小互信息在目标类的类不属预定目标的选择。结果表明,该技术可以实现好的结果相比其他特征选择方案,所选特征之间的相互冗余测量除了目标类的相关性。

此外,DI-SVM模型提出了改善分类器的性能。每个支持向量机训练用一个功能组合选择,具体地说,为单个目标类,与传统的支持向量机SVM模型的所有组合。这种方法可以减少分类器优化的复杂性通过最小化的尺寸输入向量。分类器的性能进行了分析使用两个不同的数据集:(1)以一个恒定的错插入点和(2)一个变量故障插入点。5的一系列实验进行分析提出的故障诊断方法的性能。评价指标包括精度、中华民国,AUC-ROC显示的效率提出了FS方案和提出DI-SVM模型。进一步比较表演节目的效率提出DI-SVM超过传统的支持向量机模型,神经网络和KNN-based多类传感器故障分类问题的分类器。

数据可用性

模拟传感器故障数据用于支持本研究的发现可以从相应的作者。

的利益冲突

作者宣称没有利益冲突。

确认

这项工作是支持的业务合作研发行业,学院和研究所资助的韩国中小企业技术管理2016年格兰特C0398156。