文摘
一种新的故障检测技术提出了明确解释非线性,动态的,和多峰问题存在于现实和复杂的动态过程。即时(JIT)检测方法和再(资讯)基于规则的统计过程控制(SPC)方法集成构建一个灵活和自适应检测计划控制过程的非线性、动态、多通道情况。Mahalanobis距离,表示样本间的相关性,用于简化和更新原始数据集,这是第一个好处。在此基础上,控制限计算方面的资讯规则和SPC方法,这样我们可以确定当前数据是否正常或不是由网络的方法。指出,获得的控制限的变化与更新数据库,这样一种自适应故障检测技术,可以有效地消除数据漂移的影响,转变对检测过程的性能,这是第二个优点。开发效率的方法证明了数值例子和一个工业情况。
1。介绍
故障已经研究了几十年不断的话题1- - - - - -4]。开发了几种故障检测方法来解决问题,因为存在一个不断增长的需求为故障检测在现实过程工程不仅从核电站的安全角度,也从考虑过程的产品质量5- - - - - -7]。此外,现有的方法用于故障检测已经应用于广泛的领域,比如化学过程,网络控制系统和半导体过程等等(8- - - - - -11]。动态变化、多种模式,和非线性客观存在于上述的过程,如半导体过程中,坦克反应堆,等等(9- - - - - -11),这给分析带来了新的挑战和实现故障检测。因此,他们必须认真考虑在发展高性能和自适应故障识别方法来检测异常情况下尽可能早。
在总结(12),流程分析和操作派生的技术大致分为两类:基于模型的方法和基于数据的方法。在基于模型的方法中,静态或动态模型建立过程在正常操作情况。实际过程的输出之间的差异和名义模型的输出是监测来确定是否发生任何故障(5,13- - - - - -18]。指出,许多控制过程数据丰富,但信息差,感觉强烈需要基于数据的方法得到一个灵活和高效的检测槽系统。在文献报道的结果中,提到一些,数据驱动的资讯故障检测是在(9]。在此基础上,10)提出了一种改进的主成分分析(PCA)资讯技术来实现故障识别。指出,基于数据的故障监测和识别方法也在调查11,18,19]。
应该指出了非线性动力学和多模的不可避免的障碍是基于模型的方法或基于数据的方法在检测过程中需要真实世界的应用程序。各种方法,包括统计过程控制(SPC),多元统计过程控制(MSPC),定性的知识方法,人工智能,以及各种集成方法,开发并执行(在现有文献中20.- - - - - -23]。众所周知,PCA用于MSPC很大,现有的非线性主成分分析方法(24,25),动态主成分分析方法(26),和独立分量分析PCA方法(18)已经提出了解决非线性动力学,分别和多模所面临的故障检测。因为JIT在本质上是自适应的,这是通过将当前测量数据存储在数据库(27,28),能够检测和诊断查询是否正常或不在线和自适应方法19),如图1,基于数据的JIT方法吸引了更多学者的关注近年来(见[12])。文献[12)提出了一个基于数据JIT-SPC探测和识别技术,距离计算和检查每次故障检测需要进行。参考文献(9,10]应用资讯规则为半导体生产过程中,故障检测中最近的邻居被用来解决多峰问题。然而,尽管非线性PCA方法(24,25),动态主成分分析方法(26),独立分量分析PCA方法(18),基于数据的JIT (12,18,19),和资讯的方法(9,10)已报告,自然有效的方法处理非线性相关的变量,动态变化的系统和多通道批轨迹到目前为止尚未全面调查。
作为一个事实,它是至关重要的实现所需的性能检测,以确定一个适当的正常操作数据存储在数据库中,因为太多的数据会对仓储成本和高负荷计算,同时,更少的数据自然影响探测技术的功效。如何确定一个合适的原始数据集,这样成本、计算复杂度和性能的检测可以妥协是一个挑战。基于Mahalanobis样本之间的距离,简化原始数据集研究[29日),简化程序终止的所需的样本数量。然而,如何确定的样本数量是密切相关的质量检测没有调查。众所周知,数据漂移和转移中存在实际的复杂动态过程不可避免的是,它可以产生由于更无法克服的原因,如仪器的老化,温度的变化,环境的影响,和不同材料等等(30.]。在这种情况下,一些查询的漂移和转变可能正常是错误的错误,或可能的错错误地认定为常态。然后,它是至关重要的积极调节控制限(CL)通过在线方法,必将提高故障检测的质量。然而,最好的作者的知识,如何简化和更新原始样本集光计算负荷,实现高性能迄今为止还没有充分调查。特别是对于数据驱动的故障检测与时变控制限制,很少有结果可用文献中到目前为止,本研究的动机。
本文的总体目标是提出一种灵活的、适应JIT的故障检测方案。通过计算Mahalanobis正常样本之间的距离,以及Mahalanobis距离查询到正常操作数据存储在数据库中,原始数据集是简化和更新。此外,基于数据库的时变CL派生的资讯更新规则与SPC方法相结合,这样的判断进行每次故障检测是必需的,如图2。此外,JIT的集成方法和资讯技术非常适合非线性、动态和多通道故障检测过程。最后,仿真结果和工业案例说明方法的效率。
2。简化原始数据集
在本节中,我们将描述的方法简化原始数据集。
在的实际检测过程中,大量的原始数据带来严重的计算负荷和成本支出为故障检测,识别和诊断。因为Mahalanobis两个样本之间的距离越近,越相似的基本特性,我们的意思是他们保留的共同特征,这意味着投入原始数据将替换原来的两个样品,可以保持原始数据的特点,将最大程度(29日]。让表示原始数据矩阵(行)和样品变量(习题答案)。具体过程如下。
算法2.1。
一步1。让的协方差矩阵被定义为:。在哪里,表示随机变量和表示他们的意思。
一步2。计算Mahalanobis每个样本之间的距离和所有其他样本存储在数据集,这是表示并放置在距离矩阵医学博士
。
一步3所示。找出最小和非零元素中的每个原始矩阵医学博士,这是放置在行向量的地方(列号)每个最小元素在每一行记录行向量。在此基础上,找出最小值,如果是在的地方是也没有。元素是在向量,然后矩阵的最小值医学博士
,提出了最小样本之间的距离和示例在原始数据集。
一步4所示。让,我们使用样本的均值和示例更换样品和删除示例矩阵的行号减少一条线。定义,在那里,,表示矩阵的行号。如果,在那里回到步骤2;否则,简化的数据矩阵。退出。
伪代码1是给定的。
|
|
||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
2.2的话。利用主成分分析法(PCA)的动机(10,19,31日),结合变量在数据集获取最多的信息,不平等实现了原始信息的保存和更新算法的最大程度2。1。请注意,和表示跟踪协方差矩阵的简化或更新数据集和原始数据集,分别,众所周知,等于矩阵的所有特征值的总和。在这个意义上,阈值选择最大化的保留最初的统计信息。例如,意味着98%的方差在原始数据集是由新简化数据集。显然,算法2。1是一种逻辑,并承诺为数据驱动的故障检测。
2.3的话。不同于(29日],虽然原始数据是基于Mahalanobis样本之间的距离,减少主观决定的简化数据对高性能检测过程有重要影响。本文的阈值限制的程度减少原始数据,这是一种更可取的方式妥协故障检测的准确性和计算的复杂性,以及更低的成本。
2.4的话。显然,简化和更新原始数据集提出了故障检测方案也适用于数据驱动的故障监测、诊断、和隔离,因为原始数据仍需适当数量的确定和数据漂移和转变仍然需要应对。在这个意义上,提出简化和更新技术很一般。
3所示。检测方法
在本节中,我们将使故障检测方法包括离线和在线情况如图3。
3.1。离线模型建立
算法3.1。
一步1。集,是简化数据集的数量。
一步2。找到最近的邻居(见[30.为每个样本)简化数据集和计算样本之间的距离和它的最近的邻居。
一步3所示。的累积密度函数估计above-squared距离通过在Matlab函数“ksdensity”,这是表示。
一步4所示。计算期望的KNN-squared距离的基础上获得累计密度函数的定义的期望,和期望来标示。
一步5。集。如果请转到步骤2;否则,进入步骤6。
一步6。累积分布函数的估计期望获取CL。
3.2的话。在步骤2中,使用欧氏距离,这是简单和容易的,但也适用于其他任何距离的方法。在算法获得的CL3所示。1是基于统计检验的概念在程控一样,在这个意义上资讯离线模型的基于规则的SPC方法。
3.3的话。一般而言,多维空间的概率密度函数估计是困难派生(12]。为了克服这个困难,我们试图估计平方误差的概率密度函数和期望在步骤3和步骤4的平方距离的随机变量的观点。此外,期望平方距离也可以获得的平均平方距离。
3.4的话。因为有类似的统计特征的正常样本和故障样本之间的距离和最近的邻近样本必须大于正常样本的距离最近的邻近样本(9,10,12),设置CL检测错误的累积分布函数的期望是合理的和有效的。CL提出意味着绝大多数的预期值正常样本的距离不超过它。例如,95%控制限制意味着价值在95%的人口的正常运行数据包括(预期值)。在这里,也被称为置信水平95%基于概率和统计理论。
3.2。在线故障检测
算法3.5。
一步1。计算查询和之间的距离最近的邻居的简化数据集。
一步2。的累积密度函数估计above-squared距离。
一步3所示。基于获得的累计密度函数计算期望。
一步4所示。查询异常如果期望超出其CL,否则,这个查询是正常的。
一步5。如果查询是正常的,更新,可以投入正常样本数据库,也将简化使用算法中描述的技术2。1。在这种情况下,更新数据库是用于计算新的CL继续识别下一个查询在步骤1中。
3.6的话。相比之下,(9,10,12,19),技术,简化了和更新原始数据集是本文的主要贡献。可以推导出时变CL,更重要的是,这样可以实现自适应故障检测通过在线方法,这将消除数据漂移的影响,转变对故障检测的质量。不同于(18其中just-in-time-learning (JITL)两步独立分量分析和主成分分析进行了研究,在本文中,数据库更新和简化。此外,请注意,数据库不会随机增加的数量在正常查询添加到它。原因是算法2。1一旦完成了在线检测过程实现。换句话说,更新后的数据库还可以简化的算法2。1。显然,高故障检测能力和低成本可以拥有由于算法的使用2。1- - - - - -3所示。5。
3.7的话。事实上,非线性带来的困难,动力学,和多模式控制过程的故障检测检测方法提出了明确的解决,这并不令人惊奇,因为资讯技术,SPC方法以及在线更新方案集成。
4所示。数值例子
在本节中,给出了两个例子显示故障检测方法的有效性。第一个例子旨在简化的单一模态情况下显示疗效提出了基于数据集的检测过程。第二个例子是用于多通道情况与JIT方法(12]。
例4.1。考虑以下主要非线性过程模式(9,10]: 首先,30正常运行操作验证简化原始数据集的方法。这里的阈值由算法?2。1,28个样本。数据4和5显示原始数据集和简化数据集,分别。
继续操作系统(4所示。1),我们获得300正常数据用于原始数据,5正常运行用于验证,和5错误,如图所示6。最近的邻居的数量设置为10,置信水平得到CL选为99%。表1给离开原始数据集的数量用于培训,最大Mahalanobis距离,和不同阈值下的CL,简化原始数据的柱状图和故障检测图所示7的百分比,离开日期原始数据和检测故障总缺点很明显看到。在这里,最大Mahalanobis距离意味着较小的样本距离比基于算法。它可以被合并2。1。相应地,检测结果在阈值0.99,0.95和0.6也如图8,9,10,分别。如图7- - - - - -10,离开数据逐渐越来越少和CL与降低阈值增加,因此,故障检测的效果就不好。
注意,阈值决定对检测结果产生重大影响,显然,阈值越大,越精确检测操作。仿真结果给出了说明背叛性能不受退化的简化数据集。FD-KNN [9)是应用于这种非线性情况下,检测结果如图11。它应该指出虽然也得到更好的检测结果使用FD-KNN方法(9),原始数据集简化本文实现检测之前,这将有助于节省存储空间,减少了计算复杂度。
例4.2。考虑下面的双峰情况(9,10]:
上述两个案例是经营生产200正常样本,分别和继续经营生产100正常样本和10个错误用于验证和故障变节,分别给出图12。比较分析,5正常数据和10断层数据标记。类似的例子4所示。1,最近的邻居设置为10,置信水平得到CL选为99%。
由算法2。1原始数据集简化。此外,简化数据集更新通过在线方式100正常数据和故障检测。如表所示2检测结束后,离开了原始数据的数量是358,很明显,数据集不是无限增加的数量由于阈值。毫无疑问,在线和更新方法提出了一定能降低成本的数据存储和计算负载。本文方法的检测结果和JIT方法(12]介绍了数字13和14,分别。此外,嵌入式的儿子在数字数据13和14用于强调CL和训练数据的核查和验证。从图12CL是时变的正常和故障数据确定。注意,因为只有正常数据33、34和47误认为是错误的方法,而正常数据33岁,34岁,47岁,6,62是错误的故障由JIT方法(12),获得更好的检测结果是本文使用原文件和更新CL比(12]。这里,原始的CL意味着CL所获得的简化数据库的脱机方式。相对而言,阈值确定主观提前在计算稀疏的距离可能部分降低故障检测的性能。同样,权衡的存储成本和实现高检测性能。
5。案例研究
在本节中,一个半岛堆栈腐蚀过程进行商业规模林9600等离子体蚀刻工具在德州仪器,Inc . (9,32,33]。数据取自MACHINE_DATA、OES_DATA RFM_DATA在三个实验(33]。所指出的(9),与半导体工艺相关联的独特特征不同于其他生产过程包括不平等的批处理时间,不平等的时间步,和过程漂移和转变,因此,数据从不同的实验相同的资源有不同的意思,不同的协方差结构,可以更清楚地看到在不同的资源。由于多通道特性,检测过程基于本文提出的方法如下。
一步1。数据预处理:我们选择10正常批次和流程变量选择的三个数据资源,这样可以获得有意义的结果。然后,30正常批次都存储在原始数据库。进一步展开的二维数组的数据使用的方式(9]。
一步2。数据集是简化的算法2。1。
一步3所示。CL计算的算法3所示。1。
一步4所示。的另一个选择正常15批次的验证三种不同的资源,使用5正常批次的从每个资源。此外,5故障也选择在故意诱导实验检测,在上面的参考资料。请注意,算法2。1还可用于undate原始数据集产生时变CL。
上述步骤后,阈值决定在腐蚀的检测过程中,正常和29批次后可以获得第2步。此外,CL 7.9682+ 009是计算原始CL在置信水平0.99。知道,如果查询是正常的,那么它会被放入简化数据集在识别正常数据和错误数据。值得指出的是数据库中数据的数量肯定不会无限增长的同时更新数据库将步骤4。在这种情况下,最后一个数据库的样本数量是36。检测结果如图15正确,所有的故障识别时变控制下极限的方法。然而,请注意,如果原始数据集是不更新,所有5故障不能被发现在最初的CL计算。可以肯定的是,一些原始的断裂与小数据漂移由于温度的影响和环境能更容易被识别的方法在线更新原始数据集的方法比没有更新数据集应用技术方法。
6。结论
本研究提出了旨在强调以下两个方面:一方面,简化和更新原始数据集通过JIT方法基于Mahalanobis样本之间的距离;另一方面,结合资讯规则和SPC方法,可以获得解决非线性时变CL,多通道和数据漂移和转变在实践案例研究中存在的问题。数值例子和一个工业案例研究表明,该方法是一种自适应,灵活、高性能的故障检测技术。
确认
作者要感谢中国国家自然科学基金的资助下61174119,61104093,61034006,61174026,最特殊的关键基础研究项目由格兰特2010 cb334705,中国国家高技术研究发展计划(863计划)资助2011 aa040101,中国辽宁省和科研项目在格兰特L2012141 L2011064。