文摘

波段选择是一个直接和有效的降维方法和高光谱遥感研究的热点之一。然而,大多数的方法忽略的整齐和相关选择的乐队和构造带子集只根据带聚类中心的数量所需的排序。为了解决这个问题,本文提出了一种基于自适应波段选择方法社区分组和局部结构相关性(ANG-LSC)。采用一种自适应子空间方法段高光谱图像数据集的空间避免获得高度相关的子集。然后,当地的产品密度和距离因素是利用每个乐队进行排序,并选择所需的群集中心号码。最后,通过乐队的信息熵和关联分析在不同的集群,每个集群的选择最具代表性的乐队。关于评价了该方法的有效性,用最先进的方法进行了比较实验在三个公共高光谱数据集。实验结果证明ANG-LSC的优越性和鲁棒性。

1。介绍

高光谱图像(HSI),作为一种来源丰富的光谱信息,可以准确地描述对象和在各领域的广泛应用如海洋勘探、军事目标探测、林业、和水文(1- - - - - -4]。然而,高光谱数据的高维和标记样本的缺乏使高光谱数据的分类一个具有挑战性的课题。冗余邻乐队在高光谱图像导致存储和传输的挑战,增加计算复杂度,和一般,可以降低分类器的性能。因此,它仍然是一个挑战性的任务删除冗余和无关紧要的信息在一个合理的时间在这些复杂的情况。

特征提取和特征选择(也称为“乐队选择”)是两个最广泛使用的降维的策略。特征提取主要依赖于找到一个将然后项目原始高维数据嵌入到一个低维特征空间5]。然而,通过空间的转换,原高光谱数据的物理意义是改变,和一些关键信息丢失。特征选择方法(6)降低铸铁的维度通过寻找最具代表性的乐队,形成一个数据子集,即。,a group of most important bands is selected from all spectral bands to represent the entire spectrum. This way preserves the physical meaning of the original spectral data and facilitates the interpretation of the selected datasets. Therefore, the band selection method is very suitable for dimensionality reduction of hyperspectral data.

到目前为止,大量的波段选择方法。根据训练样本是否使用,这些方法大致可以分为监督(7),无监督(8],semisupervised [9]。监督和semisupervised方法严重依赖监管信息来识别相关的乐队。一般来说,选择代表乐队的无监督方法探索的性质没有先验信息与样本标签。然而,标签样本是一个昂贵的,乏味的,非常耗时的任务。相比之下,无监督方法不需要标签。因此,无人监督的乐队选择成为一个非常热门的研究课题。

在过去的几年中,许多无人监督的波段选择方法。他们可以分为四类:排名(中10],clustering-based [11],searching-based [12],sparsity-based [13]。因为乐队之间的交互是充分考虑在聚类方法中,乐队选择基于集群可以获得准确的结果,这吸引了越来越多的关注。这些方法可以获得令人满意的结果,但他们总是有两个在聚类过程中固有的缺陷。一方面,大多数的方法只考虑波段之间的相关性和忽略的子集信息选择的乐队。另一方面,根据高光谱图像数据集的特点,它是发现,这些乐队以有序的方式排列。此外,对于一个特定的乐队,在一定范围内,相邻带的相关性更强,更远的乐队的相关性较低。因此,可以得出结论,不连续乐队不同的波长范围不能分为波段选择的集群。

出于上述描述,基于自适应波段选择方法社区提出了分组和局部结构相关。与SNNC [14]和SNNCA [15)的方法,我们对高光谱图像的乐队。此外,在不改变原始高光谱图像数据,高光谱图像数据集分为几个subcubes,和获得的相关信息在每组乐队使用排序的想法。主要贡献如下:(1)基于相邻波段高冗余,有序高光谱波段划分为多个subcubes聚类算法,可有效避免获得高相关性的一个子集(2)当地的产品密度和距离因素是用于排序和选择聚类中心的数量每个乐队需要确保低冗余的聚类中心。它可以更好地利用当地的分布特征,使获得的子集乐队同时有更多的认可(3)通过信息熵和关联分析的乐队在不同的集群,每个集群的选择最具代表性的乐队。这个方法不直接选择集群中心作为选择乐队但认为乐队的组合在不同的集群来避免陷入局部最优解

本文的其余部分组织如下。节2相关技术的发展,介绍了该方法。部分3详细介绍了拟议的波段选择方法,包括自适应子空间划分的算法原理和社区组织。部分4给出了实验结果和讨论。结论和未来的目标将在部分5

clustering-based方法组织最初的乐队和从每个集群形成最终的选择代表乐队乐队的子集。该算法可以同时最小化组合方差和组内的方差最大化。大多数clustering-based方法来源于k - means,亲和传播(美联社)和图聚类。下面简要介绍一些典型的方法。

k - means算法是一种广泛使用的聚类技术。它初始化一组随机挑选的乐队和迭代优化目标函数,直到找到最优聚类中心。在[16),作者提出了一种新的统计方法对带聚类和乐队选择基于k - means聚类。该算法是基于四分位范围,几何平均,平均绝对偏差,平均相关系数、协方差和模式。高光谱数据可以通过这些方法计算。作者在17)提出了一种新的光谱波段选择方法,即。,代表乐队挖掘。在这种方法中,采用分离信息来衡量两个光谱波段之间的距离。应对clustering-based波段选择方法的固有缺陷,元et al。18)提出了一个新乐队选择双聚类的框架,其中包括双聚类方法与聚类过程中的上下文信息和考虑各种乐队的相互影响。在[19),作者提出了一个快速聚类算法(FDPC)基于密度的峰值。根据当地的密度的计算集群中的每个点的距离,两个因素的乘积在降序排序,和集群中心被确定为一个点和异常大的价值。作者在20.)增强FDPC算法适用于高光谱波段选择。首先,每个乐队的分数计算权重归一化局部密度和星团内各点的距离,而不是考虑他们一视同仁。然后,一个成指数关系学习规则是用来调整截止阈值选择不同数量的乐队,这是FDPC固定。因此,该方法被称为增强型FDPC (E-FDPC)。在[14),作者提出了一种高光谱最优选择基于共享的最近邻聚类方法(SNNC)。他们使用每个乐队的局部密度,以反映当地的分布特征和使用信息熵作为权重因子来设计一个方法来自动选择最优波段子集。灵感来自于SNNC方法,21)提出了SNNCA方法,认为乐队之间的相互作用在不同的集群,并获得一组乐队与大量的信息和低冗余。

自的k - means聚类算法对初始条件敏感,因此,exemplar-based AP聚类算法搜索一组适当的原型代表乐队。(22)提出了一种新的基于亲和传播semisupervised波段选择方法(美联社)。该算法提出了一种新的规范化trivariable互信息(NTMI)测量频带相关分类,考虑不仅带冗余,而且乐队协同作用。作者在23]构造相似矩阵基于几个距离措施提出但没有考虑图像的空间结构信息。结构性方法评价图像质量,提出了建立乐队乐队选择图像之间的相似性。(24)提出了一种新的亲和传播(美联社)技术基于特色指标。像素之间的光谱和空间关系是由一种新型歧视的约束。区别的特性测量(DFM)提出,和歧视的约束建模的最佳准则识别有效距离测量的学习方法,然后,乐队的代表子集是基于AP聚类算法确定。

图聚类表达乐队选择作为图问题。图中的节点代表他的乐队,和边缘连接两个节点对应于两个乐队之间的相似性。基于聚类的方法,通过构造一个亲和矩阵的相似性有关乐队,图表都聚集到子图找到代表乐队。在[25),作者提出了一个新颖的方法来解决高光谱波段选择的问题。原理是创建一个乐队邻接图,节点代表乐队,边代表相似性乐队之间的权重。一系列的随机矩阵是由两个运营商关联矩阵的交替形式不同集群的高相关性的乐队。在[21),作者提出了油印行列式点过程(MDPP)模型来捕获不同波段之间的完整结构。MDPP雇佣多个图表来获取高光谱波段之间的内在关系,并提供一个有效的搜索策略来选择最好的乐队。

3所示。该方法

在本节中,我们详细介绍该方法(ANG-LSC)。具体来说,基于高光谱波段的命令,一种自适应子空间策略是用于将高光谱图像数据集,然后,乐队的光谱特征自适应地划分为subcube类似,使用本地密度,和距离的乘积因子排序乐队和选择所需数量的集群中心。最后,通过信息熵和关联分析的乐队在不同的集群,每个集群的选择最具代表性的乐队。

3.1。自适应子空间划分

有两个常见的问题在高光谱波段的选择。首先,如果乐队选择直接上执行整个高光谱图像数据集,它将消耗大量的时间和计算机资源。其次,相邻波段之间的相关性高于不相邻。因此,有必要进行一个简单的分割hyperspectrum之前选择的乐队。

假设高光谱数据集 ,在哪里 像素的数量和吗 是乐队的总数。 是一个向量组成的吗 乐队。为了减少计算时间,我们需要将高光谱图像数据集分成equal-width subcubes,即。如果乐队的数量我们需要选择 ,然后subcube乐队的数量

接下来,欧几里得距离是用于构造之间的相似性矩阵 乐队和 乐队。

在传统聚类算法,最后获得的聚类结果和类之间的距离。受,这想法是用来进一步细分粗subcube已经分段。考虑到两个subcubes远没有相关性,只有两个相邻subcubes ( )被认为是。的数学表达式 在哪里 分别是阶级之间的距离和组内的距离,然后呢 是划分点。最大的距离是选为阶级之间的距离 组内距离的总和组成的 ,可以表示为哪一个 在哪里 分别是,

一个新的分区点可以通过上面的方程,然后,起始点 以同样的方式来获取更新最终分裂点(如图1,该示例将高光谱图像数据集(8乐队)划分为四个subcubes。虚线,意味着只有这些黑暗区域相邻的乐队被认为更新当前分割点)。

3.2。邻接集群和局部结构相关

高光谱波段分为subcubes后,subcubes通常独立处理。选择代表乐队每个多维数据集时,传统方法通常选择最相关的或信息最丰富的乐队在每个立方体。然而,这种策略使代表乐队可能并不代表。为了解决这个问题,一个有效的方法,LSC,同时选择的乐队,乐队最相关的信息,采用。

自适应subcube分区方法可以减少subcubes之间的相关性,有效避免冗余的选择。接下来,选择subcube选择最相关的波长与最多的信息。

首先,信息熵是用来评估信息的数量在每一个乐队,也就是说, 在哪里 是一个特殊的灰色空间, 表示某一灰度的概率的乐队。信息熵 每个乐队可以根据灰度直方图计算。

接下来,高斯滤波器用于内核转换给定的输入矩阵 使用矩阵的空间信息,转换后的光谱值是通过矩阵计算的像素值。二维高斯分布 在哪里 标准差和吗 变量的样本均值吗 二维高斯滤波进行输入矩阵,并设置为高斯核宽度 ,然后 在哪里 是邻居家的像素的像素值, 是过滤结果, 是核心的位置坐标像素区域。高斯核函数是连续的离散近似高斯。根据高斯分布和数据分布的特点,滑动窗口的宽度和标准差 确定。

然后,计算两者之间的相似性乐队,也就是说, 在哪里 代表共享的元素的数量 乐队的 - - - - - -最近的邻居集。当地的密度 计算欧氏距离和相似性矩阵。

距离的因素 每个乐队都是通过计算每个乐队和其他高密度乐队之间的最小距离。

然后,以三个因素的乘积为综合权重 每一个乐队。

后所有乐队的综合权重降序排序,选择最优波段的预期数量的聚类中心构造一个子集所需的乐队。

最后,选择最佳乐队通过测量局部结构相似度指数和信息熵的图像质量,在局部结构相似度指数( ,缩写为 下面) 在哪里 在哪里 , 是当地的手段、标准差和cross-covariance图片吗 如果 ,然后

为了找到一个代表性的乐队拥有大量信息的子集和低冗余,一个新的重量 评估每个乐队的质量定义。具体的方程是

输入:高光谱图像 ,乐队被选中的数量 ,高斯窗口的大小
输出:选定的乐队的数量
1:原始高光谱图像数据集分割成subcube 通过自适应子空间划分方法。
2:计算信息熵 每一个乐队。
3:信息熵矩阵 与高斯核函数的卷积,形状是相同的。
4:根据方程(9),两者之间的相似度矩阵计算的乐队。
5:计算当地的密度 根据欧氏距离和相似性矩阵。
6:通过计算每个乐队和其他高密度乐队之间的最小距离,距离因素系数 每一个乐队。
7:以三个因素的乘积为综合权重 每一个乐队。在降序排序权重后,选择最佳乐队的预期数量作为聚类中心构建所需的波段子集。
8:计算当地的结构相似度指数 每个subcube乐队。
9:一个新的重量 定义重新评估每一个乐队的质量。根据方程(16),乐队与每个集群的最大重量被选中代表乐队。

根据上面的公式,乐队与每个集群的最大重量被选中代表乐队。

本文的算法流程图如图2。为更详细的算法,总结了程序算法1

4所示。实验

在本节中,我们将进行大量的实验来评估算法的优越性在高光谱图像分类。首先,我们介绍三种常见的高光谱图像数据集。然后,实验环境、评估标准和比较算法。最后,我们详细分析几种方法的性能实验,实验结果显示了该方法的有效性和优越性。

4.1。数据集

(1)印度松树:这个场景是在印度AVIRIS传感器收集的松树在印第安纳州西北部,由测试网站 像素和224光谱反射波长范围0.4 - -2.5的乐队μm。消除严重的吸水率和低信噪比的乐队(104 ~ 108、150 ~ 163年和220年),最后,剩下的200乐队用于实验(2)帕维亚大学:帕维亚大学现场收集的光学传感器反射光学系统成像光谱仪(ROSIS-03), 0.43 - -0.86μ光谱范围, 像素,和103个光谱波段。共有115个乐队包括12乐队删除严重水吸收,剩下的103乐队(3)萨利纳斯的萨利纳斯:萨利纳斯是一个著名的子场景图像收集的224 -乐队AVIRIS传感器在萨利纳斯山谷,加州,美国。图像像素 像素,光谱分辨率是10 nm,波长范围是0.4 - -2.5μ20 m。水蒸气吸收带和乐队删除低信噪比,即:,108 - 112,154 - 167年,204年和224年,剩下的乐队

4.2。实验装置

为了验证本文算法的可行性和有效性,实验前应以下设置是必需的。

4.2.1。准备运行时环境

实验环境是十代英特尔酷睿i7 - 10750 h六核处理器,主要的频率是2.60赫兹,有效的16 GB的内存和MATLAB R2016b开发环境。

4.2.2。比较的方法

在本文中,该方法(ANG-LSC)与五个最先进的无监督波段选择方法相比,ONR [26],OCF [27],SOPSRL [8],ASPS-MN [28],MDSR [13]。

4.2.3。许多选择的乐队

因为乐队的实际数量选择的三个公共高光谱图像数据集是未知的,实验是在5-50乐队的范围(5)的时间间隔来解释不同波段的数目对分类精度的影响。

4.2.4。分类器

在这个实验中,资讯和支持向量机两种分类器,用于分类。然而,分类器的参数设置为5。RBF核函数的支持向量机分类器使用。考虑到这些分类器进行监督,我们随机选择10%的每个类别的样本作为训练集;剩下的90%是测试集。减少10%随机选择样本的影响,该算法运行10次获得一个平均的结果。

4.2.5。精度的措施

本文采用整体精度(OA),平均总体精度(AA), Kappa系数作为高光谱图像分类的精度测量。OA越大,Kappa值,图像分类效果越好,AA是一种常见的指标来衡量小类别的分类结果。

4.3。结果

在本节中,该算法的有效性和优越性从三个方面进行了说明,包括高斯核大小、数量选择的乐队,和分类性能分析三个数据集。

4.3.1。高斯核大小

大小的内核是至关重要的。如果它太大,图像的细特性可能被消除。但内核选择太小,消除噪音。因此,为了选择适当的内核,内核是先后设置为3,5,7,9,11,13,15三个数据集上进行实验。三个数据集的实验结果如图3- - - - - -5

从数据3- - - - - -5,我们可以得出这个结论。随着窗口继续增加,OA的变化,AA, Kappa萨利纳斯的数据集往往是稳定的。然而,从另外两个数据可以看出,随着窗口继续增加,OA的三项指标,AA, Kappa不断减少。总之,选择大小的内核 在这个实验中。

4.3.2。数量的乐队

为了验证提出的波段选择方法在这篇文章中,实验是三个高光谱数据集上执行5-50乐队的范围。表1提供了支持向量机分类器的分类结果在三个数据集。

从表可以看出1通过设置许多不同的乐队,OA的价值观,AA, Kappa正逐渐增加。虽然有一些乐队暂时下降,下降的价值几乎可以忽略不计。因此,它可以被认为是评价指标仍日益增加的乐队。此外,表显示,当乐队的数量是15 - 20,最好的效果可以实现三个数据集。为印度松树数据集,它是更合适的选择一群15。帕维亚大学和萨利纳斯的数据集,当乐队的数量是20,OA已达到92.04%和92.57%,分别。此外,从三个高光谱图像数据集的实验,一些关键的结果可以概括,即。,the algorithm in this paper can realize the classification of different datasets through multiple classifiers and the information entropy distribution of each band, and can obtain stable classification performance. The classification results are shown in Figures6- - - - - -8

为印度松树数据集,可以看到从图6 (b)分类效果不理想,有一个现象误分类。结合信息熵分布图表所选的乐队,可以看出,乐队的数量在106 - 142区间太密集了。密度和大量的信息很容易影响到双方的乐队。数据集的另一个原因是,印度的松树,有太多不移除特性和小样本的特性实验。然而,与以前的波段选择方法相比,尤其是对低维数据,本文提出的方法具有一定的优势在OA, AA,卡帕。帕维亚大学和萨利纳斯的数据集,通过比较事实地图和分类结果图,可以看出,分类效果很好,正好对应表中的值1。它也可以从数据78很少有错误分类,基本上满足分类要求。

4.3.3。分类性能

证明了该方法的有效性,该方法相比,本文的四个最先进的算法。两个分类器(资讯和SVM)是用来分析高光谱图像通过使用三个精度评估标准。

为印度松树数据集,图9和表2清楚地表明,本文方法比其他方法更少的乐队,这完全符合降维的目的。5乐队,该方法的OA已达到73.32%,高于4.44%的ASPS-MN方法。另一方面,当选择的乐队的数量超过25岁,虽然ASPS-MN方法在一些乐队的OA会高于这个方法,它可以从表2支持向量机分类器的稳定性这个方法比其他的好。相应的标准差OA和Kappa±0.11±0.09,分别。此外,该算法比其他算法的准确性,和与MDSR相比,它的优势是非常明显的。总之,本文的方法具有更好的稳定性和优势,和分类是有效的,如图10

帕维亚大学的数据图11和表2本文表明,该算法具有良好的性能在OA和Kappa指标,分别达到了91.34%和88.45%(分类结果如图12)。与ASPS-MN方法相比,分别提高了2.78%和2.55%。与其他四个方法相比,OA和Kappa资讯分类器上的最大提高2.52%和3.9%,分别。当选择乐队的数量很小,一些算法显示精度的不稳定,尤其是MDSR和SOPSRL。所有算法执行时选择的乐队的数量超过25。分类利用这种方法在印度松树数据集是不明显,但它是在这个数据集。同时,根据支持向量机分类结果曲线,该算法的优点是比其他算法更明显。至于其他算法,其精度提高乐队的数量稳步增加,和ASPS-MN方法可以更好地说明这一点。

萨利纳斯的数据集,人物13和表1显示的OA和Kappa这种方法明显高于其他方法。从表可以看出1此时Kappa系数可以达到92.58%,这表明,本文方法具有较高的分类精度和更好的效果为每个特性。此外,下面的结论可以从图13,即,although the accuracy of the proposed method is lower than that of other algorithms in the initial stage, its superiority becomes very obvious when the number of bands exceeds 20. Particularly for the KNN classifier, the OA coefficient of this method is continuously rising and leading other algorithms. When the number of selected bands is small, SOPSRL and ASPS-MN fluctuate greatly. In addition, from the classification result map (Figure14),可以看出,该方法有更少的错误分类。

通过大量的实验的三个高光谱数据集,可以看出大多数比较算法的性能在印度松树数据不是很理想。然而,对本文提出的方法,它具有良好的性能在这个数据集。的另外两个数据集的分类性能,本文提出的方法也有绝对的优势。

为了进一步说明每个波段选择算法的优点和缺点,乐队选择是进行三个数据集(以15乐队为例)和每个地物的分类精度,给出了不同的算法(如图15- - - - - -17)。乐队选择不同的算法在三个数据集的结果如表所示3

从数据可以得出以下结论15- - - - - -17。为印度松树数据集,由于数据集本身,所有当前算法的分类精度不高。特别是对燕麦分类、最佳性能是ONR算法;甚至可以分类的其他算法。与其他算法相比,从图可以看出,本文提出的算法比在地面物体的分类(如黄色的图所示)。帕维亚大学的数据集,本文算法和其他算法有良好的分类性能,与100%的分类的阴影。但其分类效果略优于其他算法。同时,萨利纳斯的数据集,从分类结果,该算法在本文中不会显示更好的分类性能比其他算法,但该算法在本文中可以有相同的优秀分类性能的最新算法。MDSR算法的分类性能远不如其他几个算法。以上实验证明了本文算法的有效性和优越性。

5。结论

最近,许多clustering-based波段选择方法提出了,但他们中的大多数只考虑乐队之间的冗余,忽视的信息量子集的选择。此外,这些算法没有考虑高光谱波段的命令。我们提出一个无监督高光谱波段选择方法基于自适应邻域分组和局部结构的相关性。首先,该方法将高光谱数据集划分为多个subcubes通过自适应子空间划分和雇佣当地的产品密度和距离因素对乐队进行排序和选择所需数量的集群中心。然后,根据欧几里得距离矩阵和集群中心,所有的乐队都分为若干集群。最后,基于信息熵和关联分析,选择最具代表性的乐队从每个集群。排行第三的不同于其他聚类方法,该方法采用聚类方法将空间要求高光谱数据集划分为多个subcubes生成一个整体框架,有效地避免了选择高度相关的子集。接下来,LSC方法是利用考虑乐队的组合在不同的集群来避免陷入局部最优解。大量的实验结果在三个公开可用的高光谱图像数据表明,该方法比其他方法具有更好的鲁棒性和优越性。

集群中心的质量有重要影响的性能的方法。在未来的工作中,我们将探索一个更好的群集中心选择机制改进的鲁棒性和有效性所选的乐队。

数据可用性

数据是可用的http://www.ehu.eus/ccwintco/index.php?title=Hyperspectral_Remote_Sensing_Scenes

的利益冲突

作者宣称没有利益冲突。

确认

这项工作得到了国家自然科学基金(51607059)和科技部门、黑龙江省(QC2017059)。