文摘

调查使用数据从远程观测平台经常面临一个简单但特别棘手的问题:大量的数据,在ever-replenishing供应,用于支持调查,但科学家们敏捷的将数据转化为可操作的信息经常努力跟上迅速传入流的数据积累在扩大档案。抽象的数据是一种方便的反应,许多研究通知纯粹由遥感数据是需要限制在一个小型研究领域相对较少的场景图像,或者他们依赖较大的马赛克在低分辨率的图像。因此,通常是具有挑战性的线程解释跨尺度从本地到全球,尽管这样做通常是在追求科学的关键。提出了一种解决方案,通过利用Apache火花,实现并行,内存有能力快速分类的图像处理大量的多尺度遥感图像和执行必要的分析,发现变化的时间序列。这表明处理三种不同尺度的地球资源观测卫星8数据(~ 107.4 GB, five-scene、时间序列图像集)可以在1018秒完成本地云环境。应用相同的框架与轻微的参数调整,它处理相同的报道MODIS数据在54秒商业云平台。从理论上讲,该方案可以处理各种形式的遥感图像中常用地球与环境科学,只需要轻微调整参数化计算的工作调整的数据。作者认为“火花感应”的方法可以提供的灵活性,可扩展性和可访问性必须保持在地球与环境科学的调查与数据提供的发展步伐。

1。介绍

遥感提供的数据一直作为一个关键的资源监控、测量和解释自然和物理现象。事实上,遥感特征可能公正的第一个“大数据”科学1]。坚决,远程的传感功能的进步,地球观测平台继续产生越来越多的数据,以增加观测广度和技巧的细节。这些发展有双重好处和问题:分析和调查的环境与地球科学不仅经常充斥着数据,也常常难以匹配的速度建设经验知识从这些数据,因为数据传入的匆忙和分量。策略来管理大型遥感数据必须充分利用这些数据的好处保持应用科学探究的话题如何杠杆来缓解途径计算科学和感知之间重要的货币在许多领域,尤其是快速采用高性能计算(2)和云计算在地理科学(3]。

遥感图像是一种常用的来源来支持这些研究可持续的生态系统,如生态系统动力学、草原退化、和城市生态系统恢复,特别是大面积(4]。传统上,研究纯遥感数据仅涉及几个场景的数据在一个有限的研究区域,或者他们依靠低分辨率遥感图像大面积实验(5]。这些传统正在改变,新的数据已经大大改变了潜在的底物进行分析。例如,在过去的几十年里,太空和空运的地球观测传感器不断提供大容量的数据集。例如,地球资源观测卫星8日最近的陆地卫星任务于2013年推出,每天可以收集超过700张图片,对应于每年大约86字节的数据(6),14倍,在1980年代(4]。遥感数据的处理海量现在不是唯一的问题:这些数据的内在复杂性也是一个必须考虑的重要问题。

在遥感驱动的传感器通常设计为特定需求的分析对不同领域的研究。将这些不同的需求,满足传感器通常负责捕获图像在不同分辨率。例如,高分辨率卫星传感器等WorldView-4能产生图像空间分辨率的全色远眺,0.31米和1.24米空间分辨率的多光谱远景(7),而QuickBird平台可以形象地用0.61米空间分辨率全色形式和2.44米空间分辨率多光谱形式(8]。这些决议,分数的一米几米空间分辨率,提出了重要的机会来监视地球,代表着最先进的地球观测成像细节。

同时,其他遥感平台的任务是刷新整个地球表面的观察,目标覆盖大面积的时间一致性,而不是小区域的细节。例如,相对中分辨率传感器,如陆地卫星和相对低分辨率的传感器,如MODIS作为长期部署地球天文台。陆地卫星提供15米全色和30米多光谱图像,这是非常广泛应用于大面积草地退化的研究和城市土地覆盖动态(9]。MODIS提供250多光谱图像,可以构建一个马赛克的整个地球每隔几天。MODIS数据一直在全球范围内广泛采用的研究,尤其是那些训练对全球森林覆盖的调查研究植物的树冠动力学(10]。

许多传感器支持多光谱成像。例如,WorldView-4数据包括四个光谱波段,地球资源观测卫星8奥利/行动提供了11个光谱波段。一些可怕地敏感研究高光谱分辨率图像是必需的。在这些研究中,高光谱传感器(如亥伯龙神生成220个乐队在0.4 - -2.5之间μ米(11)可以产生详细的光谱数据在一个非常小的波长范围。此外,不同的传感器提供不同的时间分辨率的成像速度以及他们的覆盖下的学科范围的时机。例如,WorldView-4卫星能够重新审视观点每4.5天(有时早),而陆地卫星每16天可以交付重复视图(12]。高时间分辨率的回报的观点促进动力学的研究在地球表面,所以时间序列之间的时间间隔访问成为观察的重要属性,在空间分辨率和光谱范围。因此,简化的方法可行,有效,高效的方法来处理归档和不断传入multispatial,多光谱、多瞬时遥感数据是一个持续的需求在许多潜在应用遥感应用科学探究。

本文介绍了可能的可伸缩解决方案来解决问题的处理多尺度大容量multispatial遥感数据集,多光谱、多瞬时情况。目标是实现一个工具,它可以处理不同提出了遥感任务只有较小的调整而不是完全重建新的工具包。此外,该解决方案应该完全有能力利用得益于先进的云计算技术,资源,平台帮助研究人员过程和分析大型遥感数据集难以处理在本地机器上的一个有效和高效的方式。

1.1。云计算作为一个资源大数据处理

许多研究人员已经取得了显著的进展在推进可行,有效,高效的处理multiprong遥感数据的属性,使用计算机工程的发展。特别是,研究如何图形处理单元(gpu)和基于集群的高性能计算(HPC)可能杠杆推动图像处理遥感特别富有成果(13]。最近,云计算正日益被视为资源遥感图像处理,很大程度上是因为云计算规模的本土能力计算的规模也正在处理的数据。此外,重要的云计算资源现在商业上可用,“付费”模式,从提供者等亚马逊网络服务(AWS) [14),微软Azure(15),而谷歌计算引擎(16]。这些资源可以给图像处理任务为IaaS(基础设施即服务),PaaS(平台即服务),或SaaS(软件即服务)。

云计算是有用的在提供一些输入数据之间的速度匹配所需的灵活性,大型现有数据竖井,进化在图像处理分析的需要,作者在引言中提到。云计算提供这种灵活性通过允许用户分配和共享软件和硬件资源在互联网上以分布式的方式,通过大量计算任务被划分为许多小的并行计算任务,然后将它们分配给尽可能多的计算实例需要实现基于数据的大小,计算目标数据融合,资源使用,或计算时间。毕竟云服务的分布式节点完成分配的任务,结果打包并返回给用户的本地数据库。通过这种方式,虚拟实例、应用程序和软件要求基础上提供,用户可能支付这些服务要求。这提供用户访问理论上无限的大小计算能力(尽管很强的限制可用的财政预算来支付服务迅速码头理论能力切实的实践现实在许多真实的实例)。

一个有前途的社会计算框架的伙伴与云计算硬件,和这些框架的几个重大承诺处理遥感图像的地球表面。例如,MapReduce被院长介绍,格玛沃特(17,十年前。十年以来,许多开源的实现MapReduce模型已成为有前途的中介框架计算遥感数据图像处理之间和云资源分配和/或加速商业(或而)云计算。MapReduce是其中最主要的开源实现Apache Hadoop。虽然Hadoop MapReduce依靠磁盘读写数据,另一个变体,Apache火花(18)保持在内存中数据分区(所谓的内存计算框架)。火花还提供了一个网络为每个减少缓冲的任务,而不是输出合并到一个单独的分区,结果引发可以一百倍于Hadoop MapReduce一些大数据任务(19]。然而,Hadoop可能掌控一个优势是Hadoop允许并行处理大量数据的物理存储大小超过可用的内存。事实上,许多遥感数据集的大小是如此巨大,他们在本地机器或超过可用内存小的集群。此外,物理磁盘资源通常在财务成本更昂贵比内存资源(拥有或访问)。所以,在内存有限的情况下成为一个制约因素,Hadoop在某些情况下表现为一个更好的选择对于处理大量的遥感数据。

然而,云计算框架敏捷相对于资源约束。,新颖先进的云计算技术和云平台允许火花利用资源和在不同的云计算平台,与内存限制的可能性可能不再显得那么大一个约束对大型遥感数据处理场景。考虑内存资源,可以根据需要,研究人员可以访问理论上无限的记忆在云上。此外,火花可以运行在一个工作站,以及当地计算集群和云平台。和火花可以访问不同的数据源,如Amazon S3,Hadoop分布式文件系统(HDFS),卡珊德拉,HBase。换句话说,火花不仅可以访问本地私有数据仓库,也可以达到cloud-stored大遥感数据集,通过云平台直接这样做,有能力处理这些数据在云上然后流所需的结果。

1.2。云计算处理遥感图像

的一个常见的计算解决方案处理的负担,分析和管理大规模的遥感数据是并行化遥感处理任务:将负担分摊到多个计算单元可以降低整体的处理时间(6]。例如,黄和她的同事们使用消息传递接口(MPI)作为他们的工作在沙尘暴的计算框架模拟和预测Amazon EC2商业云服务(13]。他们部署了MPI在亚马逊云计算和松散耦合的嵌套模型适用于处理高分辨率数据集的沙尘暴。他们的性能测试表明高效和经济的结果。Cavallaro等(20.)用gpu实现一个支持向量机(SVM)分类器和MPIopenMPI框架。替代使用HPC计算框架,其他研究人员已经开发出自己的定制并行大规模的遥感数据处理平台。例如,王等(21)开发pipsCloud,这是一个基于云计算的高性能计算方法来处理遥感实时点播和。为了进一步提高性能,王et al(21)使用希尔伯特 树索引。

由遥感科学家转向发展的工具,为遥感科学家,利用计算技术但离开遥感应用的方式很特别,是一个美妙的遥感科学发展。然而,定制解决方案(特别是在学术环境)下导致无法计算的大量可用现在商业上,结果绝对性能总是落后于那些可能在市场上。同时,应用MPI或自主研发的系统通常需要大量的研究和开发工作进入编程,调试,优化计算系统和环境,有人也许会让一个论点的时间致力于这些任务可以用于应用科学。在某些情况下,在定制的基础上建立这些系统是非常具有挑战性的。例如,考虑MPI编程任务为串行计算和将它们转换为并行设计形式可以显著繁重的,特别是对于一些复杂的图像处理算法。此外,网络安全,附近无处不在的可用性和快速移动的硬件兼容性(例如,在共享内存集群)的商业平台提供显著的实践优势。一些现有的工作指向潜在的优势是获得在云大地理空间数据的处理。例如,陈和周22)表明,可以利用Apache Hadoop分区使用均值漂移算法。与当地模式测试,他们成功的处理速度提高了~ 2倍(22]。此外,Giachetta [23]介绍了Hadoop-based地理空间数据管理和处理工具包,“宙斯盾”,他对许多现有的MapReduce-based框架相比,等SpatialHadoop,Hadoop-GIS,HIPI,MrGeo空间连接查询,和聚合操作23]。

MapReduce-based方法相比,解决方案基于Apache火花通常可以生成结果以更高的效率,介绍中提到”。“例如,太阳等(24)使用MLlib在火花试验multi-iteration奇异值分解(圣)算法对高分辨率高光谱遥感图像。相比Apache Mahout(MapReduce)方法,从本质上说,他们发现,引发方法可以打败MapReduce在他们的测试中,一旦引发足够能够访问硬件资源。另一项研究使用火花处理大量的遥感数据,由黄和他的同事(25),展示了一系列的综合性能测试,使用火花来实现不同类型的算法在遥感。黄等(25]讨论的每个测试的性能在不同的运行环境,包括当地的,独立的,另一个资源谈判代表(纱)。他们还提出了一个自定义,strip-based分区方法替换默认哈希分区方法(25]。

2。方法和数据来源

本文提出延长在最近的事态发展在云计算资源遥感图像进行处理。具体来说,Spark-based大规模遥感图像处理工具,它可以部署在云平台将推出。在下面几节中,作者将讨论如何设计实验通过应用两个常用classifiers-normalized植被指数(NDVI)和归一化水指数(NDWI)——一个实验来评估我们的工具的可行性和性能。方案设计变化检测方案根据分类结果提出工具生成的时间序列也将介绍。这种方法的主要优势之一是其能力和直接支持用户的访问处理大量的时空内的土地覆盖变化图像。此外,本文将演示一个可视化的方法保存文本输出分析常见的图片格式,允许用户轻松快速地检查结果。

2.1。方法

本文提出的方法是基于纱云环境。用纱,目标是促进加工环境的可用性的方式广泛适用于现实世界的场景。纱线已广泛应用于许多当前云计算环境(26]。与传统版本的Hadoop MapReduce,纱允许分配系统资源容器的各种应用程序。换句话说,不同的计算框架可以部署在单个物理集群noninterfering的方式。在纱线模式中,一个火花框架由一个主实例和许多工人。主实例负责谈判的纱线资源管理器要求足够的计算资源,根据需要,通过分析引发客户提交的应用程序。一旦加载主实例,它将计划分配的任务执行人容器。直到所有任务已经完成,资源管理器将撤销所有资源进一步可能的任务分配。

弹性分布式数据集(抽样)形式的基本抽象数据集的火花。抽样可以从外部创建数据集,或从现有的抽样。本研究病例,将创建抽样从原始遥感图像存储在HDFS中。对于每一个图像,将创建三个抽样为绿色,红色,近红外波段对归一化植被指数和NDWI土地覆盖分类在初始阶段。抽样包含数据分区和元数据记录。根据引发机理、抽样和行动将会通过一系列的转换操作来处理数据分区分配的方式。的转换操作将单个分区上执行抽样的抽样和这些操作将返回一个新的抽样。行动操作将总结信息从一个抽样由用户定义函数和返回一个结果。加入操作,例如,作为一种常用的变换操作的火花,包括加入属于两个抽样和创建一个新的分区。在这种情况下,数据块不会移动在当前阶段,因为懒惰的机制。 However, action operations, such as count, will process the data partitions in RDD and perform real computing.

基于工作流火花的特点,设计了如图1。工作流程的第一步是提取每个乐队的光栅数据集使用地理空间数据抽象图书馆(GDAL)是一个开源翻译库光栅和矢量地理空间数据格式27]。提取数据的每一行包含地理坐标和数字栅格单元的数量(DN)值在原始栅格数据集。这些文件然后放入HDFS数据输入源分配处理。

第二步是进行并行处理的图像分类和土地覆盖变化检测。之前介绍过的,每个形象都必须由这个工具,处理三个抽样将为其创建绿色、红色和近红外波段。抽样的基本单位是键值对。在这种情况下,地理坐标设置为关键,和光栅的DN值细胞将价值。通过这种方式,并行可以跨许多计算机进行土地覆盖分类单元在一个集群中。并行处理的程度取决于应用程序配置火花和集群硬件规格。因为pixel-wise基本并行处理单元,该方法可以高度灵活和可伸缩的,允许将栅格数据集划分,以任何方式,不管光栅的空间结构。然而,分区策略仍然必须认真考虑,因为适当的分区策略将有助于优化性能更好的使用集群的计算资源。火花支持哈希分区和默认范围分区;这些应用程序是适合在现实世界中很多情况下。 However, according to the results of the study of Huang et al(25),分区规模不能太小或太大。一个非常小的分区规模将导致低档次计算,甚至增加了故障恢复的成本。一个非常大的分区规模可能导致内存不足的错误。灵感来自他们strip-based分区方法,把数据分解为块后需要配置HDFS块大小的实验。

在算法1,使用归一化植被指数和NDWI作为分类器的详细算法对遥感图像。抽样数在每个分区上执行转换操作。为 输入GeoTiFF遥感图像,该算法首先将解析的维数。此外,这些创造了抽样将时间序列的时间序列。为每个数据块,在每一对图像抽样(例如,一对2014年2013年的图像和图像),归一化植被指数和NDWI分类器将被应用到每个像素计算值表示。归一化植被指数(28)可以根据其定义计算

1:输入= ;尺寸=
2: 做的事:
3:输入
4:输入
5: 到2:
6: 在1
7: 在1 :
8:
9:
10:
11:
12:endFor
13:endFor
14:endFor
15:
16:
17:endFor

归一化植被指数的范围从- 1到1,也可以使用不同的范围来表示稀疏植被、茂密的植被,贫瘠的岩石和沙子,和水。然而,归一化植被指数可能并不总是正确区分水体,尤其是当有噪声信号在水里地区(如泥)。为了进一步提高分类的准确性,根据McFeeters (NDWI应用29日)如下:

NDWI可以区分水功能的积极价值指标。从算法实现的角度来看,抽样三乐队将加入一个抽样的归一化植被指数和NDWI计算每个栅格单元的映射操作。因此,土地覆盖分类可以进行并行计算通过使用归一化植被指数和NDWI结果。一旦土地覆盖特征的归一化植被指数和NDWI指标进行分类,每个特性可以用一个类标签ID和通过这些ID更改检测功能。变化检测函数将比较特性id从每个图像对和总结这些土地特性变化的前一年。

最后一步是可视化土地覆盖变化,如算法的伪代码2。与所有 土地覆盖变化的数字结果生成的算法1对于每一对图像来说,可视化图像中创建PPM格式输出抽样获得的,这是一个最小公分母彩色图像文件格式(30.]。虽然冗余,PPM是一个简单的格式编写和管理基于文本的输出转换成人类可读的数据。土地覆盖分类的两个抽样的两幅图像的算法1作为一个单一的抽样,将加入和键值的值将被转换成颜色根据用户定义的RGB颜色方案。这个加入抽样原始顺序将排序,减少每个键值对的方式,这样代表一行最初的光栅图像。最后,以产生一个PPM-format形象,这个抽样是附加到PPM文件头来创建一个完整的PPM的形象。

1:
2: 做的事:
3:
4:
5:排序 由两个维度
6:
7:重塑
8:
9:保存 文件
10:endFor

的概述整个过程的工作原理如图2。在这个设计应用四个步骤:(1)读取和解析每一对输入图像和为绿色创建抽样,红色,和近红外波段;(2)数据分割成块和并行处理;(3)收集结果,并将标签分配给每个像素;和(4)重建整个图像的排序输出抽样和可视化在PPM格式。

2.2。数据源

为了证明该方案的应用效用,执行三个实验,两个不同的遥感图像数据集。第一个实验是利用地球资源观测卫星8操作陆地成像仪(奥利)在三个不同尺度的数据集测试分类、变化检测和可视化算法的工作流与火花在当地的云环境。为了进一步研究这个方案的优化性能,第二个实验的目的是在不同的执行配置下运行这个工具相同的陆地卫星8数据集。最后一个实验是将证明这个工具可以使用不同的源遥感图像数据集,只有小参数的调整。通过使用相同的算法上面提到,MODIS数据集在Amazon EC2上这是一个真正的商业云平台处理。

地球资源观测卫星8扫描整个地球表面在为期16天的时间31日]。配备最新的奥利传感器,地球资源观测卫星8提供了前所未有的与另外两个光谱波段光谱信息在整个陆地卫星仪器的家庭。除了提供15 m全色波段和30 m多光谱波段,在此前的许多产品,地球资源观测卫星8还包括一个质量评估(QA)支持基于像素的云带,阴影和地形闭塞过滤。一段相对较短的重新审视,中等空间分辨率,和七个光谱波段使地球资源观测卫星8奥利产品常用的自由获取遥感图像数据集依赖于空间科学,为环境研究光谱和时间地球属性。此外,地球资源观测卫星8集目前在云平台上对公众开放,如Amazon S3 (32),谷歌地球引擎(天啊),使之成为一个伟大的数据源提供基于云计算的大规模遥感处理在云中。

像地球资源观测卫星8奥利,MODIS卫星数据集都落在Amazon S3 (33自2017年以来,哎呀。MODIS提供了各种地球观测产品每天的时间分辨率。摘要MODIS /地球表面反射每日L2G全球1公里和500罪恶网格V006 (MOD09GA)将被用作第二个数据输入,也可以提供7带表面光谱反射率与500米空间分辨率。此外,一群1千米分辨率观察和地理定位数据乐队是提供这种产品。

每个数据集的范围见图3。三个尺度的地球资源观测卫星8图像数据集的小,介质,和大规模的用于实验,作为输入数据源。这种多尺度方法允许我们评估我们的工具是否可以执行多尺度遥感图像处理,只有小参数的调整,以评估是否广泛的遥感图像数据集可以由我们提出处理框架在现实场景。由于遥感图像,在不同空间分辨率、不同的传感器收集的各个波段的光谱信息,在不同的时间尺度上基本上是由像素,基于像素算法通过火花在云中实现应该能够执行一个非常广泛的基于像素的处理和分析。然而,进一步证明了工具可以处理多源遥感图像在现实情况下,相同的MODIS数据集符合覆盖大型陆地卫星8数据集都是进口的。

生成的时间序列变化检测,每年一个图像选择从一个数据集生成2013到2017。小型和中型图像图像是大约一个场景的陆地卫星图像。因此,这些图像,获得类似的日期每年最好选择减少季节性变化引起的土地覆盖变化的因素。然而,一个大型数据集是由超过15原始图像的场景。在这种情况下,它不能保证每个瓷砖的数据集可以由同一日期每年图像。因此,通过扩大过滤标准月水平,获得足够的瓷砖可以确保整个地区。另一个重要因素是所选的图片最好是高质量减少云计算和烟雾的问题。MODIS数据集,相对较粗的空间分辨率和大型覆盖每个场景,需要大约一半的单一场景符合大型陆地卫星数据集覆盖。同时,它遵循的采集时间的日期中小陆地卫星数据集因为MODIS可以提供每日的产品。每个数据集的详细的收集时间列在表中1

研究区域的选择的原因如图3是,苏伊士运河地区土地覆盖主要包括稀疏和茂密的植被,自然水体,苏伊士运河(水),和裸沙和岩石。因此,研究区域是一个伟大的测试区域的我们的归一化植被指数/ NDWI分类器来检测详细的土地覆盖和生成相对准确的变化检测结果。研究区域的选择的另一个原因是,苏伊士运河是2013年以来扩大建立另一个分支(34]。这个项目可以清楚地监控提出了变化检测过程。

在这些实验中,遥感影像数据集都是出口啊,这是一个基于云计算的平台,可以为遥感数据源与定制的标准(35),例如,设置(1)该地区属于我们的研究区域和边界获取数据(2)云掩膜过滤之前云像素图像导出数据到我们云驱动器。地球资源观测卫星8和MODIS (MOD09GA)提供表面反射产生的啊。如果使用其他数据集,应遵循一个严格的基于图像的大气校正消除烟雾对这些图像的影响(36]。

2.3。实验环境

两个实验环境是参与这项研究为本地云环境测试和实际商业云平台测试,分别。当地的计算集群总共包含了20节点。其中两个是主节点,配备2 Intel Xeon e5 - 2680 v4 2.4 GHz cpu和256 G内存。18计算节点配备2 Intel Xeon e5 - 2690 v4 2.6 GHz cpu核心(28)和256 G内存。10 Gbit网络分配。总共有1008个计算vcores和5.12结核病可用内存。2 Pb HDFS是配置和块大小是128为默认。Linux (Centos 6.9)在这个集群上运行。Java 1.8.0_152 64位服务器虚拟机安装。火花版本是2.2.0 Cloudera版本1和鼎晖5.12.0。

亚马逊EC2-based计算集群是另一个计算环境。基于计算需求的第三个实验本文3-node集群是由1 t2。超大实例4个vCPU英特尔Broadwell e5 - 2686 v4 2.3 GHz和2 t2为主节点。大型实例2个vCPU英特尔Broadwell e5 - 2686 v4 2.3 GHz的奴隶。所有节点都参与计算。vcores总数是8和整体内存32 G。20 G存储每个节点连接默认128块大小。默认的HDFS副本是设置为3。Ubuntu 14.04 LTS (HVM)操作系统。类似于本地计算集群,Java 1.8.0_152 64位服务器虚拟机,火花2.2.0 Cloudera版本1,鼎晖5.12.0配置。

在本文的以下部分,作者如何应用上述工作流在真正的多尺度和不同的源遥感数据集测试的性能和可行性Spark-sensing计划将讨论。工具的性能和实验结果的可视化也会显示。此外,灵活性,可扩展性和可访问性收集利用Spark-based解决遥感图像数据集处理将进一步讨论。

3所示。结果与讨论

第一个实验20-node纱计算集群上执行。在这个实验中,多尺度遥感影像数据集Spark-based分类和变化检测算法已成功处理。

详细数据大小和处理时间如表所示2。处理时间记录在配置默认的块大小,与20芯50执行人,20克执行人的记忆。注意,火花可以为遥感图像提供高效的处理。特别是对于一个相对较大的集群,足够的计算资源可以支持整个分布式计算过程,确保处理时间不会显著增加随着数据量的增加。从算法设计的角度,剖析整个处理时间在每个操作耗时的部分,发现加入操作很耗时的,特别是对于大像素的数据集。相比之下,映射操作分类和变化检测加入操作相比要快得多。因此,设计一个图像处理算法用更少的连接操作和适当的分区来减少数据块移动可能会提高性能。此外,重新分区操作也应该避免,因为它将导致一个非常耗时的洗牌的过程。

除了提高算法的整体性能设计、开发第二个实验进一步研究如果执行配置可能对加工性能的影响。8只大型陆地卫星数据集应用于这个实验评估处理时间与不同的配置。根据引发性能调优官方文件(37],遗嘱执行人数字、遗嘱执行人、核心和执行人记忆三个主要因素可能影响Spark-based应用程序的性能。通常需要提前预算可用计算资源为用户获得满意的处理性能。在这里,三个不同的配置集分配如下:(1)10执行人与每100 G内存和100核组1,(2)50执行人20 G内存和20芯每组2,和(3)500执行人与2 G内存和2芯组3。这三个配置集设计相同的总计算vcores和记忆。同样值得指出,块大小有时可能会影响性能。正如上面所讨论的,重新分区操作(尤其是对增加分区)通常应该避免消除不必要的洗牌的过程。在这种情况下,分区将I / O过程中主要由块大小决定抽样时创建。如果块大小是太小,将创建大量的分区尤其是非常大的输入数据集,这将导致增加任务管理的开销,尽管合并操作可能适用于减少分区在某些情况下有时没有洗牌。如果块大小太大,只有少数分区将被创建,所以,并不是所有的核心可以充分利用可用的计算资源。换句话说,没有充分揭示并行性的特点来提高性能。 Here, three different block sizes are set during the experiments. In Figure4,处理数据集的性能在不同的执行配置和不同的块大小是代表。最短的运行是由50执行人提供20 G内存和20芯下每个默认的块大小。执行人相同的配置,性能与64块大小显示有点低,这可能会导致从总的任务是增加一个更小的块大小。然而,每个任务的执行时间是不显著降低与相应的设置。相同的性能配置设置有256块大小也被默认的块大小。原因是在这一块大小生成的分区是太少,这样执行人在处理过程中不活跃的部分。这个问题显然当应用配置组3,因为任务执行人的数量远远超过在这种情况下,太多的空闲计算资源,从而导致较低的性能。执行配置设置1显示了非常相似的性能2组在每个块大小设置。然而,通过监测的核心利用率组1,它是低于2组。这可能出现的越来越多的执行者和减少核/执行器可能提高核心的利用率,也可以帮助提高总体性能在某些情况下,特别是对于非常大的数据集相对有限的计算资源。

这里的土地覆盖特征是定义在四类:茂密的植被,植被稀疏,摇滚/砂,和水。的传奇人物5、颜色设置为研究区域每个像素的变化从一个到另一个的特性。例如,“岩石水”表明,土地覆盖特征观察从沙子或岩石已经改变了水体在过去的一年。条件没有变化表明在过去的一年里没有发现变化。其他人表示这些部分的图像没有数据或错误的数据。在图5,每一对的变化图像清晰可见。此外,用户可以生成一个“最终”结果直接与一个参数变化从2013年到2017年。在2014年到2015年的数字地图的变化5作为一个例子,用户可以监控苏伊士运河正在建造的新分支,装满水。它还表明,一些新的植被沿着运河增长;这种植物可能是一个新的耕地,因为大多数artificial-like植被区域的形状。

正如之前所讨论的,提出了工具可以部署商业云平台没有变化(如果硬件配置高度不同,策略的平衡工作负载可能需要重新考虑)。第三个实验的目的是使用该框架在Amazon EC2上处理MODIS数据集。不同于地球资源观测卫星8产品与四级红色,带5近红外光谱和乐队3绿色,MODIS (MOD09GA)产品集红乐队,乐队1,近红外波段2,绿色为四级。除了改变乐队指数输入、处理工具准备发射编码不需要额外的调整。这个实验在3-node Amazon EC2云计算集群上运行。通过应用2执行人与2芯和4 G内存,实验中成功地完成了54秒。值得指出的是,54-second处理时间并不快,这么小的输入数据集和~ 0.5现场MODIS图像只有50米。因为在这种情况下,很多时间都被作业提交,任务管理、资源分配、等等,引发的性能应用程序可以只显示明显相对较大的数据集。然而,这个实验还证明了该框架可以被部署在真正的商业平台来处理多源遥感图像只有小参数的调整。

这些实验代表一个健壮的解决方案构建遥感图像处理工具有多种用途灵活(工具的能力,以适应在不同尺度的多源数据集),可扩展(工具的能力增长的规模和容纳的体积计算解决),和可访问(工具来访问数据的能力从多个存储平台和位置对当地资源、数据中心和云计算)。所有测试图像数据集的实验是地球资源观测卫星8 30米空间分辨率和MODIS与500米空间分辨率。然而,读者应该注意,输入数据集可以是任何的基于栅格的图像在不同的空间,时间,和光谱分辨率,因为在我们的实验中实现的算法是一种基于像素的处理算法。类似的机制后,所有基于像素算法可以实现通过处理每个像素的DN值这个框架下产生所需的结果。因此,无论将它应用到现有的大量的数据或填充用昊新收集的数据集将在未来与当前传感器或新的传感器,该解决方案能够处理编码的任务只有轻微的变化,从而节省成本高通常在重组中调用不同的工具,不同的研究目标。

Spark-based实现,实验证明,该工具的主要结构不需要修改数据集的体积变化。例如,它已经成为可能,即使地球资源观测卫星8集覆盖一整年(47.33 Tb) (6同时参与处理,通过云平台的支持,用户可以获得足够的计算资源(内存尤其是火花)理论。现在考虑到Amazon EC2提供“x1e。32xlarge” instance, which contains 128 virtual CPUs, ~4 Tb memory, and ~4 Tb storage. Users can apply fewer than 20 instances to implement in-memory computing with Spark-based approaches for this dataset in many different processing purposes. Nevertheless, to maintain the high performance of the tool, the partitioning strategies should be tailored based on real execution environments, especially for clusters with unevenly distributed computing resources and networking performance.

正如简介中所讨论的,Spark-based方法可以很容易地访问HDFS, Amazon S3,卡桑德拉,HBase。受益于云存储和管理的发展,越来越多的数据被存储在云中,并向公众开放。演示的方法提供了基于云的数据资源来支持用户执行一个“纯”云分析和创造新产品,没有不必要的原始和中间数据转移到本地存储在生成最终结果之前。这个解决方案还可以支持来自多个数据源的数据在同一时间。例如,用户可以访问cloud-stored公共数据作为数据源的一部分,也可以访问和加载他们的私人数据存储在本地HDFS星星之火应用程序。

4所示。结论

在本文中,作者认为,当前状态的艺术大数据遥感,涉及大规模数据集生成从现有和新一代卫星和观测平台,是,在许多情况下,在步进行,超过我们的分析能力跟不上信息产品在这些数据。虽然数据和分析失准,研究人员也许错过机会建立必要的科学,否则是可以达到的,如果数据和分析可以更好的连接。在这篇文章中,作者讨论了当前广泛使用的方法,由现有的研究作为一种手段来迎合的呼唤社区发展的一个有效和高效的大规模处理框架来处理大容量遥感数据集。评论的基础上与其他可能的方法比较,用火花在云环境中构建一个健壮的可伸缩的工具可能是一个重要的和实用的选择匹配速度数据和分析。为此,一个Spark-based多尺度大的遥感分类和变化检测工具引入了,和它的成功部署和实验测试在云环境中已被证明。

方法本文提出几种有前景的优势。首先,Spark-sensing方案提供了相当大的灵活性处理multispatial大幅遥感数据集,多光谱、多瞬时情况。的确,改变分辨率和光谱之间可能有轻微的调整,从而大大节省了时间成本重组新工具包用于不同的目的。第二,这个方案可以利用云平台获得的好处(理论上)无限的计算资源,高效性能。第三,提出的方法是本地高访问源数据存储、甚至在云中,这是有用的在减少数据转换成本。

本文讨论的工具显然是一个典型的框架。因此,重要方面可以作出改进。在这里工作可以证明的一般原则和机制需要有实验在这个领域,希望它可以鼓励其他人在社区建立在此基础上。一个明显的延长我们的方法可能包括更复杂的遥感图像处理算法的实现,特别是在分类、更好地与现实情况下在不同的研究领域。另一个改进可以设计更好的分区策略的探索,进一步提高计算性能。此外,使用一个数据集直接从云从数据源可能减少不必要的数据传输到云环境中,这可能更好的符合使用习惯在实际解决问题。

数据可用性

地球资源观测卫星8表面反射率数据用于支持这项研究的结果已经存入谷歌地球引擎库(https://explorer.earthengine.google.com/细节/陆地卫星% 2 flc08 ft1_sr % 2 fc01 % 2)。MODIS /地球表面反射率数据用于支持这项研究的结果已经存入谷歌地球引擎库(https://explorer.earthengine.google.com/ / MODIS % 2 f006 % 2 fmod09ga细节)。

的利益冲突

作者宣称没有利益冲突。

确认

作者感谢教授Huy t .签证官在纽约大学计算机科学与工程系的他的建议构建分区组件的工作。