文摘

前罗马时代以来,橄榄树产生显著的经济和文化价值。Al-Jouf地区,2019年在沙特阿拉伯王国的北部,赢得了全球的存在进入吉尼斯世界纪录,有世界上最多的橄榄树。橄榄树检测和计数从给定卫星图像是一个重要而困难的计算机视觉问题。因为橄榄农场大面积铺开,手动计算树是不可能的。此外,精确的卫星图像中自动检测和计数的橄榄树有许多挑战,如规模变化,天气变化,扭曲角度来看,和方向变化。另一个问题是缺乏一个标准的数据库深度学习应用程序可用的橄榄树。为了解决这些问题,我们首先建立一个大规模的橄榄数据集致力于深度学习的研究和应用。230年的数据集由RGB图像收集Al-Jouf境内,籍。然后,我们提出一个有效的深度学习模型(SwinTUnet)从卫星图像检测和计数橄榄树。该SwinTUnet Unet-like网络由一个编码器,译码器,跳过连接。 Swin Transformer block is the fundamental unit of SwinTUnet to learn local and global semantic information. The results of an experimental study on the proposed dataset show that the SwinTUnet model outperforms the related studies in terms of overall detection with a 0.94% estimation error.

1。介绍

如今,卫星服务的可用性是建立很多有前途的研究与应用,例如,检测,定位,和计算对象(如人、车辆、建筑、和农场),监测、三维重建和地理分析(1]。

在计算机视觉领域,对象计数是一个众所周知的问题,旨在找出有多少对象在一个静态图像或视频帧。对象计数是一个活跃的研究领域,有很多用例在不同领域,如生态研究,人群计数、微细胞计数、和车辆计数(2,3]。

在传统的方法中,手工制作的特性(例如,筛选[4和猪5)提取从一个静止的图像检测和计数橄榄树。不幸的是,这些传统方法的性能受许多因素影响,如规模变化,天气变化,扭曲角度来看,和方向变化。最近,深度学习检测模型如单发射击multibox检测器(SSD) [6卷积神经网络)和地区(R-CNN) [7)实现高性能和这些挑战提供了一个有前途的解决方案(3]。尽管深度学习的成功方法,缺乏一个标准的数据库深度学习应用程序可用的橄榄树。

因此,我们首先创建了一个大规模的橄榄深度学习的研究和应用程序的数据集。230年的数据集由RGB Al-Jouf收集的卫星图像,沙特阿拉伯。从卫星图像取得了职业(8),它提供了卫星图像和地图对于大多数国家和世界各地的城市。减轻工作量,加快注释过程,橄榄树用中心标记点。该数据集是有用的对于许多橄榄树深度学习应用,如检测、计数和分割。

然后,灵感来自斯温变压器的成功(9),我们提出一个有效的深度学习模型(SwinTUnet)检测和计数橄榄树。SwinTUnet Unet-like网络包括一个编码器,译码器,跳过连接。而不是使用卷积操作,斯温变压器用于学习更好的局部和全局语义信息。提出SwinTUnet模型优于整体检测方面的相关研究,估计误差为0.94%,根据实验研究的结果提出了数据集。

本文的结构如下:部分2提出了一种相关的工作。拟议中的SwinTUnet架构是解释和讨论部分3。部分4讨论了实验及其结果。最后,在节5,并给出了结论和未来的工作。

使用遥感自动识别树木首次用于林业应用程序(10]。树检测和枚举在作物领域一直是近年来研究团体的当务之急。有很多技术可以有效地解决这一问题的识别和计数橄榄树。基于图像处理的方法,橄榄树从卫星和无人机图像识别和计数,一般来说,分为三组。

2.1。分类方法

在这些方法中,图像分类方法用于分类,然后数一棵橄榄树。坝子et al。11采用高斯过程分类器(GPC)和侵蚀形态滤波器(12)自动计数橄榄树在选定的区域的沙特阿拉伯。算法检测到的1124棵树1167年总体检出率为96%。土地覆盖类包含nonolive树木,建筑,和地面。橄榄树是计算使用blob分析和分为土地覆盖类。尽管高水平的整体精度,使用较少的训练样本训练分类器,有改进的余地。

Moreno-Garcia et al。13)提出了一个基于模糊逻辑的方法进行分类,然后计数橄榄树在使用高分辨率(VHR)图像k邻居的方法。这种方法是使用RGB测试从SIGPAC获得卫星图像查看器占地面积西班牙。1-in-6遗漏率和零遗漏率,结果是有前途的,但是测试图像的数量和多样性是不够的。

Peters等人。14)基于对象的特征提取和分类申请橄榄景观映射基于VHR从各种传感器(光学和雷达数据)。四步模型是用来检测在法国乡间橄榄树。这个模型由分割,提取特征,分类,,最后,映射的结果。协同方法应用于每个阶段通过合并功能从众多的传感器。因此,总体精度为84.3%。

2.2。分割方法

图像分割是分区的操作输入图像中提取感兴趣的区域(ROI)包含重要的信息。许多分割方法(如边缘检测、阈值、地区增长,和聚类)被用来识别和计数的橄榄树。这些方法也分别提出了混合方法。

Moreno-Garcia等人介绍了一种技术来识别和线段树的橄榄使用K——从卫星图像算法15]。用更少的集群和这项技术很快能告诉地面和卫星数据之间的差异。这种方法取得了0%的疏忽出错率和错误率1-in-6佣金。尽管显著结果,图像检测的数量和多样性是不够的。瓦利德等人使用改进的K——计算树的橄榄大面积(16]。一些步骤的技术包括预处理,图像分割,特征提取,分类。为目的的分段感兴趣的区域(ROI),K——分割使用。不同分类器的发展取得了可喜的成果。训练和测试的准确性97.5%,随机森林分类技术产生好的结果。

另一种方法应用阈值策略与不同水平段和提取从前台橄榄树17]。他们提出了一个健壮的和有效的模型准确地分割和检测橄榄树在各种各样的环境中。这种技术取得了有前景的结果,96%的整体精度。然而,总数nonolive元素的存在使一些改进的余地。

在[2],作者提出了一个基于颜色的分割申请橄榄树计数从从无人机系统(uas)获得的图像,利用云服务。应用取得了可喜的成果,330 332棵树的计算,但计算时间延迟和不解决了车载的混合物处理和基于云的服务。

2.3。检测方法

空中的看法树木透露类似气泡的形态学特征。这些斑点出现明亮的技巧从高处俯瞰,阴影在他们基础。拉普拉斯算子,也称为拉普拉斯算子,是欧几里得空间中的微分算子定义的函数的梯度的散度。拉普拉斯算符主要是用于边缘和blob检测(1]。

检测的橄榄,Karantzalos Argialas使用拉普拉斯算子空间分辨率与局部极大点18]。卫星从QuickBird灰度图像和IKONOS卫星被用来测试他们的算法。Blob检测是一个受欢迎的技术,因为它的简单性和可靠性;然而,它是数据容易丢失的橄榄。这项技术只有与圆形树使用形态学和对待每个对象与特征是橄榄树。

Daliakopoulos等人介绍了乔木冠枚举器之间的混合法(ACE)和高斯拉普拉斯算子(日志)检测橄榄树作为blob VHR卫星图像(19]。方法使用红色带阈值和blob检测基于归一化植被指数(NDVI) (20.]。单独的混合法克服了缺点的阈值和blob检测。1.3%的估计误差,精确检测和计数观察。然而,计算成本高,算法产生精确的结果。

瓦利德et al。1)提出了一种多步技术来识别和计数的橄榄树。这种技术包含多个图像优化和边缘检测的步骤。红色波段的信息从RGB图像中提取获得使用SIGPAC查看器。单一红色带磨,边缘检测后提取。使用形态学重建,树形成的封闭边缘界限转换为白色斑点。估计误差的1.27%,结果产生了各种各样的图像捕获地面实况信息。

使用各种技术的自动检测和计数橄榄树被记录在文献中。简单而有效的图像分割等技术,以及训练和测试样本,所有表现复杂的分类器。然而,他们发现,随着图像信息的增加,精度提高。虽然传统方法实现精度高,不稳定,影响许多卫星挑战,如变化的角度来看,图像规模、质量和取向。此外,缺乏必要的多样性所使用的数据集的数量和地面类。

尽管上述手工特征方法的成功,许多因素,如规模变化,天气变化,透视失真,和方向变化影响这些传统方法的性能。深度学习模型,如2,6,7),最近取得高绩效,并提供一个有前途的解决这些问题。然而,缺乏一个标准数据集对橄榄农场是一个主要障碍深度学习技术被用于这一领域。因此,我们首先创建一个大规模的橄榄深度学习的研究和应用程序的数据集。230年的数据集由RGB图像收集在Al-Jouf,沙特阿拉伯。然后,我们提出一个有效的深度学习模型(SwinTUnet)检测和计数橄榄树。

3所示。该模型

1描述了建议SwinTUnet架构,其中包括一个编码器,译码器,跳过连接。斯温变压器块(9是SwinTUnet的基本单位。编码器用于进行一系列的嵌入的输入。橄榄卫星图像分为4×4不重叠的补丁。基于此分区方法,每个补丁现在有一个特征维度的4×4×3 = 48。投影功能维度也转换成任意维度使用线性嵌入层(表示为C)。

分层特性表征通过创建令牌(转换补丁)几个街区斯温变压器和片层合并。将采样和增加维度补丁合并处理层,而学习是由斯温处理变压器特性表示。比起我们创建一个对称的基于变压器解码器,灵感来自U-net [21]。译码器是由斯温变压器块和相反的补丁扩展层。派生的上下文特性与多分辨率特性合并从编码器通过使用跳过连接来弥补损失由于将采样的空间特性。

一块扩展层,与一片合并层,是专门申请upsampling大小的功能。的层片扩大尺寸adjacent-dimension特征向量与upsampling决议由两个大的特征向量。最后,最终的补丁扩大层应用于特征映射到执行的四个upsamplings解析原始分辨率(WH)。这些upsampled特性之上,用来创建一个线性投影层密度地图。

3.1。斯温变压器块

与传统的多线程self-attention (MSA)模块,斯温变压器块(9)是基于改变窗口的使用。图2描述每个斯温变压器块包括LayerNorm (LN)层,MSA模块,剩余连接,中长期规划和两层。在连续两个变压器模块,窗口MSA (W-MSA)和移动窗口MSA (SW-MSA)模块使用。使用一个窗口分区机制,顺序斯温变压器块可以制定如下: 在哪里 的输出特性吗 块,分别(S) W-MSA和延时模块。MSA是计算相同的方式在先前的研究22,23]: 在哪里 代表查询,键和值矩阵。分别 表示查询或关键维度和补丁号码在一个窗口。偏差值从矩阵中提取的偏见

3.2。编码器

在编码器中,两个顺序斯温变压器块应用于输入令牌的决议H/ 4×W/ 4学习和48维表示。输出分辨率和功能尺寸不变。随着网络的扩张,令牌数量减少生产层次表示通过补丁合并图层。第一块合并图层合并的特点每组2×2相邻的补丁。之后,一个线性层应用于合并功能4C维度。输出尺寸设置为2C,令牌号码是减少2×2 = 4。这之后,斯温变压器模块是用来转换功能,保持该决议 第二阶段是指补丁的第一部分合并和功能转换。过程重复两次,与不同的输出分辨率的大小 ,分别为“第三阶段”和“第四阶段。”四个阶段有足够的学习深度特性表示,因为变压器太深是聚合(24]。

3.3。译码器

斯温变压器块编码器和解码器的支柱。与编码器,补丁扩大层中使用译码器而不是补丁合并层upsample构造特性。通过重塑邻近维度特征图和减少特征的维数除以2的输入维度,补丁扩大层增加地图的分辨率特性。考虑第一个补丁扩大层;upsampling之前,一个线性层是利用双特征的维数( )( )。然后,我们使用重新排列操作双分辨率和特征的维数减少到原来的四分之一大小(

跳过连接,就像U-net [21),用于注入从编码器upsampled特征的多尺度特征。减少空间特性将采样造成的损失,我们将浅和深功能连接在一起。连接功能的大小保持像upsampled特性的线性层后尺寸。

3.4。实现细节

在实现中,我们使用一个著名PyTorch [25)图书馆。然后,该模型的训练和测试是在一个NVIDIA GeForce 2060 RTX GPU。在培训之前,随机数据扩增,如旋转,缩放和翻转用于提高数据不同。输入图像的大小为224×224导致克服GPU内存不足的问题在培训。模型参数设置使用重量pretrained ImageNet-1K (26]。在培训期间,我们的模型优化使用知名SGD优化器反向传播(27动量值0.9和重量衰变等于1e−4

4所示。实验和讨论

本节讨论拟议中的橄榄树数据集用来评估我们的模型。它还包括的指标用于评估该模型的性能。

4.1。数据集

据统计的环境和水Al-Jouf分行,2019年,Al-Jouf地区举办3000万棵树,最重要的包括橄榄树(1800万棵树),每年产生1万吨石油(8,9]。因此,我们的数据集包含230张图片收集从Al-Jouf KSA领土,通过使用卫星Pro。卫星Pro提供了卫星图像和地图在世界大多数国家和城市。RGB图像大小为512×512的目标区域进行了32位的信息。有些图像样本呈现在图3

橄榄树是标有中心指出,减少工作量,加快注释。在第一步中,橄榄图像标签边框封闭橄榄树。边界框的四个顶点表示 在第二步中,我们计算每个箱子的质心作为中央位置由以下公式:

4.2。评价指标

评估不同的技术在不同的数据集,我们的模型的性能是评价使用各种性能指标。(1)总体精度(OA):这是橄榄树的比例正确识别的实际总橄榄树数。它显示正确确定数量的树木在地面实况数据标记的。总体精度计算数学使用以下方程: 在哪里代表了估计橄榄树和数量NA是实际的橄榄树。(2)遗漏错误率(OER):是积极的测试对象的百分比误认为是负面的测试对象。换句话说,OER的百分比乘以提出系统无法识别橄榄树。OER数学计算使用以下方程: 在哪里纳米表示省略了橄榄树的数量。(3)委员会错误率(CER):它被定义为负样本的存在被误认为是积极的。当有nonolive树的输出。CER数学计算使用以下方程: 在哪里Nf表示数量的检测到假树。(4)估计误差(EE):它指的是区别确定数量的对象和对象的数量。在我们的模型中,它是一个实际的区别和估计样本的橄榄树数量除以橄榄树的实际数量。EE数学计算使用以下方程:

4.3。该模型的整体评价

在评估该模型的基础上,整体测试的估计误差为0.94%。如表所示1,100%的橄榄和nonolive树分布以及其他对象,大约0.97%的橄榄nonolive数据错误,和1.2%的橄榄nonolive数据错误。提出数据集上的测试结果显示,全面识别和估计误差为0.94%。

3描绘一个橄榄形象以及地面实况和相应的检测结果。图片描绘了一个混合分布的橄榄树和明显的距离,那些紧密种植。我们建议的模型是否正确识别几乎所有的橄榄树,但误算年轻人和种植的树木。

4.4。比较分析与相关工作

该模型的结果比现有的橄榄检测和计数技术。数据集的参数,加工数量的图像、光谱代表处理数据的大小,和评估性能都进行比较。表2演示了该模型的结果比较现有方法。

如图4,我们提出的模型在大规模数据集和评估取得了精度高,说明我们的模型是准确和鲁棒性。我们建议的模型解决了相关技术的缺陷准确识别和计数橄榄树。这部小说橄榄树检测和计数模型验证在RGB图像的整体精度98.3%,克服了相关工作。测试的大规模数据集由橄榄树和其他地面物体,该模型的总体估计误差最低0.94%的现有技术。值得注意的是,我们建议的数据集包括230的橄榄树和其他物体图像。

5。结论

总之,我们提出了一个有效的深度学习模型(SwinTUnet)从卫星图像检测和计数橄榄树。SwinTUnet Unet-like网络包括一个编码器,译码器,跳过连接。而不是使用卷积操作,SwinTUnet斯温变压器块适应学习本地和全局语义信息。此外,我们开始通过构建一个大规模的橄榄深度学习的研究和应用程序的数据集。230年的数据集由RGB图像收集在Al-Jouf,沙特阿拉伯。根据实验研究的结果提出了数据集,SwinTUnet模型优于相关研究的整体检测、估计误差为0.94%。

然而,也有一些缺点,如难以确定接近其他树木的橄榄树。因此,在未来,我们打算扩展更多的图片数据集提出的从各种来源,提高该模型。

数据可用性

的数据支持本研究的发现可以从相应的作者在合理的请求。

的利益冲突

作者宣称他们没有利益冲突的报告对于本研究。

确认

作者扩展他们的感谢院长以来Jouf大学科学研究的资助这项工作通过研究批准号域- 2021 - 02 - 0104。