数字土壤制图方法应用于复杂,在厄瓜多尔的安第斯山区。救援功能来自一个数字高程模型和用作表土结构预测类砂、粉砂和粘土。三种统计学习方法的性能比较:线性回归,随机森林,回归树的随机梯度增加。在线性回归,逐步向后变量选择过程应用和过度拟合控制通过最小化锦葵的Cp。随机森林和提高预测效果的选择和调优过程评估。100倍重复的5倍交叉验证选择造型程序用于验证、不确定性评估,和方法的比较。绝对的评估模型的性能是通过比较所选方法的预测误差和意思。提高执行最好,提供可靠比均值的预测。均方根误差的中值减少5%左右。海拔是最重要的预测因子。所有模型明显区分山脊和山坡。 The predicted texture patterns are interpreted as result of catena sequences (eluviation of fine particles on slope shoulders) and landslides (mixing up mineral soil horizons on slopes).
最突出的概念模型来解释和解释的空间分布的基本方程是土壤成土因素,从珍妮(
这个模型可以被应用为预测土壤的空间发展一个或几个clorpt因素的函数,这种方法被称为数字土壤制图(DSM)。DSM的范围内,相当数量的研究跨越一个大范围的理论和应用目标、方法论和预测因素,数据源进行。McBratney et al。
clorpt模型的因素中,Schaetzl和安德森(
本文提出一种方法来比较线性回归,随机森林,和随机梯度增强回归树(后来被称为提高),应用于预测表土结构在复杂地形在厄瓜多尔的安第斯山脉。尽管大量的研究和减免土地开发的重要性,研究应用DSM广泛,复杂山区地形稀缺(例如,
研究区位于“珍藏”意思就是旧金山(RBSF)在3°58′年代和79°4′W。它坐落在厄瓜多尔的安第斯山脉南部,东崖河山谷的旧金山。跨越了26公里²与跨越的面积高度的范围从1800米到3200米a.s.l。(图
研究区土壤剖面的位置。覆盖hillshading与光源从北(改编自
它是受热带信风政权与今年强劲的东风。结合位置在安第斯山脉东部,这导致>年降水量6000毫米,达到它的最大强度从四月到八月。西风只出现在11月有些干燥机(
谷的NNW-facing斜坡的林木线大多是由常绿丘陵山地森林,其次是subparamo灌丛带树线以上。家的和沃纳
该地区是Chiguinda单位萨莫拉系列的一部分。母质是高度风化和包括metasiltstones、粉砂岩和石英岩,混杂在一起,千枚岩和粘土层片岩(
横断面被定义为Ließet al。
空间信息对地形参数区域化的采样点数据是来自一个数字高程模型(DEM)的10米光栅细胞研究单位的数据库提供的分辨率
地形参数计算与传奇GIS软件。
| 参数 | 模块 | 参考 | 传奇作者/年 | |
|---|---|---|---|---|
| 1 | 海拔(El) | 填补下沉 | ( |
Wichmann 2003 |
| 2 | 斜率( |
斜率,方面,曲率 | ( |
康拉德2001 |
| 3 | 方面 | |||
| 4 | 谷深 | 相对高度和斜率的位置 | - - - - - - | bohn和康拉德2008 |
| 5 | 风 | 风的影响 | - - - - - - | 博纳和Ringeler 2008,康拉德2011 |
| 6 | CI | 收敛指数 | ( |
康拉德2003 |
| 7 | 特定的排水区 | 流跟踪/运动路由算法(热泪盈眶) | ( |
康拉德2001 |
| 8 | 海底钻井 | strahl秩序≥5 | ( |
Olaya 2004 |
| 距离地面水流通道网络 | ( |
康拉德2001 & 2011 | ||
| 9 | 瑞士 | 传奇湿润指数 | ( |
bohn和康拉德2001 |
| 10 | LS的因素 | 坡的长度系数 | ( |
康拉德2003 |
线性回归是非常简单、快速、高效。因此,它通常被用在许多应用程序(
决策树方法的属性几乎是相反的线性回归。他们必须解决迭代和近似。但他们是免费的刚性的假设,他们可以容纳各种各样的变量尺度,intervariable关系和分布。随机森林decorrelates个别树木和降低了预测方差相比简单回归树(
一个逐步落后变量进行选择(
发现了异常值与拟合值与标准化残差图。排除标准是一个标准化的残余,超过三倍标准差。检查过有影响力的数据点,利用与标准化残差图。利用描述的观测值对拟合值的影响相同的数据点(
随机检查组件的常态
随机森林反复引导预测样本数据符合树木随机选择的预测,然后平均预测(
除了这些调优参数,它一直辩称,随机森林不需要大量的调优工作,因为决策树方法是健壮的,如果不是免疫对噪声变量(
因此,几个造型程序被用于比较。
没有预测的选择和优化(
预测选择,但没有调优。指标选择的
没有预测的选择,但调优
没有预测的选择,但调优
过程复杂性的等级次序是这样(1)<(2)=(3)=(4)。程序(2)(4)的类似程度的复杂性,但是都比(1)复杂。在分析
而不是测试的RMSE分布的显著差异,这是决定箱线图和直观地确定优良的拟合程序按照下列标准:RMSE值和方差的分布和造型过程的复杂性。以下决策规则应用于选择最好的程序:
提高了引导预测样本数据,适合一棵树,并减去原始数据的预测。树木被迭代拟合残差和预测总结(
提高模型通过使用代码发布的Elith et al。
关于其他参数的调优,Elith et al。
没有变量选择和优化。
步骤(1)的最优模型,但是检查是否变量选择的功能
程序的优化模型(2),但是
从过程(2)最优模型,但与一个
排序的程序复杂性因此是(1)< <(3)(2)=(4)。5倍交叉验证的RMSE被用来评估运行。这个方案是运行在100倍重复产生的变异占涉及随机过程。优越的造型过程被描述的决策规则的随机森林。
为了比较模型的性能和估计模型不确定性的三个应用方法,计算5倍交叉验证方案。交叉验证涵盖完整的建模程序选择在前面的部分中,包括预测的选择。交叉验证是在100倍进行重复考虑到外部的影响(例如,样本归因交叉验证组)和内部(如引导)随机事件和获得一定程度的造型过程的方差。因此,均方根误差(RMSE)分布的完整造型过程得到了一个大样本的随机配置。允许的绝对判断模型性能,RMSE分布的均值计算的数据相同的方案。
而不是评估模型的性能通过使用常见的指标,如确定系数(
从三个模型结构类,有最小的减少中间RMSE预测误差下降和相关的类派生的区别是100%,剩下的两个类的总和。因此,三个类总是加起来是100%,不需要扩展或分对数转换。
四分位范围明显区分,而低粘土含量较高的砂含量22.8 - -41.7%和8.3 -18.7%甚至更高的淤泥的内容(图47.0 - -59.9%
土壤质地的箱线图。
根据最小锦葵的Cp,表现最好的模型沙(
%的空间分布的残差最大绝对剩余价值(红色=负值,绿色=积极的价值观,顶部)和莫兰
图
预测误差分布的RMSE四个随机森林模型的程序。
一般来说,变量选择和调优步骤的影响是相对较小的对所有反应。决策规则的应用导致的选择造型过程如下:砂和粘土含量,建模过程(1)被选中;关于泥沙含量,造型过程(3)被选中。
图
%的空间分布的残差最大绝对剩余价值(红色=负值,绿色=积极的价值观,顶部)和莫兰
图
旨在预测误差分布的RMSE四个提升过程。
决策规则的应用识别了造型过程如下:沙子,淤泥内容的过程(2)选择;(4)选择粘土含量的过程。完整的数据集的选择过程和使用符合最终的模型对含砂量导致了4050棵树,2250棵树为淤泥的内容,和粘土含量的950棵树。因此,Elith et al。(
%的空间分布的残差最大绝对剩余价值(红色=负值,绿色=积极的价值观,顶部)和莫兰
图
5倍旨在RMSE分布所选的建模过程。LM:线性回归;射频:随机森林;波:梯度增加。行参考箱线图的RMSE分布参数的均值数据作为预测模型。实线:中位数;虚线:上/下铰链;虚线:上/下胡须。
线性回归预测砂和粘土和随机森林预测粘土一般都比均值但仍重叠部分的RMSE分布的意思。唯一的例外是淤泥的线性回归,显然已经过度拟合。提高预测是优越的方法根据决策规则,在所有响应比的意思是,和显示几乎没有重叠的RMSE分布除了淤泥,尽管绝对差异的其他方法仍然较小。这与发现Viscarra Rossell和behren
提高模型被用来预测响应变量的全部民主党。泥沙模型是下降了,因为它提供了最小的减少中间RMSE预测误差。相反,泥沙含量是派生的区别100%,砂和粘土的和预测的每一个细胞。三个土壤质地类显示在地图的数据
土壤质地地图预测通过梯度增加覆盖hillshading从北,(一)含砂量,(b)淤泥内容,(c)粘土含量和边际依赖情节显示含砂量的预测因子的重要性(d)和粘土含量(e)。
块选择的预测提高边际依赖过程(图
粘土含量与海拔高度之间的关系(图
西蒙森(提出的概念模型
此外,山体滑坡的频率也可能导致粗颗粒大小在山坡上相比于山脊,因为他们倾向于离开脊不受影响,对边坡产生的肩膀,把低背坡地区日光和混合的视野视野在下坡的地区。解释,而粘土含量低的另一个原因可能是海拔越高,主砂的石头。然而,Ließet al。
应用造型设计是有用的,尽管交叉验证不允许推广应用于其他领域。同时这三种方法进行同样按绝对价值计算,提高显示所有三个反应变量性能优越,更精确地预测比均值在几乎所有的重复。线性回归在淤泥砂和粘土但overfitted表现良好的反应。因此建议测试修改线性回归建模设计,包括交互和使用其他指标比锦葵的Cp模型选择。随机森林没有overfit期望的数据,但只有的粘土模型超过了预测性能的意思。然而,即使方差解释为提高模型减少了旨在RMSE的意思只有5%左右。因此,DSM应用程序在热带山区仍然是一个挑战,即使在模型校准使用的区域,建议扩展预测土壤因素发展的套件除了救济功能。
最重要的预测模式高度依赖和山脊和山坡上的差异对比。高海拔的表土结构往往是粗,中在低海拔地区,和最好的山脊。预测结构模式可以解释为连续序列,造成了坡淋溶作用的细晶粒大小初始斜率的肩膀。根据这一模式岭地区不受这样的影响排序过程由于缺乏把水流。山体滑坡被认为增加晶粒尺寸在斜坡网站由于矿物混合土壤的视野。
作者宣称没有利益冲突有关的出版。