文摘
的高速发展人工智能、机器学习方法已经成为智能关键技术探索、开发和生产在石油和天然气领域。本文提出了一种工作流分析含油饱和度变化的主要控制因素,利用机器学习算法从实际水库基于静态和动态数据。生成的数据集在这项研究从468年井包括厚度、渗透率、孔隙度、net-to-gross (NTG)比,石油产量变化(口服脊髓灰质炎疫苗),水生产变化(小儿麻痹症)、含水变化(WCV),邻近液体生产变化(NLPV),邻近注水变异(NWIV)和含油饱和度变化(OSV)。数据处理工作流实施替代异常值和提高模型精度。总共10机器学习算法在数据集进行测试和比较。随机森林(RF)和梯度增加(GBT)优化和选择进行定量分析的主要控制因素。分析结果表明,NWIV OSV变量具有最高程度的影响;影响因子为0.276。提出优化措施的发展这类砂岩储层的主要控制因素分析的基础上。本研究提出了一种参考案例含油饱和度定量分析基于机器学习的方法将帮助油藏工程师做出更好的决定。
1。介绍
含油饱和度的变化是一个油藏工程师长期关注的问题。在中期到后期开发阶段,复杂的地质特征和不同的开发场景使含油饱和度变化更加复杂。影响含油饱和度澄清的主要控制因素是至关重要的优化发展计划。
有三个主要传统的测量方法,分析和预测含油饱和度。第一类是物质平衡方程方法,估计平均整个储层的含油饱和度基于储层地质数据和开发和生产数据(1]。邓等人开发了一个改善time-differentiated变量多个物料平衡模型来评估在水淹区残余油饱和度区分水涌入大量的位移过程。该方法的计算结果表明,残余油饱和度是在良好的协议与实验岩心分析结果(2]。Shahamat和克拉克森讨论了应用传统的流动物质平衡(FMB)分析单相或多相流在单一或多井场景,提出了一种新的综合FMB。发达FMB可以用来确定碳氢化合物的原始卷在常规和非常规储层(3]。拉赫曼等人提出了一个新的严格的物料平衡方程的可压缩气体流动形成和残余流体饱和度(4]。
第二类是核心分析和日志分析。实验室岩心分析是一种直接测量含油饱和度的方法。根据取心工具,核心分析分为常规取心(5,6],密闭取心[7,8),和海绵取心9,10]。张等人three-meter-scale核心间隔和取样计算含油饱和度指数通过x射线衍射分析,TOC分析和编程热解分析(11]。肖等人地质和地球化学特征的系统研究的第一个成员白垩纪勤加凹陷青山口组基于核心样品和核心分析(12]。日志记录是使用最广泛的方法,获得可靠的含油饱和度在油田13),特别是脉冲中子测井(14]。东等人研究了检测原则,模式,优势,脉冲中子测井工具的优缺点,建立了基于蒙特卡罗方法的形成模型,并分析了检测的灵敏度14]。聂等人介绍了一个新颖的含油量页岩油储层模型通过分析日志和核心实验数据和建筑之间的关系干酪根和不同测井疏包括核磁共振(NMR)孔隙度、中子孔隙度和密度孔隙度(15]。
第三类是油藏数值模拟,模拟了开发过程和计算关键参数(生产、注塑、饱和度等)基于地质模型。任和邓肯利用商业油藏模拟器来模拟有限公司2之二采油(有限公司2三次采油)。这些模拟探索含水层流动强度的影响,流动方向,毛细管压力油的性质和分布在残余油饱和度区(警察)16]。任和邓肯各种元素的影响进行了探讨:含油饱和度,模式,储层非均质性,并基于模拟渗透率各向异性17]。
近年来,世界已进入“工业4.0”的时代,所以有石油和天然气开发行业。机器学习也是广为人知的应用从大量的数据中提取的复杂的模式。机器学习是广泛应用于上游石油行业,比如生产预测和优化(18- - - - - -20.[]、地质建模、管理不确定性21,22),和连通性和异质性的特征23,24]。王等人开发了一种新颖的等概率基因表达式编程(EP-GEP)方法分析碳酸盐岩储层的产量递减。验证和比较表明,该方法优于传统的Arps模式在毁灭的准确性18]。刘等人提出了一个好的生产性能基于人工神经网络的预测方法。这种方法可以帮助工程师分析大量数据从非常规储层理解底层的模式和关系,尤其是在采油(采油)试点项目19]。妞妞等人建立了多参数综合智能预测方法岩溶帷幕灌浆体积(KCGV)基于支持向量机(SVM)。应用结果表明,该方法实现KCGV优良的预测性能,可以为现场提供实用和有益的帮助岩溶帷幕灌浆工程(20.]。康等人建立了一个分类模型,以确定合理的地质不确定性之间的适当的地质情况,利用机器学习方法包括支持向量机(SVM)、人工神经网络(ANN),和卷积神经网络(CNN)。结果表明,该方法生成更可靠的储层地质模型,成功地降低了不确定性情况(21]。杜等人利用深转移学习(迪泰)从训练图像中提取的特征(TI)的多孔介质来代替扫描过程中不同模式的TI多点统计方法。实验结果表明,该方法效率高,同时保留相似的特征与目标图像,缩短重建时间22]。歌等人开发了一个新的预测模型预测纵向非均质性的储层根据不同的深层神经网络算法。机器学习模型的学习能力和捕捉隐藏动态生产数据和储层非均质性之间的关系。应用结果表明,该模型在预测实现性能优良的异质性(23]。刘发明了一种机器学习方法来评估喷油器和生产者之间的连接性基于反向传播(BP)算法和卷积神经网络(cnn)算法在层间水库。模型的训练数据集包含动态生产数据在不同渗透率下,夹层倾角和注射压力。结果表明,CNN具有更好的预测性能比英国石油公司(24]。黄等人开发的长期短期记忆(LSTM)神经网络模型预测性能(25]。
先前的研究已经观察剩余油饱和度的分布和影响因素26- - - - - -30.]。这些研究主要集中在静态储层特点,如微观孔隙结构和非均质性。然而,他们未能结合静态地质资料和动态生产数据,进行定量分析和计算的主要控制因素。
在这项研究中,机器学习算法用于定量分析的主要控制因素,在注水过程中含油饱和度变化的中东水库。本研究分为以下部分。节2,我们简要描述地质特征、发展历史、布局,研究储层的动态生产性能。节3,我们提出本研究的工作流程。我们介绍详细的数据收集和处理,这是重要的和模型的基础培训。我们屏幕总共10机器学习算法适用于分析和展示他们的基本原则。此外,模型评价方法介绍了部分。节4,得到最优算法的比较和应用它们来计算影响含油饱和度变化的主要控制因素。最后,讨论和结论出现在部分5。
2。研究领域
研究领域(RM水库)是一个烈度背斜油藏位于中东-趋势,及其主要岩性为砂岩。沉积环境是浅海大陆坡沉积,大海,礁石,泻湖环境。RM水库开发储层连续性好,北方的物理性能比南部的一部分。岩心分析结果显示良好的孔隙度渗透率关系,平均孔隙度范围的10 - 15%和平均渗透率范围40 - 300。RM储层的地层厚度范围从10到60米,有效截面厚度范围从6到40米的单。目标储层开发了主要消耗了近40年;在2009年,它的石油日产量约200000桶依赖127开放的生产商。注水实施在这个水库2010年之后当地层压力迅速下降,导致关闭大量的生产商和产量下降。目前油藏生产大约150000桶。长时间的生产和开发积累了大量有价值的监测和测试数据,为应用程序提供一个坚实的基础的机器学习算法。 The current development of this reservoir is facing difficulties in evaluating the effect of water flooding and optimizing development measures.
3所示。方法
3.1。工作流
这项研究包括的具体工作流程如图4步骤1。第一步是数据处理包括变量选择、相关性分析和异常处理。训练模型,利用不同的算法是第二步。下一步是模型评价包括得分和比较不同算法模型。最后一步是定量计算含油饱和度变化的主要控制因素。
3.2。数据收集和处理
机器学习中最重要的组件的分析数据库,这是基本的造型。借助数据收集和处理,可以收集和大量有用的数据可以从不同的贵重物品之间的关系中获得有意义的见解。在这个过程中,不恰当的变量筛选出来,离群值删除,插入缺失值,建立一个集成的数据集对模型的训练。
影响含油饱和度的因素包括地质、油藏,工程,和其他人,如图2。本研究中的数据集建立和利用包含原始数据从468年井代表目标储层开发的实际情况。
静态地质资料包括地层厚度、渗透率、孔隙度、net-to-gross (NTG)比例。详细数据来自地震解释、测井解释报告,核心的分析和研究。动态生产数据包括石油产量变化(口服脊髓灰质炎疫苗),水生产变化(小儿麻痹症)、含水变化(WCV),邻近液体生产变化(NLPV)和邻近注水变异(NWIV),来自日常和月度监测。为了更好地分析含油饱和度的影响因素,我们也认为是邻近井的注入和生产的影响。我们的邻国关系定义为两个井直接相邻之间彼此没有任何好。邻近井和邻国关系的图在图所示3。含油饱和度变化(OSV)作为因变量也是研究中的关键参数。所有饱和度数据来源于生产测井测试(PLT)和储层饱和度测试(RST)报告。我们使用动态数据的变化而不是利率,因为变化可以反映在一段时间内的生产性能。动态数据的变化在这个研究等于饱和测试两者的区别。
在这项研究中,皮尔森系数来分析变量之间的相关性;计算方法见方程(1)。相关系数变化从1(负相关)到1(正相关)。当相关系数为0,这意味着没有两个变量之间的相关性。 在哪里是两个随机变量的相关系数 , 协方差,的标准偏差 ,和的标准偏差 。
热图的相关性分析结果如图4。在这个储层,孔隙度与渗透率有中度相关性和NTG很强的相关性,这表明NTG越高,孔隙率越高,储层属性越好。含水变化是很强的相关性与水生产变异,这是符合储层开发的物理定律。此外,含油饱和度变化与其他变量之间的相关性很弱,所以是不可能建立一个简单的线性模型来分析它们之间的隐式关系。
异常值的存在严重影响机器学习模型的性能,因此正确处理的异常值在提高模型精度至关重要。箱线图是一个图形化描述方法通过四分位数和平均的分布数据。数据集的箱线图显示five-number总结:最小值,最大值,第一四分位数( ),第三四分位数( ),和中位数。箱线图方法定义一个索引,四分位范围划分异常值(差);所示的计算方程(2)和(3)。评价指标模型的准确性是确定系数( ),和计算公式方程所示(4)。 在哪里和实际数据和预测。是数据的平均值。
这个数据集的概述和离群值分布如图5。水生产的三个变量变化(小儿麻痹症)、含水变化(WCV)和邻近的液体生产变化(NLPV)有一个相对高比例的离群值。有四种方法来处理异常值:忽略,意思是,中位数,和删除。“忽略”意味着忽略异常值没有任何处理。“的意思是”和“中值”是指替代异常值与平均值或中位数的值。“删除”意味着消除异常数据点。四种处理方法是三种算法的射频测试,GBT ADBT,结果如表所示1。使用中间值来代替离群值获得最高的训练和测试 。
3.3。机器学习算法
皮尔森系数只能简单地分析单个变量的线性影响含油饱和度变化。在油藏开发过程中,含油饱和度变化是受多变量非线性的影响。为了阐明每个变量的贡献在含油饱和度变化,机器学习方法是用来生产定量分析。
在这项研究中,共计10机器学习算法选择和用于开发基于数据集的回归模型。这些回归模型可以用来分析因变量之间的隐藏关系“含油饱和度变化”和独立变量和量化特征变量重要性(影响因子)。这10个算法包括合奏算法(随机森林、演算法、梯度增加),线性回归算法(线性回归、多项式回归、套索,岭回归,和弹性净回归)、支持向量机、多层感知器。
随机森林(RF)是一个集成学习算法用于分类和回归和由决策树(31日- - - - - -33]。在分类或回归过程中,射频的输出是基于其内部决策树的输出值。射频优于决策树由于能够避免过度拟合。射频具有以下优点:(我)它卓越的精度在当前算法(2)它能有效地处理大数据集和成千上万的输入变量降维(3)它可以处理缺失数据的数据集和维护数据的准确性在很大一部分失踪(iv)它可以计算估计的变量分类的重要性
自适应提升或演算法(ADBT)是一种迭代算法,列车不同的弱分类器相同的训练数据集,然后这些弱分类器结合形成一个更强的最终分类器(34,35]。ADBT分类器精度高,不容易过度拟合。
梯度增加(GBT)是一种基于提高技术的分类和回归方法(36,37]。GBT的核心理念是培养新添加的弱分类器基于负当前模型损失函数的梯度信息,然后将训练弱分类器集成到现有的模型以积累的形式。在每个迭代中,GBT首先计算当前的负梯度模型在所有样本,然后火车一个新的弱分类器以适应负梯度与这个值,并计算出弱分类器的重量来更新模型。与演算法只使用指数损失函数相比,GBT可以使用任何可微的损失函数,所以GBT可以应用从二进制分类回归和多类分类。
至少绝对收缩和选择算子(套索)是一种回归分析方法进行特征选择和正则化同时提高准确性和可解释性38- - - - - -40]。套索使用L1正规化,这将使一些学习特征权值0,以便实现稀疏的目的和特征选择。
岭回归是一个带有偏见的估计回归方法致力于共线性数据分析(41,42]。它本质上是一种改进的最小二乘估计方法。岭回归获得更现实的放弃缺乏偏见回归系数的最小二乘法和代价是失去的一部分信息,降低精度。岭回归的拟合异常数据比最小二乘法。
弹性净回归(ENR)是一个混合的岭回归和套索。全球是一个线性回归模型训练使用L1和L2正规化作为先天的正则化项(43,44]。
支持向量机(SVM)是一种监督学习算法用于分析数据,分类和回归。SVM建立在高维空间做出良好的分离超平面的最大距离最近的数据点(45- - - - - -47]。
多层感知器(MLP)是一个完全连接多层前馈神经网络。中长期规划的基本结构由三层组成:第一个输入层、隐层,最后输出层。每个节点是一个神经元,它使用一个非线性激活函数。这使延时处理复杂的线性不可分的数据(48,49]。
线性回归(LR)是一个使用最小平方函数的回归分析模型的一个或多个自变量和因变量之间的关系(50]。
多项式回归(PR)被认为是一种特殊形式的多元线性回归。公关塑造一个独立变量之间的非线性关系和因变量作为一个th多项式在(51]。
4所示。结果
4.1。不同的算法的精度比较
上述10算法一直在训练和测试相同的数据集进行处理。最好可以通过多个算法的横向比较中筛选出来。训练和测试10算法如图的表演6,详细的值如表所示2,实际价值的交会图和模型预测的值在图所示7。
随机森林(RF)和梯度增加(GBT)明显优于其他算法。这两个准确捕获数据集的特性,符合得很好。演算法(ADBT)测试处理中表现良好,但拟合模型训练中获得较低。支持向量机(SVM),多层感知器(MLP),线性回归(LR),至少绝对收缩和选择算子(套索)排在中间。多项式回归的拟合效果(PR)很差,和交会图提出了一种不同的形状,如图7。弹性净回归(ENR)和岭回归是完全不适用的数据集。
相比之下,更高级的集成学习算法打败了传统回归算法。射频和GBT利用定量分析含油饱和度变化的主要控制因素。
4.2。主要控制因素
射频和GBT用于计算每个变量的影响因子OSV,如图8。“平均”的意思是射频和英国达人的结果。邻近的注水效果的变量对OSV最高程度的影响,这是符合目标油藏的开发动态2010年之后,如图9。它显示了积极的效果,在这个储层注水。
渗透率和石油产量分别排在第二和第三,的重要性,这也是符合储层开发的法律。邻近的液体生产变化排名第四,表明完成注采井模式是必不可少的提高原油采收率和挖掘剩余油的潜力。
分析结果的基础上含油饱和度的主要控制因素,提出优化措施的发展这种砂岩储层。(我)继续实施注水开发,建立有效驱替系统,密切监控生产商的性能。储层饱和度测试(RST)和生产测井测试(PLT)需要进行监测含油饱和度变化,防止水突破(2)地区的高导磁率,优化注采井模式填入井和他人挖掘剩余油的潜力(3)在低渗透或贫穷的地区特性,储层改造措施如水力压裂和低盐度等三次采油措施可以应用注水
5。讨论和结论
机器学习是一个数据驱动的分析方法。它可以处理大量数据和澄清隐藏变量之间的关系。这两个传统方法无法定量计算影响因子影响含油饱和度的影响。本研究的主要优势是,所有数据机器学习所使用的分析来自实际的砂岩储层。机器学习领域已广泛应用于石油和天然气开发,但并不是所有的算法都是非常适用的。本研究的目的是通过比较和选择合适的算法测试10个不同的机器学习算法,充分利用油田实际数据,并进行定量分析的含油饱和度的主要控制因素。本研究可以为进一步的研究提供了强有力的支持,是整个储层含油饱和度分布通过开发的神经网络模型。
本文提出了一种方法,分析含油饱和度变化的主要控制因素。实际静态地质资料和动态生产数据收集机器学习来建立分析模型。具体结论如下。(1)建立了一个数据处理的工作流程,包括相关分析和异常处理。中位数法最成功的异常处理方法(2)10和测试机器学习算法相比,射频和GBT获得最优算法和模型的精度最高(3)含油饱和度分析模型建立了使用射频和GBT算法,和主要控制因素进行定量计算。NWIV是最重要的因素,影响因子为0.276(4)变量的排名优化水库发展提供建议的基础。工作流也是一个先进和复杂的数据分析方法,它提供了一个基础,随后建立神经网络饱和度预测模型(5)继续实施注水开发,建立有效驱替系统,密切监测井,防止水的性能突破
数据可用性
手稿是一个独立的数据条;整个数据用于支持本研究的结果包括在本文中。如果需要任何额外的信息,这可以从相应的作者要求(电子邮件保护)。
的利益冲突
作者宣称没有利益冲突有关的出版。
确认
作者感谢的支持中国的国家自然科学基金(批准号51974357)。