文摘

面向问题的预测不稳定地改变单一的注水油藏的油井生产,机器学习模型基于CNN(卷积神经网络)和LSTM(长期短期记忆)建立实现精确的预测每月的单井产量。本研究考虑60多个动态和静态因素,影响油井生产的变化,注水参数引入到数据集,选择11个主要控制因素,然后建立一个CNN-LSTM贝叶斯模型优化的优化。验证了该模型的有效性在一个现实的水库。实验结果表明,该模型的预测精度超过90%,这表明悔罪的应用程序在一个广泛的应用范围。生产预测开发模型很简单,高效,准确,可以提供一个指导注水油藏的动态分析,和工作作为一个好的参考的其他类型的水库的开发和生产。

1。介绍

石油产量预测贯穿整个技术推动油田的发展历程;好刺激的基础和投资决策中发挥着重要作用。很长一段时间,主要生产油藏数值模拟预测方法、机理模型,和递减曲线分析各自的优点和缺点。自1990年代以来,模糊综合评价(FE), BP神经网络(摘要),灰色模型(GM),和其他方法已经应用于油田生产预测(1,2]。最近,大数据的成熟和广泛应用,人工智能,和其他技术的理论和方法,越来越多的智能算法引入到石油工业,提供一种新的方式来解决复杂的工程问题(3,4]。

非线性拟合方法,机器学习可以学习规则从数据并作出预测。在过去的20年里,已经有大量研究生产预测基于机器学习。常见的方法包括随机森林(RF)、支持向量机(SVM),模糊综合评价(FE),人工神经网络(ANN)和集成自回归移动平均模型(ARIMA) [5- - - - - -14]。这些经典的机器学习方法充分应用在石油工业领域,显示出强大的生命力。

y Duana等人使用RTS(劳赫东Striebel)光滑的天然气生产系列,然后,建立了ARIMA模型预测的天然气生产6]。j .顾等人提出了一个油井产量预测模型相结合ARIMA和卡尔曼滤波器消除nonsynchronicity和滞后的影响7]。越南阮黎等人提出3 ANN模型预测参数为双曲线下降然后可以生产状况(13]。y朱等人建立了一个“ε支持向量机“生产预测模型基于序列最小优化算法(SMO)使用生产记录和井底压力数据(14]。

自2015年以来,复发性神经网络由长期短期记忆(LSTM)和封闭的复发性单元(格勒乌)成为一个新的热点领域的生产预测(15- - - - - -22]。

l .张等人提出了一个GRU-FNN模型来预测水驱油田单井产量(23]。x歌等人采用粒子群优化(PSO)优化LSTM模型的基本结构,取得了更好的模型性能(24]。维斯应用模糊排名和神经网络建立预测石油产量的相关性(25]。h·王等人建立了一个为高含水油田产量预测模型考虑基于LSTM时机和工程因素和增加了17项输入功能,相对误差只有1%26]。Sagheer等人相比简单RNN的应用效果和LSTM石油和天然气产量预测,证实LSTM有更好的性能比简单RNN [27]。

所有上述预测的研究是相当准确的,但仍有进一步改进的空间。首先,大部分的作品旨在预测储层或油田的总产量,一些研究集中在单井生产预测。事实上,准确预测单井的生产是不容易因为单井生产更不规则的波动和更激烈的比块/水库生产。此外,有太多的因素影响单井产量,我们很难分析清楚。其次,在大多数研究,生产系列基于时间分为3段,前面的一个培训,中间一个用于验证,和最新的一个测试。然而,我们都知道,油田、油井的生产变化有明显的阶段,早期阶段,中间阶段和后期阶段有不同的主导控制因素或规则的变化。在早期学习规则和预测生产后期的变化必然会导致错误。最后,很少有研究考虑时间序列预测的动态和静态特性。基于这些考虑,达到准确预测水驱油田单井生产,数据集建立了考虑超过60的地质及开发因素影响油井产量。注水对石油生产的影响也量化和添加到数据集作为一个特性。 The missing data are filled in accordance with the industry knowledge and the distribution pattern of data. Secondly, the feature correlation analyses tailored to time series prediction are carried out, through which 11 dominant control factors of oil well production are selected to build the samples. The production prediction model is established based on a one-dimensional convolution neural network and a long short-term memory neural network, and the model hyperparameters are optimized by Bayesian optimization. Finally, an example numerical test is carried out in a practical reservoir. Results show that the CNN-LSTM model has better performance compared with the Bi-LSTM model, Attention-LSTM model, or any other models. Production forecasting by the developed model is simple, efficient, and accurate, which can provide a guidance for the dynamic analysis of a water flooding reservoir and work as a good reference of the development and production of other types of reservoirs.

2。方法

2.1。LSTM和Conv1D

LSTM(长期短期记忆)最成功的递归神经网络(RNN)。其独特设计门的结构和细胞状态可以捕获长期依赖关系,这也是其成功的关键。如图1不同于其他简单RNN单位,盖茨在LSTM细胞单元有三种:忘记门,输入通道和输出通道。在每个时间步,LSTM部分细胞会将信息传递给下一个步骤和保留一些信息在细胞的细胞状态,即LSTM达到长期记忆的关键。LSTM神经网络时间序列预测领域的表现良好(28]。

Conv1D(维卷积神经网络)是著名的在图像识别领域,但近年来,人们发现维CNN (Conv1D)可以完成这项任务的时间序列预测,甚至优于LSTM等时间序列预测模型在某些情况下。Conv1D用于时间序列预测时,输入, 时间的步骤与 特性,可以被视为一个图像的大小 ,和Conv1D可以从输入数据中提取一种新的图像扫描和计算在一个方向上。改变过滤器和卷积核的大小,我们可以很容易地控制输出(参见图的大小2)。应该注意的是,卷积核Conv1D也是二维的,但是它只能在一个方向滑动窗口,这是Conv1D和二维卷积神经网络的区别。

2.2。斯皮尔曼相关系数

斯皮尔曼相关系数,也称为等级相关系数,可以测量两个特性之间非线性关系的程度,是一个方法来分析两个变量之间的相关性。斯皮尔曼相关系数计算的

是负的,这意味着两个特性有负相关,一个功能增加意味着其他减少。类似地,如果 是正的,这两个功能呈正相关。绝对值越大,两个特性之间的相关性越强。

2.3。贝叶斯优化

誉为最好的hyperparameter调优算法现阶段,贝叶斯优化一般非常全局优化策略,可以一套好的hyperparameters认同一些迭代。它适用于两种情况:(1)目标函数非常复杂而耗时的评估;(2)目标函数是很难区分的独立变量。

在每个迭代中,贝叶斯优化优化问题分解成多个小的优化问题。这样品原始函数曲线通过一定方法和构建一个替代曲线拟合这些点。贝叶斯优化构建一个模型来描述parameter-distribution使用高斯过程模型的目标函数,然后解决了替代模型的最小值,并使用这个最小值作为原始函数的最优解的迭代。这个过程称为代理优化。通过逐渐增加采样点的数量,该模型将逐渐接近原始目标函数,和hyperparameters将获得一个最优组合。

本文使用贝叶斯优化优化hyperparameters网络模型,包括网络深度和宽度,最初的学习速率和网络激活功能。所有hyperparameters优化,一个最大值和一个最小值首先被指定,分别。基于贝叶斯优化方法在包Keras_tuner、适当设置最大迭代和优化目标,然后执行hyperparameters的获得最优组合。

3所示。工程数据处理和特征

3.1。数据的来源

这篇论文使用的数据收集从426年94年的油井和水井在中国水库命名406个月的平均生产时间。最古老的井数据集可以追溯至1956年。在水库超过60年的发展,经历了各种生产方法如泵生产、注水生产,压裂生产。目前,水库已经进入了超高含水阶段,平均含水率超过95%。

初始数据包括每月426油井的生产数据,每月注射数据94注水的井,单井储层信息。具体项目见表1

3.2。数据预处理
3.2.1之上。填充

本文的大部分缺失数据是井底流动压力,储层静态压力,或动态液位高度。根据自己的特点,我们用不同的填充方法,以及作为一个例子来说明。(1)储层静态压力

根据油田开发的经验,在油田开发过程中静压的变化不显著,可能有一个明显的趋势;因此,回归拟合方法可能是有用的。通过使用现有的数据回归分析,静态压力和时间之间的关系,和失踪的静压数据计算,如图3(一个)(2)井底流动压力(FBHP)

3 (b)显示在井的井底流动压力变化的生产生活阶段,和FBHP的范围在不同的阶段会有很大不同,这限制了拟合回归方法的应用。在本例中,我们使用三次样条插值,并填充结果如图3 (b),这与实际值分布基本上是一致的。(3)动液面

工作液面和FBHP高度相关(见图3 (c)),我们可以很容易地获得两个特性之间的线性关系,和一个可以从另一个计算。如果工作液面高度或井底流动压力可用,使用三次样条插值。

3.2.2。编码

由于很大一部分静态数据集的分类特征,分类的一个炎热的编码过程特性应和谐数值特征和类别特征。处理该操作的功能包括单位、层,以及类型和生产计划。

3.2.3。注采关系的测量

一个主要的因素影响生产水力驱动油藏的油井注水措施。在本文中,我们提出了参数 ,生产井 注入体积月 ,并将其添加到数据集作为一个功能“注入”。

如图4石油/生产井通常所控制 水/水力喷射井。我们假设一个注水有一定的辐射半径,在水井周围的辐射半径,在半径是影响油井注水,距离越小,影响越大的注入井生产井,和更大的生产井注入体积。生产井注入总额等于所有的叠加影响水力喷射井”。

根据这个假设,我们可以量化生产井注入体积,如所示

在这里, 表示生产井 , 表示水力喷射好 , 表示数量的注水影响生产井井 和生产井之间的距离 和水力喷射 个月, 单位的水被注入储层注水

辐射半径是由相关分析:辐射半径越接近实际的辐射半径,相关性越高生产井注入体积和油井产量。通过建立辐射半径和相关系数之间的关系,我们可以找到最优的辐射半径。如图51000米是最佳的辐射半径。在这个半径下,生产井注入体积计算在一个特定的时间和特定的生产井和添加到数据集特征“注入”。

3.3。工程特性
3.3.1。特征降维

压缩为更好的预测精度,特性是需要改善的质量特性和限制特征的数量。在压缩的过程特性,静态特性和动态特性分别需要治疗,所以是离散的特性和连续特性。否则,静态特性代表个别井的特点将淹没在不断变化的动态特性。同样,高度稀疏的0 - 1功能由一个炎热的编码也会淹没在不断变化的数值特性。在本文的数据处理工作流程(图6),我们第一次单独的动态特性(特征随时间变化),如表所示1。总共有11个没有降维动态特性。其次,我们区分0 - 1的特性和静态特性进行主成分分析(PCA)降维(95%)的信心;压缩之后,剩余的数值特性由另一个PCA模型(95%)的信心,和拼接,形成两套压缩特性的特性没有编号。没有。32(见图7最后)。

3.3.2。特征选择

在以前的研究中,相关的分析与时间序列通常在同一时间进行一步的生产预测;这种相关性之间的关系是当前月的产量和当前月的流动压力(或其他特性)。这种关系可以反映目标和变量和变量之间的关系和变量。然而,仍然有一些松散的地方:数据用于预测不是当前月份的数据,但之前的数据 月,这意味着,如果我们想要得到一个更准确的相关系数,计算还应该进行目标月的输出和输入之间的数据用于预测它(见图8)。

这项研究需要的输入长度12和12的输出长度(使用前12个月的数据预测未来12个月生产)作为一个例子来说明这个问题。

7显示的可视化结果斯皮尔曼相关系数之间的输入和输出。图7(一个)显示12平均产量之间的相关系数 个月和 在过去 个月:

在这里, 表示之间的斯皮尔曼相关系数 ; 表示的生产 个月; 表示 th特性; 表示 在过去 个月。

7(b)展示了生产之间的相关系数在接下来的1月,在过去的特性 个月。当某一特性是固定的,从左到右,网格图的颜色7(一)逐渐变浅,和网格图的颜色7(b)逐渐变得黑暗,这意味着更大的输入和输出之间的时间间隔,降低它们之间的相关性,预测的难度就越大。

一行一行地观察,我们可以很容易发现动态特性与未来产品有更强的相关性比静态特性,它可以很容易地解释说:相关系数在一定程度上取决于样本的相对价值的变化特性。与生产仍然改变随着时间的推移,静态特性只从好到好,所以整体相关性较弱。我们还注意到预期目标(生产)有很强的autocorrelation-future生产与过去的产量远远超过任何其他特征(0.9),这意味着预测价值将在很大程度上取决于过去的生产数据。

减少模型拟合的难度,加快收敛,并消除无效的特征,特征选择,如图7(c):±0.2作为阈值, 或≤−0.2将被保留,最终进入11特性的数据集,它们之间的相关性如图9。我们可以发现,每月水生产液体和月度生产之间的关系,远比每月月度石油生产和液体之间的生产,确认了块已进入超高含水阶段,和大多数的液体是水。

3.4。样品一代

在生成输入样品之前,我们需要标准化数据,这样不同的特征有相同的规模,他们将有一个公平的机会来学习模型。在介绍中提到的,为了使模型学习生产规则的变化在每个生产阶段,我们把数据集水井:341口井构成模型的训练集训练、43井组成验证集hyperparameter优化,和42井构成了模型试验的测试集。样本由滑动时间窗口和重新排列以达到更好的培训效果。

4所示。模型设计和评估

4.1。评价指标

在本文中,为了评估模型的预测性能全面,五个评价指标用于评估模型,如表所示2。值得注意的是,以减少可能带来的不确定性模型的随机性,本文模型评价结果都是平均的3实验在相同设置。

4.2。模型结构设计

经过广泛的调查和比较实验,LSTM和CNN选择建立一个混合模型。CNN是堆叠首先,特征提取的能力使模型中提取尽可能多的隐性知识。CNN层后,我们堆LSTM层模型,希望可以学习更好的时序的变化。此外,该层LSTM层之间的规范化使用,防止可能的灭绝梯度和梯度爆炸。

本文使用贝叶斯优化优化hyperparameters和结构模型。由于有限的空间里,只有结构和hyperparameter优化的结果(CNN-LSTM)提出了最优模型,如表所示3

4.3。比较模型

有8个选择模型为最优模型,如下所示:

CNN-LSTM: Conv1D特征提取。LSTM时序捕获(29日,30.]。

LSTM:古典LSTM模型。

Bi-LSTM:正常LSTM模型只能学习的信息,但不能捕捉信息回到前面。双向LSTM是这方面的改善。它结合了LSTM向前和向后LSTM捕捉向前和向后的信息在同一时间(31日,32]。

格勒乌:格勒乌是LSTM品种之一,也许是最成功的一个。它简化了三个门LSTM细胞结构为两个,几乎可以达到相同的预测精度LSTM而大大加快收敛(23]。

有线电视新闻网:一维卷积神经网络时间序列预测模型(33]。

Attention-LSTM: LSTM模型补充的注意机制在希望的注意机制模型可以帮助更好的捕捉到关键时刻步骤可能包含关键信息生产的变化。本文采用陈德良注意力机制,“将军”得分函数。关注多个步骤,而不是一个时间,我们修改重量激活函数“乙状结肠”[34- - - - - -36]。

Self-Attention:不要使用RNNs或cnn,多线程Self-Attention机制用于实现时间序列的预测。模型的结构是指伯特(37),但字嵌入和嵌入位置下降,和激活函数采用“乙状结肠”[38]。

ARIMA:最常见的一种时间序列预测模型。

值得注意的是,上述模型的hyperparameters也获得的最综合的贝叶斯优化。

4.4。训练集

选择神经网络的输入特性以及生产记录一定时间,和模型训练的“监督”的方式与未来生产的输出。在这种情况下,模型的输入每一步包括历史生产连续82个月/特性数据;输出是生产在未来3个月。

在培训过程中,模型基于encoder-decoder使用“老师迫使“混合训练策略35),60%的输入数据中的每个时间步译码阶段是真实数据,另40%是先前模型的预报值的输出。这种混合策略可以防止过度拟合迅速趋同造成的同时确保模型的预测精度。通过实验,”Adagrad”被选为模型优化器。批处理和最初的学习速率的大小设定在36和0.05,分别。回调函数ReduceLROnPlateau是用来调整学习速率。最大的时期是150;训练过程是由回调函数控制EarlyStop。和模型预测生产的损失是美。

5。结果与讨论

5.1。讨论不同的模型

在8模型提出,CNN-LSTM模型实现最佳性能,和其他模型的预测性能图所示10和表4

结果表明,注意机制模型的预测精度(包括self-attention机制)是最坏的打算。在许多论文,注意机制提高了时间序列预测的分数(32,34- - - - - -36]。然而,这并非如此。事实上,在一个月的生产并不严重依赖于一个或多个特定的前几个月,所以增加权重不同的时间步骤不是很有用的预测。此外,添加关注机制大大加剧了训练模型的负担,这是另一个可能的模型的预测精度低的原因。

Bi-LSTM模型还未能达到预期的分数,和它的表现略逊于古典LSTM模型。与语义识别任务,如机器翻译,改变油井生产系列的订单预测产量无显著差异,和使用Bi-LSTM无疑带来了更复杂的模型结构,制作模型训练更加困难。

格勒乌和CNN模型获得相似的结果,比LSTM LSTM模型有更高的精度,但应该注意的是,格勒乌的训练时间和CNN是LSTM的近一半。格勒乌或CNN模型在一些不太受青睐的情况下可能更合适。

5.2。讨论模型输入的长度

摘要CNN, LSTM CNN-LSTM模型被用来进行对比实验,分别和验证不同的输入长度的影响模型预测误差,如图11

很容易看到,CNN模型的性能优于LSTM CNN-LSTM当输入长度短。然而,随着输入长度的增加,CNN模型的预测误差也显著增加,而LSTM CNN-LSTM减少。与CNN和LSTM相比,CNN-LSTM模式似乎来自继承优势,比LSTM在短的情况下,在长期情况下比其他两个。考虑数据特征、案例需求,和模型性能,下面的示例使用84个月的每月数据预测未来三个月生产。

5.3。特征选择的讨论

特征选择的有效性,验证两个特征选择计划被用于特征选择实验。计划一:输入所有功能;B计划:输入选择功能。每个模型使用不同特性的预测精度如表所示5

发现功能和算法有交叉影响模型的预测精度。RNN模型具有较强的敏感性特征的数量,和选择的数量特性可以减少预测误差。与卷积模型层数的变化不敏感的特性。从表可以看出5没有多大差异,模型预测精度之前和之后的特征选择。分析表明,RNN (LSTM /格勒乌)模型是更倾向于捕捉样本时间序列的连接,而卷积结构模型是更倾向于分析和提取高维特性。因此,在特征选择LSTM模型意味着一部分特征提取工作之前已经完成模型的训练,从而降低LSTM训练的难度,所以LSTM模型具有更高的预测精度数据集用更少的特征。CNN本身可以很好地实现特征提取和特征选择只有加快训练速度,但对最终的预测精度影响不大。

5.4。案例验证

拟议的模型被用来预测43井的生产在测试组,随机选择6井的结果。结果如图所示12

数据12(一个)- - - - - -12 (c)比较的三个输出的预测误差模型与井B, C, D为例。显然,1日输出最小误差与相关分析一致。

数据12 (d)- - - - - -12 (f)比较不同模型的预测结果井E, F, g .类似结果见表4CNN-LSTM模型的预测更接近真正的趋势,但其他模型也可以密切配合曲线。另一个明显的现象是,在更早的时间阶段的预测相比,后者更糟糕的;换句话说,错误在高产量大于错误在低产量。这是因为生产更戏剧性的变化发展的初期阶段。

大量实验表明,提出的方案极大地提高了生产预测精度和提高预测效率。

6。结论

本文提出一种机器学习模型预测水驱油藏单井产量。具体结论如下:(1)60多个因素的地质和开发影响油井生产的变化被认为是全面构建数据集。数据填充和特征提取,分别根据数据的特点。特性进行了分析,从时间序列的角度选择。数据集除以井使样本分布更实用(2)8在时间序列预测模型具有良好的性能。相比之下,CNN-LSTM模型获得最好的得分,而注意力机制的改进和Bi-LSTM模型是有限的。这也说明复杂的模型,在其他任务可能并不适合油井生产预测(3)使用贝叶斯优化优化模型的hyperparameter,这可以极大地提高hyperparameter优化的效率,提高模型的预测精度(4)一个实验案例进行水库,结果证明本文提出的模型可以成功的完成单井产量的预测任务,提供了一个很好的参考和指导注水油藏的开发和生产

数据可用性

手稿是一个独立的数据条;整个数据用于支持本研究的结果包括在本文中。如果需要任何额外的信息,这可以从相应的作者要求(电子邮件保护)

的利益冲突

作者宣称没有利益冲突有关的出版。

确认

作者感谢的支持中国的国家自然科学基金(批准号51974357)。