文摘
在所有数据中,政府统计在社会经济活动中起着极其重要的作用,而外部因素的不断变化带来新的挑战政府的统计数据和统计数据的质量有很大的影响。经济的快速发展和市场经济体制的成熟,政府统计数据来自各行各业的需求变得越来越激烈。为了有效改善宏观经济流出预测的准确性,进一步安全经济生产,加权最小二乘支持向量机(二)优化与免疫遗传算法(IGA)提出了构建一个宏观经济流出预测模型。的非线性、时变和经济流出系统的复杂性,提出了一种新的加权策略函数改进回归模型,然后介绍了IGA优化改进为生物与内核参数δ和正则化参数γ。最后,一个使用经济出现数据进行实验分析从经济历史。结果表明,使用预测模型的最大相对误差为2.763%,最小相对误差为0.705%,平均相对误差为1.3298%,模型具有更快的收敛,更强的泛化能力,预测的准确性高于其他预测模型。
1。介绍
转变经济发展方式和需求结构的不断变化,中国经济系统逐渐向市场经济体制、和主题的利益变得越来越多元化(1]。个别指标的准确性已不再是唯一的标准来评估数据的质量,和不同宏观经济统计指标的数据应该在相互协调关系2]。出于这个原因,学术界和政府统计部门增加了统计数据质量评估方法的探索从数据的角度协调(3]。
政府统计数据质量的准确性直接关系到国家宏观调控和各经济实体的发展战略的正确性,但中国政府统计数据的质量一直是社会经济活动的核心主题和统计工作,并已被国内外许多学者关注,成为一个困难的问题在统计领域(4]。除了影响经济活动,政府统计数据的质量也直接反映了政府的公信力5]。准确、全面、快速、有效的统计信息可以提高政府的信誉和发挥非常重要的作用,公众获取信息和正确的决策6]。
近年来,中国的经济经历了前所未有的持续快速增长,随着中国的经济实力和国际影响力继续增长,宏观经济统计数据质量作为衡量经济发展也吸引了人们的广泛关注国内外[7]。然而,国内外学者以及来自各行各业的人不断质疑中国的主要宏观经济数据8]。为了使大多数的数据用户更好地理解中国的宏观经济数据,并进一步使中国的宏观经济统计数据与国际标准和提高他们的国际可比性,本文认为有必要尝试进行深入、系统的评估数据质量的五个主要宏观经济指标的中国从一个新的角度9]。本文认为,有必要尝试进行深入评估数据质量的五个主要宏观经济指标,中国从一个新的角度,得出相应的结论,为未来的经济决策提供一定的参考和数据用户带来便利10]。
吴和宁(2018)指出,自1998年以来在中国发布的官方GDP数据被怀疑高估和偏见比统计技术困难,造成的错误,官方的GDP增长率并不能反映真实的经济效益,并提出了一个真正的评估的经济增长在中国11,12]。布兰查德(13)评估从1990年到2000年中国能源统计的质量基于假设能源数据应该是连贯的不同项目之间在能源数据,得出的结论是,数据在1990年代早期相对准确和可靠的,但质量的数据1990年代中期以来已经下降。古普塔和Kabundi14选择10核心宏观经济指标和评估GDP数据的准确性通过构造一个固定后果变量拦截模型,运用面板数据从1984年到2001年在中国28个地区。发现该地区没有发现依据长期GDP数据中的错误的整个研究期间1984 - 2001。Sagaert et al。15构造一个基于计量经济模型 - - - - - - 生产函数和选择相关指标数据从1978年到2004年GDP评价的准确性通过计算库克和W-K等传统的统计数据,计算得到的有问题的1978年GDP数据,1984 - 1986年和1991年。一个et al。16)数据质量诊断方法构建了一个基于健壮MM估计的基础上 - - - - - - 生产函数和评估从1978年到2008年中国GDP数据的准确性和得出结论,中国GDP数据是相对可靠的。
总结了国内外文献,发现模型的估计方法,大多数学者仍然使用普通最小二乘法估计模型参数;然而,OLS回归是容易受到影响的几个数据集内的异常值;因此,模型估计结果不准确,根据获得的残差拟合模型无法检测所有异常值(17]。近年来,统计学家已经开始注重稳健估计方法,建立数据质量评估模型基于稳健估计方法,可有效解决多个异常值的缺点掩盖经常发生在OLS方法。
2。相关工作
尽管外国对宏观经济学的研究已经相对成熟,国内宏观经济研究是相对罕见的,并没有系统的介绍和相关领域的研究,和大多数文献只是一个简单的介绍宏观经济学和简单的应用程序领域的审计。这表明国内学者的法律并没有引起足够的关注,并与国外仍有相当大的差距。
的评估审计的财务数据的质量,Azis et al。18]给出了宏观经济学的起源和意义,然后使用大学的年度财务数据来说明如何使用宏观经济评估数据,分析表明,前两个数字的数据可以更准确的结果只有第一个数字数据的分析,最后总结了使用宏观经济学领域的审计的具体步骤(19]。从日常经验的注册会计师,Excel工具的帮助下,发现中国上市公司发布的主要财务数据很好地符合宏观经济、和数据不符合本法只能表明欺诈的迹象,为审计人员提供强有力的证据来检测金融欺诈。Forrester (20.)简要地总结了宏观经济学的应用在安全市场,紧随其后的是一个详细的描述在本文描述的示例选择,最后拟合优度检验宏观经济和统计测试适用于调查是否存在人为操纵利润的年度会计报表净利润的3570家上市公司2000年至2002年在中国上海和深圳证交所。McAlinn et al。6)识别欺诈行为在中国审计财务状况和现有的国外经验适用于审计研究。罗西和Sekhposyan8)解释了宏观经济学领域的审计的范围和步骤,指定如何通过实际的财务数据,运用法律,表明计算机相关软件可以用来分析数据是否符合宏观经济。Zheng-wan et al。11]表明,随着现代信息技术的发展,审计模式已经演变成一个基于数据的审核,然后介绍了宏观经济学的基本原理、使用条件和步骤的分析。吴和宁12]介绍了宏观经济学的含义及其使用的范围和建议,宏观经济学是一个有用的补充审计抽样技术的基础上,分析审计抽样的缺点。宏观经济学和相关系数的季度和年度财务数据结合资产负债表和损益表的上市公司,和Excel软件是用来检查上市公司财务数据的真实性。
从上面的文献综述,可以看出研究宏观经济学在中国开始在国外价格相比相对较晚,并且更广泛、更深的研究在国外已经进行了。根据现有的研究在中国,大多数的文章只关注存在的欺诈和人工操纵财务数据领域的审计。
3所示。宏观经济统计数据质量的诊断
3.1。趋势诊断方法
现有的趋势诊断方法评估之间的数据通过计算错误率之间的协调的实际统计值解释变量并根据获得的估计价值模型,如果错误率超过允许误差范围的设置本身的数据在这一时期被认为是不一致的,和这个数据的可信度值得怀疑。具体公式如下: 在哪里代表了错误率,代表实际的统计值,代表了估计价值。
通过阅读大量文献,发现统计学家普遍认为宏观经济数据估计是怀疑当他们偏离实际值5%以上。在本文中,基于之前的研究,最大限度的错误率也设置为5%。
3.2。统计诊断方法
稳健回归本身使评估结果更耐异常值,减少异常值对估计结果的影响,当有异常值的数据集,但它也可以识别异常值的类型和数据质量的诊断通过健壮residual-robust距离诊断情节(RR-RD诊断图)。RR-RD诊断图的纵轴是标准化的健壮的残差 ,水平轴是健壮的鞅的距离在独立的变量 - - - - - -空间。
在方程(2),均值向量和协方差矩阵鲁棒估计从MCD估计获得抵抗异常值对估计结果的影响,然后呢指的是在模型中解释变量的数量。
基于RR-RD诊断图,它不仅是可能的诊断数据点是离群值,还识别异常值的类型。在纵轴上,在残差服从正态分布的假设下,该数据点可以视为局外人的角度如果 或 , 。的 ,最大的距离是2.24允许偏离的地方方向,在后面的小节中最大允许偏差距离。在横轴上,这些数据可以被认为是一个异类边如果 (是模型中解释变量的数量),这个健壮的距离被认为是过度的。RR-RD诊断情节将数据点划分为四类。
和对正常的值都很小,又大又是纵向离群值小,和都是大坏杠杆点,很小,充分的利用是大点。四种类型的数据点,正常的价值观和良好的杠杆点与数据集的总体趋势一致,不会导致数据质量的退化,但纵向异常值和坏杠杆点远的数据集的总体趋势 - - - - - -空间或 - - - - - -空间,这两种类型的数据点的存在增加了回归系数的标准错误,导致数据质量的退化。
4所示。改善二
加权回归模型的基本思想是设置不同的权重为每个训练样本根据对建模的影响。作者构造了一个新的权重策略函数通过考虑时间因素和样品之间的相似性: 在哪里的重要性吗 - - - - - -th样本,由2部分组成,如时间加权函数相似度函数 , 是用来调节的权重,是根据训练样本的时间从测试样品,越接近训练样本与测试样本,更重要的是,是根据训练样本的欧几里得距离的测试样品,和训练样本与测试样本,它是更重要的。训练样本越接近,就越重要。
使用 作为模型的输入和输出,提高回归模型可以描述为最低解决以下问题: 在哪里权向量, 正则化参数,是错误的变量。 在哪里表示样品的非线性映射到高维特征空间,和偏差值。
拉格朗日乘数介绍了构造拉格朗日函数如下:
改进LS kuuch矩阵可以通过结合优化SVM库恩矩阵: 在哪里 , ,Ω是内核矩阵,其元素 被称为内核函数。
作者选择径向基函数(RBF) 最后获得改进的回归拟合模型
时间权重确定基于正态分布的性质,也就是说, ,在哪里的采样时刻吗 - - - - - -训练样本,电流的采样时刻测试样本,然后呢β确定基于样本预测误差的分布。
相似的权重是由非线性插值。让相似的重量训练样本和预测样本的最小欧氏距离是1和训练样本的相似性体重最大的欧几里得距离预测样本是0。选择的非线性插值函数 , 的采样时刻 - - - - - -th测试样本,然后其他训练样本的相似度权重是由正态分布函数的非线性插值(21,22]。
5。IGA-LSSVM-Based经济流出的预测
模型需要标准化样本数据与之前不一致的情况下预测,正常化和区间选择的作者是[0.1,0.9],和归一化公式如下: 在哪里 和样本数据,样本数据的最小值,最大值在样本数据,分别和规范化的数据。预测操作完成后,预测数据归一化的逆规范化公式:
基于IGA-LSSVM经济流出预测的具体步骤如下:
步骤1。确定模型的输入和输出层,获得样本数据,然后进行预处理样本数据根据方程(9)。
步骤2。选择最优内核参数δ和最优正则化参数γ为生物利用IGA,然后基于训练样本集的训练模型获取IGA-LSSVM-based气体流出预测模型。
步骤3。训练IGA-LSSVM模型用于预测预测样本集,预测完成之后,逆规范化流程执行根据方程(10),然后执行误差分析(23,24]。
6。经济流出预测测试和分析
有许多因素影响经济流出,该模型与文献中提出的加权回归模型(25基于样本的预测误差。2选择RBF预测方法,相同的最优模型参数选择IGA优化,预测结果和预测的相对误差数据所示1和2。从图2,可以看出,最大相对误差使用IGA-LSSVM-based经济流出预测模型的预测为2.763%,最小相对误差为0.705%,平均相对误差为1.3298%。
相比之下,使用加权的最大相对误差预测LSSVM预测模型提出了文献[13)基于样本的预测误差为6.263%,最小相对误差为1.759%,平均相对误差为3.4897%。上述经济流出预测模型的预测结果表明,基于IGA-LSSVM建立本文具有较强的泛化能力和更高的预测精度,这是一个合理的、可靠的方法来预测经济流出26]。
图3显示的比较IGA和GA的优化过程。可以看出,IGA显著优于遗传算法在整个参数搜索过程,在45代达到最优,而只在83代遗传算法达到最优。
7所示。宏观经济统计数据质量评估
如果样本数据的分布模式与理论分布模式不匹配所描述的宏观经济学,我们可以假设这一现象可能是由人为因素引起的,例如有人工制造,弄虚作假,故意隐藏在某种程度上,然后我们可以假定数据可能是有问题的。宏观经济学是不同的数据。宏观经济学给了第一个数字的概率分布在不同的数据
的代表非零的概率数字出现在不同的数据,和概率分布如图4。
连续的宏观经济学研究,第二个数字的概率分布 ,第三位 ,第四个数字在数据逐步探索,对数法②可以扩展到更高的数字。基于研究对数法,我们可以获得的概率第一,第二,第三,第四位数字0 - 9的数字,如表所示1,在那里表示每个数字的发生概率在第n个位置。
例如,当第一个数字是1,发生的概率是31.003%,而当第一个数字是9,发生的概率只有4.687%,和之间的差距最大和最小概率高达26.133%;的概率发生的第二个数字是明显比第一位数,更集中的最大概率12.001%,最低8.8%的概率。第二个数字的概率是比这更集中的第一个数字,最大的概率12.001%,最低8.8%的概率,以及它们之间的差距从26.133%降低到3.201%;第三位的概率是更加集中,波动在10%左右;第四位是更加明显。我们可以看到,随着数字在样本数量的增加,每个数字出现0 - 9的概率会越来越一致,即。,每个数字出现的概率等于0.1,通常认为。
8。结论
虽然基于模型的异常数值观察和参数稳定性分析方法比前三个科学方法,使用这种方法时,我们必须首先确保所有模型中使用的数据是真实和可靠的;在解决实际问题时,我们可以先运用宏观经济评估测试统计数据,当发现异常数据,我们可以仔细检查这些数字目标的方式。当发现异常数据,这些数据可以仔细检查是否有任何人工操作,从而确保统计数据的质量。本文基于宏观经济动态评估和预测IGA-LSSVM,从可行性的角度来看,大多数的统计在现实生活中有一个特定的分布规律,这种分布规律有一定的内在联系和宏观经济学的理论分布规律;所以,当评估主要统计数据的质量在中国,我们可以参考宏观经济学和期望得到更好的结果。
数据可用性
使用的实验数据来支持本研究的发现可以从相应的作者。
的利益冲突
作者宣称他/她没有关于这项工作的利益冲突。