CIN 计算智能和神经科学 1687 - 5273 1687 - 5265 Hindawi 10.1155 / 2018/6401645 6401645 研究文章 再加权方案来改善神经自回归分布估计量的表示 http://orcid.org/0000 - 0003 - 4242 - 9756 http://orcid.org/0000 - 0003 - 2706 - 6264 Qingbiao Sanei Saeid 数学科学学院 浙江大学 杭州 浙江 中国 zju.edu.cn 2018年 23 12 2018年 2018年 21 04 2018年 29日 10 2018年 21 11 2018年 23 12 2018年 2018年 版权©2018郑王先生和吴Qingbiao。 这是一个开放的文章在知识共享归属许可下发布的,它允许无限制的使用,分布和繁殖在任何媒介,提供最初的工作是正确的引用。

神经自回归分布估计量(纳德)是一个竞争模型密度估计的任务领域的机器学习。而纳德主要集中在估计密度的问题,处理其他任务的能力还有待提高。在本文中,我们介绍一种简单而有效的再加权方案修改的参数学习纳德。我们利用纳德的结构,激活的重量来自相应的隐藏层。实验表明,无监督学习的特点与我们再加权方案将更有意义,并为神经网络初始化的性能有显著的改善。

中国国家自然科学基金 11771393 11632015 浙江省自然科学基金 LZ14A010002
1。介绍

学习是最重要的一个特点在机器学习领域的任务。一个有意义的特征表示可能是其他程序的基础。在各种方法中,限制了玻耳兹曼机(元),这是一个强大的生成模型,展示了其学习能力有用表示从许多不同类型的数据( 1, 2]。

元模型输入的高阶维度之间的相关性。常用的特征提取器,或各种深度模型的构建块,例如,深度信念网。在后一种情况下,学会表示美联储到另一个组织遏制在更高的层,和深架构通常会导致更好的性能在很多领域( 3- - - - - - 5]。其变体( 6- - - - - - 8)也有能力处理各种各样的任务。

尽管遏制有很多优势,但它并不适合估计分布的问题,换句话说,估计的联合概率观察。联合概率的估计一个给定的观察,必须计算归一化常数,这是棘手甚至对于中等大小的输入。要处理这个问题,一些其他的方法必须被用来近似归一化常数,例如,退火重要性抽样( 9, 10),它是复杂和计算成本。

神经自回归分布估计量(纳德) 11)是一个强大的模型估计的分布数据,这是受遏制的平均场过程。下的联合概率计算纳德可以准确、高效地完成。纳德和它的变体( 12- - - - - - 17已被证明是最先进的联合密度模型对各种数据集。

而纳德主要关注数据的分布,它也可以被视为一种模型来从数据中提取特征。

调整的方法有了很大的成就在机器学习领域。在整体学习的一些模型,如演算法( 18),每个样本数据集的重要性将会再加权来实现更好的结果。在一些深生成模型,提出了调整方法调整的重要性权重重要性抽样的过程 19, 20.]。与调整方法,梯度的估计会更准确。

在本文中,我们处理功能由纳德和提出一个新颖的方法来提高学习的质量表示通过一个简单的再加权方案的权重由纳德学习。该方法仍然是模型的结构,而计算的过程仍然是简单和容易掌握的。

本文的其余部分的结构如下。节 2,我们审查的重要架构遏制和纳德,这是我们的方法和实验的基础。节 3介绍和分析再加权方案改进的质量功能由纳德学习。节 4的情况下,我们提出一个类似的方法初始化。我们提供实验评价和证明的结果部分 5。最后,我们在部分结论 6

2。审查的遏制和纳德

在本节中,我们审查的基本元模型和强调遏制和纳德之间的关系。

限制玻耳兹曼机是一种马尔可夫随机场,其中包含一层可见的单位<我nline-formula> v 0 1 D 和一层隐藏的单位<我nline-formula> h 0 1 H 。两层彼此相连,intralayer没有连接。

的能量状态<我nline-formula> v , h 被定义为 (1) E v , h ; θ = = 1 D b v = 1 D j = 1 H W j v h j j = 1 H c j h j , 在哪里<我nline-formula> W j 层之间的连接权值吗<我nline-formula> b , c j 是每一层的偏见。

可见状态的概率 (2) p v ; θ = 1 Z θ h 经验值 E v , h ; θ , 在哪里<我nline-formula> Z θ = v , h 经验值 E v , h ; θ 是归一化常数。

由于棘手的归一化常数,遏制竞争力在估计分布的任务。

对于一个给定的观察,可以写成分布 (3) p v = = 1 D p v v < , 在哪里<我nline-formula> v < 表示subvector前的观察<我talic> 我th维度。评估的条件分布<我nline-formula> p v v < 一个阶乘分布<我nline-formula> v , v > , h v < 是用来近似<我nline-formula> p v , v > , h v < : (4) v , v > , h v < = μ v 1 μ 1 v , j > μ j v j 1 μ j 1 v j , k τ k h k 1 τ k 1 h k

吉隆坡的最小化这两个发行版之间的分歧导致了两个重要的方程: (5) τ k = 团体 c k + j W k j μ j + j < W k j v j , μ j = 团体 b j + k W k j τ k , 在哪里<我nline-formula> 团体 x = 1 / 1 + 经验值 x 是乙状结肠函数。

纳德的主要结构是受平均场过程( 21,结果在以下方程: (6) p v = 1 v < = 团体 b + V T , h , h = 团体 c + W , < v < , 在哪里<我nline-formula> V T , 代表了<我nline-formula> th行矩阵的转置<我nline-formula> V 和<我nline-formula> W , < 代表第一个<我talic> 我1列的矩阵<我nline-formula> W 连接输入与相应的隐藏层。

这两个方程表明,纳德就像一个前馈神经网络的训练过程纳德可以转换为相同的框架为普通神经网络在成本函数的平均负对数似训练集。成本函数的梯度对每个参数可以完全通过反向传播,和最小化代价函数可以通过使用简单的随机梯度下降法。相比之下,对每个参数的梯度组织遏制必须由抽样近似从马尔可夫链 22- - - - - - 27]。实验表明,纳德通常优于其他模型估计的任务分配,在纳德的性能等其他任务的无监督学习特性和神经网络的初始化并不是那么优秀。在本文中,我们主要处理这两个问题。

3所示。再加权方案特性

功能完全程度由学会了重量<我nline-formula> W 和偏见<我nline-formula> c 无论在遏制或纳德。提高功能,我们尝试修改相应的参数学习的同时保持纳德的结构模型。

直接的想法是由纳德利用条件概率的计算。考虑输入条件的一维概率在其他维度;测量指定的维度的重要性,我们夹其他维度和简单地比较两种情况下的概率如下: (7) p v = 1 , v p v = 0 , v = p v = 1 v p v p v = 0 v p v = p v = 1 v p v = 0 v = ω

在这个例子中,我们定义的<我nline-formula> ω 的重量分数<我talic> 我th维度的输入。大或小的价值<我nline-formula> ω 表明,这两种情况的概率大大不同,我们应该更加注意这个指定的尺寸。这个再加权方案没有工作在实践中由于大量的计算。为每个维度的观察,我们必须计算两个前馈过程和它是不切实际的。

处理这个问题,我们近似条件概率<我nline-formula> p v = 1 v 和<我nline-formula> p v = 0 v 顺序固定的条件概率<我nline-formula> p v = 1 v < 和<我nline-formula> p v = 0 v < ,这是兼容纳德的原始结构。这种近似大幅降低了成本计算的一个因素<我talic> H,这是每个隐层的大小。

我们进一步取代<我nline-formula> ω = p v = 1 v < / p v = 0 v < 通过<我nline-formula> ω = p v = 1 v < p v = 0 v < 控制的不稳定性<我nline-formula> ω 。因此,我们使用<我nline-formula> ω 修改相应权重矩阵<我nline-formula> W 换句话说,<我nline-formula> th列<我nline-formula> W 。我们会更加注意的尺寸在两种不同情况下概率变化强烈。这些维度应该有更大的权重生成特征表示。

最后再加权方案表示为 (8) ω = p v = 1 v < p v = 0 v < , (9) ω ˜ = ω , ω < τ , τ , 否则, (10) k = D ω ˜ , (11) ω ^ = D ω ˜ k , (12) h = 团体 c + D ω ^ W , v , 在哪里<我nline-formula> τ 0 1 是阈值控制的区别,<我talic> D是输入的大小,<我nline-formula> ω ^ 的重量分数吗<我talic> 我th维度,<我nline-formula> W , 是<我talic> 我th列<我nline-formula> W ,<我nline-formula> h 是最后再加权特性。

在再加权过程,方程( 8)计算概率之间的差异在两种情况下为每个维度。方程( 9)控制体重的规模。方程( 10)和( 11)正常的体重。

虽然这再加权方案似乎是可信的,但很少改进功能。这可能解释说,再加权分数确实改变激活每个维度的特性<我nline-formula> h 虽然不会改变的相对大小激活,这可能是更重要的是为了更好的表示。

为了解决这个问题,我们更愿意处理的行<我nline-formula> W 而不是列,我们将再次利用纳德提供的结构。每个维度的输入,纳德提供了相应的隐藏层,它可以用来修改学习功能。在这种情况下,我们更加注意隐藏层的尺寸在饱和或灭活。这些想法会导致新的再加权方案如下: (13) h ˜ = D h D , (14) ω ˜ j = ε , h ˜ j > τ , ε 较低的 , h ˜ j < τ 较低的 , 1 , 否则, (15) k = H ω ˜ j , (16) ω ^ j = H ω ˜ j k , (17) c ^ j = c j ω ^ j , (18) W ^ j , = ω ^ j W j , , (19) h = 团体 c ^ + D W ^ , v , 在哪里<我nline-formula> D 是输入的大小,<我nline-formula> h 是<我talic> 我在纳德th隐藏层,<我nline-formula> ε , ε 较低的 相对权重,<我nline-formula> τ , τ 较低的 是阈值控制激活的价值,<我nline-formula> h ˜ j 是<我talic> jth单位规范化隐藏层<我nline-formula> h ˜ ,<我nline-formula> W ^ j , W j , 代表了<我talic> j为每个矩阵th行。

我们结束了再加权算法程序 1

<大胆>算法1:< /大胆>再加权方案的新特性。

鉴于:观察<我nline-formula> v 、体重矩阵<我nline-formula> W 和偏见<我nline-formula> c 从训练有素的纳德

输出:新功能对应的观察

总和所有隐藏层的激活和规范化它得到一个向量<我nline-formula> h ˜ 使用方程( 13)

为每个维度<我talic> j在向量<我nline-formula> h ˜ ,比较<我nline-formula> h ˜ j 与阈值<我nline-formula> τ , τ 较低的 并设置相应的权重<我nline-formula> ω ˜ j 使用方程( 14)

规范化的重量分数使用方程( 15)和( 16)

修改<我nline-formula> W , c 使用方程( 17)和( 18)

计算新功能使用方程( 19)

选择最好的功能验证。

这个再加权方案特性值得解释更多。作为每一个隐层的激活形式对应的向量的大小相同,在第一步中,我们和向量和规范化获得结果<我nline-formula> h ˜ 。因此,<我nline-formula> h ˜ 为每个维度的平均值是激活的隐藏层,它是如何激活的测量维度在纳德在前馈过程。

然后,我们介绍两个阈值<我nline-formula> τ , τ 较低的 控制激活。单位被认为是在饱和如果激活大于上层阈值<我nline-formula> τ ,这个单位的相应维度具有重量<我nline-formula> ε 。同样的,我们给一个重量<我nline-formula> ε 较低的 的维度激活小于低阈值<我nline-formula> τ 较低的 。应该注意的是,重量<我nline-formula> ε 较低的 和<我nline-formula> ε 是相对的值与标准相比值1。在实践中,重量<我nline-formula> ε 应该小于1时<我nline-formula> ε 较低的 应大于1。我们强调这种方法的重要性。在饱和单位经常影响性能,通过这个步骤中,我们设置一个小体重减轻这种情况。而单位激活值接近于零被认为是灭活的,这些单位应该保持灭活,和其他一些单位甚至可能成为灭活后调整。在这种情况下,<我nline-formula> W j , v + c j 这个维度是负的,和一个大重量确认情况。根据我们的观点,这个过程迫使的稀疏表示,这常常会导致更好的性能。

我们假设每个维度的原始再加权分数只是一个和规范再加权分数保持合理。

在这里,我们强调,我们的目标是改善功能。我们见面时估计分布的问题,纳德的原始重量应该利用自原始重量是最大似然代价函数的优化结果。我们的计划是不适合密度估计。

4所示。初始化再加权方案

遏制所学到的重量或纳德可以用来初始化一个神经网络的重量,这是这类模型的优点之一。进一步的神经网络可以用于其他任务,比如分类。

我们提出了再加权方案的特性,适用于每一个观察,尽管这种方法不适合初始化。

为了解决这个问题,我们计算再加权分数为每个样本在训练集和他们获得一个新的再加权的平均分数的权重矩阵和偏见。这个过程可以表示为 (20) ω ^ = k = 1 N ω ^ k N , (21) c ^ j = c j w ^ j , (22) W ^ j , = ω ^ j W j , , 在哪里<我nline-formula> N 在训练集样本的数量,<我nline-formula> ω ^ k 是再加权得分向量对应<我nline-formula> k th训练样本。

完整的过程是在算法结束 2

<大胆>算法2:< /大胆>初始化再加权方案。

鉴于:一组训练样本<我nline-formula> v k 、体重矩阵<我nline-formula> W 和偏见<我nline-formula> c 从训练有素的纳德

输出:再加权新的权重矩阵<我nline-formula> W ^ 和偏见<我nline-formula> c ^ pretraining神经网络

对训练样本<我nline-formula> v k 使用方程,计算相应的再加权得分向量( 13)- ( 16)

使用方程( 20.)计算最后再加权评分向量

使用方程( 21)和( 22)获得<我nline-formula> W ^ 和<我nline-formula> c ^

选择最佳的权重矩阵和偏见的验证。

5。实验

在本节中,我们将展示几个二进制数据集上的实验结果再加权方案的特性和初始化。纳德的训练过程,一个固定尺寸的顺序必须选择输入的开始。由于实验表明,订货不产生重大影响的性能纳德( 11),对于每一个数据集,选择排序独立和保持相同的在所有的实验中。此外,hyperparameters纳德保持不变的hyperparameters为了选择再加权方案。纳德模型的实现是基于所提供的代码Larochelle和莫里 11]。

5.1。结果学习特性

测试是否再加权方案提高了学习功能,我们对分类进行一些实验。

我们注意我们的主要目的是评估提出再加权方案而不是追求最佳性能分类,我们只使用一个中等大小的模型来降低计算的成本。对于每个数据集,我们首先训练纳德和使用算法 1得到改进的功能。处理这个过程的所有样本在训练集,验证集和测试集在所有新三组对应的结果。然后火车与单隐层神经网络作为分类器的学习功能。性能是衡量测试集上的分类错误率。我们进一步实验特性没有再加权方案获得一个标准的结果进行比较。同样大小的遏制与纳德也训练和分类结果作为参考。

我们十二个不同的数据集实验UCI存储库:成人,Binarized-MNIST, Connect-4,凸,DNA,蘑菇,新闻组,OCR-letters, RCV1,矩形、SVHN和Web。我们在表列出这些数据集的详细信息 1。实验结果如表所示 2。我们选择最好的结果再加权方案结果对应于不同hyperparameters之一。我们发现再加权方案的分类误差特点是低于没有再加权,这证明了改进原有的功能。功能的再加权方案可能更有意义。

十二个数据集的详细信息。

数据集 输入的大小 类的数量 培训 验证 测试
成人 123年 2 5000年 1414年 26147年
Binarized-MNIST 784年 10 50000年 10000年 10000年
Connect-4 126年 3 16000年 4000年 47557年
784年 2 6000年 2000年 50000年
DNA 180年 3 1400年 600年 1186年
蘑菇 112年 2 2000年 500年 5624年
新闻组 5000年 20. 9578年 1691年 7505年
OCR-letters 128年 26 32152年 10000年 10000年
RCV1 150年 2 40000年 10000年 150000年
矩形 784年 2 1000年 200年 50000年
SVHN 1024年 11 594388年 10000年 26032年
网络 300年 2 14000年 3188年 32561年

通过神经网络分类结果在12个数据集。

数据集 输入的大小 特征尺寸 神经网络的大小 纳德 Reweighted-NADE 遏制
成人 123年 One hundred. 200年 0.16074 0.16013 0.16598
Binarized-MNIST 784年 300年 400年 0.0247 0.0243 0.0250
Connect-4 126年 One hundred. 200年 0.22436 0.22143 0.23367
784年 300年 400年 0.27742 0.26124 0.29242
DNA 180年 One hundred. 200年 0.15683 0.15008 0.15093
蘑菇 112年 One hundred. 200年 0.0082 0.0059 0.0066
新闻组 5000年 1000年 2000年 0.30286 0.26156 0.30007
OCR-letters 128年 One hundred. 200年 0.1459 0.1409 0.1361
RCV1 150年 One hundred. 200年 0.05461 0.04674 0.06034
矩形 784年 300年 400年 0.09566 0.08782 0.10204
SVHN 1024年 300年 400年 0.08455 0.08025 0.09050
网络 300年 150年 200年 0.02189 0.02079 0.02515

为了进一步验证我们的方法,我们取代神经网络和支持向量机分类器,RandomForest,演算法和执行额外的实验。这些实验是通过实现LIBSVM [ 28)和scikit-learn。结果如表所示 3- - - - - - 5。在所有的实验中,分类器的参数优化了网格搜索和验证会给最好的性能。特性与我们再加权方案再次超越原版的,它证实了我们方法的有效性。

通过SVM分类结果在12个数据集。

数据集 纳德+支持向量机 Reweighted-NADE +支持向量机 元+支持向量机
成人 0.15876 0.15753 0.16495
Binarized-MNIST 0.0374 0.0349 0.0358
Connect-4 0.27130 0.26680 0.28696
0.30036 0.28570 0.31466
DNA 0.13406 0.12985 0.14418
蘑菇 0.01085 0.00871 0.00996
新闻组 0.29714 0.26862 0.28208
OCR-letters 0.1851 0.1802 0.1692
RCV1 0.06041 0.05325 0.07041
矩形 0.10836 0.09864 0.11526
SVHN 0.09346 0.08839 0.09842
网络 0.02110 0.01969 0.02420

通过随机森林分类结果12个数据集。

数据集 纳德+射频 Reweighted-NADE +射频 元+射频
成人 0.16399 0.16069 0.16587
Binarized-MNIST 0.0301 0.0265 0.0312
Connect-4 0.26783 0.25443 0.28364
0.29632 0.28502 0.30658
DNA 0.16948 0.15346 0.15936
蘑菇 0.01227 0.01014 0.01174
新闻组 0.32192 0.29460 0.31459
OCR-letters 0.1986 0.1863 0.1708
RCV1 0.07265 0.06249 0.08258
矩形 0.11816 0.10624 0.12646
SVHN 0.09838 0.09339 0.10283
网络 0.02647 0.02368 0.02773

分类结果通过演12个数据集。

数据集 纳德+ AB Reweighted-NADE AB + 元+ AB
成人 0.16013 0.15677 0.16445
Binarized-MNIST 0.0313 0.0274 0.0309
Connect-4 0.23912 0.22737 0.25494
0.29420 0.28206 0.30082
DNA 0.14250 0.13238 0.14587
蘑菇 0.01049 0.00853 0.00978
新闻组 0.30753 0.28115 0.29474
OCR-letters 0.1681 0.1571 0.1432
RCV1 0.06847 0.06072 0.07509
矩形 0.10522 0.09476 0.11762
SVHN 0.08866 0.08374 0.09438
网络 0.02279 0.02147 0.02512

实验结果为不同的权重<我nline-formula> ε , ε 较低的 在OCR-letters数据集如表所示 6。在这一系列的实验,我们训练数据集上的纳德一开始,学习速度设置为0.001,下降常数设置为0,隐层的大小是100,我们用绑在纳德。也就是说,我们集<我nline-formula> V = W 在方程( 6)。接下来,我们继续<我nline-formula> τ = 0.73 τ 较低的 = 0.27 只有修改再加权参数探讨再加权方案的性能。结果表明,再加权方案有决定性作用改善功能。不合理再加权方案常常会导致更糟糕的结果比没有再加权方案。我们发现,设置较低的体重<我nline-formula> ε 较低的 大于1和上面的重量<我nline-formula> ε 小于1似乎是一个合理的再加权方案。在前面的章节中,我们已经解释了这种方式,一个较小的值上重量使饱和单元不饱和,表示这是有益的,而一个更大的值较低的重量保留了灭活单位和部队稀疏的特性。

OCR-letters分类结果不同的权重。

Upper-weight 低体重 错误
0.8 0.8 0.1477
0.9 0.9 0.1472
1。0 1。0 0.1459
1。1 1。1 0.1445
1。2 1。2 0.1459
1。1 0.9 0.1470
1。2 0.8 0.1465
0.9 1。1 0.1447
0.8 1。2 0.1427
0.7 1。3 0.1425
0.6 1。4 0.1411

还应该指出的是,权重<我nline-formula> ε , ε 较低的 是相对的体重比标准体重1。因此,必须控制体重和体重太大或太小会导致一个可怕的结果。

另一个因素影响再加权方案的性能阈值<我nline-formula> τ , τ 较低的 显式地控制单元是饱和或灭活。结果不同的阈值<我nline-formula> τ , τ 较低的 在OCR-letters数据集如表所示 7。之前我们所做的一样,我们只修改这两个阈值在这一系列的实验,我们组上部重量0.6和重量降低到1.4。结果也证明了阈值的重要性。一方面,上阈值控制单位的比例被认为是在饱和,和一个更大的值上阈值导致这些单位占比例较小。另一方面,较低的阈值控制单位的比例被灭活,和一个更小的值较低的阈值会导致这些单位占比例较小。这些单位将更加灭活后再加权方案。

分类结果OCR-letters不同阈值。

更高层的上限 下辨别阈 错误
0.55 0.45 0.1434
0.58 0.42 0.1434
0.61 0.39 0.1447
0.64 0.36 0.1431
0.67 0.33 0.1409
0.70 0.30 0.1424
0.73 0.27 0.1411
0.76 0.24 0.1418
0.79 0.21 0.1433

从我们的观点来看,这两个阈值更依赖数据集而不是规范。作为一个保守的策略,我们宁愿上设置阈值的范围从0.5到0.8,而较低的阈值的范围从0.5到0.2。

进一步研究的特性,我们检查和分析的价值激活的所有特性OCR-letters的测试集。图 1显示单元的数量对应于每个激活值从0到1的步骤0.01。0.01单位下的激活,其价值被忽略保持平衡图,因为这些单位占绝大多数的单位。这些单位在调整之前的数量是562453年和575928年调整后,这证明了我们提出的政策并保持灭活单位和甚至力更稀疏的特性。明显降低的饱和单元如图,这符合我们的目的。

单位的数量对应于每个值OCR-letters激活。(一)功能调整。调整后(b)特性。

我们也调查的平均价值激活每个维度的特性。结果如图所示 2。我们发现在纳德特性调整后,在饱和尺寸限制,而灭活尺寸保持甚至更多的灭活。调整前后的平均特性相似而纳德特性和遏制特性显著不同。纳德特性和遏制功能之间的差异是由于内在差异模型纳德和遏制。

平均每个维度的激活值OCR-letters。(一)功能调整。调整后(b)特性。从遏制(c)特性。

5.2。结果初始化

再加权方案我们还提出了由初始化,提高了神经网络的性能,我们将显示在这里。

测试性能,我们为每个数据集训练纳德,与同样大小也是训练有素的遏制。然后我们使用学到的权重矩阵<我nline-formula> W 和偏见<我nline-formula> c 初始化参数的神经网络分类器。然后,神经网络分类器训练在相应的数据集。评估我们的再加权方案,参数调整后也用作另一个神经网络分类器的初始化大小相同。最后,性能是衡量分类错误。

我们展示了结果表 8。像之前一样,我们同样的12个数据集上执行实验和hyperparameters相同。从结果,这一次,我们可以看到,再加权方案初始化使得更显著改善分类性能相比原纳德参数。在大多数的数据集,错误reweighted-NADE和纳德之间的差异远远大于纳德和疟疾之间,这表明该再加权方案的效率。reweighted-NADE OCR-letters,分类性能不如遏制,这可以解释为之间的内在区别参数学习纳德和遏制,这是很难消除只能通过再加权方案。总之,该方案总是超过一个没有再加权。

分类结果为初始化十二集。

数据集 输入的大小 隐层的大小 纳德 Reweighted-NADE 遏制
成人 123年 One hundred. 0.15921 0.15814 0.16009
Binarized-MNIST 784年 300年 0.0216 0.0198 0.0205
Connect-4 126年 One hundred. 0.19326 0.18474 0.19725
784年 300年 0.25672 0.23898 0.26394
DNA 126年 One hundred. 0.06998 0.05986 0.06324
蘑菇 112年 One hundred. 0.00729 0.00498 0.00605
新闻组 5000年 1000年 0.34231 0.28767 0.3291
OCR-letters 128年 One hundred. 0.1669 0.1601 0.1374
RCV1 150年 One hundred. 0.05131 0.04449 0.05567
矩形 784年 300年 0.09062 0.08338 0.09948
SVHN 1024年 300年 0.08405 0.07810 0.08889
网络 300年 150年 0.01477 0.01366 0.01492

为了使实验更完整,我们实验不同的权重<我nline-formula> ε , ε 较低的 Web上的数据集,结果如表所示 9。纳德,在这个数据集,学习速率设置为0.005,下降常数设置为0,隐层的大小是150,体重是解开。上阈值和较低的阈值保存到0.67和0.33。启发式再加权方法,它集低重量大于1和上部重量小于1,再一次被证明是有效的。而这一次,适当的权重更远离标准体重1。这可以解释为平均的效果。因为我们计算的平均值再加权分数的所有训练样本,更歧视再加权方案保持尺寸之间的差异在最后再加权得分向量。换句话说,我们更喜欢更大的值为低重量和一个更小的值上重量在处理初始化的问题。

分类结果与初始化网络不同的权重。

Upper-weight 低体重 错误
0.8 0.8 0.01409
0.9 0.9 0.01477
1。0 1。0 0.01477
1。1 1。1 0.01480
1。2 1。2 0.01480
1。1 0.9 0.01446
1。2 0.8 0.01486
0.9 1。1 0.01477
0.8 1。2 0.01471
0.7 1。3 0.01468
0.6 1。4 0.01418
0.5 1。5 0.01455
0.4 1。6 0.01375
0.3 1。7 0.01366
0.2 1。8 0.01437

结果数据集网络上关于各种阈值如表所示 10。上重量和低体重设置为0.6和1.4,分别。我们在前一节中类似的结论。的阈值更依赖于数据集,我们喜欢一个保守的策略。

分类结果不同阈值对网络的初始化。

更高层的上限 低阈值 错误
0.55 0.45 0.01425
0.58 0.42 0.01434
0.61 0.39 0.01449
0.64 0.36 0.01446
0.67 0.33 0.01418
0.70 0.30 0.01431
0.73 0.27 0.01464
0.76 0.24 0.01446
0.79 0.21 0.01452
6。结论

在本文中,我们提出了一个简单的和小说再加权方案修改纳德的学习参数。我们利用激活隐藏层的学习纳德模型,设置适当的阈值控制的比例超过饱和和灭活单位。为了达到更好的效果,提出了一个启发式再加权方法。原始参数修改和规范化。再加权参数用于生成特性或更好地提高神经网络的初始化的性能。实验表明,再加权方案的有效性,并有明显的改善在机器学习领域的两个重要的任务。

数据可用性

本文中使用的数据都是公开的,可以获得 http://archive.ics.uci.edu/ml/datasets.html

的利益冲突

作者宣称没有利益冲突有关的出版。

确认

这项研究得到了国家自然科学基金(批准号11771393和11771393)和浙江省自然科学基金(批准号LZ14A010002)。

Bengio Y。 人工智能的学习深入架构 机器学习的基础和趋势® 2009年 2 1 1 127年 10.1561 / 2200000006 2 - s2.0 - 69349090197 Bengio Y。 考维尔 一个。 文森特 P。 表示学习:审查和新观点 IEEE模式分析与机器智能 2013年 35 8 1798年 1828年 10.1109 / tpami.2013.50 2 - s2.0 - 84879854889 辛顿 g . E。 Osindero 年代。 格兰 Y.-W。 深度信念网的快速学习算法 神经计算 2006年 18 7 1527年 1554年 10.1162 / neco.2006.18.7.1527 2 - s2.0 - 33745805403 Salakhutdinov R。 穆雷 我。 定量分析的深层信念网络 25日学报》国际会议上机器学习 2008年7月 芬兰赫尔辛基 ACM 872年 879年 Schmidhuber J。 深度学习神经网络:概述 神经网络 2015年 61年 85年 117年 10.1016 / j.neunet.2014.09.003 2 - s2.0 - 84910651844 Marc-Alexandre C。 Larochelle H。 无限限制玻耳兹曼机 神经计算 2016年 28 7 1265年 1288年 10.1162 / neco_a_00848 2 - s2.0 - 84976515716 考维尔 a . C。 詹姆斯 B。 Bengio Y。 高峰和板限制玻耳兹曼机 1 AISTATS学报》 2011年10月 美国劳德代尔堡 5 辛顿 g . E。 Salakhutdinov R R。 复制softmax:一个无向的话题模型 22日学报》国际会议上神经信息处理系统 2009年12月 加拿大的温哥华,MB 1607年 1614年 Y。 Grosse r B。 Salakhutdinov R。 准确和保守估计的MRF对数似使用反向退火 2015年 https://arxiv.org/abs/1412.8566 尼尔 r·M。 Lingua:: EN:: Titlecase 统计和计算 2001年 11 2 125年 139年 10.1023 /:1008923215028 2 - s2.0 - 0000273048 Larochelle H。 穆雷 我。 神经自回归分布估计量 1 AISTATS学报》 2011年10月 美国劳德代尔堡 2 Larochelle H。 年代。 一个神经模型自回归主题 22日学报》国际会议上神经信息处理系统 2012年12月 太浩湖,内华达州 2708年 2716年 穆雷 我。 Salakhutdinov R R。 评估概率在高维潜变量模型 学报的发展神经信息处理系统 2009年12月 加拿大的温哥华,MB 1137年 1144年 Raiko T。 l K。 Bengio Y。 迭代估计nade-k神经自回归分布 学报的发展神经信息处理系统 2014年 加拿大的蒙特利尔,QC 325年 333年 乌里亚 B。 穆雷 我。 Larochelle H。 神经自回归density-estimator Rnade:实值 学报的发展神经信息处理系统 2013年12月 太浩湖,NV,美国 2175年 2183年 Y。 泽梅尔 r S。 Y.-J。 Larochelle H。 一个神经自回归方法引起的认可 国际计算机视觉杂志》上 2014年 113年 1 67年 79年 10.1007 / s11263 - 014 - 0765 - x 2 - s2.0 - 84939873522 Y。 Yu-J。 Larochelle H。 主题建模的多通道数据:一个自回归方法 学报IEEE计算机视觉与模式识别会议 2014年6月 美国哥伦布,哦 1370年 1377年 弗洛伊德 Y。 Schapire r·E。 实验用一个新的增强算法 96年 13日学报》国际会议上机器学习 1996年7月 巴里,意大利 148年 156年 Bornschein j。 Bengio Y。 再加权和生物钟 2014年 https://arxiv.org/abs/1406.2751 Y。 Grosse R。 Salakhutdinov R。 重要性加权autoencoders 2015年 https://arxiv.org/abs/1509.00519 扫罗 l·K。 Jaakkola T。 约旦 m . I。 平均场理论乙状结肠信念网络 人工智能研究杂志》上 1996年 4 1 61年 76年 10.1613 / jair.251 k . H。 Raiko T。 亚历山大 我。 玻耳兹曼机并行回火是有效学习的限制 学报2010年国际神经网络(IJCNN)联合会议 2010年7月 西班牙巴塞罗那 1 8 辛顿 G。 一个实际的指导培训限制玻耳兹曼机 动力 2010年 9 1 926年 辛顿 g . E。 培训产品的专家通过最小化对比差异 神经计算 2002年 14 8 1771年 1800年 10.1162 / 089976602760128018 2 - s2.0 - 0013344078 马顿斯 J。 Sutskever 我。 可平行的马尔可夫随机域的采样 AISTATS学报》 2010年5月 意大利撒丁岛 517年 524年 Salakhutdinov R R。 学习在马尔可夫随机域使用回火转变 学报的发展神经信息处理系统 2009年12月 加拿大的温哥华,MB 1598年 1606年 从事公务 T。 培训限制玻耳兹曼机使用近似梯度可能性 25日学报》国际会议上机器学习 2008年7月 芬兰赫尔辛基 ACM 1064年 1071年 c c。 C.-J。 LIBSVM:支持向量机的库 ACM智能交易系统和技术 2001年 2 3 1 27 10.1145/1961189.1961199 2 - s2.0 - 79955702502